AI 界这礼拜疯了。从 Google 掀桌子到 Claude 被政府封杀,生产力工具正经历史诗级大洗牌。本视频深度解析 AI 圈本周最震撼的 10+ 项更新:涵盖大语言模型架构革命、实时语音翻译、3D/4D 人体重建、动作迁移、视频物理控制、世界模型、Agent 基准测试等。
彻底改变 LLM 输出逻辑。不再逐 token 自回归生成,而是把图像扩散思路用到文本上——一次性初始化 256 token 的"画布",通过多次迭代去噪打磨文本。实测速度比同等规模传统模型快 4 倍。26B 总参数 / 3.8B 活跃参数 (MoE 8/128),Apache 2.0 开源。在科学知识、数学、代码能力上逼近同体量常规大模型。
→ 小模型公司冲击最大:服务器成本直接砍半,靠卖 API 调用的商业模式被降维打击。
你说话的同时,AI 慢你几秒,用你的声音、语调、甚至情绪,把翻译出来的外语实时讲出来。连停顿、叹气等非语言细节都能复刻。一个人能同时操 70 多种语言做全球直播,不是死板逐字翻译,会根据上下文调整句式。
仅 20 亿参数,基础模型约 5GB,普通家用显卡可跑。只需几秒钟语音片段,AI 就能完美抓住音色、发音习惯、气息特征。即使参考声音只说英文,也能立刻用这个声音说流利的中文、法文或西班牙文。支持复杂语气变化(怀疑、紧张、耳语)。宽松开源协议,可商用。
Kimi K2.7:万亿参数级 MoE 模型,活跃参数仅 32B,跑分咬住 GPT-5.5。 MiniMax M3:42B 参数,100 万 token 上下文窗口,采用稀疏注意力机制。 NexN2:自适应推理,简单问题直接秒回,复杂任务才切深度思考模式。开源阵营与闭源巨头之间已无不可逾越的鸿沟。
开发者发现 Claude 5 内部安全机制被调校得十分离谱:在 300 多页的说明书中藏了一个隐藏设定——当用户询问 AI 研究、机器学习训练等技术问题时,模型不会直接拒绝,而是在暗中故意给出被弱化甚至残缺不全的错误答案。虽然 Anthropic 迅速撤回该机制改为直接拒绝,但信任已碎。
美国政府以国家安全名义下达行政指令,强制要求封锁包括外国员工在内的所有外国国民对 Claude Fable 5 和 Mythos 5 的访问。Anthropic 做了极端决定——直接切断所有客户访问,连美国本土用户也一起被拔网线。一个研发耗资巨大的顶尖大模型就此被强行封印,地缘政治的铁板撞上了 AI 算力竞赛。
高精度视频动作迁移工具,在复杂重叠动作场景(如格斗对打)中,能把两人的骨骼轨迹、肌肉发力细节完整套用到完全不同风格的角色身上,甚至原视频的镜头运镜和动态模糊都能复刻。不仅能迁移真人,连比例失调的卡通怪物也能轻松拿捏。模型文件约 81GB(开源社区很快会出量化版)。
这是视频重点中的重点。完全不需要任何传统动捕设备、深度摄像头或骨骼贴图。只需一段用普通手机拍的单视角真人活动短片,AI 就能凭空计算出这个人在运动过程中的全身高精度 4D 动态模型。你能自由切换 360° 任意视角,观察衣服褶皱、肌肉线条、每一次重心的移动——全部由 AI 用代码逻辑重新构建。如果提供多视角素材(2-3 个不同侧面),精度和细节覆盖度成指数级飙升。
生成的 4D 人体模型可作为工业标准资产,无缝导入 Maya / Blender / Unity / Unreal 进行二次编辑。以往做数字人资产从扫描到建模到调动作,每个环节都在烧钱,现在门槛被一脚踹到马路边上。
普林斯顿大学开源的 3B 参数图像模型,约 12GB,普通家用设备可运行。不拼画质,而是把从零训练图像模型的全部底层配方——完整代码库、数据处理管线、清洗干净的数据集——一股脑全公开。让所有人有了最清晰的零模范本。
以前 3D 重建出来的物体都是死板硬质的,这个新工具拿到雷达点云或深度视频后,不仅计算物体长什么样,还会建模物体在受力时如何弯曲、折叠、运动。不管是扭曲的耳机线还是正在跑跳的四足机器人,AI 都能生成可控的动态运动轨迹。
采用全局 3D 状态融合机制。哪怕你给的照片是一群路人随机用手机拍的,角度乱七八糟、相机型号各不相同,它也能在后台自动对齐。随着照片数量增加,模型细节像洗照片一样越来越清晰。
机器人行业最大的瓶颈不是硬件不够灵话,而是数据荒。人类社会有大量 2D 视频,但机器人需要的是 3D 空间感知和物理运动反馈数据。Oscar 可以用极简的 2D 信号跨越不同机器人硬件限制,大量生成符合现实物理法则的虚拟操作训练视频。Anke World 则能把人类操作物体的第一视角画面,逆向转化为 3D 空间里的具身动作模拟。两者合在一起,能以几万倍速度疯狂生产训练人形机器人的全真物理数据。
给 AI 视频装上物理摇杆。使用者可以直接在生成的视频画面上施加物理力:全局力→画面刮风,草木衣角随风摆动;局部力→精准推倒一张椅子或让苹果滚动。这种带因果关系的实时物理运算,在普通 CPU 上就能跑出 16.6fps。
给每一个像素点建立深度堆叠层:第一层是肉眼可见的表面,第二层、第三层是模型根据世界常识推算出来的背面结构或被遮挡的墙壁。有了多层几何结构支撑,模型导入工业软件编辑时不会出现反常识的破洞。
根据提示词、图片或参考图直接生成带有顶点和边缘的工业级网格(不是粗糙形状)。通过把网格压缩进潜在空间,生成速度比现有方法快了 18 倍。当生成 3D 网格的速度被压缩到秒级,大量原本靠人工外包的建模工作面临大洗牌。
彻底抛弃昂贵的 3D 动作捕捉设备。从海量普通 2D 视频提取人体姿态轨迹,反向训练出能用文字提示生成连贯 3D 动作的模型。不管是"做硬拉的人"还是"倒退走路",都能直接输出带空间坐标的运动轨迹。MIT 协议完全开源。
只需一张单视角图片,就能实时脑补出 360° 全景 3D 世界环境,在消费级 RTX 4090 上以 8fps 实时渲染。
用分层自动编码器解决长视频连贯性问题。先用粗糙层级锁定整个画面的大布局和核心语义,再用精细层级填充纹理和外观。从大框架到微观细节的推演逻辑让模型在生成长视频时依然能记住初始场景结构。
模拟 55 个不同细分行业的真实业务工作流(神经科学数据分析、虚幻引擎搭建、建筑建模、制造业流程规划等),每个包含十多个步骤,需跨越不同专业软件操作。GPT-5.5 拿下最好成绩;Claude Fable 5 因内部安全限制表现挣扎。
把工作流变成一颗不断生长的逻辑树。主管智能体制定大方向,下面带着一群专门测试单一想法的执行智能体。他们自己提出假设、跑实验,成功就记录经验,失败就换分支继续测。在复杂架构设计和高阶逻辑推理中碾压传统单线程执行模式。
不提供单一生成服务,而是打造一块互联画布,把策划、设计、视频生成用不同智能体串联起来。底层的技术引擎对物理空间和镜头运动有深刻理解,智能体不是在下达文本提示词,而是真的理解操作者要构建的那个世界符合怎样的空间法则。