蚂蚁灵波正式开源了LingBot-Video,这是全球首个面向具身智能的大规模MoE视频基础模型与视频物理引擎。
与通用视频模型关注画质、光影不同,LingBot-Video从架构、数据到训练目标全链路为机器人量身打造,核心在于生成的视频是否符合物理规律。
核心亮点
- MoE架构:总参数30B,推理时仅激活3B,有效平衡模型容量与推理成本。
- 海量具身数据:引入超70000小时具身相关视频,涵盖机器人操作、导航、第一视角等场景。
- 多维奖励系统:将物理合理性、任务完成度纳入优化目标,确保生成内容符合现实物理规律。
- 性能优异:在RBench等评测中超越业内通用视频生成标杆模型。
为什么机器人需要专属视频模型?
通用视频模型中的穿模、物体消失等瑕疵,若用于训练机器人,会导致其学习错误的世界规律。LingBot-Video旨在让机器人大脑学会真实的物理规律,例如在工业场景中保持末端执行器与工件的相对关系稳定,或在动态场景中理解空间与运动预测。
技术实现路径
- 架构创新:采用稀疏MoE架构,将总参数规模与实际激活计算量解耦,大幅降低计算成本。
- 数据融合:结合通用互联网视频与具身数据,通过五维结构化标注和课程式五阶段渐进训练,掌握复杂物理交互逻辑。
- 强化学习:搭建分层强化学习奖励体系,从感知、物理、执行三个维度同步约束生成结果,并原生支持Action-to-Video动作条件生成。
具身智能的“世界模型”
LingBot-Video为机器人提供了低成本、可反复试错的物理世界模拟器,其价值体现在三个层面:
- Data Engine:生成可信的动作过程和场景变化,提供低成本训练数据。
- Policy Evaluator:在虚拟视觉环境中预跑策略,降低真实测试风险。
- Action Planner:预测动作后果,辅助决策规划与异常预判。
视频模型正从内容创作赛道外溢至世界模型和具身智能赛道,成为下一阶段AI发展的兵家必争之地。
原始来源: 量子位 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。