AI

全球首个具身专属MoE视频模型LingBot-Video开源

蚂蚁灵波正式开源LingBot-Video,这是全球首个面向具身智能的大规模MoE视频基础模型与视频物理引擎。该模型总参数达30B,推理时仅激活3B,引入超7万小时具身相关视频数据,并加入多维奖励系统以优化物理合理性与任务完成度。其旨在为机器人提供低成本物理世界模拟器,助力具身智能发展。

来源:量子位

蚂蚁灵波正式开源了LingBot-Video,这是全球首个面向具身智能的大规模MoE视频基础模型与视频物理引擎。

与通用视频模型关注画质、光影不同,LingBot-Video从架构、数据到训练目标全链路为机器人量身打造,核心在于生成的视频是否符合物理规律。

核心亮点

  • MoE架构:总参数30B,推理时仅激活3B,有效平衡模型容量与推理成本。
  • 海量具身数据:引入超70000小时具身相关视频,涵盖机器人操作、导航、第一视角等场景。
  • 多维奖励系统:将物理合理性、任务完成度纳入优化目标,确保生成内容符合现实物理规律。
  • 性能优异:在RBench等评测中超越业内通用视频生成标杆模型。

为什么机器人需要专属视频模型?

通用视频模型中的穿模、物体消失等瑕疵,若用于训练机器人,会导致其学习错误的世界规律。LingBot-Video旨在让机器人大脑学会真实的物理规律,例如在工业场景中保持末端执行器与工件的相对关系稳定,或在动态场景中理解空间与运动预测。

技术实现路径

  1. 架构创新:采用稀疏MoE架构,将总参数规模与实际激活计算量解耦,大幅降低计算成本。
  2. 数据融合:结合通用互联网视频与具身数据,通过五维结构化标注和课程式五阶段渐进训练,掌握复杂物理交互逻辑。
  3. 强化学习:搭建分层强化学习奖励体系,从感知、物理、执行三个维度同步约束生成结果,并原生支持Action-to-Video动作条件生成。

具身智能的“世界模型”

LingBot-Video为机器人提供了低成本、可反复试错的物理世界模拟器,其价值体现在三个层面:
- Data Engine:生成可信的动作过程和场景变化,提供低成本训练数据。
- Policy Evaluator:在虚拟视觉环境中预跑策略,降低真实测试风险。
- Action Planner:预测动作后果,辅助决策规划与异常预判。

视频模型正从内容创作赛道外溢至世界模型和具身智能赛道,成为下一阶段AI发展的兵家必争之地。

原始来源: 量子位

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度