蚂蚁灵波近日发布了全球首个“具身原生”预训练VA(Video-Action)基座模型LingBot-VA 2.0。该模型从架构、数据到训练目标均专为机器人量身定制,核心在于赋予机器人“预判未来”的能力,实现从反应式控制向预判式控制的跨越。
核心能力展示
研究团队通过三组真实任务验证了模型的性能:
- 整理桌面:考验长程记忆与状态维持。模型通过高维planner进行任务拆解,双臂并行推进,视频预测分支携带时序状态记忆,顺利完成全桌面整理。
- 传送带抓取:考验时间对齐能力。模型将物体移动纳入动作决策,预测抓取瞬间物体位置,成功实现与移动目标的同步抓取。
- 抓薯片:考验精细操作与局部视觉细节保留。模型精确把握相对位置并控制力度,成功抓取易碎薄片物体。
核心技术拆解
LingBot-VA 2.0的性能提升得益于四大技术改动:
1. 新一代语义视觉-动作分词器:在像素重建同时向冻结的视觉基础模型对齐特征,将语义信息融入latent,并通过隐动作模块从连续帧中反推动作信号。
2. 因果预训练:摒弃改造式路线,从零构建单向因果架构,使模型按时间线学习,天然匹配机器人闭环控制需求。
3. 稀疏MoE架构:视频主干总参数约13B,推理时仅激活约1.9B参数。结合一致性蒸馏等优化,推理时间降至142ms/chunk,最高异步控制频率达225Hz。
4. Foresight Reasoning异步推理:设计“预测-执行-纠偏”闭环机制,机器人执行当前动作时模型并行预测下一步,并在真实观测返回时重新校准,避免脱离物理现实。
实验结果
在RoboTwin 2.0仿真基准上,LingBot-VA 2.0在干净场景、域随机化场景及平均成功率分别达到93.8%、93.4%和93.6%,全面超越π0.5等基线模型。消融实验进一步证实,自研分词器与多步预测(MCP)辅助目标显著提升了模型准确率与训练效率。
原始来源: 量子位 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。