7月7日,蚂蚁集团旗下具身智能公司灵波科技发布空间感知模型 LingBot-Depth 2.0。该模型基于 1.5 亿规模数据进行训练,在边缘清晰度、细小物体识别、远距离深度估计以及复杂场景鲁棒性等方面实现全面升级。
核心性能全面升级
LingBot-Depth 是灵波自研的空间感知模型,相当于机器人在物理世界的眼睛。1.0 版解决了机器人看清透明、反光等复杂场景的空间感知难题。相比 1.0 版,2.0 版的训练数据从 300 万扩充至 1.5 亿规模:
- 在深度补全基准的 16 项测评中获得 12 项第一。
- 在最难的室内大面积深度缺失场景中,深度误差较上一代减半(RMSE 从 0.132 降至 0.062)。
- 在玻璃、镜面、透明物体等传统深度相机最容易失灵的场景中表现尤为突出。
同步推出视觉基座模型 LingBot-Vision
此次同步推出的视觉基座模型 LingBot-Vision,构建起机器人从“看懂”到“看准”的能力链路。作为业内首个把“边界结构”作为预训练目标的视觉基础模型,它拥有亚像素级的边界定位与空间结构理解能力。
- 训练效率高:预训练语料仅为 1.6 亿张图像,比 DINOv3 小一个数量级,深度估计精度却优于 DINOv3。
- 边界判定稳定:能在视频中连续追踪物体边界。
- 版本开源:本次开源了 ViT-G/L/B/S 4个版本。
商业化落地与生态合作
目前,LingBot-Depth 2.0 已通过奥比中光深度视觉实验室专业认证。基于奥比中光 Gemini 330 系列双目 3D 相机提供的数据,该模型在边缘清晰度、物体轮廓完整性等方面均有明显提升。
在商业化方面,蚂蚁灵波已与奥比中光展开深度合作:
- 奥比中光最新推出的 RGB-D 版本 EGO 设备将适配灵波科技优化的 LingBot-Depth 版本。
- 奥比中光将推出集成 LingBot-Depth 最新模型能力的 SDK 产品,供机器人客户在端侧使用。
- 计划于年底推出集成 LingBot-Depth 商业版的一体化相机产品,实现“3D 相机 + 空间感知能力”的一体化交付。
目前,两款模型的技术报告及 LingBot-Vision 的模型权重已开源。蚂蚁灵波科技希望以开放方式与行业共建机器人视觉底座,加速具身产业规模化落地。
原始来源: 机器之心 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。