3D世界成AI竞赛新战场
生成式AI的竞争正从平面内容延伸至三维世界。近期,Anthropic、World Labs、OpenAI与字节跳动接连发布或曝光了面向3D交互空间的新模型与技术,三条技术路线逐渐清晰。
LLM驱动3D内容生产
OpenAI与Anthropic选择依靠大语言模型的通用推理与工具调用能力,切入虚拟内容生产管线。
- OpenAI GPT-6 Astra:具备计算机操作能力,能独立驱动Blender、Unreal Engine等软件,完成从概念到可交互3D场景的全链路生成,大幅降低游戏开发与场景搭建的人工成本。
- Anthropic Claude Fable 5.1:通过MCP连接器生态直接嵌入专业软件内核,流畅协同完成素材检索到成品输出的全流程。两者均致力于将智能体能力嵌入工业软件管线,服务专业创作者。
视频模型向可交互空间延伸
视频模型正试图从单纯的画面渲染向上游的空间理解与实时交互延伸。
- 字节跳动:正基于Seedance视频模型研发实时空间视频生成模型,由张一鸣亲自协调资源。该模型目标直指可响应用户动作与声音的实时虚拟环境,端到端延迟约50毫秒,计划适配Pico VR头显,覆盖直播、互动短剧与游戏场景,从生成工具转向承载体验的平台。
原生世界模型重构空间理解
与依托现有工具链不同,原生世界模型选择从零训练以理解三维空间。
- World Labs Atlas:由李飞飞联合创立的World Labs发布。作为原生多模态模型,Atlas统一处理文本、图像、视频和相机位姿信息,锚定在同一套三维空间坐标系中。其核心在于原生的空间一致性,仅需少量参考图即可还原真实三维场景并输出新视角画面,适用于影视虚拟制片、游戏关卡原型与数字孪生等领域。
短期内,LLM智能体派、视频模型派与原生世界模型派将各占山头,共同推动内容产业形态向“可进入、可交互的空间”转变。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。