AI

腾讯混元多模态理解负责人胡瀚离职创业,原团队将转向世界模型

腾讯混元大模型多模态理解负责人胡瀚已提交离职准备创业,前OpenAI研究员田永龙将接手其视觉语言模型研发工作。据悉,姚顺雨近期正密集复盘团队,胡瀚原所在团队预计将转向世界模型前沿研究。腾讯正集中资源攻坚基础大模型,因多模态理解技术边际收益递减且商业化受限,腾讯将有限算力优先投入大语言模型及世界模型等核心方向。

来源:36氪

腾讯混元多模态理解负责人胡瀚离职创业,原团队将转向世界模型

前OpenAI研究员田永龙将接手胡瀚的工作。

近日,腾讯混元大模型多模态理解负责人胡瀚已提交离职,准备创业。此前,他曾担任微软亚洲研究院视觉计算组首席研究员,2025年初加入腾讯后负责视觉大模型研究,后并入大语言模型部旗下的“前沿”先进技术研究组,负责多模态理解相关研究并向姚顺雨汇报。据悉,胡瀚也曾承担世界模型的研发工作。

与此同时,腾讯大语言模型部负责人姚顺雨近期正对团队进行密集复盘,胡瀚此前所在的研究组预计将转向世界模型的前沿研究。截至发稿,腾讯官方尚未对此回应。

大语言模型仍是混元最高优先级

自2026年中以来,围绕混元生态的人事调整一直在进行。7月初,前OpenAI研究员、麻省理工学院博士田永龙加入大语言模型部,他将接替胡瀚领导视觉语言模型(VLM)方向的研发,向姚顺雨汇报。

自姚顺雨加入腾讯以来,填补能力空白、迅速将混元基础模型能力提升至第一梯队,已成为腾讯AI的核心优先级。重组资源配置,将人才和算力集中到大语言模型部的基础模型研发上,是姚顺雨上任后实施的核心举措之一。例如,腾讯解散AI Lab后,所有核心研发人员均并入大语言模型部。

重新评估多模态理解的投入产出比

在腾讯各AI业务线尚未确立绝对领先地位的情况下,腾讯需要重新评估各AI技术方向的投入产出比。

一方面,胡瀚从事的多模态理解研究已趋于成熟,继续投入资源的边际收益十分有限。多模态研究者表示,目前文本、图像和视频的识别准确率普遍能达到85%以上,真正的挑战在于视觉推理,而这无法仅靠多模态研究实现,需要提升语言模型的推理能力。此外,多模态理解带来的商业效益依然模糊,如“图像识别”等场景难以直接商业化,用户真正愿意付费的是文档处理、PPT制作等依赖模型推理和Agent能力的办公场景。

另一方面,腾讯的算力资源有限,相比字节跳动和阿里巴巴并不具备优势。在资源有限的情况下,混元团队不可避免地面临供不应求的局面。因此,暂停技术红利有限的多模态理解研究,将资源集中投入到更具战略意义的世界模型和大语言模型研发中,成为腾讯AI当前的必然选择。

原始来源: 36氪

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度