近日,由中国科学院香港创新研究院人工智能与机器人创新中心领衔,联合中国科学院自动化所、香港中文大学、慕尼黑工业大学及多家顶尖医院,正式发布了全球首个十亿级参数、最大规模数据集练成的手术视频原生基础模型SurgMotion。
范式颠覆:从“像素重建”到“时空运动预测”
传统医疗视觉模型受限于单帧静态感知或低效像素级重建。SurgMotion基于视频联合嵌入预测架构(V-JEPA),摒弃传统像素级解码,专注于潜空间运动预测,引入三大核心技术创新:
- 运动引导的潜空间遮蔽预测:过滤噪声,聚焦器械运动等关键语义区域。
- 时空亲和力自蒸馏:学习时空强关联,实现对复杂流程的连贯理解。
- 时空特征多样性正则化(SFDR):解决纹理单一导致的表征崩溃,保持鲁棒性。
全球最大预训练数据集
研究团队打造了SurgMotion-15M数据集,包含3658小时真实手术视频,总帧数达1500万帧。汇聚50个数据源,横跨13个主要解剖区域,涵盖多学科复杂术式。
十亿级参数与全面评测
在1B参数支持下,SurgMotion成功整合视频特征空间。在涵盖17项权威基准测试中表现卓越:手术动态理解性能平均提升16.5%,静态任务误差平均降低2.9%。在动作三元组识别等任务中刷新世界纪录。
全球生态共鸣
SurgMotion在GitHub和Hugging Face全面开放。发布仅三个月,已成为Hugging Face上全球下载量第一的手术视频基础模型。已有来自5大洲、14个国家和地区的近40个顶尖机构申请使用,包括直觉外科、卡尔史托斯、蔡司等企业,以及杜克大学、慕尼黑工业大学等高校,推动技术落地与临床实践。
原始来源: 机器之心 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。