代季峰团队开源首个模型,探索AI研发AI新路径
Naive AI 正式开源其首款模型 Naive-N0.5-Flash。该模型总参数量为 309B,激活参数量为 15.5B,原生支持百万 token 上下文,主要面向编程与 AI 研发。其核心特点是具有双重身份:既由 AI 参与研发,也被专门训练来承担 AI 研发工作。
AI 深度参与研发流程
Naive AI 摒弃了传统以人类为中心的研发体系,将写代码、跑实验、监控流程等工作交给 AI。研究员主要负责提出目标、设定约束与评价标准及最终决策。技术报告显示,AI 参与了注意力架构的探索以及训练、推理和部署系统的优化。例如,在推理运行时 NaiveRT 的优化中,研究员与 AI 用六天推进 151 轮实验,将投机解码耗时从 12.3 毫秒降至 3.4 毫秒。此外,模型还接手世界模型研究工作,经过 400 小时实验得到 AutoWM,跻身 WorldArena 第一梯队。
核心评测成绩亮眼
在考察论文复现能力的 PaperBench 中,Naive-N0.5-Flash 取得 63.2 分,高于 Claude Opus 4.7 和 GPT-5.5 等模型。在机器学习工程 MLE-bench-30 上取得 73.7% 的成绩。在语言模型后训练 PostTrainBench 上取得 37.5 分。在 NanoGPT SpeedRun 任务中,将成绩提升至 73.8 秒。此外,在编程能力 NL2Repo 和长程任务 ALE-CLI 上也展现出强竞争力。
架构改造与训练优化
为解决百万 token 上下文的效率问题,团队以 MiMo-V2.5 base 为起点,用 DeepSeek 稀疏注意力(DSA)替换全局注意力,构建 SWA-DSA 混合稀疏注意力架构。在累计 3.25T token 的多阶段训练中,AI 承担了关键验证工作,如分析索引器召回情况并修复数值稳定性问题。在训练系统层面,AI 提出混合序列并行方案,将 SWA 部分的通信复杂度大幅降低,并细化了显存管理策略。
Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,并提供 API 服务,为研究者和开发者提供了新的部署选择。
原始来源: 机器之心 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。