StartLux-Decision 发布,综合成绩超越 Jev
9月30日,上海AI企业StartLux(原点星辉)正式发布完全开源的决策模型 StartLux-Decision。该模型推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。
在 Decision Index 0.2.1 的 38 项基准测试中,StartLux-Decision-27B 有 31 项成绩超过 Jev 1.13,综合得分 63.88 对 57.91,领先公开榜首近 6 分。在与 Jev 的国际象棋对弈实战中,StartLux-Decision 在 36 局中赢下 35 局。
为什么 Agent 需要决策模型?
与传统生成式 AI 不同,Decision 模型不需要先生成自然语言再由程序解析,而是直接针对开发者提供的候选项进行选择、是非判断或等级评分。
在 Agent 系统中,大量步骤的需求非常短小且答案空间相对明确。如果由大模型完成这些高频判断,会消耗大量算力。StartLux-Decision 专为这些高频、候选集明确的判断任务设计。测试显示,其 4B 版本一次回答三个问题平均耗时仅 26 毫秒。当 Agent 任务包含几十个判断节点时,专用决策模型能显著降低计算开销,提升响应速度。
本地智能分层与 Auto Research 体系
StartLux-Decision 是 StartLux 本地智能系统分层架构中的关键组件。在该架构中,StartLux-27B 承担通用能力层,Decision Model 专注于高频决策,上层部署 Agent 与 Memory,底层由量化和推理系统支撑。这种设计解决了个人电脑硬件资源受限下的算力分配问题。
此外,该模型的研发得益于 StartLux 的 Auto Research 体系。团队仅用 3 天便跑通了从确定方向到首轮研发验证的流程。在该体系下,AI 参与了 70% 的核心研究与决策环节,包括失败分析、数据构造和实验评估。这标志着本地智能正从单纯的模型迭代演变为综合的系统工程。
原始来源: 机器之心 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。