AI

AI预测未来能力获验证:DigClaw框架在FutureX榜单斩获三席前十

7月,DigClaw预测框架Rhizome v1在FutureX评估平台的真实事件预测中,基于Kimi-K3、DeepSeek-V4-Pro等模型同时斩获第1、3、7名,验证了预测能力可沉淀于基础模型之外。针对大模型缺乏因果推理与概率校准等盲区,DigClaw构建了以因果结构为骨架、概率计算为引擎的预测基础设施,将搜索、因果推理和概率推断解耦,证明系统能力可独立于模型权重存在。

来源:量子位

VCs are starting to rely on AI to predict the future.

7月,DigClaw的预测框架Rhizome v1在FutureX评估平台中斩获第1、3、7名。这三个成绩分别基于Kimi-K3、DeepSeek-V4-Pro等不同基础模型取得。同一套框架使它们同时进入Top 7,DigClaw也是唯一实现这一点的参与者。

FutureX包含59个涵盖政治、经济和技术领域的真实事件预测问题,不存在训练数据泄露的可能。这一结果验证了DigClaw的判断:预测能力可以沉淀在基础模型之外。随着基础模型的进步,系统可以获得能力红利,而预测轨迹、结算反馈、校准经验和不断演进的工作流则持续沉淀在系统内部。

预测是AI最被低估的能力

大语言模型天生不擅长预测。LLM学习的是相关性而非因果性,这带来三个致命问题:
- 因果方向盲区:模型知道A和B常一起出现,但不知道因果关系。
- 干预推理失败:无法回答“美联储降息对东南亚科技股有何影响”,因为没有因果图支持干预计算。
- 缺乏校准:模型输出的“70%概率”未经概率学校准,只是token分布的副产品。

现有解决方案均有局限:预测市场需要流动性且对小众问题价格不可信;LLM模式匹配缺乏因果结构;端到端训练存在结果导向偏差。

DigClaw的预测基础设施

DigClaw构建了以因果结构为骨架、概率计算为引擎、搜索智能为数据管道的预测基础设施。其核心假设是:预测不应由单一模型端到端完成。搜索、因果推理和概率推断是三个正交的能力,应由三个专用系统分别解决,然后进行结构化组合。

FutureX榜单验证跨基础模型能力迁移

FutureX是目前最具挑战性的实时预测排行榜,每周发布真实事件预测问题,提交预测时标准答案尚未生成,事后进行结算。数据集托管在HuggingFace,评估框架在GitHub开源。

Rhizome在三个基础模型上采用同一套预测框架和运行条件,独立生成并提交答案,不进行跨模型聚合。这三个排名是同一系统方法在三个基础模型上的独立运行,即明确的跨基础模型对照实验。

这表明:如何组织检索、处理时间、表达概率、维护证据和控制长时间运行操作,可以形成独立于模型权重的系统能力。

Rhizome技术报告核心设计

Rhizome的设计围绕三个工程判断:
1. 搜索与推理必须解耦:搜索质量和推理质量是两个正交问题。当前主流DeepResearch代理将搜索和推理绑定在同一模型中,导致相互拖累。Rhizome将两者完全解耦,搜索代理只负责寻找相关信息,推理层只负责对现有证据进行结构化推理。

原始来源: 量子位

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度