AI

美国阿贡国家实验室提出ChemGraph,以13项基准测试评估计算化学Agent

美国阿贡国家实验室提出大模型驱动的Agent系统ChemGraph,用于执行计算化学领域的分子模拟工作流。该系统结合图神经网络与大语言模型能力,支持多种分子模拟方法。研究人员设计了13项基准实验评估其能力,结果显示大模型在复杂任务中表现更优,但通过合理拆解子任务,小模型也能达到甚至超越大模型性能。相关论文已发表于Nature旗下期刊。

来源:36氪

美国阿贡国家实验室研究团队提出ChemGraph,一个由大语言模型(LLM)驱动的Agent系统,旨在执行计算化学领域的分子模拟工作流。近年来,AI和LLM的发展为自动化科研开辟了新途径。此前已有ChemCrow、CACTUS、MDCrow等化学Agent被开发出来。在此背景下,ChemGraph应运而生。

ChemGraph利用基于图神经网络的基础模型实现准确高效的计算,同时结合LLM的自然语言理解、任务规划和科学推理能力,提供直观的交互界面。它能完成从SMILES字符串和分子结构生成,到几何优化、振动分析和热化学计算等一系列任务。此外,它支持用户使用多种分子模拟方法,包括半经验方法、机器学习势能和密度泛函理论(DFT)。

由于计算化学领域缺乏统一的Agent评估基准,研究人员设计了13项基准实验,测试ChemGraph使用6种集成工具完成单项及链式工具调用的能力。任务根据输入类型分为分子名称、SMILES字符串和化学反应三类,共进行360次独立评估。前11项实验主要围绕分子名称或SMILES字符串,最多需4次工具调用;后2项实验聚焦化学反应的热化学性质计算,复杂度显著增加,需9至12次调用。

测试结果显示,对于只需少量工具调用的简单任务,较小的LLM(如GPT-4o-mini和Claude-3.5-haiku)能实现高准确性和稳定性。但随着任务复杂度增加,这些模型性能显著下降,而大模型(GPT-4o)保持强劲表现。不过,通过将复杂任务策略性地拆解为更小、更易管理的子任务,即使使用较小规模的模型也能提升ChemGraph的性能,使其达到与GPT-4o相当的水平,甚至在某些情况下超越GPT-4o。

ChemGraph是一个基于LangGraph并遵循ReAct框架的LLM驱动Agent框架,通过结构化的工具调用和推理能力实现自动化。LangGraph引入基于图结构的执行模型以实现更稳健的多Agent协作,包含状态(State)、节点(Nodes)和边(Edges)三个核心组件。相关研究论文已发表在Nature旗下期刊《Communications Chemistry》。

原始来源: 36氪

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度