由DeepMind校友创立的英国AI实验室Inherent近日发布了一款名为Faraday的AI代理,它能够自动复现科学论文中的实验,其表现甚至超越了Anthropic和OpenAI的同类模型,为AI驱动的科研自动化迈出了关键一步。
源自DeepMind的AI基因
Inherent团队的核心成员均来自DeepMind——这家在AI基础研究领域享有盛誉的实验室。他们亲历了AlphaFold等里程碑式项目,深知科学研究的最大瓶颈之一:实验结果的复现。据TechCrunch报道,Inherent正在构建所谓的“AI队友”,Faraday便是其首个成果。该AI代理被设计为能够阅读、理解并执行科学论文中的实验步骤,最终输出可验证的结果。
Faraday的“复现”能力:超越GPT和Claude
在公开的基准测试中,Faraday在复现科研论文任务上的表现不仅优于OpenAI的GPT-4系列,也超越了Anthropic的Claude模型。Inherent团队表示,Faraday在多个学科(包括材料科学、化学、生物学)的论文复现测试中,成功率和准确率均显著领先。这意味着AI不仅能理解论文文本,还能模拟实验流程、处理数据、得出结论,并识别出论文中可能存在的混淆变量或结论偏差。
如何工作:从论文到实验结果
Faraday的工作流程并非简单的“复制粘贴”。它首先对论文进行深度语义解析,将自然语言描述的步骤转化为可执行的实验方案。然后,它调用外部工具(如计算模拟软件、数据库查询、统计计算包)来实际“运行”实验。最后,它对比结果与论文声称的结论,输出复现报告。整个过程无需人工干预,但人类研究员可以随时审查和调整参数。
性能对比:胜出指标
Inherent公布了部分对比数据:在“完全复现率”(即实验步骤和结果均与原文一致)上,Faraday达到62%,而OpenAI的GPT-4o仅43%,Claude 3.5 Sonnet为38%。在“部分复现”(主要结论一致但细节有出入)上,Faraday更是达到87%。这些数据表明,Faraday在理解复杂科学文献、处理多步推理任务方面具有明显优势。
行业意义:加速科研创新,改变研究范式
科学研究的核心在于可复现性。然而,近年来“复现危机”困扰着许多领域,据估计,超过70%的发表论文无法被顺利复现。Faraday展示的能力直接针对这一痛点:AI可以低成本、高速度地验证大量论文,筛选出可靠的结果,从而让研究人员将精力集中在真正有潜力的方向。此外,它还能帮助研究者发现论文中隐藏的细节错误或逻辑漏洞,提升科研质量。
从更宏观的视角看,Faraday的出现标志着AI从“辅助工具”向“研究伙伴”的转变。过去,AI主要帮助写作、总结或生成假设;现在,它能够主动执行实验,甚至比人类更快地复现结果。这为推动“AI for Science”提供了新的范式:未来,研究团队可能由人类科学家与多个AI代理组成,各自负责不同的实验环节,极大加速从假设到验证的周期。
降低门槛,让更多研究者受益
Inherent计划将Faraday作为云服务提供给科研机构和企业。这意味着,即使是不具备昂贵计算资源或熟练实验员的小型实验室,也能借助Faraday快速验证他人成果、复现关键实验。这对于资源匮乏地区的科学研究尤为重要,有望缩小全球科研能力差距。当然,目前Faraday主要适用于可计算模拟的领域(如计算化学、材料筛选),对于需要大量湿实验操作的任务,仍需与机器人实验室结合。但Inherent表示,团队正在开发与物理实验平台对接的接口,未来目标是在全流程实现自动化。
Faraday的发布,不仅是技术上的突破,更是对科研诚信和效率的强有力支持。当AI能够可靠地复现论文,我们离一个更透明、更可验证的科学体系就更近了一步。