系统升级
2026年8月28日,谷歌DeepMind发表论文,展示其多智能体系统Co-Scientist的重大升级——从最初的假设生成工具,进化为能够规划实验、编写代码、控制实验室设备并撰写科学论文的闭环自主科研系统。
该系统基于Gemini 3系列模型构建,在三个学科领域展示了不同程度的自主性。
三领域验证
- 材料科学:与半自动化高温炉配对,发现更安全的二维材料合成路径,利用Gemini 3 Deep Think直接控制设备,将配方开发时间从数天缩短至数分钟
- 生物学:自主构建图像分析管线,预测基因工程大肠杆菌菌落的图案形成
- 计算机科学:在几乎无人类干预的情况下,设计出名为「Agent_H」的医疗AI架构,在健康基准测试中超越GPT-5和Claude Opus 5
造假率显著降低
最引人注目的技术突破在于造假率的显著降低。通过引入验证模块——将论文中的数值声明与代码执行日志进行交叉核对——Co-Scientist的关键结果造假率从46%降至4%,而对比系统高达90%。完全伪造的数据从未出现在Co-Scientist的输出中,但对比系统44%的论文存在此问题。
局限性
然而,研究也揭示了局限性:三名执业医师评估Agent_H时,在九个评估类别中仅有一项(降低有害回答风险)显示出统计学显著优势,且自动评估器与医生判断的相关性较弱。这表明高基准分数并不等同于实际临床价值。
在AI系统能够驾驭科学的物理现实之前,还有很长的路要走。但我们对LLM帮助人类和加速现实世界进展的潜力深感兴奋。

