AI科学家走进物理世界:Google三档自主度实验的突破与边界
当AI不再只待在服务器里跑数据,而是走进实验室接过烧杯和炉子,科研的边界正在被重新定义。2026年8月,Google DeepMind发布升级版Co-Scientist,这是一款基于Gemini的多智能体科研Agent。它按三档自主度分级部署,从材料配方设计到生物形态预测再到代码级推理全程自动化,让AI科研从纯计算走进物理世界。这不仅是技术迭代,更是对AI Agent可靠性的一场公开双盲检验。
三档自主度的分级实验部署
Co-Scientist的核心创新在于自主度的分级设计。材料科学档由人类执行AI设计的配方,生物领域由专家与AI协作,计算机科学则全程全自动。实验越依赖物理操作、越难被确定性核查,人工介入就越深。这种分级机制背后是对不同领域风险敞口的精准把控:湿实验的不确定性远高于代码执行,因此材料档必须保留人类专家的判断权。同一套Agent在不同自主度下承担截然不同的职责,这意味着AI的价值不是取代科学家,而是按需放大某一环节的效率。
晶体生长:从理论配方到物理验证
材料科学档的突破最为直观。Co-Scientist收到一条指令:找一种安全前驱体替代有毒且怕空气的四氯化钛。它结合实验室CVD炉的物理约束推理反应动力学,在272个候选配方中排名第二的方案被人类专家选中——六氯乙烷加钛粉。经过25轮迭代,成功生长出二维晶体,衍射峰位、元素组成、晶格间距均与MXene文献值吻合。更进一步,MoS2、MoSe2、WS2三种二维半导体也通过类似流程一次长成单层。代价同样存在:晶体比完整演化配方的更小、更不规整,且仅在自建炉子上验证过一次,跨实验室复现尚未得到证实。
AI科研的成败,不在论文数量里、不在benchmark分数里,而在每一个声明都能对着执行记录核查的真实性里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
可靠性工程:幻觉率从90%压到4%
Agent Laboratory把前作放上双盲实验台当基线,对比完整版Co-Scientist、关闭可靠性模块的消融版和基线系统三个版本,由30位专家进行450次盲评。结果显示,足以推翻结论的严重幻觉率方面:完整版仅4%,消融版46%,基线高达90%;极端捏造一项,完整版归零,消融版40%、基线44%;严重抄袭方面,完整版16%,基线60%。Schmidgall指出,两处关键改动压住了幻觉:一是幻觉罚项和抄袭罚项直接写进优化目标,编造结果在数学上不划算;二是确定性核查模块把论文声明绑在执行日志上,没有实验记录就写不成文,相当于每篇论文强制附上实验记录本。残留问题同样值得关注:选择性报告、潜意识抄袭、方法漂移等现象尚未根除,且这套核查机制只在计算领域成立,湿实验的噪声测量还无法像代码日志这样对账。
自动评测与医生盲评的鸿沟
Agent_H在计算机科学档全自动运行,采用8阶段推理时架构:分诊、并行生成28到48个候选、两两淘汰、多轮审计,回答一题需调用40到80次LLM。在HealthBench Hard和Professional两个医疗评测集上,Agent_H的长度修正分数超过GPT-5.6 Sol、Claude Opus 5等6个前沿模型,两个LLM评委口径一致。然而,3名执业医生盲评106道题的结果却大相径庭:9个临床维度里只有「降低潜在伤害」一项达到统计学显著(p=0.0486),其余8个维度医生感知不到差别。LLM评委按评分细则逐条打勾,而医生看的是回答整体的可信度。这揭示了一个根本矛盾:benchmark分数的上涨不总能转化成专家偏好。Schmidgall在论文中写道:Agent_H没有失败,医生盲评是对所有benchmark捷报的提醒。
Google把AI科学家往前推了一格:设计配方让人类执行、预测还没做的实验、全自动完成整个计算研究,每个声明都能对着执行记录核查。AI从纯计算走进物理世界,走的方式是先把每个声明钉在实验记录上。自主度分级、可靠性工程与双盲验证,这套组合拳为AI Agent在真实科研场景中的落地提供了方法论参考。
