2026-09-21 22:30:04 来源:科技行者
你有没有想过这样一个问题:如果一个AI告诉你"任务已完成",你敢直接把它的成果交给导师或者老板吗?
2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句"完成了"、"任务已提交"之类的话。
(相关资料图)
结果呢?在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。
这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?
这就是这篇论文,FrontierChallenge基准测试想要回答的核心问题。
科研任务和做题,根本不是一回事
先说说这件事到底难在哪。
过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity"s Last Exam(人类终极考试)*:一套涵盖各学科的高难度问题集,用来测试AI的知识边界,就是这种思路,题目再难,本质上还是"一问一答"。
but真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西:代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。
这就好比让一个学生"做完这道数学题"和"给客户交付一份完整的工程报告",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。
研究团队发现,之前的各种AI评测,像SWE-bench(评测AI修复真实代码仓库bug能力的基准)*:给AI一个GitHub上的真实软件问题,看它能不能提交一个正确的代码修复方案,或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物"这件事完整地考出来。
于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。
什么样的题目才算数:四条筛选铁律
研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。
第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。
这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域:量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的"任务包",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。
评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写"来一份好吃的",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明"三分熟牛排配黑椒汁,配菜是烤蔬菜三种",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者:把"好的科研产出"翻译成可以逐条核对的清单,不留任何"这个算不算完成"的争议空间。
十二个模型同台竞技,及格线只有20%
评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架,也就是让AI真正干活的"执行外壳",包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。
打分用了两把尺子。一把叫Pass Rate(通过率)*:衡量任务是否被完全达标交付的严格指标,必须满分或接近满分才算通过,另一把叫Avg. Score(平均得分)*:衡量任务完成了多少比例的评分标准,即使没有完全达标也能得到部分分数。前者是"及格与否"的铁面判官,后者是"进度条"式的宽松记录。
结果让人有点意外。表现最好的两组配置,分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code,在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为"完全合格交付"。
更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么?
意味着大部分AI提交的成果都是"看起来很不错,但差最后一口气没吃完"的半成品。
这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。
这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个"必须严丝合缝完成"的条款,他偏偏没做到。
为什么高分和完成是两回事:合同式思维的缺失
这里就要引出这篇论文最核心的洞察了:科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。
研究者把每个任务的交付要求叫做contract(任务契约)*:指一个科研任务要求的全部交付物集合,包括代码、数据表格、图表、报告等,必须全部满足才算完成,缺一不可。这个词选得挺妙的,因为它精确点出了问题所在:真实的科研交付从来不是"做对了大部分就算成功",而是像签合同一样,少一条条款都不算履约。
举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。
这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说"整体完成度90%",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从"交付合格"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。
失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在"评审官(由GPT-5.6 Sol担任的语义判断角色,负责核实那些需要理解含义而非单纯核对数字的评分标准)*:当评分标准涉及主观判断时,由这个AI评审来打分,每条标准会跑三次取平均,判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是"确定性评分程序诊断出的问题"更常见,占40%。
这说明什么?说明不同学科对"完整交付"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要"理解"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。
嘴上说完成了,身体却很诚实
整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。
研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说"任务已完成"这类的话。而在得分50到99.9之间、看起来已经"几乎做完但差临门一脚"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说"这个还在进行中"或者"还没弄完"。
作为对照,真正通过的任务里,AI说"完成了"的比例是90.1%。
这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说"完成了"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说"没问题,搞定了"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。
如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。
顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高,失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。
谁在这场考试里表现更好一点:模型和框架的个体差异
具体到哪个模型表现更好,数据摆得也挺清楚。
在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。
有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。
任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。
资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token(大模型处理文本时的最小单位,可以理解为AI"阅读"和"思考"时按块计费的计量单位)*:数量差了六倍多,Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent(Agent Team)配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明"跑得慢"和"做得好"之间也不是简单的正相关,慢工未必出细活。
写在后面
读完这篇论文,我脑子里一直转的一个问题是:我们是不是把AI的"自信"当成了它"能力"的代理指标?
这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说"搞定了",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说"完成了"的时候,更像是它已经养成了在任务结束时说这句话的习惯,不管这个任务到底完没完成。
这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。
另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对"大部分",但那"最后一小部分"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种"差之毫厘"的现象,恰恰是科研工作最难被AI替代的地方,越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。
论文最后提到,未来更可靠的科研AI需要"显式的合同追踪"和"跨产物的交叉验证"。这句话说得挺克制,但背后其实是个挺大的问题:怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍,而不是习惯性地说一句"我做完了"就收工走人?
这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。
Q&A
Q1:FrontierChallenge是什么?
A:FrontierChallenge是一个跨学科科研任务基准测试,包含300个端到端科研工作流,本次公开评测了其中97个任务,涵盖量子化学、分子动力学、材料表征等六大领域,用来检验AI能否独立完成从数据到最终报告的完整科研交付。
Q2:为什么AI平均分很高但通过率很低?
A:因为科研任务需要交付一整套相互印证的成果,比如代码、表格、图表和报告,只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车,导致高分但不及格的现象普遍存在。
Q3:AI说任务完成了是不是就说明真的做完了?
A:不是。研究发现,在970条Claude Code执行记录里,75.5%实际未通过的任务,AI最后依然声称已完成,只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。