资讯动态
首页 / Our Projects /复现论文,10 个模型集体“翻车”!PaperBenchX 找到了 AI 科研的卡点复现论文,10 个模型集体“翻车”!PaperBenchX 找到了 AI 科研的卡点
作者 | 黄小艺 微信 | H997Hbiu AI 正在承担越来越完整的科研工作。人们对它的期待也从辅助研究,延伸到了自主发现。 10 月 6 日,OpenAI 一次性公开了由内部前沿模型产出的 722 篇数学论文手稿,并为其中部分证明提供了可由计算机检查的 Lean 形式化版本。AI 参与科研的成果,正以越来越大的规模呈现在人们面前。 但成果越多,验证也就越重要。OpenAI 在发布中明确说明,这批结果处于不同的验证阶段,部分非正式的结果仍可能存在问题。 这也是 PaperBenchX 想要讨论的事情。 它由 UniPat AI 推出, 关注的正是模型交出的研究成果,能不能经得起独立检查,以及该如何检查和衡量? PaperBenchX 评测的角度也很巧妙:通过给 AI 一篇已经发表的论文,让模型在真实的科学软件中,把指定的关键实验重新做一遍,来观察它能否交出规范的实验流程,并执行得到可验证的结果。 10 个前沿 Agent 配置参与了这一评测。结果是,在覆盖了12个科学方向的93道题中,有 70 道,没有被任何配置“完全复现”。即使是表现最好的 GPT-6 Astra,也只有 14% 的任务能过关。而国产模型,基本在 7%左右,只有 GPT-6 Astra的一半。 PBX 中的前沿 Agent 表现。柱状图表示完整得分(> 90%);方框表示部分得分 一直以来,可重复性都是科学的关键特征之一:一项结果的意义不仅在于它已被发表,更在于其背后的假设、程序和证据可以被重构并独立检验。 放到 AI for Science 里,可重复性同时也是未来 AI 自主发现需要打牢的地基。在 PBX 里,已有论文提供了明确的目标,也提供了检验方法是否成立的参照。 模型能否复现实验过程,直接关系到我们能否把更开放创新性研究放心地交给它。 这也是我们觉得 PBX 重要的原因——它把“AI 能否可靠地复现研究”,变成了可以逐项检验的问题。 当模型不断突破智能上限、解决科研难题时,总有人要关注:这些能力能否支撑它按科学规范完成整个研究过程,模型进入科研人员的日常工作后,究竟能承担多少工作,又有多少成果值得信任。 团队也公开了相关研究和背后的思考,感兴趣的读者可以进一步查看下面两个链接: GitHub 开源链接:https://github.com/UniPat-AI/PaperBenchX 官网 Blog 链接:https://unipat.ai/blog/PaperBenchX 1 模型们都错在哪里了? 先看 Astra 做的一个“八单元手机 MIMO” 天线任务。 简单说,就是塞进手机里的 8 根小天线,要同时工作、互不干扰。它要求模型搭出结构,在电磁仿真软件 HFSS 里算出匹配、隔离、效率等一堆性能,看是否和论文一致。 GPT-6 Astra 花了 187 轮交互,2.83 小时,跑了两组仿真,不仅都收敛了,隔离、增益等部分指标也过了关。 但问题出在一个关键尺寸上。 它在建模时写进了参数文件,却没有进入真正被计算的结构。 就像照图纸造东西,尺寸抄对了,东西却没照着造,最终未能通过核心性能检查。 这也是科研 Agent 的一道难关:论文里的要求,需要在长周期执行中,始终准确地传递到不同环节。 另一个天线任务,要求比较三种结构,DeepSeek-V4.1-Flash 完成了三组计算,也发现了需要调整的地方。但最终,总分却只有 13.2%,科学验证一项得分为 0。 这是因为,它修正端口方向时,最后一次完整重跑已经结束,交付前没有再完整检查修改后的流程。此外,计算一项指标时,它还漏掉了公式中的平方。 多轮实验探索,是相互递进的。这个错误反映出的是,Agent 必须知道,每组结果对应哪套设置。 改动一个参数后,哪些计算需要重做、哪些图表需要更新、哪些结论需要重新检查,都要沿着这些依赖关系跟进。 这也是 PBX 把评分拆成三类的原因:建模,看研究对象搭得对不对;执行,看规定的计算有没有真跑、证据留没留住;科学验证,看算出来的东西能不能撑起论文要的结论。 1 做对不少步骤,为什么还是没做成? 把具体失误放回总榜,模型之间的差异就更容易理解了。 PBX 让 10 种前沿 Agent 配置接受相同的 93 个任务。看它们完成了多少步骤和结果上的评分要求。 受测模型中,Astra 以 59.08%领先,Fable 5.1 和 Fable 5 都在 58%左右,与它接近;而国产配置中,Kimi K3、Qwen3.8-Max 则分别约 49%、47%。 10 组受测配置在 93 个复现任务上的总体与分阶段表现 再看模型们能完整完成多少任务。 单项得分严格超过 90%,才达到论文定义的“完全复现”门槛。Astra 过关 13 个,两个 Fable 分别过关 12 个、1
搜索
最新内容
苹果突然官宣发布会!全新产品来了
国足三连败只是表层问题
[流言板]李楠:新赛季我们要拼字当头,打出北京男篮顽强拼搏的作风
[流言板]翟晓川:休赛期大家进步比较明显,从感官上看都是有进步的
第二战线打响!
[流言板]努诺拒绝回答曼城问题:西汉姆联把精力放在重要的事上