Wink Pings

斯坦福把GPT-6和Claude组队?论文实际测的可能是小模型

推文称斯坦福用两个大模型协作打破重采样墙,MATH500提升28个点。但评论区有人读完全文:模型是Qwen和LLaMA,1.5B起。

一条推文在AI圈传得很快:斯坦福研究组找到一种方法,让Claude Opus 5.5和GPT-6 Astra协同工作,直接打破了重采样墙。听起来很性感。但评论区有人读完论文,说:里面根本没有这两个模型。

先解释一下重采样墙。大多数开发者理解的test-time compute,就是让同一个模型在报错后反复重试。你烧掉大量token,模型却在同样的错误模式里打转。这篇斯坦福论文(arXiv:2608.05643)的思路是:把计算分给两个不同模型。

具体做法是:

- **广度搜索**:GPT-6 Astra以高熵模式(T=0.8)探索多条解题路径。

- **逐步审计**:Claude Opus 5.5以零温(T=0.0)逐条扫描推理步骤,定位逻辑错误。

- **局部手术**:Opus只重写出错的那一步,而不是推倒整个推理链。

- **免验证器共识**:多数投票锁定结果,不依赖容易漂移的过程奖励模型。

简单说:一个负责发散找路,一个负责冷静挑错。

论文报告的数据很亮:91.2%的已检测推理缺陷恢复率,正确分支回归率低于1.8%。MATH500从29.6%涨到58.0%,AMC-2023在零奖励模型下提高7.5%。

下面是原推文附带的实验图表视频。

问题出在推文的表述上。网友@Kagi在评论区说他读了原文,里面没有Opus 5.5或GPT-6 Astra,测试的是Qwen2.5和LLaMA-3.1这类1.5B-8B的开源模型。MATH500那个58%的成绩,来自一个1.5B模型。

这个差异很关键。如果属实,那这篇论文的价值就不是“大模型组队”,而是证明了小模型也能通过分工策略获得接近大模型的推理能力。这其实更能说明test-time compute的价值:推理时算力可以部分替代参数规模。

marfin那条推文可能只是把论文结果嫁接到了大家熟悉的模型上,方便传播。但这不意味着论文没价值。它和marfin自己写的《Test-Time Compute Engineering》其实是同一套思路:动态预算、过程奖励模型、树搜索、提前剪枝。只是论文实验用的模型更小,更接近可复现的学术研究。

另一个视角:大模型+大模型组合,成本会翻倍。小模型+小模型组合,如果真能把MATH500翻倍,那才是工程上的大新闻。毕竟在test-time compute里,经济性才是落地关键。

所以,下次看到“XX模型+XX模型突破瓶颈”的标题,先别急着转发。查一下论文,确认它测的到底是谁。真正的宝藏,可能藏在没有品牌光环的实验里。

发布时间: 2026-10-05 09:09