9月8日,分析机构SemiAnalysis连甩五条推文,直接点名谷歌和Meta两家万亿巨头——Gemini 3.8 Flash和Muse Spark 1.3是「刷榜痕迹最明显的两个模型」。
在测Agent干活能力的Terminal-Bench 2.1榜单上,Gemini 3.8 Flash考了89.4分,在182个模型里高居第2,把GPT-6 Astra都压在了身下。结果换到8月29日刚上线的Terminal-Bench 4.0,同一个模型只拿到19.1分,在14个测试对象里直接掉到第12,成绩当场打了个二折。同一时间,GPT-6 Astra从88.4掉到57.7,好歹算个六五折。仅仅27分钟后,Meta首席AI官Alexandr Wang亲自杀到评论区,开口直接甩出六个字,这是个愚蠢的论点。他认为GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但没人说Sol在刷榜。同时他还强调,Meta从没说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是它的性价比显然更高。简单介绍一下,Terminal-Bench测的是Agent真实干活的能力。方法是丢给模型一个终端和一个模糊目标,剩下的全让它自己看着办。然后,系统得自行规划路径、调工具、写脚本,报错了还得自己去改。在已经被业界刷了大半年的2.1版本上,这俩的成绩确实好看。Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。好家伙,一个Flash级的便宜模型,一个主打性价比的Meta新作,双双把两家顶级实验室的旗舰按在地上摩擦。新卷子一共66道题,不仅砍掉了8道已经被「刷穿」的旧题,大修了19道,还统统加上8小时的超时限制。主办方不仅设了35条评分细则,还加了一轮专门的「对抗性作弊试验」,故意让Agent自己去试着钻奖励机制的空子,只要钻得通的题就会被直接毙掉。Claude Mythos 5.1(max)拿到60.9分稳住阵脚,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别拿到37.3分和23.6分。相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis给出的图表,Muse Spark 1.3的成绩是33.3分。旧榜上,Gemini 3.8 Flash还能压着GPT-6 Astra打;新榜上,它的分连人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。吵架归吵架,SemiAnalysis第二条推的点名才是真正的行业内幕。在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝对不会傻到直接拿原题去训练,但他们绝对会去买数据,专门买那些被设计得无限贴近TB 2.1题型的训练数据。最后的效果其实跟作弊没差。以前的「污染」套路很糙,直接把原题混进预训练语料让模型死记硬背。业界在这上面栽过不少跟头,比如HumanEval近四成样本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,换套私有代码库重测,分数直接腰斩。所以现在大厂不碰原题了,大家改买「长得像考题的模拟卷」。也就是提供给模型试错并给奖励的封闭任务系统。- 单个训练任务售价200到2000美元,复杂的软件工程任务甚至能开到2万。
- 要是想克隆一个网站做成UI训练场,大约需要2万美元。
- 如果要求复刻一个Slack量级的产品,那就是30万美元起步。
根据Epoch AI的调研,Anthropic内部讨论过每年在这上面砸10亿美元。单季合同动辄六七位数,有研究员透露均价在30万到50万美元一季。供给侧至少有35家公司在做这门生意,绝大多数是20人以下的初创团队。老牌数据巨头也全在转型,Scale AI在被Meta入股前营收就超14亿,Surge的ARR也逼近10亿。一边是完全公开的榜单题库,另一边则是成熟的卖题产业链。想让模型在某个榜单上考高分,真不用费劲作弊,直接掏钱下单就行。
随后,SemiAnalysis直接点名了一家叫Datacurve的公司。在专测长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash拿到73.8分排在第四。这个榜是Datacurve办的,而Datacurve赚钱的门路,恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。DeepSWE不仅是Datacurve自家的基准,跑分用的还是它自己运营的评测环境。既当卖题的辅导机构,又当出卷的监考老师,可以说是彻底坐实了。
最后,SemiAnalysis顺势给整个行业的公开评测下了一道判词。他们觉得这说到底就是所有优质公开基准的宿命。TB 4.0也不例外,它现在看着还准,仅仅是因为它才发布了两周。只要它的题目还是公开的,用不了多久就会被所有标榜「前沿」的实验室盘出包浆。SemiAnalysis最终给出的解药非常直接,那就是多做高质量的私有基准。一旦评测全部私有化,公开榜单就会彻底沦为各家的营销通稿。真正有区分度的真实成绩,只会在实验室和私有评测机构之间暗箱流动。但对于广大开发者来说,那把用来公平丈量所有模型的公共尺子,恐怕再也找不回来了。参考资料:
https://x.com/SemiAnalysis_/status/2097112791471522292
编辑:摩西

内容中包含的图片若涉及版权问题,请及时与我们联系删除
评论
沙发等你来抢