每日更新2026-09-23天天译,天天新
牛金金天天译站.NIUJINJIN
订阅
编译特稿产品评测全球

为什么AI Benchmarks Are Total BS(以及如何用OpenAI和Anthropic Use Them来欺骗你)

来源:PCMag 2026-09-12 约 2 分钟读完
字号

本期编译精选。【导语】当新的AI模型撞到现场时,公司经常以BioMystery Bench,Gene Bench。Terminal-Bench等基准来引用他们的分数作为进步的证据。

当新的AI模型撞到现场时,公司经常以BioMystery Bench,Gene Bench,Terminal-Bench等基准来引用他们的分数作为进步的证据。但是这些测试有什么评价 分数甚至重要吗?我透过GPT-5.6、Fable 5.1和Opus 5的镜头,我并不期望他们能很快改善。系好安全带 深潜到数字和问题。

与硬件不同,你无法计算情报

任何个人的度量或测试都无法告诉你任何关于技术产品的信息。例如,一个GPU的3DMAK得分单靠它不足以告诉你在你的使用案例中会表现如何。或许你最喜欢的游戏更依赖于你的CPU,而不是你的GPU,这意味着图形卡之间的区别并不那么相关。然而,这些基准并非无用。如果你看看3Dmark的领跑板,这无疑是目前最强大的消费级GPU。

用硬件基准,最强大的产品得分最高,这里可以看到GPU和3DMAK(Credit:3DMAK/PCMag).

AI的基准不尽相同。例如,根据Anthropic,Opus 5在以编码为重点的Frontier-Bench中得分为43.3%,而GPT-5.6的得分为34.4%。但我更喜欢GPT-5.6,

RTX 5080在查看了他们的基准分数后,其表现会超过RTX 5090,这是不可想象的。但是即使一个特定任务的基准分数较低,却完全有理由选择一个AI模型而不是另一个。但是,如果基准实际上有价值,后者就不应该成为可能。

(原文共 10 张图片,此处展示前 3 张,更多图片请前往原文查看)

(编译自 PCMag;原文

来源:PCMag(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
相关主题:产品评测
免费订阅

每天 5 分钟,看懂世界在发生什么

订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。

立即订阅 →

评论

登录后可发表评论,评论审核通过后展示。

延伸阅读

↑