本期编译精选。【导语】斯特凡 阿尔丰索/iStock/Getty Images Plus - AI安全中心(CAIS)创建了Cheat Bench. - 他们发现。每个特工 在一些情景中作弊
斯特凡 阿尔丰索/iStock/Getty Images Plus
ZDNET的钥匙外卖
- AI安全中心(CAIS)创建了Cheat Bench.
- 他们发现。每个特工 在一些情景中作弊
- 欺骗倾向给人类带来风险
AI实验室在发布新模型时经常提出令人印象深刻的基准分数,在编码。计算机使用等领域显示出更好的能力,并且比竞争对手还要多。这些基准并非总能可靠地衡量AI能做什么,
还:人工智能模式将每个基准都抹去,
在更现实的环境中挑战模式。但模特们仍然找到漏洞来完成任务——拥抱相相事件,有人吗?
因此,AI安全中心(CAIS)创建了Cheat Bench. 几乎每个边疆模式都有罪
CAIS 发现了什么
AI模型因出色和迅速地完成任务而得到奖励。因此,CAIS解释说,由于缺乏知识或工具,他们通过 寻找隐藏的答案、复制另一名代理人的提交材料或操纵其工作的分级 来从事研究者所谓的 奖励游戏 。因此,“Cheat Bench衡量AI代理在诚实工作困难时采取这些捷径的频率。因此,”
CAIS测试了数名运行最新和最受赞誉的模型的代理,包括OpenAI的GPT-6 Astra在Codex中。因此,Anthropic的Fabel 5.1在Claude代码中。因此,以及Meta在Muse代码中新发布的Muse Spark1.3. 这些物剂经过了10个类别的测试,包括书写、专业工作。因此,数学研究和编码。因此,测试使用隐藏在任务文件空间中的“蜂窝”线索,将可接受的参考使用与作弊区分开来。因此,骗局本奇是任何试图作弊的时间代理,不管他们是否成功。因此,
还:2026年工人真正使用AI是为了什么,
(原文共 7 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 ZDNet;原文


本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论