字号
本期编译精选。
OpenAI的新Astra模型将使用一种称为经常深度的推理技术,使其能在大多数推理模型所特有的相继思维之外运作,The Information在星期二报道。这种技术也称为 不透明再现 ,可能使模型的思想链更加难以监测,而AI的安全专家也对此感到惊慌。
Astra对技术的使用据说有限,但这种技术的出现仍然引起大赦国际安全专家的严重关切。
Astra使用不透明的再现方式,“我不知道Astra是否比以前的模型更难监测CoT。但是如果OpenAI进一步推开这一技术,他们会有大规模地增加再现并彻底摧毁CoT可监测性的选择。
长期AI安全倡导者Zvi Mowshowitz也进行了权衡并写道,可能需要制定法律,防止AI实验室“竞相向下”。
Mowshowitz写道,“这一技术在火上浇油,冒着OpenAI和Anthropic争相禁忌的风险,“更密集地使用这种技术可能会损害可监测性。”
在正常情况下,推理模型的思想链提供了模型在试图解决问题时所采取的相继步骤。虽然代表性不完善,但它仍然是监测不当行为或错配的宝贵工具。在OpenAI最近的无赖代理活动中,思维链记录是揭穿代理为何如此行事的重要工具。
在不透明重现中,模型采取更不线性的方法,在循环中多次处理相同的查询。结果留下了较少可见的痕迹,有效地绕过传统的思维链记录。
(编译自 TechCrunch;原文

来源:TechCrunch(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论