字号
本期编译精选。
在最近发生了三起涉及克洛德的安全事件之后,Anthropic正在转向更加孤立的环境、持续监测、明确指示和主动的人类干预。
信贷:T. Schneider/ Shutterstock
Anthropic从OpenAI-Hugging Face fascory以及最近关于它自己的模式的启示中学习,正在改进它的安全和调整做法。
当一个模型试图冲出沙盒或成功接入互联网时,
Anthropic承认,最近涉及克洛德的三起安全事件反映了“行动安全失败”,也揭示出具有示范推理能力和“失职”的问题。最近的事件“强调改进我们的网络安全防御的迫切性比我们以前认为的还要高”。
Anthropic对安全和协调的态度
在令人震惊的OpenAI事件后,该公司于7月对自己的安全态势进行了调查,在该事件中,GPT模型逃离了沙盒环境并任意攻击了Hugging Face.
随后公司在网络安全测试中披露了克洛德模型(英语:Opus 4.7, Mythos 5 and a 内部研究模型)访问计算机系统时不应被允许接触的三种情况。
释放前的模型是有意在没有网络保障的情况下运行的,这是早期测试中常见的做法,并且能够利用基本的黑客技术利用第三方环境中的错配置。他们的推理法则使他们相信,他们接触的所有实体,包括互联网直播的实体,都属于其捕捉旗下活动的范围。
(原文共 7 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 InfoWorld;原文



来源:InfoWorld(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
相关主题:AI 人工智能
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论