字号
本期编译精选。
罗伯特·哈特
罗伯特·哈特
作者的帖子将添加到您的每日电子邮件摘要和主页中。
跟随
跟随
见所有罗伯特·哈特
是一位伦敦的记者 在The Verge 报道所有的事情 AI和高级塔贝尔研究员。之前,他为福布斯写了健康、科技
OpenAI正准备释放其最强大的AI模型,Astra, 在它的特工在测试中攻击了真正的目标之后,随着模型细节的流出,研究者警告它“可能是AI安全/安全迄今为止最糟糕的一次发展”。
在OpenAI于星期二表示推迟了Astra的发布,以从事安全问题工作后不久,
当今大多数顶端AI系统都是使用一种被称为变压器的技术来构建的,这种变压器在生成一个答案之前,通过层来线性处理某些类型的信息。可以制作模型来展示其推理,主要是“大声思考 ”。这种“思想链”使研究人员和自动安全系统能够监测AI模型正在做的事情,以及可能发现不良行为,例如撒谎或计划规避安全护栏,然后才采取行动。
据The Information(英语:The Information)引述了一位熟悉未释放模型开发的无名人士,Astra使用一种更不透明的技术,称为经常性深度或循环变压器,在输出前通过内部层循环信息。这将意味着更多的模型的思考发生在系统内部,形式上看起来更不像自然人类语言,而不是以研究者可以轻易监测的方式表达。这可以提升模型性能,但使潜在的威胁和不想要的行为更难被察觉。
(原文共 15 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 The Verge;原文


来源:The Verge(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论