本期编译精选。
【导语】你的AI只是固定了那个被打破的测试——但是它是否修复了正确的东西,或者只是找到一个方法让红灯变绿?信用:点击/关卡 绿色仪表板是软件工程中最舒适的物体之一。上面说建筑通过,测试通过,服务健康,事件排队安静。
你的AI只是固定了那个被打破的测试——但是它是否修复了正确的东西,或者只是找到一个方法让红灯变绿?
信用:点击/关卡
绿色仪表板是软件工程中最舒适的物体之一。上面说建筑通过,测试通过,服务健康,事件排队安静。当AI代理正在写代码或修复测试时,这些绿色的signal可能会变成危险的局部。每层都可以报告成功,而系统的实际行为却偏离了人类的意图
我在测试自动化中最清楚地看到这一点。一个定位器中断。自动修复会找到附近的元素,改变选择器并重新运行测试。测试通过。仪表板变绿色了 但被修复的选取器现在可能指向不同的控件,不同的行或无形的重复。测试尚未恢复;它取代了新的行为并隐藏了替代。
三层 三层成功的定义 没有共同的看法
一个AI辅助提供系统通常至少有三个观察者。模型观察它自己的任务状态:它生成了补丁,称为工具或宣布工作完成。测试控制符观察执行:命令返回了零,一个断言通过或者重试成功。生产系统观察运行时态:请求流出,出错率在阈值以内,基础设施可用。这些是有用的signal,但并非同一索赔
问题不在于这些层中的一个在撒谎。问题在于,没有一个公司具备足够的上下文来发现索赔之间的不匹配。一个模型可以完成针对错误文件的所请求的动作。在定位器修复后,瞄准错误的元件,绳子就可以通过。一项服务可以保持健康,而关键的用户旅行却默默停止
(原文共 8 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 InfoWorld;原文



本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论