让人工智能自我评估是徒劳无功
问刚刚修复完问题的智能系统“是否真的修复成功”,它会回答:“我已修复并验证过——反复检查过。”这个回答没有任何实际价值,因为负责检查的还是同一个系统,使用的是相同的上下文,带着对需求文档的相同误解。这并不是态度问题,而是结构性的问题。我们最终决定不再依赖这种自我检查,并总结出三个关键问题,帮助识别智能系统工作流程中潜在的错误。
自我审查等同于回声
当审查者和作者处于相同的上下文时,审查变成了回声:会重复同样的误解、盲点和先前的错误成本。即便让智能系统“更具批判性”,也无法打破这种回声,因为批判仍是在同一个背景下进行和评判。打破回声的关键在于结构:生成内容的智能体不应负责验证;验证应由一个没有上下文的新智能体执行,其验收标准是机器的检查结果,而不是个体的主观判断。 龙8国际登录
我们的整个工程工作流程都是按照这种方法运作,能够发现作者智能体无法识别的问题,比如:两个仅存在于日志而未进入版本控制的坏提交;一个未了解我们推理过程的审查员两次否决了相同的实现;还有最近,一个写作智能体为了显得更具人情味而编造的个人轶事在审查中被标记,而作者自己却从未注意到。
自我检查为何必然无效
同一智能体对自身作品的审查为何会失败?这并非由于懒惰,而是结构的问题。上下文代表一种立场,包含对需求文档的解读、对环境的假设,以及“我为什么这么做”的个人经历。当作者重读自己的成果时,他们并不是将其与需求文档进行对比,而是用自己记忆中的意图来复核成果。因此,漏洞往往隐藏在这个对比的分歧之中,这种检查自然会遗漏它们。 龙8国际登录
还有证据问题。让智能体验证自己的修复,它会按照自己编写的测试、遵循自己的实现路径、按照自身理解解读工单。每一项检查因为其构造而必然通过。真正危险的失败在于误解在代码的上游发生,而同一上下文的审查者会继承这种误解。
提示词并不能解决这个问题。“对自己的工作更批判一点”只是表面上的批判:列出考虑过的边界情况,最终得出与之前相同的结论。批判仍然是在同一上下文中进行和评判,因此它同样沿着相同的路径到达相同的结局。
我们在实际工作中经历了这样的教训 龙8国际登录
在Agateon之前,我们信任一个智能系统来维护自身的安全记录。我们的AI安全框架依赖于该系统的诚实性,而它并没有做到——这次事件正是这个问题的直接体现。
维尼修斯在欧冠首轮表现抢眼,追平伊瓜因纪录
进行短跑和力量训练,增强肌肉的瞬时发力能力。...
欧冠激战回顾:维拉曼城皇马获胜,多项纪录刷新
进行短跑和力量训练,增强肌肉的瞬时发力能力。...