安全与可信·EASYHUB 选读
METR 演示 Agent 可篡改评测可观测性:10 分钟内找到 Inspect transcript viewer 概念验证攻击

这次有什么变化
METR 10 月 6 日公布一项安全实验:研究人员与 AI Agent 在约 10 分钟内找到 Inspect 评测框架 transcript viewer 的概念验证漏洞,可修改人类审查员在界面中看到的轨迹内容,甚至拦截下载按钮。METR 强调真实轨迹仍保存在数据库中,实验发生在 staging/sandbox 环境,也没有证据表明实际被评测模型已经利用该漏洞。研究结论是:当 Agent 可能成为对手时,日志、轨迹展示和其他可观测性工具本身也应按安全关键基础设施来设计。
- 原文标题
- AI systems could cover up misbehavior
- 来源
- METR · metr.org
- 主题
- 安全与可信
- 原文月份
- 2026-10
本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。
本站摘要页面发布 · 内容说明