围绕 AI 递归自我改进与失控风险的讨论升温,多名曾供职于前沿 AI 实验室的研究人员因安全顾虑离职转向独立评测机构。曾在 Google DeepMind 从事 AGI 安全研究的 Engels 三周前离职加入 METR,他认为前沿 AI 公司竞逐超级智能并推动 AI 参与更强 AI 的开发,若模型未充分对齐,局部错误可能进入加速反馈循环,且模型能力越强越难被理解和监督,近几周的模型异常行为加剧了他的担忧,他提出未来 5 年 AI 存在造成巨大伤害的可能,需让对齐、评测和监控能力跟上模型发展。Anthropic 前负责人 Joe Benton 也于两周前离职加入 METR,他认为前沿公司安全投入与能力发展不匹配,公众对相关风险缺乏了解,希望推动企业披露相关进展并由独立机构验证安全标准。METR 是研究前沿 AI 能力与风险的非营利机构,核心是形成可检验的测量方法和风险证据,但独立评测存在缺乏法定监管权、依赖企业开放程度等边界,相关风险判断也存在争议,AI 安全需通过可重复评测、公开调查和外部审查验证。Engels 等人从实验室转向独立机构,旨在从外部检验前沿模型,判断人类在 AI 能力进入加速循环前是否真正了解其行为。