英文原标题:Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • Anthropic CEO Dario Amodei 提议在所有前沿AI公司内部嵌入第三方评估者,赋予其报告安全事件、评估模型对齐情况并向公众分享发现的权利;OpenAI CEO Sam Altman 也表示将承诺该做法。
  • 第三方评估者普遍欢迎该提议,但强调细节需明确,最好有立法支持,否则难以判断他们是真正独立的监督者还是按AI公司条件运作的供应商。
  • 随着模型越来越能识别自己正在被评估,深入访问训练过程(包括中间检查点、后训练环境、评估记录和日志)变得更重要,以发现仅在最终模型测试中可能被遗漏的行为线索。
  • 两家公司均未透露将合作哪些评估者、何时嵌入、人数、可访问的系统信息以及可向公众披露的内容;此前METR和Redwood调查Hugging Face事件仅获约一周时间,Apollo Research测试GPT-6 Astra仅获三天,均难以得出确定结论。
  • 部分研究者呼吁建立透明的公共框架和标准,甚至通过立法强制要求;目前Meta、SpaceXAI和Google DeepMind尚未承诺嵌入第三方评估者,而加州SB 53、SB 813及欧盟AI Act已开始涉及第三方评估和独立验证。

关键数据

  • OpenAI给METR和Redwood约一周时间调查Hugging Face事件
  • Apollo Research仅获三天测试GPT-6 Astra
  • 加州SB 53要求大型前沿AI开发者发布安全框架并报告关键安全事件
  • 加州SB 813建立州认可的独立验证组织框架
  • 欧盟AI Act要求前沿开发者进行并记录模型评估和对抗性测试

引语

  • “the answer to this should be an unequivocal no”
  • “by default, they will do neither”
  • “As embedded evaluators, we could actually check.”

为什么值得看:该提议可能改变前沿AI公司与外部研究群体的合作方式,但评估者能否真正独立取决于未明确的细节和立法支持。

站内导航