英文原标题:Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • Baseten 旗下研究部门 Base Labs 与 Hugging Face、Goodfire AI 合作,为开放权重模型构建安全评估与监控基础设施,并推出新的安全基础设施标准。
  • 此举正值开放权重模型安全争议升温:通过 abliteration 技术移除模型安全防护的现象日益增多,Hugging Face 上已列出超过 6000 个被 abliterated 的模型。
  • Base Labs 将开发并发布开放模型的训练与监控方法,并将未来工作定位为开放模型的一种“标准”,强调透明且内置于模型训练和部署过程中,而非事后附加。
  • Baseten 在 X 上表示,开放性是 AI 安全的优势,能提供更多模型行为可见性,以及将安全研究转化为可操作、透明控制的手段。
  • 合作的技术细节尚未披露,但 Goodfire 在回复中表示安全必须内置于开放模型并由服务提供者提供;Goodfire 专注于打开 AI“黑箱”以解释模型决策,最可能负责“内置”部分。

关键数据

  • Hugging Face 目前列出超过 6000 个 abliterated 模型
  • Baseten 6 月完成 15 亿美元 F 轮融资,估值达 130 亿美元
  • Goodfire AI 今年早些时候完成 1.5 亿美元 B 轮融资,由 B Capital 领投

引语

  • 我们相信开放性是 AI 安全的优势
  • 安全必须内置于开放模型,并由服务提供者提供
  • 我们正共同构建安全且人人可用的开放模型生态

为什么值得看:开放权重模型的安全风险因 abliteration 技术而加剧,此次合作试图为开放模型建立透明、内置的安全标准,可能影响未来开放模型的训练与部署方式。

站内导航