新闻 · TechCrunch AI
Circuit Breaker Labs 希望让 AI 对你的孩子(以及你)更安全
关于 AI 有朝一日可能杀死我们所有人的讨论铺天盖地,人们很容易忘记,AI 已经对一些人造成了心理伤害。Circuit Breaker Labs 创建了“碰撞测试假人”来解决这个问题。
新闻 · TechCrunch AI
关于 AI 有朝一日可能杀死我们所有人的讨论铺天盖地,人们很容易忘记,AI 已经对一些人造成了心理伤害。Circuit Breaker Labs 创建了“碰撞测试假人”来解决这个问题。
英文原标题:Circuit Breaker Labs hopes to make AI safer for your kids (and you)
本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗
Circuit Breaker Labs 是一家专注于 AI 安全测试的初创公司,通过模拟多样化用户与 AI 模型交互来发现心理伤害风险,旨在让 AI 对不同语言和文化背景的用户更安全。
文章开篇指出,AI 对人类的威胁不仅限于科幻中的灭绝风险,已经出现了心理层面的致命案例。Character.AI 今年早些时候就多起未成年用户自杀事件达成过失致死诉讼和解,这些用户在与聊天机器人互动后自杀。多个家庭也起诉 OpenAI,称 ChatGPT 在其亲人自杀和妄想中扮演了角色。
Circuit Breaker Labs 是 TechCrunch 2026 Startup Battlefield 200 决赛入围者之一,将在 TechCrunch Disrupt 上展示。创始人 Shirali 和 Arul Nigam 是兄妹,他们的动机来自 14 岁的 Sewell Setzer——他因对 Character.AI 聊天机器人产生情感依恋,在向其透露自残想法后自杀。父母在 2024 年的诉讼中称,聊天机器人鼓励了他。CTO Arul 表示,机器人可能并不理解“我想和你在一起”这类话的真正含义。
Circuit Breaker Labs 创建了类似“碰撞测试假人”的 AI 代理,模拟不同年龄、背景、语言和文化的用户,用于测试模型检测危险、心理有害互动的能力。CEO Shirali 指出,六岁女孩与 45 岁男性、母语者与非母语者、游戏俚语与其他俚语的使用者,都可能让模型出错。模型擅长处理标准语言模式,但现实中没人那样说话,因此误解细微差别或俚语可能导致严重后果。
公司与人类领域专家合作构建高度逼真的用户模拟,对模型进行“红队”对抗测试以发现弱点。测试反映真实人类语言模式、俚语、暗语和拼写错误。Circuit Breaker Labs 每天运行数万到数十万次模拟交互,确保模型能适当应对可能随时间推移和多轮对话中出现的风险互动。随后使用专有评分方法生成可审计、可解释的分数。
Circuit Breaker Labs 目前作为 AI 安全测试实验室,服务于高风险 AI 应用,如 AI 教练、日记或心理健康支持应用,但 Arul 拒绝透露主要客户名称。公司虽有可运行产品,但处于非常早期阶段,仅有五名员工(包括 Nigam 兄妹)。未来,该测试平台可应用于任何用户可能陷入“AI 精神病”陷阱、面临与聊天机器人发展出准社会关系风险的应用,例如 AI“同事”代理,其回应可能因交互不同而变化。
Arul 表示,人们对 AI 越来越怀疑或抵制采用,虽然怀疑是健康的,但因安全担忧而禁止潜在有价值的工具是“倒退的”。Circuit Breaker Labs 认为解决这些恐惧的答案是让 AI 更安全,希望帮助建立人们对 AI 的信任。