英文原标题:Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • AI 基准测试已成为行业验证模型能力、进行宣传的常规手段,但许多旧有基准系统已跟不上现代模型的发展,甚至可被公司规避。
  • 2024 年成立的初创公司 Vals 致力于修复这一不完善的评测体系,去年获 8VC 和 Bloomberg Beta 领投的种子轮,上月又完成 Andreessen Horowitz 领投的 4000 万美元 A 轮融资。
  • 25 岁的联合创始人 Rayan Krishnan 曾实习于 Palantir,并在斯坦福期间为微软和该校 AI 实验室工作;他认为学术基准未能跟上模型前沿进步。
  • Vals 不公开具体测试材料以防模型针对性训练作弊,并侧重评估模型在法律、金融、编程等特定行业完成复杂任务的能力,以及可能产生的负面影响。
  • 公司还涉足递归自我改进、心理健康、网络安全、生物安全乃至武装冲突法(如应用日内瓦公约)等基准测试;企业付费测试模型,类似学生付费参加 SAT。

关键数据

  • Vals 成立于 2024 年
  • A 轮融资 4000 万美元,由 Andreessen Horowitz 领投
  • 种子轮由 8VC 和 Bloomberg Beta 领投
  • 联合创始人 Rayan Krishnan 25 岁
  • 收入是去年的八倍
  • 团队从年初 8 人增至 25 人,计划再招 10 至 15 人

引语

  • 学术基准未能跟上前沿进步
  • 评估一直以非常抽象的方式衡量智能
  • 我们实际上是在看模型的真实影响
  • 如果这些模型在世界上失控,负面后果会是什么

为什么值得看:Vals 试图以不公开测试材料、聚焦行业实际任务和负面影响的评测方式,成为 AI 基准测试的新标准,并已获得 a16z 等资本支持,其模式可能影响 AI 公司的商业决策与公开披露。

站内导航