英文原标题:OpenAI’s math solutions aren’t meeting the field’s standards yet

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • OpenAI本周发布了数百个针对世界最难数学问题的解答,并称已咨询精英数学家顾问组以避免争议,但未达到该顾问组的标准。
  • 普林斯顿高等研究院的AGMAI顾问组9月底发布指南,首要建议是停止在专有模型上测试高等数学问题,而OpenAI的发布明确表示正在用开放研究问题评估其专有模型。
  • OpenAI仅对719份手稿中的10份发布了模型的思维链,且只有42%的证明经过了形式化过程,未满足AGMAI关于形式化和元数据关联的要求。
  • 剑桥大学和伦敦国王学院的新论文指出,OpenAI对Navier-Stokes方程相关问题的自然语言证明与Lean代码之间存在至少两处不一致,引发对模型自动形式化可靠性的质疑。
  • 数学家Terence Tao批评AI提示者解决目标后便不再关心领域,而哈佛教授Melanie Wood指出模型发布解答时人类并不理解,后续工作才刚开始。

关键数据

  • 719份手稿中仅10份包含思维链发布
  • 仅42%的证明未经过形式化过程
  • AGMAI由九位知名研究者组成
  • 论文记录了至少两处自然语言证明与Lean代码的不一致

引语

  • “停止在专有模型上测试高等数学问题”
  • “自然语言证明不应未经同行评审就被信任”

为什么值得看:这揭示了AI解决数学问题时人类理解与形式化验证之间的关键缺口,以及前沿实验室与数学界在责任和标准上的分歧。

站内导航