英文原标题:UN turns to Google to make its global data ready for AI agents

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

  • 联合国与Google合作推出UN System Data Commons,基于Google开源Data Commons平台,支持自然语言查询,取代原有UNData门户,并支持Model Context Protocol(MCP)以便AI系统直接连接外部数据源。
  • UNICEF基准测试显示,六个大语言模型在超过13.3万条全球发展指标问答中平均准确率仅21.2%,约五分之三的回答未提供可用数字,且同一模型两次回答数字一致的概率仅约一半。
  • UNICEF数据网站每月访问量超600万,来自ChatGPT答案链接的访问量同比增长67%,AI助手整体约占十分之一访问量。
  • 联合国26个实体已承诺加入Data Commons,启动时已有近20个实体的数据,目标到2027年将联合国系统80%的统计数据集纳入平台。
  • Google.org提供200万美元能力建设资金和技术支持,平台托管在联合国治理的实例上,最终将由联合国独立维护和扩展;Google演示了AI通过MCP生成仪表板、图表和分析,但强调人类应始终审查输出。

关键数据

  • UNICEF基准测试覆盖超过133,000条回答,平均准确率21.2%
  • 测试模型包括GPT-4o、GPT-4o-mini、Claude Sonnet 4.5、Haiku 4.5、Gemini 2.5 Flash和Gemini 2.0 Flash
  • 约五分之三的回答未提供可用数字
  • 同一模型两次回答数字一致的概率约一半
  • UNICEF数据网站月访问量超600万
  • ChatGPT链接访问量同比增长67%(1月1日至9月14日)
  • AI助手整体约占十分之一访问量
  • 26个联合国实体承诺加入,启动时近20个实体数据可用
  • 目标2027年纳入80%的联合国系统统计数据集
  • Google.org提供200万美元资金

引语

  • “我们规模、范围和灵活性都先进了几个数量级”
  • “我们采取‘培训培训者’的方法”
  • “人类应始终审查输出”

为什么值得看:联合国与Google合作将权威统计数据AI化,旨在解决AI系统难以可靠获取权威数据的问题,同时UNICEF测试揭示了当前大模型在关键发展指标上的低准确率,凸显了可信数据源和人工审核的重要性。

站内导航