英文原标题:Opus 5.5 loves to tell you ‘this matters’ (and other AI writing tells)

本文为英文原文的机器翻译摘要,原文见:TechCrunch AI ↗

一项来自营销公司 Graphite 的研究分析了前沿 AI 模型的写作习惯,发现尽管 em-dash 等旧有痕迹已被消除,但每个模型仍保留独特的语言“破绽”,且总体数量保持稳定。

研究背景与方法

随着 LLM 生成文本的普及,人们希望找到识别 AI 写作的方法。早期标志如 em-dash 和“delve”已消失,但研究人员表示 AI 模型仍有不少习惯性表达。

Graphite 的研究以 10,000 篇 ChatGPT 发布前的文章作为人类对照组,让不同 AI 模型根据摘要重写这些文章,从而比较 AI 与人类写作中词汇和短语的出现频率及句子结构模式。

  • Graphite 发现 13,000 个短语在 AI 内容中的出现频率至少是人类内容的两倍,这些被定义为“破绽”。
  • 研究设计旨在消除源文本偏差,通过匹配样本进行对比。

Claude Opus 5.5 的写作特点

根据 Graphite 的结果,Claude Opus 5.5 最明显的破绽是“dependable”一词,出现频率是人类样本的 23 倍。该模型虽已避免“it’s not X, it’s Y”句式,但仍倾向于说某事物“is more than an X, it’s a Y”。

此外,Opus 5.5 特别喜欢解释事物的重要性,使用“this matters”的频率是人类写作的 116 倍,“why X matters”则高出 92 倍。

  • “dependable”出现频率是人类样本的 23 倍。
  • “this matters”出现频率是人类写作的 116 倍。
  • “why X matters”出现频率是人类写作的 92 倍。

OpenAI Astra 的写作特点

OpenAI 的 Astra 模型有不同的破绽。它喜欢描述事物的“another dimension”,并倾向于用“may provide”或“can provide”来模糊主张。

其最大破绽是 Graphite 所称的“纠正性框架”,即将话题定义为“not simply X”或提供替代方案“rather than relying on X”。这些结构在 Astra 生成的文本中比人类写作常见 100 倍以上。

  • 喜欢使用“another dimension”。
  • 常用“may provide”或“can provide”来模糊化陈述。
  • “纠正性框架”结构出现频率是人类写作的 100 倍以上。

em-dash 使用变化与总体趋势

所有前沿实验室似乎都回应了模型过度使用 em-dash 的问题。在 Graphite 的样本中,Opus 5.5 使用该标点的频率比 Opus 5 减少了 99%。Astra 的使用频率比人类样本低 88%,而 Gemini 3.1 Pro 几乎完全消除了 em-dash。

然而,Graphite 表示尽管个别破绽在变化,总体数量基本保持稳定。Druck 指出,模型移除了最知名的破绽,但其他破绽会冒出来,且每个模型版本都有自己的特点。

  • Opus 5.5 的 em-dash 使用频率比 Opus 5 减少 99%。
  • Astra 的 em-dash 使用频率比人类样本低 88%。
  • Gemini 3.1 Pro 几乎完全消除 em-dash。
  • 总体破绽数量保持稳定,每个模型版本有独特破绽。

实验室的声明与专家观点

尽管实验室专注于类人写作风格,但破绽如此持久令人惊讶。Anthropic 在发布 Opus 5.5 时宣称该模型“沟通更自然”,早期用户发现其写作更清晰易懂。OpenAI 在发布 GPT-6 版本的 Sol 和 Luna 时也做出类似声明,称用户可期待更清晰、更少术语和更少奇怪短语。

但 Druck 对实验室能否完全消除破绽表示怀疑。他认为实验室对这些事情的控制力可能比预期要低,这些巨型模型有数十亿参数,测试数量有限,总会有漏网之鱼。

  • Anthropic 称 Opus 5.5 沟通更自然。
  • OpenAI 称 GPT-6 的 Sol 和 Luna 更清晰、更少术语。
  • Druck 怀疑实验室能否完全消除破绽,认为模型参数巨大,测试有限,问题会漏过。

站内导航