行业新闻

Graphite 研究:AI 写作痕迹随版本更替,总量并未减少

这份研究用配对语料量化了各家模型的写作口头禅,说明破折号这类老破绽被删掉了,但新的会补上来,实验室很难彻底清干净。

营销公司 Graphite 做了一项新研究:它用 ChatGPT 上线前的 1 万篇文章作人类对照,让各前沿模型按摘要重写,再统计词频差异,累计找出 13,000 个在 AI 文本中出现频率至少是人类 2 倍的短语。结论是 Claude 系列的用词越来越接近人类,GPT 系列则相反。

正文摘录

如今 LLM 生成的文字已经无处不在,人类迫切想找到识破它们的办法。虽然破折号(em-dash)和 "delve" 这类早期破绽早已被清理干净,但研究者表示,AI 模型在写文章时仍会退回大量习惯性的露馅表达。 营销公司 Graphite 的[一项新研究](https://graphite.io/five-percent/research/ai-tells-opus-5-5-update)考察了前沿模型的写作习惯,逐一挖出了每个模型偏爱的词和短语。像滥用破折号这样的老破绽已经被清除,但模型依然会频繁使用对比强烈的句式,而且每个模型版本各有各的怪癖。最让人意外的是破绽的范围之广。Graphite 找出了 13,000 个短语,它们在 AI 内容中的出现频率至少是人类内容的 2 倍 —— 这就是他们对 “tell”(破绽、露馅之处)的定义。 “事实证明,Claude 系列模型其实在随时间推移越来越接近人类的用词分布,”Graphite 首席 AI 官 Greg Druck 对 TechCrunch 说。“而 GPT 系列模型则越来越远。” 要大规模研究 AI 生成文本,需要谨慎的实验设计。Graphite 先取了一个包含 1 万篇文章的语料库,都是 ChatGPT 发布之前发表的,作为人类撰写的对照组。随后,研究者让不同的 AI 模型根据摘要重写这些文章,尽量消除来源偏差。有了人类样本与各个模型样本的配对数据,他们就能比较特定词句在 AI 写作中出现的频率,以及句子结构上更宏观的模式。 按照 Graphite 的结果,Claude Opus 5.5 最大的破绽是 "dependable"(可靠)这个词,出现频率比人类样本高 23 倍。

阅读原文(techcrunch.com)→

行业新闻Russell Brandom2026-10-01原文

相关内容