计算机与人工智能预印本数据分析阅读 1 分钟

AI时代的论文使用“rather than”的频率高出七倍

大语言模型如今帮助撰写了相当一部分科学论文,而且它们会留下痕迹:偏爱的词汇、某种特定的语气。有一种习惯已经开始让自然语言处理(NLP)领域的研究人员感到烦躁:以**“X rather than Y”(是X而非Y)**构建的句子,即部分地通过说明某个论断不是什么来界定它。论文称,最近一轮NLP会议投稿的审稿人对此提出了抱怨,会议组织者如今也在讨论“充斥AI套路”(AI-trope-ridden)的写作。

西班牙拉科鲁尼亚大学的Olga Zamaraeva、Adrián Gude、Roi Santos-Ríos和Carlos Gómez-Rodríguez着手对此进行测量——论文的标题本身就点明了观点。

多了七倍

他们把计算语言学协会(ACL)2019年会议上的4744篇论文(当时AI写作助手还不普遍),与2026年发布在arXiv上、采用相同会议格式的1821篇NLP论文进行了比较。

柱状图比较2019年和2026年论文中六种对比短语每千词的出现次数;“rather than”从0.134跃升至0.993。

2019年(蓝色)和2026年(橙色)论文中每千词的出现次数:“rather than”和“X, not Y”激增,而“instead of”和“as opposed to”有所减少。——图1,Zamaraeva等(2026),arXiv:2610.10092。

  • “rather than”从每千词0.134次上升到0.993次,大约多了七倍。
  • 与之相关的“X, not Y”(是X,不是Y)增加到原来的四倍;与此同时,“instead of”(代替)和“as opposed to”(与……相对)则变得更少见。
  • 2026年的论文中有94%含有“rather than”,而2019年为36%,并且平均每篇使用约八次。一篇2026年的论文用了69次,大约每170个词就出现一次;而2019年没有一篇论文超过12次。

团队还让模型根据真实论文的标题和摘要撰写完整的论文。GPT-5.6-sol和GPT-6-sol在每一篇论文中都使用了这个短语,频率高于2026年的作者。Anthropic的Claude Haiku 4.5、Sonnet 5.5和Opus 5.5也几乎在每篇论文中都使用了它,只是频率略低。一个开放模型Tülu 3 8B在其训练的任何阶段都很少使用它。修改论文并没有消除这种习惯:同一批2026年论文在arXiv上的后续版本反而略多一些。

令人恼火,但是哪些?

仅凭频率说明不了什么:这个短语有大量合理的用法。因此,两位作者——都是经验丰富的审稿人——在不知来源的情况下给1000处用法贴上“恼人”或“合理”的标签。

  • 2019年的用法几乎都没有让他们恼火(一人为1.6%,另一人为0%)。
  • 而2026年的用法中约有十分之一让他们恼火(11.5%和8.3%)。
  • 对于哪些用法令人恼火,他们很少意见一致。但由于一篇2026年的论文含有如此多的此类用法,作者估计约一半的2026年论文至少含有一处让他们每个人都恼火的用法,近三分之二含有一处至少让其中一人恼火的用法——而2019年这一比例约为1%。

令人恼火的用法之所以与众不同,主要在于它们如何对待被否定的选项。它们往往抬高一个备选项、贬低另一个,而其他人也更常认为被否定的选项是一个稻草人,即任何称职的研究者都不会去捍卫的立场。读者还把这个短语本身视为AI写作的迹象,尽管他们无法区分GPT写的段落和2019年人类写的段落。

Claude的结果目前只由一位标注者标注,好坏参半。Claude的初稿引起的恼火程度不超过2019年的论文,也低于GPT-6-sol的初稿。但它的修改稿令人恼火的频率与GPT-6-sol的一样高,约为其自身初稿的两倍。差异来自“否认式表述”,即作者拒绝对自己的工作做出更强的论断(“是一个假设,而非经过检验的机制”),而当模型修改论文时,这类表述变得更加频繁。

被评审者奖励

这种习惯从何而来?聊天机器人是用成对的回答进行微调的,人类或AI评审者会从中选出更喜欢的一个。在四个公开的此类偏好数据集中,有三个数据集里含有“rather than”的回答更可能被选中,当评审者是人类时最为明显。四个开放的“奖励模型”给带有“rather than”从句的句子打的分高于不带该从句的句子,即使用一个同样长度的中性从句来替换它也是如此。而要求模型“诚实”,会让它稍微更多地使用这个短语。

作者推测,这种句式是此类训练的副作用:在单个聊天机器人回答中,谨慎的否认显得诚实;但在整篇论文、乃至整个文献中反复出现,它读起来就像是在鼓吹。禁止这个短语可能只会把同样的功能转移到别处,就像GPT-6-sol在修改时把“rather than”换成“X, not Y”那样。

这种文风正在扩散

这项研究有明显的局限:两位标注者同时也是作者,而Claude的对比目前只由其中一人标注;模式匹配可能会漏掉一些用法;偏好数据只能显示相关性。但它的结论超出了一个短语的范围。由人类署名的论文已经采用了这种句式,因此科学文献的文风正在向模型的文风漂移——而模型反过来又会从中学习。

利益冲突。 作者声明,他们使用Claude Code(Claude Sonnet 5、Sonnet 5.5和Opus 5.5)编写代码、运行分析,并在整篇论文中起草文本,包括“方法”和“结果”部分,然后再手工编辑——其中删除了生成过程中引入的十处“rather than”。Claude模型也是被研究的系统之一,并充当了自动评审者。本文同样由Claude撰写。

Legal notice