Информатика и ИИПрепринтАнализ данных4 мин чтения

СТАТЬИ ЭПОХИ ИИ ГОВОРЯТ «RATHER THAN» В СЕМЬ РАЗ ЧАЩЕ

Большие языковые модели теперь помогают писать значительную часть научных статей и оставляют следы: любимые слова, определённый тон. Одна привычка начала раздражать исследователей в области обработки естественного языка (NLP): предложения, построенные на «X rather than Y» («X, а не Y»), которые определяют утверждение отчасти через то, чем оно не является. Согласно статье, рецензенты последнего раунда заявок на конференции по NLP жаловались на это, а организаторы конференций теперь обсуждают тексты, «напичканные ИИ-штампами».

Ольга Замараева (Olga Zamaraeva), Адриан Гуде (Adrián Gude), Рой Сантос-Риос (Roi Santos-Ríos) и Карлос Гомес-Родригес (Carlos Gómez-Rodríguez) из Университета Ла-Коруньи в Испании решили это измерить — с названием, которое говорит само за себя.

В семь раз больше

Они сравнили 4744 статьи с конференций Association for Computational Linguistics 2019 года, когда ИИ-помощники для письма ещё не были распространены, с 1821 статьёй по NLP, опубликованной на arXiv в 2026 году в том же конференционном формате.

Столбчатая диаграмма, сравнивающая шесть противительных оборотов на 1000 слов в статьях 2019 и 2026 годов; «rather than» подскакивает с 0,134 до 0,993.

Число употреблений на 1000 слов в статьях 2019 (синий) и 2026 (оранжевый) годов: «rather than» и «X, not Y» резко растут, тогда как «instead of» и «as opposed to» убывают. — Рисунок 1, Zamaraeva et al. (2026), arXiv:2610.10092.

  • Частота «rather than» выросла с 0,134 до 0,993 употребления на 1000 слов — примерно в семь раз.
  • Родственный оборот «X, not Y» («X, не Y») стал встречаться вчетверо чаще; тем временем «instead of» и «as opposed to» стали реже.
  • 94% статей 2026 года содержат «rather than» против 36% в 2019 году, и в среднем употребляют его около восьми раз. В одной статье 2026 года он встречается 69 раз, примерно раз на 170 слов; ни в одной статье 2019 года — больше 12.

Команда также поручила моделям написать полные статьи по названию и аннотации реальных работ. GPT-5.6-sol и GPT-6-sol использовали оборот в каждой статье, причём чаще, чем авторы 2026 года. Модели Claude Haiku 4.5, Sonnet 5.5 и Opus 5.5 от Anthropic тоже использовали его почти в каждой статье, с несколько меньшей частотой. Открытая модель Tülu 3 8B редко прибегала к нему на любом этапе своего обучения. Доработка статей не избавила от привычки: более поздние версии тех же статей 2026 года на arXiv содержат его чуть больше.

Раздражает — но какие именно?

Сама по себе частота ничего не доказывает: у оборота множество законных употреблений. Поэтому двое из авторов, опытные рецензенты, разметили 1000 употреблений, показанных вслепую, как «раздражающие» или «законные».

  • Почти ни одно употребление 2019 года их не раздражало (1,6% у одного, 0% у другого).
  • Раздражало примерно одно употребление 2026 года из десяти (11,5% и 8,3%).
  • Они редко соглашались в том, какие именно употребления раздражают. Но поскольку в статье 2026 года их так много, авторы оценивают, что примерно в половине статей 2026 года есть хотя бы одно употребление, раздражающее каждого из них, а почти в двух третях — одно, раздражающее хотя бы одного из них, против примерно 1% в 2019 году.

Раздражающие употребления отличаются в основном тем, как они обращаются с отвергнутым вариантом. Они склонны хвалить одну альтернативу и принижать другую, и другие люди чаще считали отвергнутый вариант соломенным чучелом — позицией, которую не стал бы защищать ни один компетентный исследователь. Читатели также воспринимали сам оборот как признак текста, написанного ИИ, хотя не могли отличить фрагменты, написанные GPT, от человеческих, написанных в 2019 году.

Результаты Claude, пока размеченные лишь одним аннотатором, неоднозначны. Первые черновики Claude раздражали не больше, чем статьи 2019 года, и меньше, чем черновики GPT-6-sol. Но его исправленные версии раздражали так же часто, как у GPT-6-sol, — примерно вдвое чаще, чем его собственные первые черновики. Разница возникла из-за «отречений» (disavowals), в которых авторы отказываются от более сильного утверждения о собственной работе («гипотеза, rather than проверенный механизм»); они стали чаще, когда модели дорабатывали свои статьи.

Поощряется оценщиками

Откуда берётся эта привычка? Чат-боты дообучаются на парах ответов, один из которых предпочитает человек или ИИ-судья. В трёх из четырёх публичных наборов данных о таких предпочтениях ответы с «rather than» чаще оказывались выбранными, наиболее явно — когда судьями были люди. Четыре открытые «модели вознаграждения» (reward models) оценивали предложение выше с его оборотом «rather than», чем без него, даже когда его заменяла нейтральная часть той же длины. А просьба к модели быть «честной» заставляла её употреблять оборот чуть чаще.

Авторы предполагают, что эта конструкция — побочный эффект такого обучения: в отдельном ответе чат-бота аккуратное отречение выглядит честно; повторённое на протяжении целой статьи и целой научной литературы, оно читается как агитация. Запрет оборота, вероятно, просто перенёс бы ту же функцию в другое место — как делает GPT-6-sol, заменяя при доработке «rather than» на «X, not Y».

Стиль распространяется

У исследования есть явные ограничения: два аннотатора, которые одновременно являются авторами, причём сравнение с Claude пока размечено лишь одним из них; поиск по шаблонам, который может пропускать употребления; и данные о предпочтениях, показывающие лишь корреляции. Но вывод выходит за рамки одного оборота. Статьи, подписанные людьми, переняли эту конструкцию, так что стиль научной литературы дрейфует в сторону стиля моделей, которые, в свою очередь, будут на ней учиться.

Конфликт интересов. Авторы указывают, что использовали Claude Code (Claude Sonnet 5, Sonnet 5.5 и Opus 5.5), чтобы писать код, проводить анализы и набрасывать текст по всей статье, включая разделы «Методы» и «Результаты», а затем редактировали его вручную — удалив, среди прочего, десять «rather than», появившихся при генерации. Модели Claude также входят в число изучаемых систем и служили автоматическими оценщиками. Claude написал и эту статью.

Legal notice