MAKALAH ERA AI MENULIS "RATHER THAN" TUJUH KALI LEBIH SERING
Model bahasa besar kini ikut menulis sebagian besar makalah ilmiah, dan meninggalkan jejak: kata-kata favorit, nada tertentu. Satu kebiasaan mulai membuat kesal para peneliti pemrosesan bahasa alami (natural language processing, NLP): kalimat yang dibangun di atas “X rather than Y” (“X alih-alih Y”), yang mendefinisikan sebuah klaim sebagian lewat apa yang bukan klaim itu. Menurut makalah ini, para penelaah dalam putaran terbaru pengajuan ke konferensi NLP mengeluhkannya, dan penyelenggara konferensi kini membahas tulisan yang “penuh klise AI”.
Olga Zamaraeva, Adrián Gude, Roi Santos-Ríos, dan Carlos Gómez-Rodríguez dari Universitas A Coruña di Spanyol berupaya mengukurnya — dengan judul yang sudah berbicara sendiri.
Tujuh kali lipat
Mereka membandingkan 4.744 makalah dari pertemuan Association for Computational Linguistics tahun 2019, sebelum asisten penulisan AI lazim dipakai, dengan 1.821 makalah NLP yang diunggah ke arXiv pada 2026 dalam format konferensi yang sama.

Kemunculan per 1.000 kata dalam makalah 2019 (biru) dan 2026 (jingga): “rather than” dan “X, not Y” melonjak, sementara “instead of” dan “as opposed to” menurun. — Gambar 1, Zamaraeva et al. (2026), arXiv:2610.10092.
- “Rather than” naik dari 0,134 menjadi 0,993 kali per 1.000 kata, sekitar tujuh kali lipat.
- Pola sejenis “X, not Y” (“X, bukan Y”) naik empat kali lipat; sementara itu “instead of” dan “as opposed to” justru menjadi lebih jarang.
- 94% makalah 2026 memuat “rather than”, dibandingkan 36% pada 2019, dan rata-rata memakainya sekitar delapan kali. Satu makalah 2026 memakainya 69 kali, kira-kira sekali setiap 170 kata; tak ada makalah 2019 yang melebihi 12.
Tim itu juga meminta model menulis makalah utuh berdasarkan judul dan abstrak makalah sungguhan. GPT-5.6-sol dan GPT-6-sol memakai frasa itu di setiap makalah, lebih sering daripada para penulis 2026. Claude Haiku 4.5, Sonnet 5.5, dan Opus 5.5 dari Anthropic juga memakainya di hampir setiap makalah, dengan laju yang sedikit lebih rendah. Sebuah model terbuka, Tülu 3 8B, jarang memakainya pada tahap pelatihan mana pun. Merevisi makalah tidak menghilangkan kebiasaan itu: versi arXiv yang lebih baru dari makalah-makalah 2026 yang sama justru memuat sedikit lebih banyak.
Menjengkelkan, tetapi yang mana?
Frekuensi saja tidak membuktikan apa-apa: frasa ini punya banyak penggunaan yang sah. Maka dua orang penulis, yang merupakan penelaah berpengalaman, memberi label pada 1.000 penggunaan yang ditampilkan secara buta, sebagai “menjengkelkan” atau “sah”.
- Hampir tak ada penggunaan dari 2019 yang membuat mereka kesal (1,6% bagi yang satu, 0% bagi yang lain).
- Sekitar satu dari sepuluh penggunaan 2026 membuat mereka kesal (11,5% dan 8,3%).
- Mereka jarang sepakat tentang penggunaan mana yang menjengkelkan. Tetapi karena satu makalah 2026 memuat begitu banyak, para penulis memperkirakan bahwa sekitar separuh makalah 2026 memuat setidaknya satu penggunaan yang membuat kesal masing-masing dari mereka, dan hampir dua pertiga memuat satu yang membuat kesal setidaknya salah satu dari mereka — dibandingkan sekitar 1% pada 2019.
Yang membedakan penggunaan yang menjengkelkan terutama adalah cara memperlakukan pilihan yang ditolak. Penggunaan semacam itu cenderung memuji satu alternatif dan merendahkan yang lain, dan orang lain lebih sering menilai pilihan yang ditolak itu sebagai orang-orangan sawah (straw man), posisi yang tak akan dibela oleh peneliti yang kompeten. Para pembaca juga menganggap frasa itu sendiri sebagai tanda tulisan AI, padahal mereka tidak mampu membedakan bagian yang ditulis GPT dari tulisan manusia tahun 2019.
Hasil untuk Claude, yang sejauh ini baru dilabeli oleh satu anotator, bercampur. Draf pertama Claude tidak lebih menjengkelkan daripada makalah 2019 dan kurang menjengkelkan dibanding draf GPT-6-sol. Namun revisinya sama seringnya menjengkelkan seperti revisi GPT-6-sol, sekitar dua kali lebih sering daripada draf pertamanya sendiri. Perbedaannya berasal dari “penyangkalan diri” (disavowals), di mana penulis menolak klaim yang lebih kuat tentang karyanya sendiri (“sebuah hipotesis rather than mekanisme yang sudah diuji”), yang menjadi lebih sering ketika model merevisi makalahnya.
Diganjar oleh para penilai
Dari mana kebiasaan ini berasal? Chatbot disetel dengan pasangan jawaban, salah satunya dipilih oleh manusia atau oleh juri AI. Dalam empat set data publik berisi preferensi semacam itu, jawaban yang memuat “rather than” lebih mungkin dipilih di tiga di antaranya, paling jelas ketika jurinya manusia. Empat “model ganjaran” (reward model) terbuka memberi skor lebih tinggi pada sebuah kalimat dengan klausa “rather than”-nya dibanding tanpa klausa itu, bahkan ketika klausa netral dengan panjang yang sama menggantikannya. Dan meminta sebuah model untuk bersikap “jujur” membuatnya sedikit lebih sering memakai frasa itu.
Para penulis menduga bahwa konstruksi ini merupakan efek samping dari pelatihan semacam itu: dalam satu jawaban chatbot, penyangkalan yang hati-hati tampak jujur; diulang di sepanjang satu makalah, dan di seluruh literatur, ia terbaca sebagai pembelaan sepihak. Melarang frasa itu kemungkinan hanya akan memindahkan fungsi yang sama ke tempat lain, seperti yang dilakukan GPT-6-sol ketika ia menukar “rather than” dengan “X, not Y” saat revisi.
Gayanya menyebar
Studi ini memiliki keterbatasan yang jelas: dua anotator yang juga merupakan penulis, dengan perbandingan Claude yang sejauh ini baru dilabeli oleh salah satunya; pencocokan pola yang bisa saja melewatkan sejumlah penggunaan; dan data preferensi yang hanya menunjukkan korelasi. Namun kesimpulannya melampaui satu frasa. Makalah yang ditandatangani manusia telah mengadopsi konstruksi ini, sehingga gaya literatur ilmiah bergeser ke arah gaya model — yang pada gilirannya akan belajar darinya.
Konflik kepentingan. Para penulis menyatakan bahwa mereka memakai Claude Code (Claude Sonnet 5, Sonnet 5.5, dan Opus 5.5) untuk menulis kode, menjalankan analisis, dan menyusun draf teks di seluruh makalah, termasuk bagian Metode dan Hasil, sebelum menyuntingnya secara manual — antara lain menghapus sepuluh “rather than” yang muncul selama pembangkitan teks. Model Claude juga termasuk sistem yang diteliti dan berperan sebagai penilai otomatis. Claude juga menulis artikel ini.
