Риторичний вплив на оцінку ШІ вводить в оману рецензентів наукових досліджень
Науковий рукопис може отримати вищий бал лише тому, що він написаний інакше, хоча й розповідає точно ті ж результати? Це питання в центрі дослідження, підписаного Мінгом Лі та ще сімома авторами, опублікованого 10 серпня 2026 року, яке вводить в академічну дискусію концепцію, настільки технічну, наскільки й тривожну: риторичний вплив оцінки ШІ в автоматизованих процесах рецензування. Дослідження показує, що великі мовні моделі, покликані оцінювати наукові статті, можуть бути під впливом стилю, в якому подається текст, навіть коли науковий зміст залишається незмінним.
Резюме
- Ключові моменти
- Як було побудовано дослідження рецензування наукових статей, довірених ШІ
- Риторичні вибори, які найбільше впливають на бали оцінки ШІ
- Чому більш складні робочі процеси переписування не гарантують кращих балів
- Ефект строгого протоколу оцінювання та що змінюється для наукового рецензування
- Поширені запитання
- Як риторичні вибори впливають на бали рецензування на основі ШІ?
- Який набір даних використовувався для аналізу риторичної чутливості в рецензуванні ШІ?
- Чи призводять більш складні стратегії переписування до кращих балів у рецензуванні ШІ?
- Який ефект строгого протоколу рецензування на бали оцінки ШІ?
Ключові моменти {#Ключові_пункти}
- Дослідження використовувало контрольний корпус з 4200 рукописів, отриманих з 120 анонімних подань конференції ICLR 2026.
- Два переписувачі на основі великих мовних моделей змінили шість риторичних вимірів в протилежних напрямках, тоді як п'ять рецензентів ШІ оцінили тексти за стандартними та строгими протоколами.
- Оформлення доказів та позиція щодо новизни є змінними з найбільшим впливом на остаточні бали.
- Строгий протокол рецензування знизив середній бал загальної оцінки на 1,36 бали, не змінивши при цьому послідовно риторичну чутливість.
Як було побудовано дослідження рецензування наукових статей, довірених ШІ {#Як_було_побудовано_дослідження_рецензування_наукових_статей_довірених_ШІ}
Дослідницька команда побудувала експеримент, задуманий для ізоляції лише однієї змінної: форми, а не суті. Виходячи з 120 анонімних подань, представлених на ICLR 2026, одній з найважливіших конференцій у галузі машинного навчання, автори створили контрольний корпус з 4200 повних рукописів, усі отримані з тих самих оригінальних робіт, але переписані відповідно до різних риторичних варіантів.
Два переписувачі на основі великих мовних моделей працювали над шістьма окремими риторичними вимірами, перетворюючи їх у протилежні напрямки для кожного рукопису: з одного боку версії, які підкреслювали певні переконливі аспекти, з іншого - версії, які їх пом'якшували, проте зберігали незмінними наукові результати. На цьому етапі вступили в гру п'ять рецензентів ШІ, які були покликані оцінити рукописи за двома різними протоколами, одним стандартним і одним більш строгим, а також протестувати конфігурації спільного, рекурсивного та керованого рецензентом переписування.
Риторичні вибори, які найбільше впливають на бали оцінки ШІ {#Риторичні_вибори_які_найбільше_впливають_на_бали_оцінки_ШІ}
Найзначнішим результатом є те, що риторична чутливість не є однорідною, а структурована відповідно до справжньої ієрархії. Серед шести протестованих вимірів, рамка доказів та позиція щодо новизни роботи створюють найбільші контрасти між переписаними версіями в позитивному та негативному сенсах. Рамка мети дослідження формує другий рівень, більш слабкий, але все ще помітний, тоді як інші риторичні виміри демонструють менші або менш стабільні ефекти.
Ця ієрархія зберігається також при порівнянні рукописів різної якості, сприйнятої оригінальними рецензентами. Але є один нюанс, який робить явище ще більш делікатним: рух балів сильно залежить від початкової оцінки, присвоєної AI-рецензентом. Рукописи, які починали з нижчих балів, мали тенденцію підніматися після риторичного переписування, тоді як ті, що мали вже високі бали, мали тенденцію знижуватися. Найбільш чіткі напрямкові контрасти спостерігаються в проміжних діапазонах балів, саме там, де редакційні рішення є найбільш невизначеними і, отже, більш піддатливими.
Ціна --
Чому більш складні процеси переписування не гарантують кращих балів {#Chomu_bil'sh_skladni_protsesi_perepysuvannya_ne_harantuyut_kraschykh_baliv}
Один з найбільш контрінтуїтивних аспектів дослідження стосується ефективності більш складних методів риторичної маніпуляції. Більш складні робочі процеси, які поєднують спільне, рекурсивне або кероване рецензентом переписування, не забезпечують надійно більших виграшів у порівнянні з простішими втручаннями. Іншими словами, додавання складності до процесу переписування не означає автоматично кращу маніпуляцію судженням AI.
Ефекти спільного переписування виявляються сильно залежними від моделі, що використовується як переписувач: зміна великої мовної моделі значно змінює результат. Навіть надання чітких вказівок AI-рецензенту не показало постійної переваги в порівнянні з простим другим читанням без керівництва. Повторне переписування, крім того, виробляє зменшувані доходи і сильно залежить від конкретної конфігурації, що використовується. Однак дослідження виявляє досить чітке розділення ролей: модель переписувача визначає, перш за все, розділення між протилежними варіантами, тоді як модель рецензента визначає величину та знак ефекту на бал.
Ефект суворого протоколу оцінювання та що змінюється для наукового рецензування {#Efekt_suvorogo_protokolu_otsinyuvannya_ta_shcho_zminyuyetsya_dlya_naukovogo_retsenzuvannya}
Коли дослідники застосували більш суворий протокол рецензування, середній бал загальної оцінки знизився на 1,36 пункту в порівнянні зі стандартним протоколом. Але тут є дані, які найбільше важливі для тих, хто проектує ці системи: більша суворість не зменшила послідовно риторичну чутливість AI-рецензентів. Зробити суддю більш вимогливим, отже, не робить його автоматично більш імунним до стилістичних виборів тексту, який він оцінює.
Чому це все важливо? Тому що науковий рецензування вже під тиском. Обсяг публікацій зростає експоненціально, і залучити доступних рецензентів стає все важче, так що, згідно з опитуванням серед персоналу журналів Frontiers, понад половина рецензентів вже в якійсь формі використовує штучний інтелект у своєму процесі оцінювання. У цьому контексті ідея про те, що автоматизовані системи можуть бути маніпульовані простими риторичними прийомами, не торкаючись наукового змісту, відкриває потенційно серйозну тріщину в цілісності процесу.
Автори дослідження не обмежуються документуванням проблеми: вони представляють її як форму reward hacking, тобто використання мовних скорочень для отримання кращого балу без реального покращення якості роботи. Висновок, який з цього випливає, є чітким: потрібні автоматизовані системи оцінювання, здатні витримувати риторичні зміни, які не змінюють науковий зміст. Поки ця стійкість не буде забезпечена, кожен доданий або переформульований рядок може важити більше, ніж дані, які наукова стаття насправді повинна передавати.
FAQ {#FAQ}
Як риторичні вибори впливають на бали рецензування на основі ШІ? {#Як_риторичні_вибори_впливають_на_бали_рецензування_на_основі_ШІ}
Риторичні вибори, такі як оформлення доказів і позиція щодо новизни, значно впливають на оцінки рецензентів ШІ, навіть коли науковий зміст залишається незмінним.
Який набір даних був використаний для аналізу риторичної чутливості в рецензуванні ШІ? {#Який_набір_даних_був_використаний_для_аналізу_риторичної_чутливості_в_рецензуванні_ШІ}
Був використаний контрольований корпус з 4,200 рукописів, отриманих з 120 анонімних подань, представлених на ICLR 2026.
Чи призводять більш складні стратегії переписування до кращих балів у рецензуванні ШІ? {#Чи_призводять_більш_складні_стратегії_переписування_до_кращих_балів_у_рецензуванні_ШІ}
Ні: більш складні робочі процеси переписування не забезпечили надійного збільшення балів у порівнянні з простішими втручаннями.
Який ефект має суворий протокол рецензування на бали оцінювання ШІ? {#Який_ефект_має_суворий_протокол_рецензування_на_бали_оцінювання_ШІ}
Суворий протокол рецензування знизив середній бал загальної оцінки на 1,36 пункту, але не змінив послідовно риторичну чутливість рецензентів ШІ.
Контент створено за допомогою штучного інтелекту та з редакційною перевіркою людини.
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Peach обмежує P2P-продажі біткоїнів відповідно до нових правил

Біткоїн: American Bitcoin встановлює рекорд виробництва, незважаючи на дискусії щодо витрат

Криптовалютний ринок рухається «як один блок» незважаючи на загальний ріст: співзасновник Cryptex

Що потрібно, щоб вивести Hyperliquid на ринок США? Колишній радник SEC пояснює

Іран стверджує, що збив американський дрон MQ-9 Reaper поблизу Ормузької протоки

Чому корпоративні резерви Bitcoin на $2 млрд є годинниковою бомбою прихованої умовної пропозиції

Біткоїн потребує попиту на ETF, щоб утриматися, оскільки зростає ризик підвищення ставок ФРС: аналітики

SEC звинуватила 38 суб'єктів у фальшивих поданнях інвестиційних радників

Колишні чиновники SEC та CFTC закликають до м'якшого підходу для залучення крипто-торгівлі в країну

Партнерство Solana crypto досягає рекорду в 169,9 мільйона транзакцій

Кібернапади: Штучний інтелект (ШІ) може дестабілізувати світову фінансову систему!

Бум виходів на біржу в Китаї: компанії з ІТ та робототехніки ведуть дебюти в Шанхаї та Гонконзі

HKDAP може вивести гонконгський долар за межі платежів у фінансах на блокчейні, каже дослідник HashKey

NASA та SpaceX відклали Crew-13 через витік у кораблі Dragon

Coinhouse придбає Tilvest та зміцнює свої позиції в управлінні криптовалютами

Strive купує $143 млн у біткоїнах, стає п'ятим за величиною власником

«Технології відходять на другий план»: як стейблкоїни переходять від заощаджень до повсякденних платежів

Mainnet Fogo зупинено на 46 годин без терміну перезапуску

Circle випустила 5 млрд USDC за тиждень: крипторинок знову чекає альтсезон

Кіберзлочинність: Бельгія вимагає криптоадреси від незаконних сайтів

Банки покращили свою рентабельність, але залишається тривога через заборгованість: ключові моменти останніх звітів

CME орієнтується на ETF: з'являються перші регульовані FCA мульти-активні криптоіндекси

Чому шлях SEC на $75 мільйонів у криптовалюті не є тим самим, що пропонує Конгрес

Криптофонди: 3,2 мільярда доларів за тиждень, Bank of America не бачила цього з жовтня 2025 року

Що варто зберігати: Розрив на залишках, розпад і дилема колекціонера

Фундаментальний аналіз криптовалют: як оцінювати цифрові активи перед покупкою

Штучний інтелект змушує диверсифікувати зберігання біткоїнів

Switchboard призупинив операції ораклів на SUI та Aptos після потенційного компрометації

Національний банк заборонив рекламу незареєстрованих криптовалютних та платіжних бізнесів





