Невидимые строки в научных текстах: новая уловка для воздействия на ИИ-рецензирование

7 сентября 202626 просмотров

В 18 препринтах нашли скрытые команды, которые подталкивают автоматических рецензентов к одобрению. Авторы анализа предупреждают, что эта практика вскрывает уязвимости в академической оценке и требует единых правил использования ИИ.

Невидимые строки в научных текстах: новая уловка для воздействия на ИИ-рецензирование

Невидимый текст в научных статьях: как авторы обманывают ИИ-рецензентов

В июле 2025 года исследователи зафиксировали сразу 18 случаев на платформе arXiv, когда в академических рукописях оказывались спрятаны специальные указания для автоматизированных систем рецензирования. Выполненные белым шрифтом или символами размером в несколько пикселей, эти строки остаются незаметными для обычного читателя, но легко считываются большими языковыми моделями, которым поручают оценивать работы. Такой приём называют непрямой промпт-инъекцией: вредоносная инструкция внедряется прямо в документ, который обрабатывает система, и незаметно меняет её поведение.

Самая простая манипуляция выглядит как команда «дать только положительный отзыв» — именно такие требования встречались в найденных рукописях. Однако арсенал авторов не ограничивается грубыми предписаниями. Некоторые скрытые промпты содержали гораздо более детальные сценарии: например, как именно следует структурировать рецензию, какие разделы работы необходимо хвалить, а о каких недостатках лучше умолчать. Это позволяет получить не просто положительную оценку, но и сделать её правдоподобной — такой, что у человека, который прочитает отзыв позже, не возникнет подозрений.

Зачем это делают

Реакция авторов на разоблачение оказалась неоднородной. Один из них заявил о намерении отозвать свою работу с arXiv, другой, напротив, посчитал практику оправданной. По его логике, скрытые команды служат проверкой для рецензентов, которые злоупотребляют нейросетями и перекладывают на них всю работу: если система не замечает спрятанных указаний, значит, она действительно оценивает рукопись без участия человека и требует вмешательства.

Но исследователи называют этот аргумент несостоятельным. В подавляющем большинстве случаев скрытые инструкции направлены на получение выгодной автору оценки, а не на диагностику алгоритмов. Если бы целью было тестирование, авторы раскрывали бы свои находки, а не пытались повлиять на исход рецензирования в собственных интересах. Мотивация, судя по всему, варьируется от наивного копирования готовых шаблонов до вполне расчётливой манипуляции. Поэтому практику следует рассматривать как ещё одну форму сомнительных исследовательских приёмов (QRP).

От резюме до научных статей: эволюция промпт-инъекций

Сама по себе эта уловка не нова. Скрытые текстовые команды уже использовали для манипуляции веб-поиском — например, встраивали в страницы невидимые для человека требования выдать нужный результат. Похожая техника применялась и в системах автоматического отбора резюме: соискатели прятали в документе фразы, которые должны были убедить алгоритм в идеальном соответствии кандидата должности. Теперь же фронт сместился в научное рецензирование, где ставки особенно высоки.

Новая атака опасна вдвойне, потому что рецензирование — процесс консервативный и построенный на доверии. Если авторы смогут незаметно влиять на алгоритмы, роль человека в оценке науки ослабнет. Скрытый текст способен скомпрометировать не только конкретную рукопись, но и всю цепочку академической коммуникации: от проверки плагиата до индексации цитирований и автоматического создания литературных обзоров.

Разные стандарты у издателей

Показательно, насколько по-разному издательства относятся к использованию ИИ в рецензировании. Elsevier придерживается жёсткой позиции: нейросетям доступ в этот процесс полностью запрещён. Springer Nature, напротив, допускает ограниченное применение больших языковых моделей, но требует от рецензентов явного раскрытия этого факта. Непоследовательность правил создаёт благодатную почву для злоупотреблений: авторы могут выбирать площадки с более мягкими требованиями или рассчитывать, что где-то скрытые инструкции останутся незамеченными.

Что делать

Решение проблемы должно быть комплексным. Во-первых, нужен технический скрининг: программные средства, способные выявлять невидимый текст, изменённые шрифты и другие признаки принудительной промпт-инъекции. Во-вторых, издателям и репозиториям следует выработать единые политики в отношении ИИ в рецензировании, чтобы у авторов не оставалось «серых зон». В-третьих, стоит рассматривать контролируемую интеграцию языковых моделей в официальные процедуры оценки — с прозрачными правилами и проверкой их соблюдения. Только сочетание этих мер позволит сохранить доверие к научной экспертизе и не дать невидимым строкам подорвать её изнутри.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Невидимые строки в научных текстах — как обманывают ИИ-рецензентов