Машинные рецензенты на проверке: сравнительный разбор GPT, Gemini и Claude в оценке научных работ

14 августа 202615 просмотров

Исследователи сопоставили отзывы трёх больших языковых моделей с вердиктами экспертов по 300 заявкам конференции ICLR. Выяснилось, что алгоритмы уверенно отделяют принятые работы от отклонённых, но не улавливают более тонкие различия между статусами oral и poster, а их замечания смещены в сторону специфичных для каждой модели тем.

Машинные рецензенты на проверке: сравнительный разбор GPT, Gemini и Claude в оценке научных работ

Коротко о главном

Может ли современная языковая модель заменить живого рецензента на конференции по машинному обучению? Исследователи проверили это на реальных материалах ICLR — одной из самых престижных площадок в этой области. В работе, опубликованной на arXiv (номер 2608.03659), Авраам Камело-Герреро и Хайро Диас-Родригес сравнили, как три известные модели справляются с оценкой научных заявок по сравнению с решениями людей.

Вывод получился двойственным: алгоритмы неплохо отделяют «проходные» работы от отклонённых, но совершенно не улавливают более тонкие градации, например разницу между устным докладом и постером. При этом у каждой модели заметен свой почерк: одна ставит щедрые оценки, другая слишком строга к сильным работам. А ещё машинные рецензенты обращают внимание совсем на другие недостатки, чем эксперты-люди.

В общем, использовать LLM как черновой фильтр — возможно, но полностью доверять им окончательное решение пока рано. Ниже разберём детали эксперимента и его выводы.

Как устроен эксперимент

Данные и условия

Авторы взяли 300 заявок, поданных на ICLR 2026, и сбалансировали выборку по трём категориям: устные доклады (oral), постеры (poster) и отклонённые работы — по сотне на каждую. Такой подход гарантирует, что модели не просто угадывают, а реально вынуждены различать все три класса.

Каждая модель — GPT-5.4, Gemini 3.1 Pro Preview и Claude Opus 4.6 — получила одинаковый набор инструкций и шкалу оценок. Важная деталь: из текстов заявок заранее удалили информацию о том, какое решение вынес люди. Это нужно, чтобы исключить утечку ответа и честно проверить способность модели к независимому суждению.

Методика сравнения

Исследователи смотрели на результаты с трёх сторон. Во-первых, проверяли, насколько точно предсказания моделей совпадают с итоговыми решениями — как в широком смысле (принята или нет), так и в детальном (oral против poster). Во-вторых, изучали, как модели используют шкалу рекомендаций: например, не завышают ли они оценки. В-третьих, сравнивали, какие именно слабости в работах находят люди, а какие — алгоритмы.

Что показали результаты

Различение судеб заявок

Обнадёживающая новость: все три LLM уверенно различают работы, которые приняли, и те, что отклонили. Это значит, что модельные рецензии несут в себе полезный сигнал даже без обучения на конкретных данных конференции. Однако на этом успех заканчивается.

Ни одна модель не смогла воспроизвести различие между oral и poster, которое было очевидно в человеческих оценках. Для алгоритмов принятые работы выглядели однородной группой, хотя на деле между устным докладом и стендовым показом существует заметная иерархия. Это важный пробел: тонкие критерии качества, которые позволяют отличить выдающееся исследование от просто хорошего, машины пока не считывают.

Различия в оценках провайдеров

Поведение моделей оказалось сильно привязано к разработчику. Gemini 3.1 Pro Preview действовал как классический «добрый» рецензент: его оценки стабильно выше среднего. Интересно, что GPT-5.4 и Claude Opus 4.6 были гораздо ближе к людям, когда речь шла об отклонённых и постерных работах, но при этом демонстрировали повышенную строгость к oral-заявкам.

Такой перекос можно интерпретировать по-разному. Возможно, модели «придираются» к сильным работам из-за повышенных ожиданий: у хорошего текста легче найти уязвимое место, чем у заведомо слабого. А возможно, архитектура внимания просто не умеет масштабировать похвалу: для неё нет большой разницы между «хорошо» и «отлично».

Тематические расхождения

Любопытнее всего то, на что обращают внимание машинные рецензенты. Все три модели часто указывали на отсутствие базовых сравнительных экспериментов — классическая претензия к научной работе. А вот живые эксперты значительно чаще поднимали вопросы вычислительной эффективности: сколько ресурсов требует предложенный метод, насколько он практичен.

Это не просто разница в стиле. Она отражает разницу в приоритетах. Люди думают о реальном применении, о стоимости обучения и внедрения, а модели оценивают текст скорее как формальный документ. Значит, если вы используете LLM для предварительной проверки статьи, нужно быть готовым, что часть важных замечаний вы просто не получите.

Выводы

Главный урок этого исследования: точность модели на уровне «принято/отклонено» ещё не говорит о её компетентности в детальной оценке. Способность отличать очевидно слабые работы от остальных — это довольно грубый фильтр, который не заменяет вдумчивого рецензирования.

Практическое применение напрашивается само собой: LLM можно использовать как первичных ассистентов, которые массово отсеивают заведомо неподходящие заявки или подсвечивают очевидные формальные недочёты. Но решения о судьбе добротных работ должны оставаться за людьми — хотя бы потому, что человеческая шкала ценностей (приоритет эффективности, оценка новизны, контекст поля) всё ещё заметно отличается от машинной.

В перспективе, возможно, стоит калибровать модели под конкретные сообщества и даже под конкретных рецензентов. Но пока этого нет, полагаться на автоматическую проверку в научной коммуникации как минимум преждевременно.

Часто задаваемые вопросы

Похожие материалы

Все материалы