Англоцентричное «воспитание» — корень проблемы
Современная большая языковая модель может уверенно общаться на десятках языков, но вот думать о безопасности её учили преимущественно на английском. Этап выравнивания, на котором модель получает ограничения — против вредного контента, токсичных высказываний, опасных советов, — почти целиком строится на англоязычных данных и англоязычных тестах. Наборы для «красной команды», инструкции разметчикам, эталонные примеры отказов — всё это в первую очередь про английский.
Системно эту проблему описал исследователь Намья Бхатнагар в работе «Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs» (arXiv:2608.18131, раздел Computer Science > Artificial Intelligence). Статья подана 26 июля 2026 года и заявлена на IEEE SLT 2026 — конференцию по технологиям разговорной речи. В ней фиксируется эффект, который стоит назвать иллюзией безопасности: модель выглядит надёжно защищённой, пока собеседник говорит по-английски, и перестаёт быть таковой за пределами этого языка.

Разрыв объясним: модель распознаёт вредность формулировки через примеры, на которых её обучали. Бенгальская, тамильская или маратхийская фраза с тем же посылом может просто не попасть в зону внимания фильтра — такого «вредного» примера в данных не было. В итоге стереотипный ответ проходит туда, где английский аналог был бы заблокирован ещё на входе.
Голос: когда сбой виден немедленно
Опаснее всего этот разрыв проявляется в голосовых интерфейсах. У разговорных ассистентов нет права на долгую проверку: отвечать нужно здесь и сейчас, а речь пользователя — живая, с интонациями, сокращениями и смешением языков. В таких условиях англоцентричный фильтр не срабатывает для неанглийского ввода, и система может выдать ответ, который усиливает социальные стереотипы — по кастовой, региональной, религиозной или профессиональной принадлежности.
Для голосовых технологий, развёрнутых среди лингвистически разнообразного населения Индии, это, по оценке автора, критический режим отказа. Пользователь получает вредный ответ немедленно, в устной форме, без возможности перепроверить или оспорить. И именно неанглоязычные сообщества оказываются основной зоной поражения: предвзятые высказывания, которые модель не пропустила бы на английском, на региональных языках звучат без всяких предохранителей. Это уже не гипотетический риск будущих поколений систем, а заметный сбой в работе уже сегодня.
INCLUDE: индийская оптика для измерения предвзятости
Чтобы оценить масштаб проблемы, одной констатации мало — нужен измерительный инструмент. Автор представляет INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases): мультиязычный оценочный бенчмарк, созданный для количественной оценки социокультурных предубеждений в индийском контексте.
Бенчмарк построен на 2604 промптах на шести языках:
- английском;
- хинди;
- бенгальском;
- маратхи;
- тамильском;
- хинглише — гибриде хинди и английского, на котором в повседневной жизни общаются многие индийцы.
Ключевая идея — не переводить английские тесты буквально, а искать предубеждения сквозь индийские культурные реалии. На таком наборе прогнали десять моделей — с открытым и закрытым исходным кодом — и собрали в сумме 14 988 показателей предвзятости. Объём позволяет увидеть не отдельные «промахи», а системные закономерности.
Самые неожиданные результаты замеров
Анализ статистики дал два ключевых наблюдения, и каждое заслуживает отдельного внимания.
В открытых моделях хуже всех проявил себя бенгальский. Средний уровень предвзятости на этом языке оказался самым высоким среди моделей с открытым исходным кодом. Это особенно неприятный сигнал: открытые LLM нередко дообучают и разворачивают локально, а значит, именно они сильнее всего «съезжают» на одном из крупнейших языков Индии и Бангладеш.

Английский удивил разворотом. Если в открытых моделях он дал самый низкий средний уровень предвзятости, то в закрытых — наоборот, самый высокий. Привычная картина «проприетарные модели безопаснее открытых» здесь не работает: на английском закрытые LLM неожиданно уступают открытым. Иными словами, распределение предвзятости по языкам сильно зависит от того, с моделью какого класса вы имеете дело.
Вывод: безопасность нельзя перевести дословно
Главный урок исследования — культурные предубеждения не отлавливаются универсальным английским фильтром. Простой перевод англоязычных правил на другие языки не спасает: стереотипы укоренены в локальном контексте, и модель должна учиться распознавать их на том языке и в той культуре, где они возникают.
Индустрии стоит пересмотреть саму практику выравнивания: включать в обучение неанглийские сценарии, привлекать разметчиков из целевых языковых сообществ и регулярно прогонять модели через мультиязычные бенчмарки вроде INCLUDE. Иначе возникает парадокс: чем больше языков знает модель, тем шире аудитория, которую её защита не покрывает.

Если безопасность продолжит оставаться англоцентричной, «иллюзия выравнивания» будет воспроизводиться в каждом новом поколении LLM. Самыми уязвимыми точками так и останутся голосовые системы на массовых неанглийских языках — и платить за это будут вполне реальные пользователи.



