Диалекты: понимаем, но не воспроизводим
Современные большие языковые модели неплохо справляются с пониманием диалектного английского — они могут разобрать вопрос или команду, сформулированную на региональном варианте языка. Но стоит попросить модель ответить в том же стиле, как она почти всегда переключается на стандартный английский, чаще всего ориентированный на американскую норму. Возникает любопытный разрыв: модель слышит диалект, прекрасно его интерпретирует, но говорит на «литературном» языке. В исследовательской литературе это явление называют robustness-generation gap — расхождением между устойчивостью к нестандартному вводу и способностью воспроизводить его в собственной генерации.
Именно этот разрыв решили изучить авторы работы DiaLLM, недавно опубликованной на arXiv (2607.07669). Они задались вопросом: можно ли научить открытые языковые модели не просто понимать диалекты, но и активно на них говорить — и если да, то какие методы обучения дают наилучший результат.
Что предлагает DiaLLM
Исследователи не стали дообучать модель на каком-то одном диалекте. Вместо этого они взяли три семейства открытых LLM и продолжили их предобучение на Международном корпусе английского языка (International Corpus of English). Такой корпус содержит тексты на множестве национальных и региональных вариантов — от австралийского до индийского.
Дальше обучение разделялось на два направления: имплицитная парадигма, при которой модель сама усваивает особенности диалекта из примеров, и эксплицитная парадигма, где модель явно обучают выбирать диалектные формулировки. Каждое направление дополнительно сочеталось с одной из трёх стратегий выравнивания. В итоге получилась своего рода матрица экспериментов, позволяющая отдельно оценить вклад каждого этапа обучения.
По утверждению авторов, это первое контролируемое сравнение подобных компонентов для австралийского, индийского и северного вариантов английского языка. Раньше никто не проверял эти методы на единой экспериментальной базе.

Что показали эксперименты
Главный вывод — способность понимать диалект и способность генерировать его действительно не связаны напрямую. Одно не вытекает из другого: модель может отлично обрабатывать диалектные конструкции и при этом упорно отвечать стандартным языком.
Любопытно и другое. Результаты моделей на автоматических бенчмарках определялись в основном продолженным предобучением и supervised fine-tuning (SFT). Влияние выравнивания на тестовые метрики оказалось почти незаметным. Но это не значит, что выравнивание бесполезно: оно сильно меняло стиль ответов, просто стандартные бенчмарки не чувствительны к таким изменениям. Получается, если оценивать модели только по цифрам, можно ошибочно решить, что все методы эквивалентны.
Почему генерация диалектов — сложная задача
Авторы отдельно сравнили явную адаптацию к конкретному варианту языка и более широкое выравнивание, не привязанное к диалекту. Явный подход действительно давал тексты, которые и автоматические классификаторы, и люди уверенно распознавали как диалектные. Такие ответы получали более высокие оценки по сравнению с широким выравниванием.
Но здесь обнаружился неожиданный нюанс. Метод, который наиболее агрессивно оптимизировал «диалектное вознаграждение», то есть активнее всего поощрял модель за диалектные обороты, в итоге не понравился людям-оценщикам. Формальный критерий, зашитый в алгоритм, не совпал с человеческим представлением о качественной диалектной речи. Дополнительный лингвистический анализ подтвердил: между формальной оптимизацией и реальным качеством существует разрыв, особенно заметный у двух из трёх семейств моделей.

Таким образом, ни одна из трёх стратегий выравнивания не показала безоговорочного превосходства. Простого рецепта в духе «дообучи модель на диалекте и получи говорящего на нём ассистента» не существует. Чтобы закрыть разрыв, нужны более тонкие дизайны вознаграждений — не сводящиеся к одному штрафу за отклонение от стандарта — и более качественные диалектные ресурсы для обучения.
Выводы и перспективы
Работа DiaLLM ценна тем, что даёт систематический срез того, как разные этапы обучения влияют на диалектную генерацию. Для практиков это означает: если вы хотите, чтобы ассистент общался на австралийском или индийском английском, одного продолженного предобучения мало. Потребуется продуманное выравнивание, а его результат стоит проверять не только автоматическими бенчмарками, но и с участием живых носителей диалекта.
Хорошая новость: авторы планируют опубликовать код, контрольные точки и наборы данных с человеческими предпочтениями. Это позволит другим командам продолжить эксперименты и попробовать более сложные методы обучения с подкреплением.
А пока основной вывод звучит почти парадоксально: большие языковые модели становятся всё лучше в понимании диалектов, но их способность говорить на них остаётся нерешённой задачей, которую нельзя закрыть одним лишь увеличением объёма обучающих данных.



