Game Arena пополняется «Оборотнем» и покером
Тестовая платформа Game Arena от Google DeepMind и Kaggle вышла на новый уровень: к уже привычным шахматам добавились две нестандартные игры — «Оборотень» и покер. Это не просто развлечение, а попытка приблизить оценку ИИ к реальным сценариям, где важны не только вычисления, но и поведение в социальной среде.
Шахматы остаются эталоном проверки логики и стратегического мышления. А вот «Оборотень» — это уже про другое. Здесь модели нужно распознавать обман, следить за поведением других игроков и выстраивать доверие. Покер добавляет ещё один сложный элемент — принятие решений при неполной информации, когда часть данных скрыта, а риск нужно просчитывать на ходу.
Теперь у разработчиков есть единое пространство, где можно сравнивать самые разные когнитивные способности ИИ — от чистой математики до эмоционального интеллекта.

Что именно проверяют новые тесты
Каждая игра на платформе отвечает за конкретную группу навыков. Логика, социальное взаимодействие, управление рисками — всё это можно оценивать в едином формате и сравнивать модели между собой.
- Шахматы — проверка способности строить долгосрочные планы и просчитывать варианты.
- «Оборотень» — оценка социального интеллекта: кто врёт, кто говорит правду, можно ли вычислить манипулятора.
- Покер — работа с неполной информацией, оценка вероятностей и контроль рисков.
Показательно, что именно «Оборотень» оказался удобной средой для изучения безопасности ИИ. В безопасной виртуальной обстановке модели учатся замечать манипуляции и противостоять им. Это важный шаг к тому, чтобы будущие системы не поддавались на уловки злоумышленников в реальных диалоговых сценариях.

Gemini 3 Pro и Flash — лидеры во всех категориях
После расширения платформы разработчики сразу обновили рейтинги. Модели от Google — Gemini 3 Pro и Gemini 3 Flash — заняли верхние строчки во всех игровых дисциплинах. Это говорит о том, что они сбалансированно сочетают и логику, и социальное понимание, и умение работать с неопределённостью.
Руководитель Google DeepMind Демис Хассабис считает, что классические бенчмарки уже не дают полной картины возможностей современных ИИ. Нужны более строгие и разнообразные испытания, которые ставят модели в сложные, приближенные к жизни условия. Игровые тесты вроде Game Arena — как раз один из таких инструментов.
Успех Gemini 3 Pro и Flash на фоне новых испытаний — хороший сигнал. Значит, подход Google к обучению моделей, с упором не только на знания, но и на поведенческие сценарии, приносит результат. Остаётся следить, смогут ли конкуренты ответить на этот вызов в следующих раундах игровых турниров.



