Game Arena ajoute "Werewolf" et le poker
Google DeepMind et Kaggle Game Arena testing plate-forme a atteint un nouveau niveau: deux jeux non conventionnels — "Werewolf" et le poker — ont été ajoutés aux échecs familiers. Ce n'est pas seulement du divertissement, mais une tentative de rapprocher l'évaluation de l'IA des scénarios réels, où non seulement le calcul compte, mais aussi le comportement dans un environnement social.
Chess reste la norme d'or pour tester la logique et la pensée stratégique. "Werewolf", d'autre part, parle de quelque chose d'autre entièrement. Ici, le modèle doit détecter la tromperie, surveiller le comportement des autres joueurs et construire la confiance. Poker ajoute un autre élément complexe — la prise de décision sous information incomplète, où certaines données sont cachées et le risque doit être calculé à la volée.
Maintenant, les développeurs ont un espace unifié où ils peuvent comparer un large éventail de capacités cognitives de l'IA — des mathématiques pures à l'intelligence émotionnelle.

Qu'est-ce que les nouveaux tests vérifient exactement?
Chaque jeu sur la plateforme est responsable d'un ensemble spécifique de compétences. Logique, interaction sociale, gestion des risques — tout cela peut être évalué dans un format unifié et utilisé pour comparer les modèles entre eux.
- Échecs — tester la capacité d'élaborer des plans à long terme et de calculer les variations.
- Le loup-garou — évaluer l'intelligence sociale: qui ment, qui dit la vérité, et si un manipulateur peut être identifié.
- Poker — travailler avec des informations incomplètes, estimer les probabilités et gérer les risques.
Il est dit que "Werewolf" s'est avéré être un environnement pratique pour étudier la sécurité de l'IA. Dans un cadre virtuel sûr, les modèles apprennent à repérer la manipulation et à la résister. Il s'agit d'une étape importante vers la garantie que les systèmes futurs ne tombent pas pour des astuces malveillantes dans les scénarios conversationnels du monde réel.

Gemini 3 Pro et Flash — leaders dans toutes les catégories
Après avoir élargi la plateforme, les développeurs ont immédiatement mis à jour les classements. Modèles de Google — Gemini 3 Pro et Gemini 3 Flash — a pris les premières places dans toutes les disciplines du jeu. Cela montre qu'ils combinent logique, compréhension sociale et capacité à travailler avec l'incertitude de manière équilibrée.
Google DeepMind PDG Demis Hassabis estime que les repères classiques ne fournissent plus une image complète des capacités d'IA modernes. Des défis plus rigoureux et diversifiés sont nécessaires pour placer les modèles dans des conditions complexes et réalistes. Des tests basés sur le jeu comme Game Arena sont un de ces outils.
Le succès de Gemini 3 Pro et Flash au milieu des nouveaux défis est un bon signe. Cela signifie que l'approche de Google pour les modèles de formation, avec un accent non seulement sur la connaissance, mais aussi sur les scénarios comportementaux, fournit des résultats. Il reste à voir si les concurrents peuvent ce défi dans les prochains tours de tournois de jeu.



