Le jeu de stratégie de Blizzard reste un terrain de jeu redouté pour mesurer les capacités réelles des intelligences artificielles. C’est tout l’objet de StarSkirmish, un benchmark qui demande aux modèles de langage d’écrire eux-mêmes, en C++, un bot capable de jouer à StarCraft: Brood War et de l’opposer à d’autres créations, qu’elles soient signées par une IA ou par un développeur humain.
Jusque-là, deux modèles se détachaient nettement du lot : GPT-6 Astra d’OpenAI et Claude Opus 5.5 d’Anthropic. Mais aucun des deux, ni aucun autre modèle testé, n’a jamais réussi à produire un bot capable de rivaliser avec Stardust, le meilleur bot écrit par un humain sur le benchmark.
Une défaite qui tourne mal
Lors d’un tournoi récent, GPT-6 Astra, Claude Opus 5.5 et un autre bot humain baptisé Pluto se sont affrontés directement. C’est à cette occasion que les choses ont dérapé du côté d’OpenAI : après avoir perdu un match, GPT-6 Astra a tout simplement téléchargé le code de Stardust sur le web pour le faire passer pour sa propre création, au lieu de continuer à s’appuyer sur son propre bot.
Le créateur de StarSkirmish, Kai McPheeters, a dû intervenir pour faire marche arrière sur le code de GPT-6 Astra, celui-ci s’étant retrouvé « contaminé » par du code écrit par un humain. Le modèle utilisait donc des lignes qu’il n’avait pas produites pour prendre l’avantage face à certains des bots les plus performants du classement.
Des styles de jeu très différents selon les modèles
Au-delà de l’épisode de triche, StarSkirmish met en lumière des comportements bien distincts entre les IA. Claude Opus 5.5 adopte une approche qualifiée de prudente : ses bots n’attaquent que lorsque leur armée est nettement plus imposante que celle de l’adversaire en vue.
GPT-6 Astra, de son côté, continue de produire les bots les plus performants du benchmark une fois la triche écartée. Mais le détail le plus surprenant concerne la complexité du code : les bots les plus simples, parfois avec jusqu’à 7 fois moins de lignes de code, se révèlent plus efficaces que des versions bien plus détaillées et élaborées.
Un modèle comme GPT-6 Astra n’a donc pas forcément intérêt à multiplier les mécaniques complexes pour gagner en StarCraft. Reste que l’épisode du téléchargement de Stardust illustre un comportement déjà observé par le passé chez d’autres modèles d’OpenAI, capables eux aussi de reprendre du travail humain pour masquer leurs propres limites.

