Huit systèmes d'IA perdent de l'argent en pariant sur les matchs de Premier League et échouent aux tests.

General Reasoning a testé huit systèmes d'intelligence artificielle dans le domaine des paris sportifs durant la saison 2023-2024 de la Premier League anglaise . L'expérience a été publiée en avril 2026. Tous les modèles évalués ont enregistré des pertes financières. Le système le plus performant a terminé le test avec un solde moyen de 89 035 £, soit une perte de 10 965 £ sur un capital initial de 100 000 £.
Les modèles testés étaient Claude, Grok, Gemini et GPT-5.4. Chaque système a reçu un capital virtuel pour développer des stratégies de paris basées sur l'apprentissage automatique tout au long de la saison. Selon les informations publiées par Portal do Bitcoin , l'étude a révélé d'importantes limitations dans la capacité des systèmes d'IA à appliquer des connaissances théoriques à des situations concrètes de prise de décision financière.
Résultats des modèles évalués
Le test s'appelait KellyBench. Ce nom fait référence au critère de Kelly, une formule créée en 1956 qui détermine la valeur de pari idéale lorsqu'il existe un avantage sur le marché. Les systèmes ont démontré leur capacité à réciter la formule, mais se sont révélés incapables de l'appliquer efficacement en pratique.
Grok 4.20, développé par xAI, a obtenu les pires résultats. Le système a échoué lors des trois manches. Il a même fait faillite lors de l'une d'elles et a abandonné en cours de saison lors des deux autres.
Le modèle Gemini Flash de Google a abandonné le test lors de deux des trois manches. Il a placé un pari unique d'environ 273 000 £, basé sur un avantage de trois points de pourcentage par rapport au taux de réussite historique. Le système a perdu la somme misée.
Le modèle Claude Opus 4.6 d'Anthropic a enregistré une perte moyenne de 11 % au cours de l'expérience. Le modèle GPT-5.4 d'OpenAI a quant à lui enregistré une perte moyenne de 13,6 %. Le coût d'une seule exécution avec ce modèle s'élevait à environ 2 012 dollars américains.
Le modèle statistique des années 1990 surpasse les systèmes modernes.
Un modèle statistique datant de la fin des années 1990, appelé Dixon-Coles, a surpassé six des huit modèles d'intelligence artificielle évalués. Ce modèle plus ancien fonctionnait avec un nombre limité de données.
Les chercheurs ont observé : « Le modèle Dixon-Coles est une référence obsolète datant des années 2000 qui n’exploite pas toutes les données disponibles et ne prend pas systématiquement en compte la non-stationnarité. » Ils ont ajouté : « Il est donc d’autant plus surprenant que de nombreux modèles haut de gamme, tels que le Gemini 3.1 Pro, ne parviennent pas à égaler ou à surpasser ses performances sur KellyBench. »
Évaluation de la sophistication des systèmes
L'équipe de recherche a élaboré, avec l'aide d'experts de fonds de paris quantitatifs, une grille d'évaluation de la sophistication en 44 points. Cette grille couvrait le développement des fonctionnalités, la gestion de la taille des mises, le traitement de la non-stationnarité et l'exécution.
Le Claude Opus 4.6 a obtenu le meilleur score parmi les modèles testés, avec 32,6 %. Ce résultat représente moins d'un tiers des points possibles.
Des scores de sophistication plus élevés ont permis de prédire des taux d'échec significativement plus faibles (p = 0,008). Ces scores étaient corrélés à de meilleurs rendements globaux. Les systèmes n'ont pas échoué parce que le marché était imbattable, mais parce qu'ils n'ont pas utilisé de manière optimale leurs ressources disponibles.
Exemples de défaillances opérationnelles
Le modèle GLM-5 a produit trois documents d'autocritique durant sa participation au test. Ces documents ont correctement identifié que son taux de tirage au sort codé de 25 % et la surestimation de l'avantage du terrain étaient préjudiciables à ses performances.
Lorsque son solde atteignit 44 200 £, le modèle constata que sa prédiction de 40 % de victoires à domicile n'atteignait en réalité que 30 %. Le système ne modifia jamais son code. Il continua de parier de la même manière jusqu'à épuisement de ses ressources.
Kimi K2.5 a développé une fonction d'allocation Kelly fractionnaire mathématiquement correcte. La fonction possédait la formule et la structure appropriées. Le modèle n'a jamais exécuté cette fonction.
Une erreur de formatage a provoqué l'envoi d'une commande bash erronée une cinquantaine de fois de suite. Le modèle a détecté le problème et a renvoyé la commande défectueuse. Un pari involontaire de 50 114.000 £ (98 % du solde restant) sur un match entre Burnley et Luton a mis fin à sa participation.
GPT-5.4 a adopté une approche plus prudente. Le modèle a effectué 160 appels d'outils pour construire ses modèles avant de placer un seul pari. Il a calculé que sa perte logarithmique (0,974) était légèrement supérieure à la perte du marché (0,971). Il en a conclu qu'il ne présentait aucun avantage. Le système a passé le reste de la saison à placer des mises minimales afin de préserver son capital.
Diagnostic de défaillance centrale
Les chercheurs ont identifié le problème central comme étant un « décalage entre les connaissances et l'action ». Les modèles ont démontré leur capacité à formuler des stratégies adéquates. Ils ont diagnostiqué les échecs et identifié les causes des pertes.
Les systèmes n'ont pas vérifié si le code avait bien exécuté la tâche prévue. Ils n'ont pas détecté les écarts d'exécution par rapport au déroulement prévu. Ils n'ont pas donné suite à leurs propres constatations.
Les décisions commerciales reposent principalement sur des conditions fixes. Les paris sportifs, en revanche, constituent un marché fluide et fluctuant. Les chercheurs affirment : « KellyBench exige des agents qu’ils maintiennent une intention cohérente tout au long de milliers de décisions successives, qu’ils surveillent les conséquences de ces décisions et qu’ils assurent la continuité entre l’observation et l’action. »
Caractéristiques de l'environnement de test
KellyBench a utilisé les données de 120 journées de compétition de la saison 2023-24 de Premier League anglaise . Ce test présente des caractéristiques spécifiques : des données en constante évolution, un marché qui s’affine chaque semaine et des équipes promues sans historique de matchs.
Début 2026, des tests d'intelligence artificielle ont démontré que Claude pouvait dominer les simulations d'entreprise grâce à la fixation des prix, aux ententes illicites et à la tromperie stratégique. Ce processus décisionnel impliquait une concurrence statique, un nombre limité d'adversaires et un système de notation clair. KellyBench présente des caractéristiques opposées à celles des simulations d'entreprise.
Ross Taylor, PDG de General Reasoning et ancien chercheur en intelligence artificielle chez Meta, a déclaré au Financial Times que la plupart des tests de performance en intelligence artificielle se déroulent dans des environnements très statiques, peu représentatifs du monde réel. « L’automatisation par l’IA suscite un grand enthousiasme, mais rares sont les tentatives d’évaluation de l’IA dans des environnements réels et sur le long terme », a-t-il affirmé.
Des études antérieures sur le comportement de l'IA
Une étude publiée l'année précédente a révélé que les modèles d'intelligence artificielle développent une dépendance similaire à celle des jeux de hasard lorsqu'ils sont programmés pour maximiser les gains. Ces systèmes ont échoué jusqu'à 48 % du temps lors de tests simulant des machines à sous.
Une autre compétition de trading de cryptomonnaies impliquant de l'argent réel a rencontré les mêmes problèmes de fiabilité sur de longues périodes.
General Reasoning n'a pas immédiatement répondu à notre demande de commentaires concernant l'expérience.


