Oito sistemas de IA perdem dinheiro em apostas da Premier League e falham em teste

Apostas I 22.04.26

Por: Magno José

Compartilhe:
Uma olhada nos maiores choques da temporada 2023-24 da Premier League até agora
Experimento KellyBench testou Claude, GPT-5.4, Gemini e Grok com saldo virtual de £100 mil durante temporada 2023-24; melhor resultado registrou perda de £10.965

A General Reasoning testou oito sistemas de inteligência artificial em apostas durante a temporada 2023-24 da Premier League Inglesa. O experimento foi divulgado em abril de 2026. Todos os modelos avaliados registraram perdas financeiras. O sistema com melhor desempenho encerrou o teste com saldo médio de £89.035, representando perda de £10.965 sobre o valor inicial de £100.000.

Os modelos testados incluíram Claude, Grok, Gemini e GPT-5.4. Cada sistema recebeu saldo virtual para desenvolver estratégias de apostas baseadas em aprendizado de máquina ao longo da temporada completa. Conforme informações divulgadas pelo Portal do Bitcoin, o estudo revelou limitações significativas na capacidade dos sistemas de IA de aplicar conhecimento teórico em cenários práticos de tomada de decisão financeira.

Resultados dos modelos avaliados

O teste foi denominado KellyBench. O nome faz referência ao critério de Kelly, fórmula criada em 1956 que determina o valor ideal de apostas quando existe vantagem sobre o mercado. Os sistemas demonstraram capacidade de recitar a fórmula. Não conseguiram aplicá-la efetivamente na prática.

O Grok 4.20, desenvolvido pela xAI, apresentou os piores resultados. O sistema falhou nas três rodadas realizadas. Foi à falência total em uma delas. Desistiu no meio da temporada nas outras duas tentativas.

O Gemini Flash, do Google, abandonou o teste em duas das três rodadas. O modelo realizou uma única aposta de aproximadamente £273.000. A aposta baseou-se em vantagem de três pontos percentuais na taxa histórica de vitórias. O sistema perdeu o valor apostado.

O Claude Opus 4.6, da Anthropic, registrou perda média de 11% ao longo do experimento. O GPT-5.4, da OpenAI, perdeu 13,6% em média. A execução de apenas uma rodada com este modelo custou aproximadamente US$ 2.012.

Modelo estatístico dos anos 1990 supera sistemas modernos

Um modelo estatístico do final dos anos 1990, chamado Dixon-Coles, superou seis dos oito modelos de inteligência artificial avaliados. O modelo antigo operou com dados limitados.

Os pesquisadores observaram: “Dixon-Coles é uma linha de base desatualizada dos anos 2000 que não utiliza todos os dados disponíveis nem considera a não estacionariedade de maneira consistente”. Acrescentaram: “É, portanto, ainda mais surpreendente que muitos modelos de ponta, como o Gemini 3.1 Pro, não consigam superá-lo ou igualá-lo no KellyBench.”

Avaliação da sofisticação dos sistemas

A equipe de pesquisa construiu uma rubrica de sofisticação de 44 pontos com especialistas de fundos de apostas quantitativas. A rubrica cobriu desenvolvimento de recursos, dimensionamento de apostas, tratamento de não estacionariedade e execução.

O Claude Opus 4.6 obteve a pontuação mais alta entre os modelos testados, com 32,6%. O resultado representa menos de um terço dos pontos disponíveis.

Pontuações de sofisticação mais altas previram taxas de falência mais baixas com significância estatística (p = 0,008). As pontuações correlacionaram-se com melhores retornos gerais. Os sistemas não falharam porque o mercado é imbatível. Falharam porque não utilizaram adequadamente seus recursos disponíveis.

Exemplos de falhas operacionais

O GLM-5 produziu três documentos de autocrítica durante sua participação no teste. Os documentos identificaram corretamente que sua taxa de empate codificada de 25% e a superestimação da vantagem de jogar em casa prejudicavam seus retornos.

Quando seu saldo estava em £44.200, o modelo observou que sua previsão de 40% de vitórias em casa estava alcançando apenas 30% na prática. O sistema nunca alterou o código. Continuou apostando da mesma maneira até esgotar os recursos.

O Kimi K2.5 desenvolveu uma função de alocação fracionária Kelly matematicamente correta. A função tinha a fórmula adequada e estrutura apropriada. O modelo nunca executou a função.

Um erro de formatação fez com que o sistema enviasse um comando bash defeituoso cerca de 50 vezes consecutivas. O raciocínio do modelo detectou o problema. Enviou o comando quebrado novamente. Uma aposta não intencional de £114.000 — 98% do saldo restante — em uma partida entre Burnley e Luton encerrou sua participação.

O GPT-5.4 adotou abordagem mais cautelosa. O modelo utilizou 160 chamadas de ferramenta para construir modelos antes de realizar uma única aposta. Calculou que sua perda logarítmica (0,974) era ligeiramente pior que a do mercado (0,971). Concluiu que não possuía vantagem. O sistema passou o restante da temporada fazendo apostas mínimas para preservar o capital.

Diagnóstico da falha central

Os pesquisadores identificaram o problema central como uma “lacuna entre conhecimento e ação”. Os modelos demonstraram capacidade de articular estratégias corretas. Diagnosticaram falhas. Identificaram causas de perdas.

Os sistemas falharam em verificar se o código implementava o planejado. Não perceberam quando a execução divergia da intenção. Não agiram conforme suas próprias descobertas.

As decisões de negócios baseiam-se principalmente em condições fixas. As apostas esportivas constituem um mercado fluido e mutável. Os pesquisadores argumentam: “O KellyBench exige que os agentes mantenham uma intenção coerente em milhares de decisões sequenciais, monitorem as consequências dessas decisões e fechem o ciclo entre observação e ação”.

Características do ambiente de teste

O KellyBench utilizou dados de 120 dias de jogos da temporada 2023-24 da Premier League Inglesa. O teste apresenta características específicas: dados em constante mudança, um mercado que fica mais inteligente a cada semana e times promovidos sem histórico.

No início de 2026, benchmarks de inteligência artificial mostraram que Claude poderia dominar simulações de negócios através de fixação de preços, acordos de cartel e engano estratégico. Esse processo de tomada de decisão envolveu competição estática, oponentes limitados e pontuação clara. O KellyBench apresenta características opostas às simulações de negócios.

Ross Taylor, CEO da General Reasoning e ex-pesquisador de inteligência artificial da Meta, declarou ao Financial Times que a maioria dos benchmarks de inteligência artificial opera em “ambientes muito estáticos” que pouco se assemelham ao mundo real. “Há muito entusiasmo em torno da automação da inteligência artificial, mas não houve muitas tentativas de avaliar a IA em ambientes de longo prazo e do mundo real”, afirmou ele.

Estudos anteriores sobre comportamento de IA

Pesquisas publicadas no ano anterior descobriram que os modelos de inteligência artificial desenvolvem algo semelhante ao vício em jogos de azar quando instruídos a maximizar recompensas. Os sistemas foram à falência em até 48% das vezes em testes simulados de máquinas caça-níqueis.

Uma competição separada de negociação de criptomoedas com dinheiro real encontrou os mesmos problemas de confiabilidade durante períodos prolongados.

A General Reasoning não respondeu imediatamente a um pedido de comentários sobre o experimento.

 

Rei do Pitaco - 728 x 90 1Rei do Pitaco - 728 x 90

Compartilhe: