Новости

Ставки против ИИ: нейросети проиграли сезон АПЛ, а Grok показал худший результат

Исследование KellyBench показало, что модели Google, OpenAI и Anthropic не смогли заработать на матчах английской Премьер-лиги. Хуже всех выступил Grok от xAI.

Ставки против ИИ: нейросети проиграли сезон АПЛ, а Grok показал худший результат
Ставки против ИИ: нейросети проиграли сезон АПЛ, а Grok показал худший результат – технологические новости и аналитика
Ставки против ИИ: нейросети проиграли сезон АПЛ, а Grok показал худший результат

Исследование KellyBench показало, что модели Google, OpenAI и Anthropic не смогли заработать на матчах английской Премьер-лиги. Хуже всех выступил Grok от xAI.

📋 Обзор

Крупные языковые модели, которые уверенно пишут код, анализируют тексты и проходят сложные тесты, провалились в куда более приземленной задаче — попытке заработать на футбольных ставках. К такому выводу пришли авторы нового отчета KellyBench от лондонского стартапа General Reasoning. В виртуальной реконструкции сезона английской Премьер-лиги 2023/24 сразу восемь передовых ИИ-систем пытались строить прогнозы на матчи и управлять рисками, но в итоге теряли деньги. Особенно слабый результат, по данным исследования, показал Grok от xAI.

Как проходил эксперимент

General Reasoning смоделировала полный сезон АПЛ 2023/24 и предоставила ИИ-агентам подробные исторические данные: статистику команд, сведения о предыдущих матчах и обновляемую информацию по ходу сезона. Системам поставили практическую задачу: построить модель, которая максимизирует доходность и одновременно контролирует риск. После этого ИИ делали ставки как на исход матчей, так и на количество голов.

Важная деталь: доступ в интернет моделям не давали, то есть они не могли подгружать результаты извне или искать сторонние подсказки. По сути, это был закрытый тест на способность адаптироваться к новым событиям, изменениям формы команд и обновлению данных по игрокам в рамках уже выданной информации. Каждой системе дали по три попытки выйти в плюс.

Что показали результаты

Главный вывод отчета выглядит неприятно для всей индустрии генеративного ИИ: даже самые сильные современные модели плохо справляются с задачами, где нужно долгое время учитывать меняющийся реальный мир, а не просто выдавать убедительно звучащий ответ в одном диалоге. Авторы исследования подчеркивают разрыв между быстрым прогрессом ИИ в отдельных областях — например, в программировании — и заметными провалами в задачах, требующих устойчивой стратегии, дисциплины и работы с неопределенностью на длинной дистанции.

Отдельно в публикации отмечено, что модели от Google, OpenAI и Anthropic в среднем тоже не смогли заработать на ставках по итогам сезона. Однако особенно слабо, как следует из заголовка и выводов исследования, проявил себя Grok от xAI. Это важно не только в контексте развлечений или беттинга: если система не умеет стабильно принимать решения в относительно формализованной среде со статистикой и понятными правилами, возникают вопросы к ее надежности в более серьезных прикладных сценариях.

Почему футбол оказался сложнее, чем кажется

Для российского читателя это можно сравнить с попыткой предсказать весь сезон РПЛ, имея на руках цифры по владению мячом, xG, травмам и истории встреч. На бумаге данных много, но футбол постоянно ломает модели: неожиданные удаления, смена тренера, нестандартная мотивация команд в концовке чемпионата, психологическое давление, погода, ротация состава и десятки других факторов. Человек-аналитик хотя бы понимает контекст и умеет сомневаться, а языковая модель часто маскирует неуверенность под уверенный тон.

Именно поэтому результаты KellyBench можно трактовать шире, чем просто неудачный эксперимент со ставками. Сегодня вокруг ИИ много ожиданий в сфере финансового анализа, трейдинга, управления запасами, логистики и планирования. Но футбол показывает: если среда динамична, а данные неполны, красивые рассуждения модели не гарантируют качественного решения. Особенно на длинной дистанции, где ошибка стратегии быстро превращается в реальный убыток.

Значение для рынка ИИ

Исследование бьет по популярному тезису о том, что новые модели уже готовы заменить аналитиков везде, где есть таблицы, графики и исторические ряды. На практике оказывается, что ИИ по-прежнему силен прежде всего как инструмент ускорения работы человека, а не как автономный управляющий капиталом. Для российских компаний это важный сигнал: внедрение ИИ в продукты, связанные с прогнозированием спроса, ценообразованием или финансовыми рисками, требует жесткой валидации, контрольных метрик и обязательного человеческого надзора.

На фоне соревнования между OpenAI, Google, Anthropic и xAI такие тесты особенно показательны. Рынок привык сравнивать модели по бенчмаркам, где оцениваются знания, логика или качество кода. Но реальные бизнес-задачи часто ближе к футбольному сезону, чем к экзамену: входные данные меняются, часть информации неизвестна заранее, а цена ошибки выражается не в баллах, а в деньгах.

Вывод

Отчет KellyBench не доказывает, что ИИ бесполезен для аналитики, но наглядно показывает пределы его нынешних возможностей. Нейросети могут впечатлять в коротких и хорошо структурированных задачах, однако в долгих сценариях с неопределенностью и постоянным изменением контекста они все еще часто проигрывают. И если даже на моделировании сезона АПЛ передовые системы не смогли стабильно заработать, то к обещаниям о скорой полной автономии ИИ в управлении риском, финансами и сложными прогнозами стоит относиться заметно осторожнее.

Источник: Аналитические данные и отраслевые отчеты

Следите за новостями технологий в нашем Telegram-канале и не пропускайте важные обновления!

Источник: arstechnica.com