Alibaba представила Qwen 3.8-Max как модель, уступающую только Claude Fable 5, но независимый тест поставил её на последнее место. Разбираемся, почему оба результата честны — и почему цена за токен больше не говорит ничего о реальном счёте.
Содержание
- Пять часов против одного: как два теста одной модели дали противоположные выводы
- Цена за токен перестала предсказывать итоговый счёт
- Парадокс усердия: когда больше размышлений даёт худший результат
- Отрасль переходит на оплату за решённую задачу
- Что изменить в работе с моделями уже на этой неделе
На этой неделе Alibaba выпустила модель Qwen 3.8-Max и представила превью-версию как вторую по силе после Claude Fable 5. Правда, таблица в день запуска была куда осторожнее маркетинга: модель лидирует лишь в одной из двенадцати строк, посвящённых кодинг-агентам. А независимый тест и вовсе дал почти противоположный результат: в прогоне бенчмарка VulcanBench, судя по всему использовавшем превью-версию, лучшая настройка усилий Qwen 3.8-Max оказалась в середине списка, а настройка по умолчанию — на последнем месте. Оба результата реальны и оба защитимы. Разница между ними — в бюджетах времени и токенов, которые редко попадают в заголовки пресс-релизов. Для российских команд, которые активно строят агентные системы на китайских моделях из-за доступности их API, эта история — повод пересмотреть сам подход к оценке моделей.
- Пять часов против одного: как два теста одной модели дали противоположные выводы
- Цена за токен перестала предсказывать итоговый счёт
- Парадокс усердия: когда больше размышлений даёт худший результат
- Отрасль переходит на оплату за решённую задачу
- Что изменить в работе с моделями уже на этой неделе
Пять часов против одного: как два теста одной модели дали противоположные выводы
Секрет расхождения прячется в сносках. Согласно примечаниям Alibaba к собственным тестам, на задачи кодинга модели давали пятичасовой таймаут, а на PaperBench — до двенадцати часов на один прогон. Независимый стенд VulcanBench ограничивал агентов куда жёстче: от 45 до 60 минут реального времени. Бюджет времени на стороне Alibaba больше в пять-шестнадцать раз — этим и объясняется гигантская разница в итоговых цифрах.
Из этой ситуации следуют два практических вывода, которые индустрии пора принять как стандарт. Первый: ключевая метрика при выборе модели — стоимость успешно решённой задачи. Это все расходы целиком, включая деньги, потраченные на провалившиеся попытки, поделённые на число задач, которые реально прошли ваш критерий приёмки. Второй: бюджет времени или токенов должен быть явной частью критериев приёмки, а не скрытой деталью настройки стенда.
Для российского рынка это особенно чувствительно. Многие отечественные компании и стартапы работают с Qwen, DeepSeek и Kimi именно из-за цены и доступности — и сравнение моделей по прайс-листу для них стало привычным первым шагом. История с Qwen 3.8-Max показывает, что этот шаг теперь почти ничего не говорит о реальных расходах.
Цена за токен перестала предсказывать итоговый счёт
В первую неделю после релиза Qwen 3.8-Max все сравнения сводились к ценам — просто потому, что других данных не было. И модель действительно недешёвая. DeepSeek-V4-Flash-0731, вышедший в публичное API-бета-тестирование 31 июля, стоит 14 центов за миллион входных токенов и 28 центов за миллион выходных. Qwen 3.8-Max — два и шесть долларов соответственно. Kimi K3 — три и пятнадцать долларов.
Но эти цифры говорят меньше, чем раньше, и причина специфична именно для reasoning-моделей вроде Qwen: достижение результата стоит «мыслительных» токенов. Модель, которая тратит большую часть токен-бюджета на рассуждения, может упёреться в лимит ещё до того, как напишет ответ. На выходе вы получаете пустой результат, неотличимый от полного провала, — по цене полноценного прогона.
Самое чистое опубликованное измерение этого эффекта есть у Artificial Analysis. Прогон Intelligence Index на DeepSeek-V4-Flash при максимальном уровне усилий потребовал 210 миллионов выходных токенов против медианы по классу в 100 миллионов. Абсолютная стоимость всё равно осталась низкой — токены слишком дешёвые. Но многословность стоит не только денег, но и времени, а в зависимости от сценария использования именно время может оказаться критичным.
Что действительно нужно — число, которое учитывает всё потраченное, включая попытки, вернувшиеся с пустым результатом, применительно к задачам, реально выполненным в заданный бюджет времени и токенов. Именно это и показывает метрика стоимости успешной задачи.
Парадокс усердия: когда больше размышлений даёт худший результат
Прогон, выдавший неправильный ответ, и прогон, исчерпавший бюджет, — разные события с разными способами исправления. Почти ни один тестовый стенд их не различает, и почти ни один лидерборд не публикует такую разбивку. Автор оригинального материала столкнулся с этим при создании собственного агентного бенчмарка: стенд фиксировал провал, но ничего не говорил о его причине, и различие пришлось добавлять вручную. Когда такое разделение появляется, выясняется, что доминирует именно исчерпание бюджета.
Исследование Long-Horizon-Terminal-Bench, опубликованное в июле, прогнало 17 фронтирных моделей по 46 задачам через единый стенд с одной 90-минутной попыткой на каждую. Таймауты составили 79% нерешённых запусков, ещё 19% — агенты, остановившиеся самостоятельно, и 3% — ошибки самого стенда. Авторы аккуратно уточняют, что это значит, а чего нет: прерванные по времени прогоны вовсе не были близки к финишу — средняя награда составляла от 0,10 до 0,35, так что нельзя предполагать, будто дополнительное время обернулось бы успехом. Но урок очевиден: бенчмарки неявно измеряют эффективность по времени, хотят они того или нет.
Самый наглядный опубликованный пример механизма — отчёт VulcanBench от 26 июля о Claude Opus 5. Самая низкая настройка усилий оказалась лучшей: 20 решённых задач из 23 против 18 на высокой настройке. Дополнительные размышления не были бесполезны: высокое усилие дало меньше всего неправильных ответов среди всех настроек — один против трёх. Проблема в том, что модель исчерпывала время, а таймаут оценивается в ноль. Два из трёх её откатов — обрывы на задачах, которые низкая настройка решает. А при неограниченном времени на обеих конфигурациях дорогая лишь сравнивается с самой дешёвой — при стоимости в 3,1 раза выше.
Отсюда прямое следствие для всех, кто строит каскадную маршрутизацию запросов. Стандартная схема эскалирует задачу к более «думающей» модели, когда дешёвая попытка провалилась, — из предположения, что следующая ступень просто лучше и лишь дороже стоит. Для значимой доли комбинаций «модель — задача» это предположение неверно: вы платите цену верхней ступени за эскалацию в таймаут или упирание в лимит токенов.
Отрасль переходит на оплату за решённую задачу
За последние несколько месяцев несколько команд независимо пришли к метрике «стоимость успешной задачи» — и это сильнейший сигнал, что она становится стандартом. VulcanBench указывает доллары за решённую задачу как главную колонку — и делает это с самых ранних отчётов. Long-Horizon-Terminal-Bench публикует стоимость задачи рядом с точностью, и самая поучительная строка там — GPT-5.4 примерно с 26 долларами за задачу при заметно более низком проценте успеха, чем у Grok 4.5 примерно с 11 долларами. TestEvo-Bench запускает агентов под жёстким потолком расходов, и оценка Claude Code на генерации тестов падает с 71% до 44% при более строгом лимите.
Поставщики уже приняли идею оплаты за результат. HubSpot в апреле перевёл Breeze Customer Agent на тариф 50 центов за решённый диалог вместо доллара за обработанный. Zendesk выставляет счета за автоматизированные решения. Fin берёт 99 центов за результат и тарифицирует только сквозное решение обращения от начала до конца. Для российских компаний, привыкших считать экономику ИИ через подписки и токены, это предвещает смену самой модели закупки: платить придётся не за «мысли» нейросети, а за закрытые заявки и выполненные задачи.
Что изменить в работе с моделями уже на этой неделе
Первое и главное: фиксируйте причину отказа в каждом запуске агента как обязательное поле — с раздельными значениями для исчерпания бюджета, провала верификатора и ошибки стенда, а не единым флагом «провал». Пока вы не отделите таймаут от неправильного ответа, ваш процент успеха измеряет две вещи одновременно, и понять, какую из них чинить, невозможно.
Второе: считайте стоимость успешной задачи для каждого уровня усилий, а не только для каждой модели. Все расходы, включая провальные попытки, делённые на задачи, прошедшие критерий приёмки. Итоговый рейтинг не совпадёт с прайс-листом — и вполне может победить самая дешёвая настройка.
Третье: ограничивайте прогоны по токенам, а не по реальному времени — если только задержка не входит в ваши целевые показатели качества сервиса. Потолок по времени оценивает скорость инференса вашего провайдера как качество модели, а это разные вещи.
И четвёртое: проверьте настройку усилий по умолчанию во всём, что уже развёрнуто. Qwen 3.8-Max при незаполненном поле effort работает на максимальном уровне рассуждений — а именно этот уровень показал худший результат в независимом тестировании. Команда, которая никогда не трогает этот параметр, фактически использует конфигурацию с самой высокой стоимостью решённой задачи.
Источник: VentureBeat