Новости

Первый бенчмарк для задач IT-предприятий: лидеры индустрии показывают результаты ниже 50%

Новая оценка моделей AI на основе бенчмарка ITBench-AA показывает, что даже лидеры индустрии не могут справиться с задачами IT-предприятий на уровне выше 50%

Новая оценка моделей AI на основе бенчмарка ITBench-AA показывает, что даже лидеры индустрии не могут справиться с задачами IT-предприятий на уровне выше 50%

Содержание

В последнее время наблюдается значительный рост интереса к задачам IT-предприятий, особенно в области искусственного интеллекта. Недавно был представлен первый бенчмарк для оценки моделей AI на основе задач IT-предприятий, получивший название ITBench-AA. Этот бенчмарк был разработан компанией Artificial Analysis и IBM, и он направлен на оценку способности моделей AI решать задачи IT-предприятий.

Что такое ITBench-AA и как он работает

ITBench-AA представляет собой бенчмарк, который оценивает модели AI на основе их способности решать задачи IT-предприятий. Этот бенчмарк включает в себя ряд задач, которые модели AI должны решить, используя различные инструменты и методы. Задачи включают в себя анализ логов, выявление проблем и решение задач в области IT-предприятий.

Результаты лидеров индустрии

Результаты лидеров индустрии, которые прошли тестирование на бенчмарке ITBench-AA, показывают, что даже самые передовые модели AI не могут справиться с задачами IT-предприятий на уровне выше 50%. Лидером стал Claude Opus 4.7, который показал результат в 47%, за ним следуют GPT-5.5 и Qwen3.7 Max с результатами в 46% и 42% соответственно.

Значение бенчмарка ITBench-AA

Бенчмарк ITBench-AA имеет значительное значение для развития индустрии искусственного интеллекта. Он показывает, что даже самые передовые модели AI не могут справиться с задачами IT-предприятий на уровне выше 50%, что указывает на необходимость дальнейшего развития и совершенствования моделей AI.

Источник: HF