Более десяти лет разговоры об AI-ассистентах, способных выполнять задачи не хуже человека, не утихают. Однако, несмотря на успехи больших языковых моделей (LLM), таких как ChatGPT, Gemini и Claude, в рассуждениях, объяснениях и кодировании, одна критически важная область остается проблемной – надежное выполнение задач для пользователей вне чата.

Проблемы существующих решений

Даже лучшие AI-модели показывают результаты лишь в районе 30-го процентиля на Terminal-Bench Hard, независимом бенчмарке, оценивающем эффективность AI-агентов при выполнении различных задач в браузере. Это значительно ниже уровня надежности, требуемого большинством предприятий и пользователей. Специализированные бенчмарки, такие как TAU-Bench airline, измеряющий надежность AI-агентов при поиске и бронировании авиабилетов, также демонстрируют невысокие показатели. Даже лучшие агенты и модели (Claude 3.7 Sonnet) достигают успеха лишь в 56% случаев, что означает, что агент терпит неудачу почти в половине случаев.

Решение от AUI: Apollo-1

Нью-йоркский стартап Augmented Intelligence (AUI) Inc. утверждает, что разработал решение, которое значительно повышает надежность AI-агентов в корпоративной среде. Их продукт, Apollo-1, как утверждается, использует новую архитектуру и алгоритмы для повышения точности и надежности при выполнении сложных задач. Подробности технологии пока держатся в секрете, но AUI обещает значительный прогресс по сравнению с существующими LLM.

Значение для России

В России, где активно развивается цифровизация бизнеса, надежные AI-агенты могли бы значительно повысить эффективность работы компаний в различных отраслях. Например, в банковском секторе AI-агенты могли бы автоматизировать процессы обработки заявок на кредиты, консультировать клиентов и выявлять мошеннические операции. В логистике они могли бы оптимизировать маршруты доставки и управлять складскими запасами. Однако, как и во всем мире, проблема надежности AI-агентов остается ключевым препятствием для их широкого внедрения. Решение, подобное Apollo-1, могло бы стать важным шагом на пути к созданию действительно полезных и надежных AI-ассистентов для российского бизнеса.

Перспективы и риски

Успех Apollo-1 будет зависеть от результатов независимого тестирования и отзывов пользователей. Если AUI действительно удалось создать более надежного AI-агента, это может произвести революцию в корпоративном секторе. Однако, как показывает практика, многие стартапы, обещающие прорывные технологии, не оправдывают ожиданий. Кроме того, конкуренция в сфере AI очень высока, и AUI придется бороться за место под солнцем с крупными игроками, такими как Google, Microsoft и Amazon.