Databricks показала, что в задачах на стыке таблиц и текстов многошаговый агент стабильно превосходит классический RAG, даже если у соперника более мощная модель.
📋 Обзор
Databricks опубликовала результаты исследования, которое затрагивает одну из самых болезненных проблем корпоративного ИИ: слабую работу систем, когда нужно одновременно анализировать структурированные и неструктурированные данные. Речь о так называемых гибридных запросах, где приходится сопоставлять, например, показатели продаж с отзывами клиентов, а число научных цитирований — с содержанием самих публикаций. В таких сценариях классические одношаговые RAG-системы, как утверждает компания, системно проигрывают многошаговым агентам.
Основные детали
Команда Databricks сравнила многошаговый агентный подход с современными одношаговыми RAG-базовыми решениями на девяти задачах из области корпоративных знаний. По данным компании, на наборе бенчмарков STaRK, разработанном в Стэнфорде, многошаговый подход показал прирост более чем на 20%. Улучшение также было стабильным на собственном фреймворке оценки Databricks под названием KARLBench.
Ключевой вывод исследования заключается в том, что разрыв в качестве между одношаговым RAG и многошаговыми агентами связан не столько с «силой» базовой языковой модели, сколько с архитектурой всей системы. Иными словами, если задача требует нескольких логических переходов, повторного поиска данных, сверки результатов и объединения разных источников, простая схема «получил вопрос — извлек контекст — сгенерировал ответ» начинает ломаться.
Отдельно Databricks подчеркивает показательный результат: компания противопоставила своему многошаговому агенту более сильную модель в одношаговой конфигурации на гибридных запросах, однако та все равно проиграла на 21%. Это важный сигнал для рынка: наращивание мощности модели само по себе не решает проблему сложных корпоративных сценариев, если оркестрация поиска и рассуждения остается примитивной.
Исследование продолжает предыдущую работу Databricks по улучшению механики поиска в RAG-системах. Ранее компания уже показывала, что управляемые, или instructed retriever, механизмы поиска заметно повышают качество извлечения информации. Теперь акцент смещается еще дальше — от оптимизации отдельного шага поиска к построению агентной цепочки, где система поэтапно решает подзадачи, выбирает источники, уточняет промежуточные результаты и только потом формирует ответ.
Для корпоративной среды это особенно важно. Типичный запрос в бизнесе редко ограничивается одной базой знаний. В реальных компаниях приходится работать одновременно с CRM, таблицами продаж, перепиской службы поддержки, юридическими документами, презентациями, спецификациями и внутренними регламентами. Если ИИ должен не просто «найти фрагмент текста», а сопоставить числа, контекст и смысл, одношаговый RAG действительно быстро упирается в ограничения.
Значение для России
Для российского рынка результаты Databricks выглядят особенно актуально. Многие компании сегодня строят внутренние ИИ-помощники для работы с документами, аналитикой, закупками, сервисом и промышленными данными. В банках это могут быть запросы, где нужно объединять транзакционные показатели с обращениями клиентов. В ритейле — сопоставлять продажи по регионам с отзывами на маркетплейсах и данными колл-центров. В промышленности — анализировать телеметрию оборудования вместе с ремонтной документацией и журналами инцидентов.
На практике это означает, что ставка только на «более крупную и умную модель» может оказаться экономически невыгодной. Для российских команд, которые часто ограничены бюджетами на вычисления и требованиями к локальному развертыванию, вывод Databricks звучит прагматично: правильная архитектура агента способна дать больший прирост, чем просто переход на более дорогую модель. Это особенно заметно в сегментах, где важны импортонезависимые решения, гибридные инфраструктуры и работа с чувствительными данными внутри периметра компании.
Еще один важный аспект — оценка качества. Многие организации до сих пор тестируют ИИ-системы на относительно простых вопросах, где достаточно извлечь один релевантный документ. Однако корпоративная ценность возникает именно в сложных сценариях, требующих нескольких шагов рассуждения. Поэтому появление таких наборов оценки, как STaRK и KARLBench, может подтолкнуть рынок к более реалистичному измерению эффективности ИИ-агентов.
Заключение
Результаты Databricks усиливают тренд, который в индустрии обсуждают все чаще: следующий этап развития корпоративного ИИ — это не просто большие языковые модели, а хорошо организованные агентные системы, умеющие поэтапно искать, проверять и объединять данные из разных источников. Если выводы исследования подтвердятся в широком числе реальных внедрений, то архитектура многошаговых агентов может стать новым стандартом для корпоративных ИИ-платформ. Для бизнеса это означает простую, но важную мысль: в сложных задачах выигрывает не только тот, у кого мощнее модель, а тот, у кого умнее устроен весь процесс работы с данными.
Источник: Аналитические данные и отраслевые отчеты
Следите за новостями технологий в нашем Telegram-канале и не пропускайте важные обновления!
Источник: venturebeat.com