Исследователи из Coral AI Labs создали AgentRadio — асинхронный слой обмена сообщениями, который позволяет ИИ-агентам координироваться в реальном времени и почти удваивает точность решения задач.
Содержание
- Почему одиночные агенты теряются в больших кодовых базах
- Три порочных паттерна мультиагентных систем
- Как устроен AgentRadio
- Результаты тестов: почти двукратный рост точности
- Кейс MinIO: координация против тупиковых путей
- Что это значит для разработчиков и бизнеса
Команда из четырёх ИИ-агентов, координирующих свои действия в реальном времени, смогла обойти по точности даже одиночного агента на базе флагманской модели Claude Opus 4.8 при решении сложных корпоративных задач программирования. Такой результат показала система AgentRadio, разработанная исследователями из Coral AI Labs совместно с несколькими университетами, — и она ставит под сомнение распространённое убеждение, что качество работы ИИ определяется исключительно мощностью модели.
- Почему одиночные агенты теряются в больших кодовых базах
- Три порочных паттерна мультиагентных систем
- Как устроен AgentRadio
- Результаты тестов: почти двукратный рост точности
- Кейс MinIO: координация против тупиковых путей
- Что это значит для разработчиков и бизнеса
Почему одиночные агенты теряются в больших кодовых базах
По мере роста корпоративных кодовых баз ИИ-агенты, которым поручено их анализировать, всё чаще «ломаются» под весом так называемых длинно-горизонтных задач — тех, что требуют множества взаимодействий и вызовов инструментов. Понимание кодовой базы представляет собой экстремальную версию этой проблемы: агенту нужно собрать программное обеспечение, запустить его, отследить пути исполнения через множество файлов и синтезировать доказательства на протяжении длительного времени.
В таких условиях одиночные агентные системы обычно выходят из строя из-за «проблемы покрытия». «Одиночный агент движется по репозиторию одним последовательным путём, — объяснили соавторы статьи об AgentRadio Синьсин Жэнь, Кэлум Фордер и Питер Кэрролл. — По мере роста контекста первоначальный план становится всё труднее пересматривать, а открытия, сделанные на поздних этапах исследования, не всегда распространяются на всю работу». Модель обычно способна выполнять отдельные шаги, но, как отмечают исследователи, «сложность в том, чтобы удерживать активными каждое обязательство, каждую зависимость и каждый фрагмент противоречивых доказательств на протяжении долгого расследования».
Одним из бенчмарков, измеряющих производительность ИИ на больших кодовых базах, является SWE-Atlas QnA. Он состоит из длинно-горизонтных вопросов на естественном языке по живым производственным репозиториям. Эти задачи нельзя решить простым просмотром кода: агенты обязаны запускать программное обеспечение и выполнять множество команд, чтобы найти ответы. Согласно экспериментам исследовательской группы, одиночный экземпляр Claude Code на базе Opus 4.6 решает лишь 32,3% таких задач. Переход на более новую и продвинутую модель Opus 4.8 поднимает показатель только до 57,2%.
Три порочных паттерна мультиагентных систем
Естественное решение — распределить нагрузку между несколькими агентами, чтобы каждый работал с меньшим и более чистым контекстом. Мультиагентные подходы действительно дают существенный прирост производительности, когда задачи чисто декомпозируются, то есть решаются по отдельности и объединяются в конце. Однако понимание кодовой базы редко поддаётся чистой декомпозиции: подзадачи тесно взаимосвязаны. Критически важный конфигурационный файл или баг, обнаруженный одним агентом, может полностью переписать или перенаправить весь путь исследования другого. Из-за этих зависимостей агентам необходимо координироваться, договариваться и делиться промежуточными находками в реальном времени.
Несмотря на эту потребность, асинхронная межагентная коммуникация встречается редко. Исследователи выделяют три порочных паттерна, на которые распадаются существующие мультиагентные системы. Первый — «параллельно, но изолированно»: агенты работают одновременно, но вообще не обмениваются данными. Второй — «параллельно, но с синхронизацией по раундам»: агенты могут общаться, но только на строгих границах раундов, что заставляет их останавливаться и ждать друг друга, прежде чем обсудить промежуточные находки. Такие системы исходят из предположения, что важные открытия могут подождать до следующей фазы коммуникации, — а это дорогое предположение, когда агенты работают над взаимозависимыми частями живой системы. Например, агент, исследующий симптом в API, может обнаружить доказательства, опровергающие текущую гипотезу агента по хранилищу данных. «Если эта информация будет ждать, пока оба агента закончат, исследование хранилища может завершиться по неверному пути», — поясняют авторы.
Третий паттерн — «асинхронность в примыкающих формах»: системы предлагают ограниченные асинхронные функции вроде нисходящей диспетчеризации задач, но лишены горизонтальных одноранговых каналов между агентами или требуют, чтобы агент активно приостанавливал работу ради чтения обновлений из общей памяти. В своей статье исследователи формулируют главное узкое место современных мультиагентных систем так: «агент, который работает, не может одновременно слушать». И добавляют: «Насколько нам известно, ни одна существующая система не даёт параллельно работающим агентам пассивной осведомлённости друг о друге через горизонтальный канал на естественном языке».
Как устроен AgentRadio
Чтобы снять взаимное исключение между работой и слушанием, исследователи разработали AgentRadio — асинхронный слой передачи сообщений, который подключается напрямую к существующим оболочкам кодовых агентов. Система наделяет агентов тремя примитивами. Примитив create_thread открывает беседу между участвующими агентами. Примитив send_message добавляет сообщение в тред и возвращает управление, не блокируя отправляющего агента. Примитив wait_for_mention блокирует процесс до прихода сообщения с упоминанием вызывающего — и доставляет его вместе с полным снимком всех тредов, чтобы агент мгновенно получал контекст.
Эта тройка даёт агентам состояние «пассивной осведомлённости»: они продолжают свои основные задачи, параллельно передавая сообщения и обновляя знания в фоновом режиме. Код AgentRadio доступен под лицензией Apache 2.0 на GitHub. Система спроектирована лёгкой и не требует прямых модификаций базовых оболочек агентов вроде Claude Code или Codex CLI.
Архитектура состоит из двух основных частей. Первая — сервер сообщений: автономный процесс, выступающий центральным узлом, который хранит все активные треды, сообщения и упоминания для группы агентов. Вторая — интеграция на стороне оболочки: агенты взаимодействуют с сервером через три простых shell-скрипта, по одному на каждый примитив. Единственное строгое требование — оболочка агента должна уметь запускать shell-команду как фоновую задачу. В системных промптах агентам предписывается держать один «наблюдатель» запущенным и отправлять сообщения через предоставленные скрипты. Запуск скрипта wait_for_mention в фоне позволяет агенту продолжать работу и получать уведомления асинхронно.
Для интеграции в существующий стек команде всё же понадобится «тонкий адаптер, который запускает рабочие процессы, назначает идентичности, подключает их к общему серверу и управляет финальным синтезом», отмечают исследователи. Эта работа располагается вокруг кодового агента и не требует изменений в самой модели.
Результаты тестов: почти двукратный рост точности
Чтобы проверить практическую полезность AgentRadio, исследователи протестировали фреймворк на 124 задачах из бенчмарка SWE-Atlas QnA. Тесты охватывали такие области, как проектирование систем, анализ первопричин, безопасность и интеграция API. В качестве базовых моделей использовались Claude Opus 4.6 и DeepSeek V4 Pro. Конфигурации оболочек варьировались от одиночного агента Claude Code (B0) до команды агентов с классическим разделением труда (L1) и вплоть до команды, использующей AgentRadio для асинхронной координации (L3).
Результаты экспериментов показали, что коммуникационная архитектура AgentRadio превосходит как наивные мультиагентные конфигурации, так и грубое масштабирование вычислений. Если одиночный агент Claude Code с Opus 4.6 решал лишь 32,3% задач, то полная конфигурация AgentRadio почти удвоила этот показатель — до 62,1%, обойдя и одиночного агента на Opus 4.8 с его 57,2%. Для DeepSeek V4 Pro прирост оказался не менее впечатляющим: с 29,0% до 50,8%.
Эти цифры особенно показательны на фоне того, как обычно развивается индустрия: компании тратят огромные ресурсы на обучение всё более мощных моделей, а здесь существенный скачок качества достигнут исключительно за счёт организации взаимодействия между агентами на моделях предыдущего поколения.
Кейс MinIO: координация против тупиковых путей
Чтобы показать практическое влияние подхода на корпоративный ИИ, авторы статьи приводят реальную задачу, связанную с системой MinIO. Для её решения требовалась проверка серверных логов по каждому запросу — требование, которого агенты не предвидели на этапе первоначального планирования.
В конфигурации L2, где агенты сотрудничают, но лишены асинхронной коммуникации, два агента независимо друг от друга продолжали двигаться по неверным траекториям, поскольку критическая находка одного из них не могла своевременно достичь другого. Именно здесь асинхронный обмен сообщениями демонстрирует свою ценность: возможность сделать поправку по ходу дела, а не дожидаться формальной фазы ревью, оказывается решающей в приложениях, где подзадачи сильно взаимозависимы. Агенты получают шанс скорректировать курс вместо того, чтобы до конца идти по тупиковому пути.
Что это значит для разработчиков и бизнеса
Для практиков в области ИИ AgentRadio демонстрирует важный принцип: правильная структура координации способна превзойти грубую вычислительную мощность и масштаб модели. Это особенно актуально для российских компаний, которые всё активнее внедряют ИИ-ассистентов в процессы разработки, но при этом нередко ограничены в доступе к самым передовым зарубежным моделям или вынуждены экономить на API-вызовах флагманских систем. Подход AgentRadio показывает, что заметного прироста качества можно добиться архитектурными средствами — поверх уже доступных моделей, включая открытые решения вроде DeepSeek.
Открытость кода под лицензией Apache 2.0 снижает порог входа: инженерные команды могут экспериментировать с фреймворком без лицензионных рисков, а требование минимальных изменений в существующих оболочках означает, что внедрение не потребует перестройки инфраструктуры. Для крупных российских технологических компаний с монолитными репозиториями и многолетней историей кодовой базы — а таких большинство среди банков, ритейла и телекома — мультиагентная координация может стать практическим способом автоматизировать аудит кода, поиск уязвимостей и анализ первопричин инцидентов.
В более широком смысле работа исследователей из Coral AI Labs намечает смену парадигмы: конкуренция смещается от «чья модель больше» к «чья оркестрация умнее». Если тренд подтвердится, следующие прорывы в прикладном ИИ будут происходить не в лабораториях, обучающих модели, а в инструментах, которые заставляют команды агентов работать как слаженный коллектив, а не как набор изолированных исполнителей.
Источник: VentureBeat