Индустрия баз данных развивается 60 лет, а ИИ-агенты — полтора года. Пит Джонсон из MongoDB объясняет, почему мода на накрутку токенов умерла и как агентная память меняет экономику ИИ.
Содержание
- Шестьдесят лет баз данных против полутора лет агентов
- Контекстное окно — самый дефицитный ресурс
- Три вещи, которые умеет настоящая агентная память
- Модель-судья: архитектура, которая дешевеет с каждым запросом
- Память бывает разной, и лучшую отбирают люди
- Ставка на память как первый «скучный» слой стека
Базы данных как отрасль существует примерно 60 лет. ИИ-агенты в том виде, в каком их понимают сегодня, — около полутора лет. Эта пропорция, по мнению Пита Джонсона, полевого технического директора по ИИ в MongoDB, объясняет почти всё, что сейчас происходит в агентной разработке: индустрия стоит не в середине кривой обучения, а у самого её подножия. Мода на «токен-максинг» — максимизацию потребления токенов как показателя работы — уже умерла, а на смену ей приходит агентная память.
- Шестьдесят лет баз данных против полутора лет агентов
- Контекстное окно — самый дефицитный ресурс
- Три вещи, которые умеет настоящая агентная память
- Модель-судья: архитектура, которая дешевеет с каждым запросом
- Память бывает разной, и лучшую отбирают люди
- Ставка на память как первый «скучный» слой стека
Шестьдесят лет баз данных против полутора лет агентов
Для агентов пока не существует своего LAMP-стека — устоявшегося, «скучного», стандартного набора решений, который позволяет команде прекратить бесконечные споры об архитектуре и просто выпускать продукт. Каждая команда изобретает всё заново, и это нормально для технологии, которой от силы полтора года.
Один из первых уроков индустрия получила на примере короткого увлечения токен-максингом. В начале 2026 года потребление токенов на какое-то время стало метрикой тщеславия: чем больше токенов сжигает агент, тем «продуктивнее» он выглядел. Реакция последовала быстро — объём токенов измеряет активность, а не результат. Но самое интересное в этой истории — не офисный театр вокруг красивых цифр, а архитектурный урок, который скрывался под ним.
Для российских команд эта история особенно показательна: при работе с платными API западных моделей или при развёртывании собственной инфраструктуры накрутка токенов бьёт по бюджету напрямую, и иллюзия «больше токенов — лучше результат» обходится заметно дороже.
Контекстное окно — самый дефицитный ресурс
Джонсон обобщил опыт более чем сотни бесед с заказчиками в 15 городах шести стран за первое полугодие 2026 года. Организации, по его наблюдениям, приходят к одному и тому же выводу: дефицитный ресурс — это контекстное окно. Проблема не в том, чтобы запихнуть в каждый промпт как можно больше информации, а в том, чтобы решить, что вообще заслуживает туда попасть.
И у этого вопроса есть ответ — память. Не в том вольном смысле, в каком слово используют, называя памятью само контекстное окно, а как настоящая, постоянная, доступная для запросов система, которая находится вне модели и снабжает её информацией осознанно и выборочно.
Три вещи, которые умеет настоящая агентная память
Хорошая агентная память делает три вещи, на которые контекстное окно само по себе не способно. Во-первых, она сохраняет то, что генеративная модель произвела в предыдущих циклах и сессиях, — дорогостоящие рассуждения, за которые уже заплачено, не испаряются в момент завершения сессии.
Во-вторых, она применяет к сохранённому ролевой контроль доступа: память, созданная одной командой, можно использовать в масштабах всего предприятия без риска утечки того, что утекать не должно. Для крупных российских компаний с их требованиями к разграничению доступа и защите данных это не абстрактное пожелание, а обязательное условие внедрения.
В-третьих, она позволяет новым запросам находить нужный прежний контент — а на практике это означает семантический поиск вместо поиска по точному совпадению, потому что агенты запрашивают информацию по смыслу, а не по ключу. Именно здесь история замыкается на шестидесятилетний опыт баз данных: индустрия шесть десятилетий училась идеально хранить и извлекать структурированные данные по точным критериям, а агентной памяти нужно другое — хранить неструктурированный результат генеративного процесса и находить его по схожести. Лучше всего с этим справляются команды, чья платформа данных умеет семантический поиск нативно, применяет к нему контроль доступа и хранит сгенерированный контент в том же месте, а не сшивает три системы вместе «на надежде».
Модель-судья: архитектура, которая дешевеет с каждым запросом
Как только такая память появляется, из неё естественным образом вырастает архитектура, к которой всё чаще приходят предприятия. Мощную систему памяти объединяют с более лёгкой моделью — часто с открытыми весами — чья задача не блистать, а быть хорошим судьёй. Поступает новый запрос, агент выполняет семантический поиск по памяти, переранжирует результаты, чтобы получить лучший кандидат на ответ, и задаёт лёгкой модели один-единственный вопрос: достаточно ли это хорошо, чтобы вернуть как есть?
Если достаточно — ответ возвращается пользователю, и дорогая генеративная модель не потребовалась вообще: ответ найден в памяти. Если нет — запрос эскалируется к дорогой модели, та выдаёт оригинальное решение, оно возвращается пользователю и сохраняется обратно в ту же систему памяти, чтобы следующей сессии не пришлось платить за него снова.
Стоит задуматься, что это делает с экономикой агентов на дистанции. Каждый оригинальный ответ дорогой модели становится дешёвым ответом в следующий раз, когда кому-то понадобится нечто похожее. Система становится дешевле и быстрее по мере использования — полная противоположность наивному токен-максингу, где стоимость линейно растёт вместе с нагрузкой бесконечно. Это разница между агентом, который учится тому, что уже знает, и агентом, который заново выводит вселенную на каждом цикле. Для компаний, разворачивающих агентов на собственных мощностях с открытыми моделями, такая схема выглядит ещё привлекательнее: лёгкий «судья» работает локально, а дорогие вызовы сводятся к минимуму.
Память бывает разной, и лучшую отбирают люди
Последний элемент, отделяющий настоящее от будущего, — зрелая агентная память не будет плоской корзиной из «краткосрочного» и «долгосрочного». У неё появятся типы, как у человеческой памяти. Таксономическая память хранит терминологию — контролируемый словарь и определения, на которых работает организация, чтобы агент понимал слово «чарджбэк» так, как его понимает ваша финансовая служба, а не весь интернет. Процедурная память хранит списки задач и последовательности действий — знание «как это делается у нас», которое превращает способную модель в полезного коллегу. Типов будет больше, и выработка правильной таксономии памяти — сама по себе часть той кривой обучения, по которой поднимается отрасль.
И здесь есть момент, знакомый каждому, кто эксплуатировал настоящую производственную систему: лучшие воспоминания часто попадают в систему потому, что их туда поместил человек. Не каждая память, сгенерированная агентом, заслуживает хранения, и не каждая сохранённая заслуживает того, чтобы показываться первой. Джонсон ожидает, что люди всё чаще будут курировать эти системы: вручную добавлять ценные воспоминания для частого переиспользования, вычищать шум, продвигать процедуру, которая работает, вместо трёх, которые работают «в основном». То же самое делали с базами знаний и документацией — курация превращает корпус из свалки в актив.
Ставка на память как первый «скучный» слой стека
Полтора года агентам и шестьдесят лет базам данных — разрыв между этими числами не повод для смущения, а просто правда о том, насколько рано всё это происходит. И эта правда должна научить скромности по отношению к каждой «лучшей практике», которой едва исполнился сезон.
Токен-максинг стал первой большой идеей, взлетевшей и упавшей внутри новой области, и его падение преподало урок, в котором отрасль нуждалась больше всего: контекстное окно дефицитно, поэтому дисциплина — в выборе того, что в него попадает. Эта дисциплина и есть агентная память: с семантическим поиском, контролем доступа, типами и человеческой курацией, сохраняющая то, что было дорого произвести, и отдающая это дёшево всегда после.
LAMP-стека для агентов по-прежнему нет. Но если бы Джонсону пришлось ставить на то, какой слой первым станет скучным, стандартным, устоявшимся выбором — тем, о котором перестанут спорить, чтобы вернуться к работе, — он поставил бы на память. Всё остальное, по его словам, пока напоминает ручную сборку CGI-BIN.
Источник: VentureBeat