Liquid AI выпустила модель LFM2.5-2.6B с 2,6 млрд параметров, которая запускает полноценных агентов прямо на устройстве, умещается в 2,5 ГБ памяти и конкурирует с моделями вчетверо крупнее.
Содержание
- Агент, который умещается в 2,5 ГБ памяти
- Четыре этапа пост-тренировки
- Как устроен конвейер агентного RL
- Сравнение с моделями вчетверо крупнее
- Скорость инференса на CPU и GPU
- Как запустить модель у себя
- Слабые места и открытые вопросы
Компания Liquid AI выпустила языковую модель LFM2.5-2.6B, созданную специально для запуска ИИ-агентов полностью на локальном устройстве. Модель поддерживает вызов инструментов и многошаговые рабочие процессы, оставаясь достаточно компактной и быстрой для повседневного железа — от ноутбуков до смартфонов. Для разработчиков это означает возможность разворачивать агентов где угодно, хранить данные на устройстве пользователя и масштабировать нагрузку без счетов за облачный инференс.
- Агент, который умещается в 2,5 ГБ памяти
- Четыре этапа пост-тренировки
- Как устроен конвейер агентного RL
- Сравнение с моделями вчетверо крупнее
- Скорость инференса на CPU и GPU
- Как запустить модель у себя
- Слабые места и открытые вопросы
Агент, который умещается в 2,5 ГБ памяти
Главная идея LFM2.5-2.6B — дать разработчикам агента, который работает целиком на устройстве и не требует обращения к облаку. По заявлению Liquid AI, модель конкурирует с системами в четыре раза крупнее в задачах использования инструментов, следования инструкциям и многошаговых агентных сценариях. При этом она выдает 220 токенов в секунду на чипе Apple M5 Max и 113 токенов в секунду на процессоре AMD Ryzen, занимая менее 2,5 ГБ памяти.
Для российских разработчиков такой подход особенно актуален. Локальный запуск снимает вопросы соответствия требованиям о персональных данных, убирает зависимость от зарубежных облачных API и позволяет встраивать ИИ-функции в корпоративные системы, закрытые от внешнего интернета. Агент на устройстве продолжает работать даже там, где нет стабильного канала связи, — на производстве, в полевых условиях, в транспорте.
Отдельно стоит подчеркнуть метод обучения: модель тренировали внутри самых популярных агентных обвязок, что улучшило совместимость с реальными инструментами. Это не академическая игрушка, а система, заточенная под практическое применение в существующих рабочих процессах.
Четыре этапа пост-тренировки
Базовая модель предобучена примерно на 34 триллионах токенов, а промежуточная фаза обучения расширила контекстное окно до 128 тысяч токенов. Затем пост-тренировка превращает базовую модель в агента за четыре последовательных этапа.
Первый этап — управляемое дообучение (SFT): два раунда с сильным перекосом в сторону агентных данных, включая использование инструментов, веб-поиск и траектории работы в обвязках. Второй этап — специализация учителей: для каждой предметной области, будь то математика, код или работа с инструментами, обучается отдельная модель-учитель.
Третий этап — многодоменная дистилляция на политике (MOPD): знания всех специализированных учителей переносятся в одну модель-студента. Финальный этап — агентное обучение с подкреплением: многоходовой RL внутри реальных агентных обвязок, где модель учится работать с разными инструментами, системными промптами и многошаговыми средами задач.
Как устроен конвейер агентного RL
Конвейер агентного обучения с подкреплением разделяет оптимизацию модели, инференс и выполнение среды на независимые компоненты. Движок обучения отвечает за оптимизацию модели, а движок роллаутов генерирует действия с использованием самой свежей версии политики. RL-фреймворк оркестрирует весь цикл: запускает роллауты, собирает траектории и награды, обновляет модель.
Действия выполняются внутри изолированного песочничного сервиса, где обвязка типа «черного ящика» размещает агента — например, OpenClaw или Hermes Agent — и координирует взаимодействие со средой задачи. Прокси обвязки позволяет работать с агентными средами без каких-либо модификаций, прозрачно захватывая токен-уровневые траектории, необходимые для восстановления и валидации обучающих примеров RL.
Такая архитектура важна для индустрии в целом: она показывает, как обучать компактные модели в реальных условиях эксплуатации, а не на синтетических примерах. Модель сразу учится тем ошибкам и ситуациям, с которыми столкнется у конечного пользователя.
Сравнение с моделями вчетверо крупнее
Liquid AI оценила LFM2.5-2.6B против моделей размером до четырех раз больше: gemma-4-E2B-it (5,1 млрд параметров), gemma-4-E4B-it (8 млрд), Qwen3.5-4B (4,7 млрд) и Qwen3.5-9B (9,7 млрд). LFM2.5-2.6B — самая маленькая модель в группе, однако она конкурирует с соперниками и нередко их обгоняет.
| Бенчмарк | LFM2.5-2.6B (2,6B) | gemma-4-E2B-it (5,1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4,7B) | Qwen3.5-9B (9,7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29,50 | -74,47 | -49,03 | -54,30 | -50,43 |
| AIME25 | 51,87 | 26,33 | 34,27 | 49,33 | 56,07 |
| LiveCodeBenchv6 | 59,41 | 54,92 | 63,77 | 60,85 | 69,86 |
| IFBench | 59,17 | 34,08 | 39,24 | 48,40 | 56,47 |
| Multi-IF | 80,07 | 69,44 | 77,35 | 55,67 | 62,55 |
| IFStruct | 85,49 | 64,85 | 76,65 | 36,25 | 78,50 |
| BFCLv4 | 56,88 | 36,98 | 46,39 | 50,56 | 60,13 |
| ToolSandbox | 77,83 | 52,40 | 65,00 | 75,55 | 76,44 |
| τ³-Bench Banking | 5,67 | 3,35 | 4,12 | 5,45 | 5,15 |
| Claw-Eval (среднее, EN) | 62,85 | 53,14 | 58,02 | 62,28 | 66,53 |
| PinchBench | 68,22 | 44,24 | 55,09 | 71,26 | 71,45 |
| BrowseComp+ (OpenClaw) | 26,89 | 8,31 | 15,90 | 24,46 | 27,23 |
Ключевые сильные стороны модели — следование инструкциям и работа с инструментами. LFM2.5-2.6B лидирует во всех бенчмарках следования инструкциям из таблицы и во всех тестах использования инструментов, кроме BFCLv4, где вперед вырывается только 9,7-миллиардная Qwen. В агентных задачах она обгоняет обе модели Gemma и держится наравне с Qwen. Модель также лидирует по знаниям и близко следует за лидерами в математике.
Единственная область, где крупные модели сохраняют явное преимущество, — программирование. Если задача связана с генерацией сложного кода, разработчикам Liquid AI честно советуют взять модель побольше.
Скорость инференса на CPU и GPU
Модель получила поддержку всей экосистемы инференса с первого дня: llama.cpp, MLX, vLLM, SGLang и ONNX. Благодаря эффективной архитектуре LFM2 это самая быстрая модель из протестированных командой: скорость декодирования достигает 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на Ryzen AI Max+ 395. Даже при 30 токенах в секунду — а это уровень смартфона — модель позволяет запускать вполне способных агентов.
На видеокартах LFM2.5-2.6B — самая быстрая модель в своем классе размера. При высокой параллельной нагрузке она выдает почти 15 тысяч выходных токенов в секунду, что эквивалентно примерно 1,3 миллиарда токенов в сутки на одной карте H100. Для сервисов с массовой обработкой запросов это означает заметную экономию на инфраструктуре.
Как запустить модель у себя
Обе версии — LFM2.5-2.6B и базовая LFM2.5-2.6B-Base — уже доступны на Hugging Face. Для начала работы нужно установить свежую версию библиотеки transformers (совместимость начинается с версии 5.0.0):
pip install -U transformersЗатем модель загружается и запускается стандартным способом:
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained( model_id, device_map="auto", dtype="bfloat16",
)
tokenizer = AutoTokenizer.from_pretrained(model_id) prompt = "Что такое C. elegans?"
input_ids = tokenizer.apply_chat_template( [{"role": "user", "content": prompt}], add_generation_prompt=True, return_tensors="pt", tokenize=True,
).to(model.device) output = model.generate( input_ids, do_sample=True, temperature=0.2, top_k=80, repetition_penalty=1.05, max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))Для быстрого знакомства доступна демонстрация в браузере: WebGPU-демо запускает исследовательского агента, который помогает изучить конкретный вопрос и формирует сводку — без всякой установки. Кроме того, Liquid AI опубликовала руководство по запуску локальных агентов на базе обвязок OpenClaw, Hermes Agent и Pi.
Слабые места и открытые вопросы
Сообщество уже начало тестировать модель, и первые отзывы показывают: не все гладко. Один из пользователей Hugging Face описал случай, когда в агентном сценарии модель получила через MCP-инструмент данные в неверном формате и вместо того, чтобы сигнализировать о проблеме, уверенно выдала некорректные данные за факт. Это классическая галлюцинация, и в агентной связке она особенно опасна: ошибочный результат напрямую попадает в следующий шаг цепочки. Показательно, что аналогичный сценарий с Gemma 4 E4B у того же пользователя прошел без подобной ошибки.
Дискуссия вокруг этого случая поднимает важный для всей отрасли вопрос: чья это зона ответственности, когда инструмент возвращает битые или неправильно отформатированные данные — модели, промпта или слоя инструментов? Практический вывод для разработчиков пока таков: при построении агентов на компактных моделях стоит добавлять явные ограничения на формат данных в промпты и закладывать валидацию ответов инструментов на уровне самой обвязки, не полагаясь на самокоррекцию модели.
Тем не менее выпуск LFM2.5-2.6B — заметный шаг к тому, чтобы локальные агенты стали массовым явлением. Сочетание конкурентоспособного качества, скорости на обычном железе и открытой доступности делает модель привлекательным выбором для высоконагруженных сценариев, где важны приватность данных и предсказуемая стоимость эксплуатации. Liquid AI просит при использовании ссылаться на публикацию: Liquid AI, «LFM2.5-2.6B: Deploy Agents Everywhere», Liquid AI Blog, август 2026.
Источник: HF