Новости

Liquid AI представила LFM2.5-2.6B: миниатюрная модель превращает ноутбук и смартфон в площадку для ИИ-агентов

Liquid AI выпустила модель LFM2.5-2.6B с 2,6 млрд параметров, которая запускает полноценных агентов прямо на устройстве, умещается в 2,5 ГБ памяти и конкурирует с моделями вчетверо крупнее.

Liquid AI выпустила модель LFM2.5-2.6B с 2,6 млрд параметров, которая запускает полноценных агентов прямо на устройстве, умещается в 2,5 ГБ памяти и конкурирует с моделями вчетверо крупнее.

Содержание

Компания Liquid AI выпустила языковую модель LFM2.5-2.6B, созданную специально для запуска ИИ-агентов полностью на локальном устройстве. Модель поддерживает вызов инструментов и многошаговые рабочие процессы, оставаясь достаточно компактной и быстрой для повседневного железа — от ноутбуков до смартфонов. Для разработчиков это означает возможность разворачивать агентов где угодно, хранить данные на устройстве пользователя и масштабировать нагрузку без счетов за облачный инференс.

Агент, который умещается в 2,5 ГБ памяти

Главная идея LFM2.5-2.6B — дать разработчикам агента, который работает целиком на устройстве и не требует обращения к облаку. По заявлению Liquid AI, модель конкурирует с системами в четыре раза крупнее в задачах использования инструментов, следования инструкциям и многошаговых агентных сценариях. При этом она выдает 220 токенов в секунду на чипе Apple M5 Max и 113 токенов в секунду на процессоре AMD Ryzen, занимая менее 2,5 ГБ памяти.

Для российских разработчиков такой подход особенно актуален. Локальный запуск снимает вопросы соответствия требованиям о персональных данных, убирает зависимость от зарубежных облачных API и позволяет встраивать ИИ-функции в корпоративные системы, закрытые от внешнего интернета. Агент на устройстве продолжает работать даже там, где нет стабильного канала связи, — на производстве, в полевых условиях, в транспорте.

Отдельно стоит подчеркнуть метод обучения: модель тренировали внутри самых популярных агентных обвязок, что улучшило совместимость с реальными инструментами. Это не академическая игрушка, а система, заточенная под практическое применение в существующих рабочих процессах.

Четыре этапа пост-тренировки

Базовая модель предобучена примерно на 34 триллионах токенов, а промежуточная фаза обучения расширила контекстное окно до 128 тысяч токенов. Затем пост-тренировка превращает базовую модель в агента за четыре последовательных этапа.

Первый этап — управляемое дообучение (SFT): два раунда с сильным перекосом в сторону агентных данных, включая использование инструментов, веб-поиск и траектории работы в обвязках. Второй этап — специализация учителей: для каждой предметной области, будь то математика, код или работа с инструментами, обучается отдельная модель-учитель.

Третий этап — многодоменная дистилляция на политике (MOPD): знания всех специализированных учителей переносятся в одну модель-студента. Финальный этап — агентное обучение с подкреплением: многоходовой RL внутри реальных агентных обвязок, где модель учится работать с разными инструментами, системными промптами и многошаговыми средами задач.

Как устроен конвейер агентного RL

Конвейер агентного обучения с подкреплением разделяет оптимизацию модели, инференс и выполнение среды на независимые компоненты. Движок обучения отвечает за оптимизацию модели, а движок роллаутов генерирует действия с использованием самой свежей версии политики. RL-фреймворк оркестрирует весь цикл: запускает роллауты, собирает траектории и награды, обновляет модель.

Действия выполняются внутри изолированного песочничного сервиса, где обвязка типа «черного ящика» размещает агента — например, OpenClaw или Hermes Agent — и координирует взаимодействие со средой задачи. Прокси обвязки позволяет работать с агентными средами без каких-либо модификаций, прозрачно захватывая токен-уровневые траектории, необходимые для восстановления и валидации обучающих примеров RL.

Такая архитектура важна для индустрии в целом: она показывает, как обучать компактные модели в реальных условиях эксплуатации, а не на синтетических примерах. Модель сразу учится тем ошибкам и ситуациям, с которыми столкнется у конечного пользователя.

Сравнение с моделями вчетверо крупнее

Liquid AI оценила LFM2.5-2.6B против моделей размером до четырех раз больше: gemma-4-E2B-it (5,1 млрд параметров), gemma-4-E4B-it (8 млрд), Qwen3.5-4B (4,7 млрд) и Qwen3.5-9B (9,7 млрд). LFM2.5-2.6B — самая маленькая модель в группе, однако она конкурирует с соперниками и нередко их обгоняет.

БенчмаркLFM2.5-2.6B (2,6B)gemma-4-E2B-it (5,1B)gemma-4-E4B-it (8B)Qwen3.5-4B (4,7B)Qwen3.5-9B (9,7B)
AA Omniscience-29,50-74,47-49,03-54,30-50,43
AIME2551,8726,3334,2749,3356,07
LiveCodeBenchv659,4154,9263,7760,8569,86
IFBench59,1734,0839,2448,4056,47
Multi-IF80,0769,4477,3555,6762,55
IFStruct85,4964,8576,6536,2578,50
BFCLv456,8836,9846,3950,5660,13
ToolSandbox77,8352,4065,0075,5576,44
τ³-Bench Banking5,673,354,125,455,15
Claw-Eval (среднее, EN)62,8553,1458,0262,2866,53
PinchBench68,2244,2455,0971,2671,45
BrowseComp+ (OpenClaw)26,898,3115,9024,4627,23

Ключевые сильные стороны модели — следование инструкциям и работа с инструментами. LFM2.5-2.6B лидирует во всех бенчмарках следования инструкциям из таблицы и во всех тестах использования инструментов, кроме BFCLv4, где вперед вырывается только 9,7-миллиардная Qwen. В агентных задачах она обгоняет обе модели Gemma и держится наравне с Qwen. Модель также лидирует по знаниям и близко следует за лидерами в математике.

Единственная область, где крупные модели сохраняют явное преимущество, — программирование. Если задача связана с генерацией сложного кода, разработчикам Liquid AI честно советуют взять модель побольше.

Скорость инференса на CPU и GPU

Модель получила поддержку всей экосистемы инференса с первого дня: llama.cpp, MLX, vLLM, SGLang и ONNX. Благодаря эффективной архитектуре LFM2 это самая быстрая модель из протестированных командой: скорость декодирования достигает 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на Ryzen AI Max+ 395. Даже при 30 токенах в секунду — а это уровень смартфона — модель позволяет запускать вполне способных агентов.

На видеокартах LFM2.5-2.6B — самая быстрая модель в своем классе размера. При высокой параллельной нагрузке она выдает почти 15 тысяч выходных токенов в секунду, что эквивалентно примерно 1,3 миллиарда токенов в сутки на одной карте H100. Для сервисов с массовой обработкой запросов это означает заметную экономию на инфраструктуре.

Как запустить модель у себя

Обе версии — LFM2.5-2.6B и базовая LFM2.5-2.6B-Base — уже доступны на Hugging Face. Для начала работы нужно установить свежую версию библиотеки transformers (совместимость начинается с версии 5.0.0):

pip install -U transformers

Затем модель загружается и запускается стандартным способом:

from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained( model_id, device_map="auto", dtype="bfloat16",
)
tokenizer = AutoTokenizer.from_pretrained(model_id) prompt = "Что такое C. elegans?"
input_ids = tokenizer.apply_chat_template( [{"role": "user", "content": prompt}], add_generation_prompt=True, return_tensors="pt", tokenize=True,
).to(model.device) output = model.generate( input_ids, do_sample=True, temperature=0.2, top_k=80, repetition_penalty=1.05, max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))

Для быстрого знакомства доступна демонстрация в браузере: WebGPU-демо запускает исследовательского агента, который помогает изучить конкретный вопрос и формирует сводку — без всякой установки. Кроме того, Liquid AI опубликовала руководство по запуску локальных агентов на базе обвязок OpenClaw, Hermes Agent и Pi.

Слабые места и открытые вопросы

Сообщество уже начало тестировать модель, и первые отзывы показывают: не все гладко. Один из пользователей Hugging Face описал случай, когда в агентном сценарии модель получила через MCP-инструмент данные в неверном формате и вместо того, чтобы сигнализировать о проблеме, уверенно выдала некорректные данные за факт. Это классическая галлюцинация, и в агентной связке она особенно опасна: ошибочный результат напрямую попадает в следующий шаг цепочки. Показательно, что аналогичный сценарий с Gemma 4 E4B у того же пользователя прошел без подобной ошибки.

Дискуссия вокруг этого случая поднимает важный для всей отрасли вопрос: чья это зона ответственности, когда инструмент возвращает битые или неправильно отформатированные данные — модели, промпта или слоя инструментов? Практический вывод для разработчиков пока таков: при построении агентов на компактных моделях стоит добавлять явные ограничения на формат данных в промпты и закладывать валидацию ответов инструментов на уровне самой обвязки, не полагаясь на самокоррекцию модели.

Тем не менее выпуск LFM2.5-2.6B — заметный шаг к тому, чтобы локальные агенты стали массовым явлением. Сочетание конкурентоспособного качества, скорости на обычном железе и открытой доступности делает модель привлекательным выбором для высоконагруженных сценариев, где важны приватность данных и предсказуемая стоимость эксплуатации. Liquid AI просит при использовании ссылаться на публикацию: Liquid AI, «LFM2.5-2.6B: Deploy Agents Everywhere», Liquid AI Blog, август 2026.

Источник: HF