Новости

ИИ без облака и видеокарт: Liquid AI выпустила модель, которая запускается даже на Raspberry Pi

Стартап Liquid AI представил открытую языковую модель LFM2.5-2.6B для агентных сценариев. Она работает полностью локально — от смартфона до Raspberry Pi — и не требует ни облака, ни GPU.

Стартап Liquid AI представил открытую языковую модель LFM2.5-2.6B для агентных сценариев. Она работает полностью локально — от смартфона до Raspberry Pi — и не требует ни облака, ни GPU.

Содержание

Стартап Liquid AI, основанный в 2023 году бывшими исследователями Массачусетского технологического института, представил LFM2.5-2.6B — открытую языковую модель, созданную специально для агентных сценариев. Её главная особенность — полная автономность: модель работает локально практически на чём угодно, от смартфона и ноутбука до одноплатного компьютера Raspberry Pi, без облачных вычислений и без видеокарт. Для компаний из регулируемых отраслей, которые не хотят отправлять чувствительные данные во внешние облака, это открывает новый класс применений ИИ.

Что представляет собой LFM2.5-2.6B

Модель содержит 2,6 миллиарда параметров, поддерживает контекстное окно в 128 000 токенов и умеет нативно вызывать внешние инструменты. Несколько громоздкое название расшифровывается просто: поколение модели (2.5) плюс количество параметров (2.6B).

На Hugging Face уже доступны как финальная версия после обучения, так и базовый чекпоинт LFM2.5-2.6B-Base для разработчиков, желающих дообучить модель под свои задачи. С первого дня поддерживаются все основные инференс-стеки: llama.cpp, MLX, vLLM, SGLang и ONNX. Это позволяет разворачивать модель где угодно — на потребительском железе, в корпоративной инфраструктуре и во встраиваемых системах. Кроме того, Liquid AI предлагает собственный открытый фреймворк для файнтюнинга под названием LEAP.

Компания сознательно не позиционирует новинку как конкурента крупнейшим фронтирным моделям. Аргумент другой: достаточно способная малая модель открывает категории корпоративных приложений, где задержка, приватность, гибкость развёртывания и стоимость инференса важнее абсолютного лидерства в бенчмарках. «Я действительно верю, что лучшие модели будут в облаке, и в этом нет ничего плохого, — рассказал Максим Лабонн, руководитель направления постобучения Liquid AI, в интервью VentureBeat после запуска. — Мы делаем модели для другого типа пользователей. Проще всего это описать так: локальный ИИ стоит использовать тогда, когда облачную модель использовать нельзя».

Лучше всего LFM2.5-2.6B подходит для массовых, чётко определённых агентных задач, выполняемых локально: вызов инструментов, работа с документами, автоматизация календаря и рабочих процессов, постоянно активные фоновые рутины. Отдельная ниша — среды с ограниченной связью: транспорт и робототехника. А вот тяжёлую разработку кода компания честно советует оставить более крупным моделям.

От Raspberry Pi до серверной H100: показатели производительности

На вопрос о минимально достаточном железе Лабонн ответил, что модель работает «очень, очень хорошо» на процессорах — архитектура LFM2, лежащая в её основе, изначально проектировалась с прицелом на реальную производительность CPU, а не на показатели в GPU-бенчмарках. «Лучший пример — Raspberry Pi, — отметил он. — У нас много демонстраций, которые показывают, что на Raspberry Pi модель работает вполне быстро».

По данным компании, скорость генерации составляет около 220 токенов в секунду на чипе Apple M5 Max и 113 токенов в секунду на AMD Ryzen AI Max+ 395 — при потреблении менее 2,5 ГБ памяти. На смартфоне модель выдаёт порядка 30 токенов в секунду. Опробовать её на телефоне можно через мобильное приложение Liquid AI под названием Apollo.

На противоположном конце спектра развёртывания — серверные мощности: на одной видеокарте Nvidia H100 модель достигает почти 15 000 выходных токенов в секунду при устойчивой параллельной нагрузке, что эквивалентно примерно 1,3 миллиарда токенов в сутки на одну карту. Важная оговорка: все эти цифры — бенчмарки самого вендора и независимо не проверялись.

Для Лабонна объём памяти и скорость — не удобство, а жёсткое ограничение, определяющее, что вообще можно развернуть. «Мы хотим показать, что это действительно удачный компромисс: вы получаете качество уровня гораздо более крупных моделей, но в крошечном форм-факторе, — пояснил он. — Модель можно развернуть на целевых устройствах, куда другие решения просто физически не помещаются».

Модель учили не болтать, а работать с инструментами

По словам разработчиков, LFM2.5-2.6B создавалась из предположения, что языковые модели всё чаще используются через агентные фреймворки, а не через привычные диалоговые интерфейсы. «Модели больше не потребляются в чат-ботах. Их используют через агентные обвязки вроде OpenClaw или Hermes Agent, — объяснил Лабонн. — Мы хотели убедиться, что модель хороша не просто в математике или коде, а в умении пользоваться инструментами».

Предварительное обучение проводилось примерно на 34 триллионах токенов, при этом словарь удвоили до 128 тысяч токенов — в том числе для лучшей поддержки нелатинских письменностей, что потенциально выгодно и для кириллицы. Отдельный промежуточный этап обучения расширил контекстное окно до 128 тысяч токенов для длительных агентных сценариев.

Постобучение выстроено как четырёхступенчатый конвейер: сначала управляемый файнтюнинг, затем специализация учителей (отдельные экспертные модели для следования инструкциям, математики, кода и работы с инструментами), после — многодоменная дистилляция on-policy (MOPD), объединяющая способности экспертов в единую студенческую модель, и наконец агентное обучение с подкреплением.

На последнем этапе модель обучали прямо внутри промышленных агентных обвязок — включая Hermes Agent и OpenClaw — на реалистичных продуктивных задачах: исследования, программирование, управление документами, вызов инструментов и автоматизация процессов. Так она познакомилась с реальными инструментами, системными промптами и паттернами взаимодействия этих сред. Лабонн назвал результат перестройки конвейера «счастливой случайностью»: улучшения вышли далеко за рамки агентных целей. «Благодаря новым техникам обучения мы стали лучше во всём. Лучше в математике, лучше в следовании инструкциям. В коде мы, честно говоря, никогда не были сильны — а тут стали действительно хороши даже в нём», — рассказал он.

Зачем Liquid AI создала собственный агентный каркас

Примечательно, что компания не ограничилась существующими фреймворками и построила собственную агентную обвязку, продемонстрировав работу модели внутри неё прямо на телефоне — с планированием и вызовом инструментов полностью на устройстве. «Это обвязка, работающая на смартфоне, и я не знаю, есть ли ещё хоть одна такая», — заметил Лабонн.

Причин было две. Первая — необходимость: нативной обвязки для телефонов попросту не существовало. Вторая — иная модель взаимодействия: сегодняшние агенты ждут промпта, а Liquid AI хочет ассистентов, которые действуют сами. «Нам нужны проактивные агенты. Агенты, которые работают в фоне, следят за тем, что вы делаете, проверяют ваш календарь и на основе этого контекста выполняют задачи. Сегодня такого, по сути, не существует», — пояснил он.

Совместное проектирование обвязки и модели позволяет программной части компенсировать слабые места модели. «Всё, в чём модель плоха, обвязка должна ей помогать — оказывать максимум поддержки, чтобы результат был надёжнее, — сказал Лабонн. — Конечным пользователям всё равно, модель это или обвязка. Им важно, чтобы задача в итоге была выполнена». При этом модель из коробки работает и с устоявшимися обвязками — Hermes Agent, OpenClaw и Pi — за любым OpenAI-совместимым эндпоинтом.

Одна модель — много ассистентов: логика для бизнеса

Для корпоративного развёртывания, по мнению Лабонна, релиз меняет представление о том, для чего вообще можно использовать малые модели. До сих пор локальные модели были экономически оправданы в основном как узко заточенные специалисты — обученные делать одну вещь с качеством облачной модели, но быстрее и дешевле. Агентные способности меняют этот расчёт: одну и ту же модель можно перепрофилировать, меняя инструменты вокруг неё, а не саму модель.

«У вас может быть календарный ассистент, а затем вы берёте ту же модель и делаете ассистента для встреч, который записывает всё сказанное и готовит саммари — примерно как Granola, — привёл пример Лабонн. — Модель вы не меняете — меняется только обвязка, только инструменты вокруг. Это даёт куда большую универсальность, и это проще и дешевле в реализации».

При этом файнтюнинг он по-прежнему рекомендует для задач, где нужна максимальная точность на узком домене. Но даже для компаний без строгих требований к приватности привлекательность очевидна: производительные, специализированные агенты, работающие по цене потребляемой электроэнергии, — сам по себе весомый аргумент в пользу новой модели.

Лицензионные нюансы и перспективы для российского рынка

Как и в случае с недавней фронтирной моделью Kimi K3 от Moonshot, у LFM2.5-2.6B используется собственная кастомная лицензия на открытые веса, а не стандартная Apache 2.0 или MIT. Юридическим командам предприятий стоит внимательно изучить её условия перед коммерческим внедрением — это стандартная практика для подобных релизов, где «открытость» часто идёт с оговорками.

Для российского рынка подобные разработки выглядят особенно актуально. Требования закона о персональных данных (152-ФЗ) и общий курс на технологический суверенитет давно заставляют отечественные компании искать решения, которые не отправляют информацию во внешние облака. Модель, способная работать на обычном офисном сервере или даже на одноплатном компьютере, вписывается в эту логику идеально: банки, медицина, госсектор и промышленность получают возможность строить ИИ-агентов внутри собственного контура без риска утечек.

Отдельный интерес представляет применение в условиях ограниченной связи — от беспилотного транспорта до промышленной робототехники, где российские разработчики также активно ищут автономные решения. Возможность запуска агента на недорогом одноплатнике вместо серверной видеокарты заметно снижает порог входа для пилотных проектов. Остаётся лишь проверить качество работы модели с русским языком на практике — расширенный словарь с поддержкой нелатинских письменностей даёт на это осмотрительный оптимизм.

Источник: VentureBeat