Новости

Meta вернулась в открытую гонку: Muse Glimmer — мультимодальная модель для локальных ИИ-агентов

Meta представила Muse Glimmer — открытую модель на 30 млрд параметров со зрением, поддержкой видео и упором на агентные сценарии. Разбираем архитектуру, бенчмарки и способы локального запуска.

Meta представила Muse Glimmer — открытую модель на 30 млрд параметров со зрением, поддержкой видео и упором на агентные сценарии. Разбираем архитектуру, бенчмарки и способы локального запуска.

Содержание

Meta снова напомнила, почему её когда-то называли главным двигателем открытого ИИ. Компания выпустила Muse Glimmer — мультимодальную модель с 30 миллиардами параметров, дистиллированную из флагманской Muse и распространяемую под лицензией Apache 2.0. Модель спроектирована специально для локальных агентных сценариев: программирования, анализа документов, персональных ассистентов и связок в духе Claw или Hermes — там, где данные важно держать на собственном железе, а не отправлять в чужое облако.

Что представляет собой Muse Glimmer

Muse Glimmer — это плотная (dense) модель на 30 млрд параметров, полученная дистилляцией из более крупной Muse. Внутри два компонента: текстовый декодер на 28 млрд параметров и зрительный энкодер на 2 млрд, построенный по архитектуре Perception Encoder. Дополнительно поставляется модуль спекулятивного декодирования на базе DFlash — его использование опционально, но он заметно ускоряет генерацию ценой дополнительной памяти. По наблюдениям разработчиков, драфтер особенно хорошо подходит для структурированного контента вроде кода.

Позиционирование у модели чёткое: приватность, снижение затрат и свобода экспериментов. Meta прямо указывает на сценарии вроде кодинга, разбора документов и персональных ассистентов, где отправка данных в сторонний API нежелательна или вовсе недопустима. Лицензия Apache 2.0 снимает ограничения на коммерческое использование — модель можно встраивать в продукты без отчислений и юридических лабиринтов.

К релизу команда Hugging Face подготовила поддержку нулевого дня: Muse Glimmer уже работает в transformers, llama.cpp, vLLM и Inference Endpoints. Веса доступны на Hugging Face Hub, так что порог входа минимальный — достаточно обновить библиотеки и скачать модель.

Бенчмарки: где Glimmer лидирует, а где уступает

Meta сравнивает Muse Glimmer-30B в режиме высокого рассуждения с двумя конкурентами того же класса: Gemma4-31B и Qwen3.6-27B, обе в режиме Thinking. Картина получается неоднозначной, и это честнее, чем обычные маркетинговые таблицы.

В агентных задачах Glimmer выглядит уверенно. На MCP Atlas модель набирает 75,5 против 54,2 у Gemma и 62,5 у Qwen. В DeepSearch QA — 74,6 против 61,7 и 71,1 соответственно. Заметное преимущество и в WildClawBench (47,6), GAIA2 (43,3) и τ³-Banking (23,5). В агентном программировании Glimmer берёт SWE-Bench Pro с результатом 51,2 (у конкурентов 36,9 и 50,2) и SciCode с 43,6. Математика тоже сильная сторона: AIME 2026 — 94,7, лучший результат среди троих.

Однако есть и поражения. Qwen3.6-27B обходит новинку на SWE-Bench Verified (77,2 против 76,0), TerminalBench 2.1 (60,7 против 51,7) и OSWorld-Verified (75,6 против 65,9) — то есть в задачах работы с терминалом и управления реальной операционной системой. В мультимодальных тестах разрыв минимален: ScreenSpot Pro и OmniDocBench v1.5 достаются Qwen с небольшим отрывом, а Charxiv Reasoning — Glimmer с 78,8.

Отдельно интересен блок безопасности. В тесте Siren AgentDojo на устойчивость к атакам доля успешных взломов Glimmer составила 28,4% при полезности 94,2% — лучший баланс среди сравниваемых моделей: Qwen поддаётся в 40,3% случаев, хотя и показывает чуть меньшую полезность. Для агентов, которым предстоит исполнять действия в реальных системах, этот показатель важнее академических баллов.

Архитектура: гибридное внимание и экономный KV-кэш

Текстовый декодер построен на гибридной схеме внимания. Три слоя со скользящим окном в 2048 токенов и ротационными позиционными эмбеддингами (RoPE) чередуются с четвёртым слоем полного внимания без позиционных эмбеддингов (NoPE). Паттерн (SWA, SWA, SWA, Full) повторяется 13 раз — итого 52 слоя. Идея в том, что RoPE сохраняет информацию об относительном порядке и расстоянии между токенами, а слои NoPE удерживают глобальный контекст всей последовательности.

Второй важный элемент — Gated Grouped-Query Attention: каждая key-value голова обслуживает сразу 16 голов запросов. Это сокращает объём KV-кэша в 16 раз, что напрямую переводится в более быструю и дешёвую генерацию — критичный параметр для локального развёртывания, где память всегда в дефиците.

Третья деталь — нормализация Q-K с дополнительным масштабированием запросов. Перед вычислением внимания к каждой голове запросов и ключей применяется RMS-нормализация, стабилизирующая логиты внимания, после чего запросы умножаются на масштабный коэффициент. По сути, это работает как обратная температура на уровне softmax, позволяя точно задавать целевой масштаб логитов.

Perception Encoder: одно зрение для изображений и видео

В отличие от большинства VLM, где зрительный энкодер — небольшая пристройка к языковой модели, здесь используется полноценная ViT-подобная сеть на 2 млрд параметров по архитектуре Perception Encoder, которую Meta ранее представила как основу для пространственных и мультимодальных задач. Энкодер разбивает изображения на патчи формы 2 кадра × 3 канала × 14 × 14, проецирует их линейным слоем и добавляет интерполированные абсолютные позиционные эмбеддинги из обученной таблицы.

Зрительная башня состоит из 50 слоёв с GELU-активациями в MLP. Схема внимания повторяет языковую модель: три оконных слоя, затем один слой полного внимания, а внутри — двумерный RoPE для запросов и ключей. После трансформера pixel shuffle объединяет соседние пространственные токены в группы 2×2, сокращая их число в четыре раза без потери каналов. Объединённые признаки проецируются в общее эмбеддинговое пространство текстового декодера.

Видео проходит через тот же энкодер покадрово: процессор берёт 2 кадра в секунду и ограничивает клип 96 равномерно распределёнными кадрами. В промпт подставляются метки времени вида «Time: 0.0s <|video|> x N», на место которых перед финальным слоем проекции встают видеоэмбеддинги. Так модель понимает не только содержимое кадров, но и их положение на временной шкале — что позволяет отвечать на сложные вопросы по видео без звуковой дорожки.

Локальный запуск: от transformers до llama.cpp

Для работы через transformers достаточно обновить библиотеки:

pip install --upgrade transformers accelerate

Модель и процессор загружаются через классы AutoModelForMultimodalLM и AutoProcessor:

from transformers import AutoProcessor, AutoModelForMultimodalLM MODEL_ID = "meta-models/Muse-Glimmer-30B" processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto"
)

Один и тот же фрагмент кода без изменений работает на GPU NVIDIA (CUDA), AMD (ROCm) и Intel (XPU): параметр device_map="auto" сам размещает модель на доступном ускорителе. Для текстовых запросов используется apply_chat_template с параметром reasoning_strength, который управляет глубиной рассуждений — например, значение "low" экономит токены на простых задачах. Для работы с изображениями понадобится torchvision, для видео рекомендуется установить torchcodec — после этого модель принимает на вход картинки по URL и видеофайлы, отвечая на вопросы по их содержимому в едином диалоговом формате.

Что релиз меняет для разработчиков

Главное следствие релиза — локальные агенты перестают быть уделом облачных API. Модель такого класса с 16-кратным сжатием KV-кэша реально развернуть на одной производительной карте уровня RTX 4090 или 5090 с квантованием, а в полной точности — на серверном ускорителе. Для компаний, обязанных хранить персональные данные внутри контура (в России это требование 152-ФЗ), открытая модель с агентными навыками и лицензией Apache 2.0 — практически готовый фундамент для корпоративных ассистентов, разбора документов и автоматизации рутины.

Интересно и конкурентное раскладывание. Последние пару лет нишу открытых моделей для локального запуска активно занимал Qwen — и, судя по бенчмаркам, уходить оттуда не собирается: в терминальных и «операционных» задачах китайская модель по-прежнему сильнее. Зато Glimmer выигрывает в агентных сценариях с инструментами, поиске и устойчивости к атакам. Для разработчиков это идеальная ситуация: две сильные открытые экосистемы давят друг друга, а пользователи получают лучшие модели каждые несколько месяцев.

Символически релиз важен ещё и тем, что Meta возвращается к стратегии, сделавшей её знаменитой во времена Llama: открывать веса, давать сообществу инструменты и позволять экосистеме доделывать остальное. Если темп дистилляции флагманов в компактные локальные версии сохранится, разрыв между облачными и персональными ИИ-агентами продолжит сокращаться — и это, пожалуй, главная новость дня.

Источник: HF