Google анонсировала новую модель Gemini Omni, которая способна создавать любые медиа-контент из любого ввода
Содержание
- 📋 Обзор
- Что такое Gemini Omni
- Применение Gemini Omni в предприятиях
- Распространение, ценообразование и вопрос API
- Дело использования в предприятиях
- Правительство и безопасность
Компания Google представила новую модель искусственного интеллекта под названием Gemini Omni, которая позволяет создавать любые медиа-контент из любого ввода. Эта модель является первым шагом в разработке нативно многомодальной модели, способной создавать контент из текста, изображений, аудио и видео.
Что такое Gemini Omni
Модель Gemini Omni является следующим шагом в развитии искусственного интеллекта, после модели Nano Banana, представленной год назад. Gemini Omni Flash - это первый вариант модели, который принимает любую комбинацию текста, изображений, аудио и видео в качестве входных данных и производит высококачественный контент в тех же модальностях.
Google заявляет, что модель является нативно многомодальной с самого начала, что важно не только как маркетинговый слоган, но и как архитектурное заявление. Единая модель может рассуждать между модальностями в одном прямом проходе, что обычно переводится в более связные редактирования, меньше артефактов конвейера и более чистую поверхность API для разработчиков.
Применение Gemini Omni в предприятиях
Для бизнес-лидеров главный вопрос заключается в том, стоит ли переключиться на модель Gemini Omni. К сожалению, модель доступна только для индивидуальных пользователей через планы подписки Google, начиная с плана «AI Plus» за 20 долларов в месяц на пользователя. Модель может быть доступна через веб-сайт Gemini, мобильные приложения, веб-ориентированный инструмент Flow и YouTube Shorts.
Хотя компания заявляет, что модель в конечном итоге будет доступна через интерфейс программирования приложений (API), она еще не готова. В отличие от этого, Google не выпустил никаких публичных бенчмарков для Gemini Omni (пока что). Однако третьи стороны, безусловно, проверят ее на различных задачах и метриках качества, сообщаемых пользователями.
Распространение, ценообразование и вопрос API
Первое, что лидеры предприятий должны тщательно прочитать, - это план распространения. Omni Flash выходит сегодня внутри приложения Gemini для подписчиков в США по тарифным планам AI Plus, AI Pro и AI Ultra - включая новый тарифный план AI Ultra за 100 долларов в месяц, который Google анонсировала на том же мероприятии.
Google заявляет, что она выпустит модель для разработчиков через API Vertex AI «в ближайшие недели». Этот разрыв значим. До тех пор, пока API Vertex не станет общедоступным, Omni по сути является инструментом для потребителей и профи.
Дело использования в предприятиях
Для лидеров предприятий главное - прочитать план распространения внимательно. Omni Flash выходит сегодня внутри приложения Gemini для подписчиков в США по тарифным планам AI Plus, AI Pro и AI Ultra. Google говорит, что она выпустит модель для разработчиков через API Vertex AI «в ближайшие недели».
Планы по выпуску модели через API будут определять ее жизнеспособность как продукта для предприятий вне производства фильмов, телевидения и развлечений.
Правительство и безопасность
Для директоров по информационным технологиям и директоров по информационной безопасности наиболее важной частью анонса Google является не карта модели, а работа по происхождению и безопасности контента, выпускаемая вместе с ним.
Каждое видео, сгенерированное Omni, несет цифровой водяной знак SynthID от Google. Google расширяет учетные данные контента C2PA через свои инструменты генерации, и запускает API обнаружения контента AI на платформе Agent, который позволяет предприятиям определять контент, сгенерированный с помощью ИИ, как из Google, так и из других популярных моделей.
Источник: VentureBeat