☝🏻Google представила Gemini Omni — семейство ИИ-моделей, способных генерировать всё: текст, код, изображения, видео и да
Анонс прозвучал сегодня на Google I/O 2026 из уст CEO Google DeepMind Демиса Хассабиса.
По его словам, Gemini Omni — это следующий большой шаг на пути к AGI, модель нового поколения, которая может создавать любой контент из любого входного сигнала.
☝🏻Главное отличие от всех существующих решений — это единая мультимодальная архитектура.
Раньше Google использовала отдельные модели для разных задач: Veo 3.1 для видео, Nano Banana для изображений, Gemini для текста.
Теперь всё объединено в одну систему, которая нативно обрабатывает и генерирует текст, картинки, видео и аудио без склейки нескольких моделей между собой.
Модель например умеет редактировать видео прямо в чате на естественном языке — можно взять обычное видео со смартфона и добавить к нему спецэффекты, сменить стиль, заменить объекты или убрать водяной знак простым текстовым запросом.
Без таймлайнов и видеоредакторов.
Omni также способна создавать образовательные подкасты по фотографиям или превращать черновые наброски в полноценные иллюстрации.🎬
Отдельно отмечается понимание физики — модель корректно симулирует гравитацию, взаимодействие материалов и поведение персонажей, что делает сгенерированные сцены значительно реалистичнее конкурентов.
Также унаследованное от Gemini длинное контекстное окно позволяет сохранять консистентность персонажей, одежды и реквизита между кадрами — слабое место большинства существующих видеомоделей.
Первая модель семейства — Gemini Omni Flash — доступна уже сегодня всем пользователям.
В будущем ожидается выход более мощной версии Omni Pro для тяжёлых продакшн-задач.🤖