фото с Зеркало недели
Компания Google выпустила EmbeddingGemma 2 — мультимодальную модель для создания эмбедингов, оптимизированную для работы непосредственно на устройствах. Она может преобразовывать текст, изображения, аудио и видео в представления в едином пространстве и использовать их для поиска. Модель имеет 740 миллионов параметров и поддерживает контекст до 8 тысяч токенов.
EmbeddingGemma 2 была создана в Google DeepMind как продолжение EmbeddingGemma — модели для создания текстовых эмбедингов. Эмбединги — это числовые представления данных, которые позволяют системам искусственного интеллекта находить семантические связи между текстами, изображениями, аудио и другой информацией.
Новая модель построена на архитектуре Gemma 4 и распространяется по лицензии Apache 2.0, которая разрешает коммерческое использование. Она имеет 740 миллионов параметров, благодаря чему рассчитана на запуск непосредственно на устройствах с ограниченными ресурсами. Для работы только с текстом достаточно 270 миллионов параметров, а для полной мультимодальной версии можно дополнительно использовать кодировщик изображений на 170 миллионов параметров и аудиокодировщик на 300 миллионов.
ИИ перепутал симуляцию с реальностью: Gemini впервые взломала реальные компании
По данным Google, EmbeddingGemma 2 демонстрирует лучшие результаты среди мультимодальных моделей для создания эмбедингов с менее чем одним миллиардом параметров. В частности, она показала высокие результаты в тестах MTEB для текста и MAEB для аудио, а в отдельных задачах не уступает или превосходит более крупные модели.
[pics_lr left="/img/forall/u/680/68/Massive_Text_Embedding_Benchmark. width-1000. format-webp. webp" ltitle="" right="/img/forall/u/680/68/Massive_Audio_Embedding_Benchmar. width-1000. format-webp. webp" rtitle=""]
Особенности EmbeddingGemma 2
Контекстное окно EmbeddingGemma 2 составляет 8 тысяч токенов — в четыре раза больше, чем в предыдущей версии. Это позволяет обрабатывать до 5,5 минут аудио, 29 изображений, 58 кадров видео или их комбинации непосредственно на локальном оборудовании.
В Google также заявили об улучшении работы с кодом. Показатель MTEB Code вырос с 68,76 в EmbeddingGemma до 78,68 в новой версии, что делает модель пригодной для локального индексирования кодовых баз, семантического поиска и получения данных для программных агентов.
В задачах с изображениями, видео, документами и аудио EmbeddingGemma 2, по утверждению Google, устанавливает новый показатель качества на единицу параметра среди моделей с менее чем одним миллиардом параметров. Компания также отмечает, что модель превосходит некоторые специализированные решения, имеющие вдвое больше параметров.
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking
Запуск непосредственно на устройстве должен обеспечить конфиденциальность данных и сократить задержку при обработке. Кроме того, разработчики могут создавать системы кросс-модального поиска, которые будут работать автономно без передачи информации на удаленные серверы.
EmbeddingGemma 2 можно использовать вместе с генеративными моделями, в частности Gemma 4, для создания локальных систем RAG — поисково-дополненной генерации. Такие системы сначала находят нужную информацию в локальных данных, а затем передают её генеративной модели для формирования ответа. Поскольку EmbeddingGemma 2 и Gemma 4 используют одинаковый текстовый токенизатор и аудиокодер, Google заявляет, что их можно запускать в одном конвейере, сокращая общий объем необходимой памяти.
На что способна новая модель EmbeddingGemma 2 может, например, находить определённый фрагмент видео по голосовой заметке или искать нужные записи среди часов аудио по текстовому запросу. Для этого все типы данных преобразуются в единое пространство эмбедингов, поэтому поиск может осуществляться между различными форматами.
Google научила Gemini “просматривать“ видео выборочно: анализ стал на 66% дешевле
Среди практических сценариев Google называет поиск в медиатеке по тексту или изображению, поиск конкретных моментов в видео по текстовым и аудиозапросам, а также работу с локальными файлами в сочетании с генеративными моделями. Эти возможности можно опробовать в инструментах Instant Media Search и Video Moments Finder в Google AI Edge Gallery и в приложении Google AI Edge Foresight.
EmbeddingGemma 2 также можно использовать для систем принятия решений в реальном времени. С помощью API MediaPipe Decision Task разработчики могут создавать решения для классификации, маршрутизации и прогнозирования на основе мультимодального контекста.
Веса модели уже доступны на Hugging Face и Kaggle, а впоследствии должны появиться в Model Garden на платформе Gemini Enterprise Agent Platform. Для развертывания Google предлагает AI Edge MediaPipe и LiteRT.
Ранее Google представила модель ИИ Gemini 4 Argon, разработанную для выполнения длительных и сложных многоэтапных задач в сфере программирования, аналитики и кибербезопасности. Ключевым техническим изменением стало увеличение лимита выходных данных до 1 миллиона токенов, что позволяет системе проводить масштабные миграции кодовых баз, оптимизировать вычислительные ресурсы и генерировать сотни тысяч токенов рассуждений за одну сессию.