Сегодня 07 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google выпустила EmbeddingGemma 2 — открытую модель для поиска по текстам, коду, изображениям, аудио и видео прямо на смартфоне

Google представила лёгкую и быструю открытую модель искусственного интеллекта EmbeddingGemma 2 — открытую модель для поиска по текстам, коду, изображениям, аудио и видео прямо на устройстве. На практике она позволяет искать в коллекции медиафайлов объекты или события по их текстовому описанию без отправки каких-либо данных в облако.

 Источник изображения: blog.google

Источник изображения: blog.google

Модель превращает разные виды данных в единый формат — числовые векторы из 768 значений, отражающие содержание. В результате текстовый запрос можно соотнести с изображением или звуком, даже если у файла нет подходящего названия и описания. То есть вместо совпадения слов система сопоставляет близость содержимого по смыслу.

Главное отличие EmbeddingGemma 2 от первой версии — выход за пределы текста. Новая модель обрабатывает изображения и звук напрямую: собирать комбайн из распознавания речи, генерации подписей к картинкам и отдельной модели для текстового поиска больше не требуется. А для видео можно проиндексировать кадры вместе с фрагментами аудио и находить конкретные моменты.

Модель EmbeddingGemma 2 построена на архитектуре открытой Gemma 4 и распространяется по допускающей коммерческое использование модели Apache 2.0. При размере 740 млн параметров она с лёгкостью запускается локально на современных потребительских устройствах.

В профильных тестах MTEB (Massive Text Embedding Benchmark) для кода и MAEB (Massive Audio Embedding Benchmark), утверждает разработчик, она продемонстрировала лучшие результаты для моделей размером до 1 млрд параметров. EmbeddingGemma 2 не уступает, а то и превосходит гораздо более крупные модели в задачах работы с текстом, изображениями и звуком.

Одной из отличительных особенностей модели является её модульная архитектура: для задач, связанных только с текстом, ей требуются всего 270 млн параметров; для мультимодальных функций и обработки изображений потребуется подключить кодировщики размером ещё 170 млн параметров; для аудио — ещё 300 млн параметров. За счёт технологии Matryoshka Representation Learning (MRL) разработчики могут динамически сокращать размерность выходных векторов с 768 до 512, 256 или 128 элементов — можно на величину до шести раз сократить занимаемый векторными базами данных объём памяти.

EmbeddingGemma 2 эффективно работает даже в условиях жёстких ограничений ресурсов. В тестах на Pixel 11 Pro квантование помогло модели занять всего 191 Мбайт оперативной памяти для весов, отвечающих только за текст; в мультимодальном варианте — около 567 Мбайт. По сравнению с моделью первого поколения новая сохранила высокую эффективность в работе с многоязычным текстом; в бенчмарке MTEB Code она повысила результат с 68,76 до 78,68 балла. Это значит, что она хорошо подходит для задач индексирования кодовой базы и задач поиска информации для пишущих код ИИ-агентов. Локальная работа на устройствах обеспечивает пользователям конфиденциальность данных.

В сочетании со «старшей» Gemma 4 служебная EmbeddingGemma 2 позволяет реализовать на устройстве конвейеры RAG (Retrieval-Augmented Generation) — учитывая, что у обеих моделей один токенизатор и аудиокодировщик, они могут работать в единой среде с меньшим суммарным потреблением памяти. Веса моделей доступны на платформах Hugging Face и Kaggle; вскоре они появятся на Gemini Enterprise Agent Platform. EmbeddingGemma 2 запускается и встраивается при помощи стандартных средств, включая transformers, llama.cpp, Ollama, LM Studio и другие.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Сценарист Resident Evil Requiem проговорился о сюжете масштабного дополнения к игре 3 ч.
Googlebook проиграл хромбукам по совместимости — поддержка PWA и Linux-приложений урезана, но Google обещает всё исправить 3 ч.
Google тихо обновила Nano Banana — новая версия 2.1 лучше работает с текстом, персонажами и панорамами 3 ч.
Баги The Witcher 3: Wild Hunt — Remastered напомнили игрокам об ужасах Assassin's Creed Unity 4 ч.
ИИ удвоил число отчётов об уязвимостях в ПО и инфраструктуре — но реальных находок стало лишь на 48 % больше 5 ч.
Google выпустила EmbeddingGemma 2 — открытую модель для поиска по текстам, коду, изображениям, аудио и видео прямо на смартфоне 7 ч.
Журналист рассекретил эксклюзивную сделку Xbox с разработчиками GTA VI, но Microsoft всё отрицает 7 ч.
Банк Англии призвал не ждать скорой экономической выгоды от ИИ 8 ч.
ESU на носу: второй год расширенной поддержки Windows 10 обойдётся предприятиям в два раза дороже 15 ч.
«В Найт-Сити не бывает счастливых концов»: новый тизер Cyberpunk: Edgerunners 2 приготовил фанатов к эмоциональной травме 17 ч.
Innodisk выпустила индустриальные модули DDR5-8000 RDIMM 41 мин.
DayOne в ходе подготовки к IPO объявила о планаха более чем вдвое нарастить мощности своих ЦОД к 2028 году 2 ч.
ByteDance заняла пятую часть мощностей дата-центров в КНР, большая их часть арендована у сторонних операторов ЦОД 2 ч.
SpaceX получила добро на 15 000 спутников Starlink Mobile — они обеспечат смартфонам 5G-связь со скоростью до 150 Мбит/с 3 ч.
Google запаслась ещё не произведённой атомной энергией для своих дата-центров 4 ч.
Китайский робот освоил вышивку шёлком — для этого ему пришлось научиться разделять нить на 16 волокон 5 ч.
Производители HDD делят головки: Toshiba пыталась купить производство магнитных головок у TDK, но Seagate предложила больше 5 ч.
Apple объединилась с LG для создания умного дверного звонка, домофона и термостата 6 ч.
Everspin расширила память x86-сервера с помощью MRAM PERSYST и CXL 7 ч.
Xbox вернулся к росту после «исторического минимума» — Аша Шарма раскрыла планы на Helix и не только 7 ч.