/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2F5f01f77bab471ca473dd36add9832974.jpg)
Текст, звук, фото та відео в єдиному просторі: Google презентувала відкриту модель ШІ
EmbeddingGemma 2 працює безпосередньо на пристроях і забезпечує локальний пошук.
Компанія Google випустила EmbeddingGemma 2 — мультимодальну модель для створення ембедингів, оптимізовану для роботи безпосередньо на пристроях. Вона може перетворювати текст, зображення, аудіо та відео на представлення в єдиному просторі й використовувати їх для пошуку. Модель має 740 мільйонів параметрів і підтримує контекст до 8 тисяч токенів.
EmbeddingGemma 2 створили в Google DeepMind як продовження EmbeddingGemma — моделі для створення текстових ембедингів. Ембединги — це числові представлення даних, які дозволяють системам штучного інтелекту знаходити семантичні зв’язки між текстами, зображеннями, аудіо та іншою інформацією.
Нова модель побудована на архітектурі Gemma 4 та поширюється за ліцензією Apache 2.0, яка дозволяє комерційне використання. Вона має 740 мільйонів параметрів, завдяки чому розрахована на запуск безпосередньо на пристроях з обмеженими ресурсами. Для роботи лише з текстом достатньо 270 мільйонів параметрів, а для повної мультимодальної версії можна додатково використовувати кодувальник зображень на 170 мільйонів параметрів та аудіокодувальник на 300 мільйонів.
За даними Google, EmbeddingGemma 2 демонструє провідні результати серед мультимодальних моделей для створення ембедингів із менш ніж одним мільярдом параметрів. Зокрема, вона показала високі результати в тестах MTEB для тексту та MAEB для аудіо, а в окремих завданнях не поступається більшим моделям або перевершує їх.
Особливості EmbeddingGemma 2
Контекстне вікно EmbeddingGemma 2 становить 8 тисяч токенів — у чотири рази більше, ніж у попередньої версії. Це дає змогу обробляти до 5,5 хвилини аудіо, 29 зображень, 58 кадрів відео або їхні комбінації безпосередньо на локальному обладнанні.
У Google також заявили про покращення роботи з кодом. Показник MTEB Code зріс із 68,76 в EmbeddingGemma до 78,68 в новій версії, що робить модель придатною для локального індексування кодових баз, семантичного пошуку та отримання даних для програмних агентів.
У завданнях із зображеннями, відео, документами та аудіо EmbeddingGemma 2, за твердженням Google, встановлює новий показник якості на одиницю параметра серед моделей із менш ніж одним мільярдом параметрів. Компанія також зазначає, що модель перевершує деякі спеціалізовані рішення, які мають удвічі більше параметрів.
Запуск безпосередньо на пристрої має забезпечити конфіденційність даних і зменшити затримку під час обробки. Крім того, розробники можуть створювати системи кросмодального пошуку, які працюватимуть автономно без передачі інформації на віддалені сервери.
EmbeddingGemma 2 можна використовувати разом із генеративними моделями, зокрема Gemma 4, для створення локальних систем RAG — пошуково-доповненої генерації. Такі системи спочатку знаходять потрібну інформацію в локальних даних, а потім передають її генеративній моделі для формування відповіді. Оскільки EmbeddingGemma 2 і Gemma 4 використовують однаковий текстовий токенізатор та аудіокодувальник, Google заявляє, що їх можна запускати в одному конвеєрі, зменшуючи загальний обсяг необхідної пам’яті.
Що вміє нова модель
EmbeddingGemma 2 може, наприклад, знаходити певний фрагмент відео за голосовою нотаткою або шукати потрібні записи серед годин аудіо за текстовим запитом. Для цього всі типи даних перетворюються в єдиний простір ембедингів, тому пошук може відбуватися між різними форматами.
Серед практичних сценаріїв Google називає пошук у медіатеці за текстом або зображенням, пошук конкретних моментів у відео за текстовими й аудіозапитами, а також роботу з локальними файлами в поєднанні з генеративними моделями. Ці можливості можна випробувати в інструментах Instant Media Search і Video Moments Finder у Google AI Edge Gallery та в застосунку Google AI Edge Foresight.
EmbeddingGemma 2 також можна використовувати для систем прийняття рішень у реальному часі. За допомогою API MediaPipe Decision Task розробники можуть створювати рішення для класифікації, маршрутизації та прогнозування на основі мультимодального контексту.
Ваги моделі вже доступні на Hugging Face та Kaggle, а згодом мають з’явитися в Model Garden на платформі Gemini Enterprise Agent Platform. Для розгортання Google пропонує AI Edge MediaPipe та LiteRT.