Google випустила EmbeddingGemma 2 — відкриту мультимодальну модель на 740 мільйонів параметрів, яка перетворює текст, код, зображення, аудіо та відео в єдиний векторний простір і працює повністю локально на смартфоні або невеликій платі. Модель розповсюджується під ліцензією Apache 2.0, тобто її можна вільно використовувати, змінювати та вбудовувати в комерційні продукти без окремих домовленостей із Google.
Ключова особливість EmbeddingGemma 2 — мультимодальність. Замість окремих моделей для тексту, зображень чи аудіо вона будує єдине векторне подання для всіх цих типів даних. Це означає, що пошук за зображенням, відео чи фрагментом коду відбувається в одному просторі, а не через набір розрізнених інструментів. Для розробників це спрощує архітектуру застосунків: достатньо однієї моделі замість кількох пайплайнів.
За даними Google, модель потребує лише близько 191 МБ оперативної пам'яті, що дозволяє запускати її на пристроях без потужних GPU. У парі з невеликою відкритою моделлю на кшталт Gemma 4 вона здатна забезпечити роботу RAG-застосунків (retrieval-augmented generation) повністю офлайн, без надсилання даних на зовнішні сервери. Це критично для продуктів, де важлива приватність або де немає стабільного інтернету.
Google також заявляє, що EmbeddingGemma 2 перевершує деякі конкуруючі моделі вдвічі більшого розміру. Втім, компанія прямо визнає: продуктивність неоднакова для всіх 100 мов, які підтримує модель. Це важливе застереження для українських команд, які працюють із локальним контентом — якість векторів для української може відрізнятися від англійської, тож перед впровадженням варто протестувати модель на власних даних.
Ще один нюанс — відсутність safety tuning. Google не проводила додаткового налаштування безпеки, тому модель може генерувати небажані результати на чутливих запитах. Для продуктових команд це означає, що фільтрацію доведеться будувати самостійно, якщо застосунок працює з користувацьким контентом.
Для українського ринку вихід EmbeddingGemma 2 відкриває кілька практичних сценаріїв. По-перше, локальний семантичний пошук у застосунках — від каталогів товарів до баз знань — без залежності від хмарних API. По-друге, офлайн-RAG для польових працівників, медичних або освітніх продуктів, де дані не повинні залишати пристрій. По-третє, здешевлення інференсу: замість оплати за кожен запит до зовнішнього сервісу команда платить лише за розробку та підтримку.
Водночас варто враховувати обмеження. 740 мільйонів параметрів — це компроміс між якістю та розміром: для складних задач, як-от аналіз довгих документів чи високоточний пошук у великих корпусах, більші хмарні моделі можуть давати кращий результат. Але для більшості продуктових сценаріїв, де важливі швидкість, приватність і відсутність залежності від мережі, EmbeddingGemma 2 — робочий інструмент, який можна тестувати вже зараз.
Практичний висновок для українських команд: якщо у продукті є пошук, рекомендації або робота з мультимедіа, варто провести бенчмарк EmbeddingGemma 2 на власних даних — особливо на україномовних текстах — і порівняти з поточним рішенням за точністю, швидкістю та вартістю інференсу. Модель під Apache 2.0 не вимагає юридичних узгоджень, тож поріг входу мінімальний.
3




