Google запустил мультиязычную модель Gemini Embedding: поддержка русского и 250 задач

Google представил новую модель обработки текста — Gemini Embedding. С 14 июля 2025 года она доступна разработчикам по всему миру и предлагает высокоточные встраивания текста на более чем 100 языках, включая русский, через платформы API Gemini и Vertex AI.
Google запустил мультиязычную модель Gemini Embedding: поддержка русского и 250 задач

Корпорация Google официально представила модель  Gemini Embedding (gemini-embedding-001), разработанную для генерации высокоточных текстовых встраиваний. С 14 июля 2025 года она доступна для использования через API Gemini и облачную платформу Vertex AI. Новинка уже продемонстрировала лидирующие позиции на международных тестах и обещает улучшить работу с текстом в таких сферах, как поиск, классификация и анализ больших массивов данных.

Что такое Gemini Embedding

Новая модель предназначена для создания встраиваний — числовых представлений текста, которые сохраняют его смысл и контекст. Эти встраивания позволяют эффективно сравнивать тексты, искать схожие фрагменты и структурировать данные даже при наличии языковых различий.

Gemini Embedding поддерживает более 100 языков, включая русский, и способна обрабатывать тексты длиной до 2048 токенов, что превосходит возможности предыдущих решений от Google.

Особенности модели

Ключевая инновация Gemini Embedding — использование метода Matryoshka Representation Learning, который позволяет масштабировать размер выходных данных в зависимости от задачи. Разработчик может выбрать один из вариантов: 3072, 1536 или 768 измерений. Это особенно важно при работе с ограниченными ресурсами или при необходимости ускорить обработку.

Модель продемонстрировала лучшие результаты на бенчмарке MTEB Multilingual, обогнав существующие аналоги в задачах поиска, кластеризации и тематической классификации на более чем 250 языках.

gemini-embedding-001 занимает первое место в многоязычном рейтинге Massive Test Embedding Benchmark (MTEB), что свидетельствует о превосходном качестве в различных областях и критических задачах.

gemini-embedding-001

«Поддержка широкого языкового диапазона делает Gemini Embedding одним из наиболее универсальных решений на рынке»,

— отметили в пресс-службе Google AI.

Как использовать и сколько стоит

Модель доступна через Google AI Studio — бесплатный веб-интерфейс для разработки и тестирования. Для коммерческого использования установлен тариф:
$0,15 за миллион токенов (примерно 12 рублей по текущему курсу).

Разработчики могут начать работу с модели, используя простой API-запрос на Python:

from google import genai
client = genai.Client()
result = client.models.embed_content(model="gemini-embedding-001", contents="Что такое смысл жизни?")
print(result.embeddings)

Более подробную информацию о тарифах и ограничениях можно найти на официальной странице документации .

Что будет с предыдущими моделями

С выпуском Gemini Embedding Google постепенно прекращает поддержку старых моделей:

  • embedding-001 будет отключена с 14 августа 2025 года;

  • text-embedding-004 — с 14 января 2026 года;

  • экспериментальная версия gemini-embedding-exp-03-07 также исчезнет из доступа после 14 августа 2025 года.

Компания анонсировала скорое появление пакетного API, что существенно упростит работу с большими объёмами текстов и повысит производительность в реальных проектах.

Перспективы и значение для разработчиков

Поддержка русского языка и высокая точность встраиваний открывают широкие возможности для российских специалистов. Gemini Embedding можно использовать в создании интеллектуальных поисковых систем, чат-ботов, рекомендательных алгоритмов, систем анализа юридических или медицинских текстов, а также в научной сфере.

«Для мультиязычных задач, где важна точность и масштабируемость, Gemini Embedding становится технологией выбора», — говорится в техническом отчёте проекта.

С полным описанием модели и результатами тестирования можно ознакомиться на arXiv.org .

20:30
902
Нет комментариев. Ваш будет первым!