Pular para o conteúdo
Zenteck
Últimas
Ferramentas de IA

EmbeddingGemma 2: o que muda nos modelos locais de IA

2 min de leitura0 comentários
embeddinggemma-2-o-que-muda-nos-modelos-locais-de-ia

O Google lançou o EmbeddingGemma 2, um modelo leve e aberto projetado para converter texto, código, imagens, vídeo e áudio em vetores numéricos unificados diretamente no hardware local. Construído sobre a arquitetura Gemma 4, o modelo possui 740 milhões de parâmetros e opera dentro de restrições rígidas de recursos.

Como o EmbeddingGemma 2 roda em dispositivos locais?

Segundo o Google DeepMind, o modelo requer apenas cerca de 191MB de RAM ativa para tarefas exclusivas de texto e aproximadamente 567MB para o pacote multimodal completo quando quantizado e executado em um aparelho como o Google Pixel 11 Pro. Em navegadores via WebGPU, cada consulta leva de 20 a 70 milissegundos.

Além disso, o desenvolvedor Simon Willison destacou que a distribuição sob a licença Apache 2.0 elimina o risco de dependência de fornecedor. Modelos proprietários de embedding frequentemente obrigam equipes a pagar pelo reprocessamento completo de bases de dados caso um provedor descontinue uma API, um problema evitado com pesos abertos.

O que muda para bases vetoriais e RAG offline?

Com o uso do Matryoshka Representation Learning (MRL), os desenvolvedores podem truncar dinamicamente os vetores de saída de 768 dimensões para 512, 256 ou 128. Esse recurso proporciona uma redução de até 6 vezes no espaço de armazenamento necessário para bancos de dados vetoriais locais.

Para quem constrói aplicações de recuperação aumentada de informação (RAG) offline, combinar o EmbeddingGemma 2 com modelos compactos como o Gemma 4 viabiliza o processamento completo no dispositivo, mantendo dados confidenciais fora de servidores externos.

Fontes

  1. EmbeddingGemma 2: an open, lightweight multimodal embedding model — deepmind.google
  2. Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size — the-decoder.com
  3. EmbeddingGemma 2 — simonwillison.net

Perguntas frequentes

Qual é o consumo de memória do EmbeddingGemma 2?
O modelo consome cerca de 191MB de RAM para tarefas apenas de texto e aproximadamente 567MB para o modo multimodal completo em dispositivos otimizados.
Como o modelo reduz o espaço em bancos vetoriais?
Ele utiliza o Matryoshka Representation Learning (MRL) para truncar vetores de 768 dimensões até 128, cortando o uso de armazenamento em até 6 vezes.
O EmbeddingGemma 2 pode ser usado comercialmente?
Sim, ele é distribuído sob a licença permissiva Apache 2.0, permitindo que os pesos sejam baixados e executados localmente sem amarras a APIs de terceiros.