Gemma 4 12B chega sem encoder e roda em 16 GB de VRAM

Novo modelo do Google DeepMind dispensa encoders de visão e áudio, rodando em notebooks com apenas 16 GB de VRAM.

Gemma 4 12B é o primeiro modelo de médio porte da família a suportar áudio nativo e fine-tuning simplificado.
Destaques
  • O Gemma 4 12B substitui encoders por módulos de embedding leves, reduzindo o consumo de memória.
  • Com quantização Q4, o modelo ocupa cerca de 6,7 GB e cabe em 16 GB de VRAM unificada.
  • A arquitetura sem encoder permite fine-tuning multimodal em um único passe com LoRA.

O Google DeepMind lançou em 3 de junho o Gemma 4 12B, um novo modelo que expande a família Gemma 4 para cinco tamanhos. A grande novidade está na arquitetura: é o único modelo da linha que elimina completamente os encoders de visão e áudio, substituindo-os por módulos de embedding extremamente leves. Com isso, o Gemma 4 12B consegue processar texto, imagem, áudio e vídeo em sistemas com apenas 16 GB de VRAM ou memória unificada, rodando localmente em notebooks como MacBook Pro ou PCs com GeForce RTX 4060 ou superior. O modelo já está disponível sob licença Apache 2.0.

Por que o Gemma 4 12B abandonou os encoders

Modelos multimodais tradicionais dependem de encoders dedicados para converter imagens e áudio em representações que o LLM possa entender. O Gemma 4 12B quebrou esse paradigma. No lugar de um encoder de visão com aproximadamente 550 milhões de parâmetros, como usado nos outros modelos da família, ele emprega um módulo de embedding de apenas 35 milhões de parâmetros. O processo é direto: a imagem é dividida em patches de 48×48 pixels, e uma única multiplicação de matriz projeta cada patch diretamente no espaço de dimensões ocultas do LLM. As coordenadas espaciais são inseridas por vetores de posição treinados nos eixos X e Y. Não há camadas de atenção envolvidas.

Para áudio, a abordagem é ainda mais enxuta. O encoder de áudio foi removido por completo. O sinal bruto de 16 kHz é segmentado em janelas de 40 milissegundos (640 amostras) e cada segmento é mapeado por uma projeção linear para o mesmo espaço dimensional dos tokens de texto. Com isso, o áudio entra no LLM como se fosse texto, sem necessidade de um tradutor intermediário.

Essa escolha de design traz um benefício importante para fine-tuning. Como visão, áudio e texto compartilham os mesmos pesos, é possível atualizar todas as três modalidades em um único passe de treinamento com LoRA ou fine-tuning completo. Não é mais preciso ajustar o encoder congelado separadamente do LLM.

Desempenho: entre o 26B MoE e o E4B

O Gemma 4 12B promete performance próxima ao modelo 26B MoE (com arquitetura mixture-of-experts) usando menos da metade da memória. Em benchmarks como GPQA Diamond, MMLU Pro e AIME 2026, o modelo de 12B mostra resultados que rivalizam com o irmão maior, mas é importante notar um detalhe crítico: a Google ainda não publicou números oficiais para o 12B em sua model card (até 4 de junho). Os valores que circulam — MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 77,5% — vêm de testes de terceiros e precisam de confirmação oficial.

Gemma 4 Família – Comparação de Benchmarks
Benchmark31B26B A4B12BE4B
MMLU Pro85,2%82,6%77,2%69,4%
GPQA Diamond84,3%82,3%78,8%58,6%
AIME 202689,2%88,3%77,5%42,5%

Nota: Os dados de 31B, 26B A4B e E4B são oficiais da model card. Os dados do 12B são referências de terceiros, sem validação do Google até 4 de junho. Para contexto, o Gemma 3 27B anterior marcava 67,6% em MMLU Pro, 42,4% em GPQA Diamond e 20,8% em AIME 2026.

Ainda assim, a tendência é clara: o 12B se posiciona entre o E4B (voltado para edge) e o 26B MoE, oferecendo um ponto de equilíbrio entre capacidade e eficiência de memória.

Rodando em 16 GB de VRAM: o cenário real

Com quantização Q4, o modelo ocupa cerca de 6,7 GB. Somando o cache KV, o consumo total fica dentro do limite de 16 GB de memória unificada. A Google planeja explicitamente que o Gemma 4 12B rode em hardware como MacBook Pro com Apple Silicon ou notebooks equipados com NVIDIA GeForce RTX 4060 e superiores.

Pela primeira vez, o Google DeepMind disponibilizou um aplicativo desktop para macOS, chamado Google AI Edge Gallery, que executa o modelo completamente local, sem necessidade de conexão com a internet. O suporte a frameworks de inferência também chega no lançamento: llama.cpp, Ollama, LM Studio, MLX, vLLM e SGLang já funcionam com o modelo.

Para turbinar a velocidade de geração, o pacote inclui um modelo draft para Multi-Token Prediction (MTP). Um modelo pequeno prevê sequências de tokens futuros, e o modelo principal valida essas previsões em lote — técnica de decodificação especulativa que acelera a saída sem comprometer a qualidade.

Áudio nativo em um modelo de médio porte

Até agora, apenas os modelos edge da família Gemma (E2B e E4B) suportavam entrada de áudio nativa. O 12B é o primeiro modelo de médio porte a oferecer esse recurso. Ele é capaz de reconhecimento automático de fala, diarização de falantes e tradução de áudio. O modelo processa clipes de áudio de até 30 segundos e vídeos de até 60 segundos (em 1 FPS). Um exemplo mostrado no blog oficial analisou 313 quadros e o áudio simultâneo de um clipe de 5 minutos da keynote do Google I/O.

O lugar do Gemma 4 12B no mercado

A família Gemma 4 acumulou mais de 150 milhões de downloads desde o lançamento em abril. A ausência de um modelo de 12B era uma lacuna sentida pela comunidade, que migrou do popular Gemma 3 12B e não encontrava um equivalente direto na nova geração. O E4B (com ~4,5B parâmetros efetivos) ficava muito abaixo, e o salto para o 26B MoE exigia hardware mais parrudo. O 12B preenche esse vácuo.

Mas não se trata de uma simples reposição de tamanho. A arquitetura sem encoder é experimental dentro da própria família. Ela simplifica o fine-tuning e reduz a latência, mas transfere para o LLM a responsabilidade de gerar embeddings semanticamente ricos que antes eram produzidos pelos encoders. Esse trade-off só será completamente compreendido com a validação da comunidade nos próximos meses.

No cenário competitivo de LLMs locais, rivais como Qwen 3.5 e 3.6 se destacam em codificação e tarefas de agente, enquanto o Mistral Small 4 aposta em custo-benefício. O diferencial do Gemma 4 está na licença Apache 2.0, que oferece liberdade total para uso comercial e modificação, e na cobertura de dispositivos que vai de smartphones (E2B) até estações de trabalho (31B). O 12B é a aposta da Google para quem quer rodar um modelo multimodal potente em um notebook padrão, sem depender de nuvem.

Compartilhar este artigo
Canal oficial de conteúdo do portal Overcentral. A Equipe Central produz notícias, guias e análises com foco em credibilidade e relevância, garantindo que você receba o melhor conteúdo editorial diariamente.