Google lança Gemini 3.8 Live e versão Extended Thinking, que raciocina e fala ao mesmo tempo
Os novos modelos de voz chegam à Gemini API, ao Gemini Live e ao Workspace. Eles usam ferramentas em segundo plano, e isso muda o protocolo da Live API.
O Google lançou em 15 de setembro de 2026 dois modelos de diálogo por voz em tempo real: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Segundo o anúncio da empresa, o primeiro foi pensado para escala e custo baixo, com conversa fluida e uso de contexto visual. O segundo é voltado a tarefas complexas, com raciocínio em várias etapas. A ideia é que agentes de voz consigam consultar ferramentas e executar tarefas sem interromper a conversa.
O que os modelos fazem
De acordo com o Google, o 3.8 Live processa imagens quase em tempo real, detecta e alterna entre 97 idiomas no meio da conversa e executa ferramentas e chamadas de API em segundo plano enquanto continua falando. Já o Extended Thinking “raciocina e fala ao mesmo tempo”: usa frases curtas, como “deixa eu verificar isso”, para confirmar o pedido e narra o andamento de tarefas longas enquanto elas rodam. Todo o áudio gerado leva a marca d’água SynthID, segundo a empresa.
Benchmarks, segundo o Google
O Google afirma que o Extended Thinking ficou em primeiro lugar no Speech to Speech Quality Index da Artificial Analysis (82,6). Pela mesma fonte, o modelo marcou 68,6% no τ-Voice, 35,1% no τ-Voice-banking, da Sierra, e 97,7% no Big Bench Audio. Já o 3.8 Live teria ficado em segundo lugar na Speech Agent Arena. São números divulgados pela própria fabricante, e o Google informa que parte dos testes rodou na Live API da plataforma Gemini Enterprise Agent. O resultado de 35,1% em atendimento bancário mostra que tarefas de ponta a ponta por voz ainda falham com frequência.
Disponibilidade
Os dois modelos começaram a ser liberados no mesmo dia na Gemini API e no Google AI Studio, e em prévia privada no Gemini Enterprise. O 3.8 Live também chega ao Search Live. O Extended Thinking passa a equipar o Gemini Live e, segundo o 9to5Google, recursos de conversa por voz no Gmail, no Docs e no Keep, com acesso que varia conforme a assinatura Google AI. O Google cita plataformas como LiveKit, Pipecat, LangChain e Vercel entre as que usam a Live API.
O que muda para desenvolvedores
A documentação do modelo traz mudanças que exigem ajuste no cliente. No gemini-3.8-live-extended-thinking, turnComplete: true deixa de indicar que o modelo está ocioso, porque o servidor pode continuar raciocinando ou chamando ferramentas. O estado deve ser lido no campo interaction_status (IN_PROGRESS ou IDLE). Só há chamadas de função assíncronas (behavior: NON_BLOCKING), e o modo bloqueante retorna erro. O raciocínio é configurado em thinking_level (low, medium ou high, sem o nível minimal), e o áudio proativo fica sempre ligado. O limite é de 131.072 tokens de entrada e 65.536 de saída. Recursos como saída estruturada, cache e execução de código não são suportados.
Fontes
- Google (blog oficial) — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (15/09/2026)
- Google AI for Developers — Gemini 3.8 Live Extended Thinking | Gemini API (documentação do modelo) (15/09/2026)
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep (15/09/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


