Site Local

Portal de notícias de tecnologia

Google lança Gemini 3.8 Live e versão Extended Thinking, que raciocina e fala ao mesmo tempo

Os novos modelos de voz chegam à Gemini API, ao Gemini Live e ao Workspace. Eles usam ferramentas em segundo plano, e isso muda o protocolo da Live API.

Google lança Gemini 3.8 Live e versão Extended Thinking, que raciocina e fala ao mesmo tempo

O Google lançou em 15 de setembro de 2026 dois modelos de diálogo por voz em tempo real: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Segundo o anúncio da empresa, o primeiro foi pensado para escala e custo baixo, com conversa fluida e uso de contexto visual. O segundo é voltado a tarefas complexas, com raciocínio em várias etapas. A ideia é que agentes de voz consigam consultar ferramentas e executar tarefas sem interromper a conversa.

O que os modelos fazem

De acordo com o Google, o 3.8 Live processa imagens quase em tempo real, detecta e alterna entre 97 idiomas no meio da conversa e executa ferramentas e chamadas de API em segundo plano enquanto continua falando. Já o Extended Thinking “raciocina e fala ao mesmo tempo”: usa frases curtas, como “deixa eu verificar isso”, para confirmar o pedido e narra o andamento de tarefas longas enquanto elas rodam. Todo o áudio gerado leva a marca d’água SynthID, segundo a empresa.

Benchmarks, segundo o Google

O Google afirma que o Extended Thinking ficou em primeiro lugar no Speech to Speech Quality Index da Artificial Analysis (82,6). Pela mesma fonte, o modelo marcou 68,6% no τ-Voice, 35,1% no τ-Voice-banking, da Sierra, e 97,7% no Big Bench Audio. Já o 3.8 Live teria ficado em segundo lugar na Speech Agent Arena. São números divulgados pela própria fabricante, e o Google informa que parte dos testes rodou na Live API da plataforma Gemini Enterprise Agent. O resultado de 35,1% em atendimento bancário mostra que tarefas de ponta a ponta por voz ainda falham com frequência.

Disponibilidade

Os dois modelos começaram a ser liberados no mesmo dia na Gemini API e no Google AI Studio, e em prévia privada no Gemini Enterprise. O 3.8 Live também chega ao Search Live. O Extended Thinking passa a equipar o Gemini Live e, segundo o 9to5Google, recursos de conversa por voz no Gmail, no Docs e no Keep, com acesso que varia conforme a assinatura Google AI. O Google cita plataformas como LiveKit, Pipecat, LangChain e Vercel entre as que usam a Live API.

O que muda para desenvolvedores

A documentação do modelo traz mudanças que exigem ajuste no cliente. No gemini-3.8-live-extended-thinking, turnComplete: true deixa de indicar que o modelo está ocioso, porque o servidor pode continuar raciocinando ou chamando ferramentas. O estado deve ser lido no campo interaction_status (IN_PROGRESS ou IDLE). Só há chamadas de função assíncronas (behavior: NON_BLOCKING), e o modo bloqueante retorna erro. O raciocínio é configurado em thinking_level (low, medium ou high, sem o nível minimal), e o áudio proativo fica sempre ligado. O limite é de 131.072 tokens de entrada e 65.536 de saída. Recursos como saída estruturada, cache e execução de código não são suportados.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.