Gemini 3.8 Live executa APIs em segundo plano sem pausar a voz

Alex da Cruz
Alex da Cruz é desenvolvedor full-stack em São Paulo. Trabalha com React, TypeScript e automação, e usa inteligência artificial no dia a dia para resolver problemas reais de código e de operação — não como demonstração. Já tocou uma operação de e-commerce de ponta a ponta e hoje constrói e mantém o pipeline de automação por trás deste blog. Escreve aqui sobre o que testa de fato.
Em publicação oficial feita pelo blog do Google DeepMind, a empresa apresentou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. O lançamento foca em resolver um dos gargalos mais persistentes nos assistentes corporativos de voz: o tempo de espera forçado sempre que o modelo precisa consultar um sistema externo ou rodar um código.
Como as APIs em segundo plano mudam o uso de voz no trabalho?
Agentes de voz tradicionais funcionam em ciclos rígidos de pausa e resposta. Quando a IA precisa consultar um estoque, atualizar um CRM ou processar uma reserva, o áudio é congelado até que a função termine. De acordo com o Google DeepMind, o Gemini 3.8 Live elimina essa barreira ao executar chamadas de API em segundo plano enquanto mantém a transmissão de áudio aberta.
Na prática, o sistema utiliza confirmações verbais curtas e narração de progresso enquanto executa rotinas técnicas no backend. Para equipes de atendimento e suporte interno, isso transforma chamadas automatizadas em interações contínuas, nas quais consultas a banco de dados ocorrem em paralelo com a fala do usuário.
O que os números de benchmark significam na prática?
Segundo os dados divulgados pelo Google, o Gemini 3.8 Live Extended Thinking atingiu 68,6% de taxa de sucesso no benchmark τ-Voice para tarefas de agentes e liderou o índice de qualidade Speech to Speech com pontuação de 82,6.
Analisar esses números exige contexto operacional. O resultado de 68,6% em tarefas genéricas de agentes significa que o modelo conclui com êxito cerca de sete em cada dez fluxos de trabalho com múltiplas etapas sem perder o contexto da conversa. Já no setor bancário (medido pelo τ-Voice-banking), a taxa cai para 35,1%, evidenciando que etapas complexas de autenticação e regras de conformidade ainda limitam a automação total. A capacidade de transição automática entre 97 idiomas permite atender clientes globais em uma única infraestrutura sem necessidade de triagem manual prévia.
O que muda na prática para equipes de Workspace e desenvolvedores?
Para profissionais que utilizam o Google Workspace, a chegada da voz em tempo real no Docs, Gmail e Keep permite redigir documentos e gerenciar e-mails por comandos falados contínuos. O usuário pode corrigir diretrizes ou acrescentar detalhes no meio da fala da IA, sem precisar interromper o processo ou reiniciar a instrução.
Para desenvolvedores integrados via Gemini Live API em plataformas como LiveKit e LangChain, a gestão de infraestrutura de streaming passa a ser absorvida pela API. Isso libera o time técnico para focar nas regras de negócio e integrações de sistema. Todas as saídas de áudio contam com marca d'água SynthID, facilitando a auditoria de conteúdo gerado por IA em ambientes corporativos.
Fontes
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — google deepmind
Perguntas frequentes
- Qual é a diferença entre o Gemini 3.8 Live e o Extended Thinking?
- O Gemini 3.8 Live é focado em baixa latência e conversas fluidas em escala, enquanto a versão Extended Thinking adiciona raciocínio em múltiplas etapas para fluxos complexos.
- O modelo consegue chamar ferramentas sem pausar a conversa de voz?
- Sim, o Gemini 3.8 Live executa APIs e integrações em segundo plano mantendo a transmissão de áudio ativa com confirmações em tempo real.
- Onde é possível acessar os novos modelos Gemini 3.8 Live?
- Os modelos já estão disponíveis na Gemini API, no Google AI Studio e em fases de distribuição no Google Workspace e Gemini Enterprise.
Comentários
0 comentário
Seja o primeiro a comentar.
Continue Lendo

ChatGPT Images 2.5 traz recurso Sketch e divisão de API
A nova versão do gerador visual do ChatGPT adiciona esboços na tela e divide sua API entre velocidade e precisão.

ChatGPT vs Claude: qual é melhor para trabalho em 2026?
ChatGPT vs Claude: a pergunta certa mudou Durante muito tempo, comparar ChatGPT e Claude significava perguntar qual modelo “responde melhor”. Em 2026, essa comparação ficou menos útil. Os dois produto

Salesforce Koa: modelo de raciocínio da Nvidia reduz custos de IA
Salesforce e Nvidia lançam o Koa, um modelo de raciocínio voltado para o mercado corporativo que promete eficiência de tokens e segurança.