Gemini 3.8 Live y 3.8 Live Extended Thinking: voz, razonamiento en tiempo real y casos de uso empresariales

Google anunció Gemini 3.8 Live y 3.8 Live Extended Thinking, sus modelos de diálogo en vivo con mayores capacidades de razonamiento en tiempo real y soporte visual. Ambas versiones buscan facilitar agentes de voz escalables y colaborativos, con mejoras en latencia, ejecución de herramientas y detección de idiomas.

Por Redaccion TD
Gemini 3.8 Live y 3.8 Live Extended Thinking: voz, razonamiento en tiempo real y casos de uso empresariales

Resumen ejecutivo

Google DeepMind presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en tiempo real orientados a mejorar la experiencia conversacional por voz y la ejecución de tareas complejas. Las novedades se enfocan en razonamiento paralelo, monitoreo de tareas en segundo plano, detección automática de idiomas y procesamiento visual casi en tiempo real. Para desarrolladores y empresas, esto significa bloques de construcción listos para crear agentes de voz en producción más fluidos, tanto en aplicaciones como en flujos de trabajo corporativos.

Qué aporta cada modelo

  • Gemini 3.8 Live: diseñado para escala y eficiencia de costos, combina inteligencia conversacional con diálogo fluido y capacidad de grounding visual. Es una opción pensada para implementaciones masivas donde el costo operativo y la latencia importan.
  • Gemini 3.8 Live Extended Thinking: orientado a tareas de alta complejidad, incorpora mayor inteligencia y razonamiento en múltiples pasos. Mantiene la conversación mientras razona y ejecuta tareas en paralelo, ideal cuando las respuestas requieren procesos más profundos.

Rendimiento y benchmarks (datos oficiales)

Google reporta resultados destacados en varios benchmarks de voz y razonamiento para 3.8 Live Extended Thinking: lidera en el Speech to Speech Quality Index de Artificial Analysis con 82.6, alcanza 68.6% en τ-Voice (agentic task completion) y 35.1% en el benchmark Sierra’s τ-Voice-banking. En Big Bench Audio logra 97.7% en capacidades de razonamiento. Por su parte, Gemini 3.8 Live obtuvo una alta preferencia de usuarios y se ubicó en segundo lugar en el Speech Agent Arena.

Además, en el EVA-Bench de ServiceNow —un referente para evaluar agentes de voz en flujos de trabajo complejos— Google indica que sus modelos amplían la frontera de Pareto, equilibrando precisión y calidad conversacional. Estos resultados se obtuvieron usando la API Live en la plataforma Gemini Enterprise Agent.

Cómo mejora la interacción por voz

Las dos variantes introducen comportamientos conversacionales más naturales: el sistema puede reconocer y seguir conversando mientras ejecuta llamadas a APIs o herramientas en segundo plano. Por ejemplo, el agente puede decir frases que reconocen el inicio de trabajo como ‘Let me check that…’ y narrar el progreso de tareas multi-step, lo que mantiene al usuario informado sin interrumpir el diálogo.

Gemini 3.8 Live procesa entradas visuales en casi tiempo real, lo que permite enriquecer conversaciones con contexto visual (por ejemplo, analizar una imagen compartida durante una llamada) y cambiar entre 97 idiomas soportados en medio de la conversación sin interrupciones perceptibles. Esto aporta ventajas claras para servicios que atienden audiencias multilingües.

Integración para desarrolladores y plataformas

El lanzamiento enfatiza el ecosistema de desarrolladores: la Gemini Live API ya es utilizada por plataformas que gestionan la infraestructura de streaming en tiempo real, como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents. Estas integraciones permiten a los desarrolladores concentrarse en la experiencia del usuario mientras la complejidad del streaming y la latencia se maneja en la capa de plataforma.

También hay alianzas con proveedores empresariales como Salesforce, Genspark y Lumeris, quienes destacan la latencia, la fluidez conversacional y las capacidades de invocación de herramientas. Para organizaciones que buscan modernizar centros de contacto, asistentes en línea o flujos de soporte, estas prestaciones facilitan construir agentes que gestionen tareas reales durante la conversación.

Seguridad y trazabilidad: watermarking con SynthID

Todas las salidas de audio generadas por los productos de IA de Google incluyen una marca imperceptible llamada SynthID. Esta watermark está incrustada en el audio para mantener la detectabilidad del contenido generado por IA, una medida que busca mitigar riesgos asociados a la desinformación y mejorar trazabilidad. Google remite a su model card para detalles sobre seguridad y responsabilidad.

Disponibilidad y acceso

Según Google, el despliegue comienza inmediatamente, con distintos niveles de acceso:

  • Gemini 3.8 Live
    • Para desarrolladores: disponible en Gemini API y Google AI Studio.
    • Para empresas: vista previa privada en Gemini Enterprise; pronto en Gemini Enterprise for Customer Experience.
    • Para el público: integrado en Search Live.
  • Gemini 3.8 Live Extended Thinking
    • Para desarrolladores: disponible en Gemini API y Google AI Studio.
    • Para empresas: vista previa privada en Gemini Enterprise; llegará próximamente a Gemini Enterprise for Customer Experience y a clientes empresariales de Google Workspace.
    • Para el público: en Gemini Live y para suscriptores de Google AI Pro y Ultra en Workspace (Docs), y para suscriptores de Google AI en Gmail y Keep.

Relevancia para América Latina

Para organizaciones en América Latina, estas mejoras abren oportunidades claras: centros de contacto que atienden en múltiples idiomas, asistentes que comprenden y responden con contexto visual (por ejemplo, inspección remota mediante imágenes), y automatización conversacional para sectores como banca, retail y salud. La capacidad de cambiar entre 97 idiomas sin interrumpir la conversación puede beneficiar entornos multilingües o regiones con alta movilidad transfronteriza.

Emprendedores y pymes tecnológicas de la región pueden aprovechar las plataformas partner (p. ej. LangChain, Agora) para prototipar asistentes de voz sin invertir en infraestructura de streaming, mientras que empresas grandes pueden evaluar la vista previa privada para integrar agentes de voz en flujos críticos.

Consideraciones finales

Gemini 3.8 Live y su versión Extended Thinking representan un avance en la dirección de agentes de voz más inteligentes y orientados a tareas reales, con foco en razonamiento paralelo, continuidad conversacional y soporte visual. Para las organizaciones latinoamericanas, la principal pregunta operativa será cómo integrar estas capacidades respetando políticas locales de privacidad, protección de datos y expectativas de transparencia en la generación de contenido.

Si su organización está evaluando asistentes de voz o modernizar su atención al cliente, conviene explorar la API de Gemini y las integraciones de los partners mencionados, así como revisar las garantías de seguridad (SynthID) y las condiciones de acceso en la región.

Fuente original: Google DeepMind