Por Redacción Pangea IA · 15 de septiembre de 2026
Google ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz en tiempo real pensados para conversar, interpretar imágenes y vídeo y utilizar herramientas sin obligar al usuario a interrumpir el diálogo. El primero prioriza rapidez y coste; el segundo puede razonar durante más tiempo y continuar hablando mientras coordina tareas. Para empresas, la novedad no es solo una voz más natural: es la posibilidad de convertir una conversación en un flujo de trabajo, con ventajas claras y riesgos que conviene acotar antes de ponerlo delante de clientes.
Qué ha lanzado Google y por qué es distinto
Google anunció los dos modelos el 15 de septiembre de 2026. Ambos pertenecen a la familia Gemini 3.8, pero su objetivo no es el mismo que el de Gemini 3.8 Flash y Flash Cyber, orientados a agentes generales y ciberseguridad. Live está diseñado para una interacción continua por voz: recibe audio, texto, imágenes o vídeo y puede responder con audio o texto.
La diferencia importante está en cómo gestiona el tiempo. Gemini 3.8 Live busca respuestas de baja latencia y ejecución rápida de instrucciones. Gemini 3.8 Live Extended Thinking reserva más cálculo para problemas que requieren varios pasos. Según la documentación de Google, el modo avanzado puede seguir conversando mientras espera el resultado de herramientas externas, en lugar de dejar un silencio largo cada vez que consulta una base de datos, comprueba una reserva o ejecuta una operación.
| Aspecto | Gemini 3.8 Live | Extended Thinking |
|---|---|---|
| Prioridad | Rapidez y eficiencia | Razonamiento de varios pasos |
| Uso recomendado | Consultas directas y herramientas rápidas | Diagnósticos, planificación y tareas complejas |
| Herramientas | Llamadas breves dentro de la conversación | Puede gestionar herramientas en segundo plano |
| Coste publicado | 0,005 dólares/minuto de entrada y 0,018 de salida | Google remite a la tarificación vigente de la API |
| Disponibilidad | Live API, AI Studio y Vertex AI | Canales de Google compatibles, con disponibilidad según producto |
Los dos modelos admiten una ventana de contexto de 128.000 tokens. Eso permite sostener conversaciones prolongadas y aportar documentación, aunque no convierte al sistema en una memoria permanente. El contexto se consume y debe administrarse; una aplicación empresarial sigue necesitando decidir qué datos conserva, durante cuánto tiempo y con qué base jurídica.
El cambio clave: hablar mientras usa herramientas
Los asistentes de voz tradicionales suelen funcionar como una cadena rígida: escuchan, transcriben, consultan un sistema y responden. Cada paso añade demora. Google plantea una arquitectura en la que el modelo mantiene la interacción mientras una herramienta trabaja en segundo plano. El usuario podría, por ejemplo, explicar un problema técnico mientras el agente consulta el historial del equipo, o pedir una cita y corregir sus preferencias sin reiniciar todo el proceso.
La documentación para desarrolladores exige que las herramientas de larga duración se declaren como asíncronas y que comuniquen su estado. Este detalle importa: la experiencia no depende únicamente del modelo. Si la API de reservas tarda, devuelve datos incompletos o no informa del resultado, una voz convincente no arregla el flujo. El diseño debe contemplar estados como «en curso», «completado» o «fallido» y explicar al usuario qué está ocurriendo.
También es una evolución respecto a los usos conversacionales sencillos. La guía de Pangea IA para practicar inglés con Gemini Live muestra el valor de una conversación natural; los nuevos modelos amplían ese enfoque hacia aplicaciones que consultan sistemas, observan una cámara o coordinan varios pasos.
Cuánto cuesta Gemini 3.8 Live
Google publica para el modelo estándar un precio de 0,005 dólares por minuto de audio de entrada y 0,018 dólares por minuto de audio de salida. Una conversación con 60 minutos efectivos de escucha y 60 minutos de voz generada costaría 1,38 dólares solo en audio: 0,30 dólares de entrada y 1,08 de salida. Es un ejemplo aritmético, no una factura típica, porque en una conversación real usuario y agente se alternan y no hablan ambos durante una hora completa.
El coste final puede incluir otras modalidades, almacenamiento, búsquedas, herramientas externas, telefonía, observabilidad y la infraestructura de la aplicación. Tampoco debe confundirse el precio de la API con un plan de consumo de la app Gemini. Una empresa que quiera presupuestar un servicio necesita medir minutos reales de entrada y salida, duración media, porcentaje de llamadas resueltas y coste de las operaciones auxiliares.
Qué dicen las primeras evaluaciones
Artificial Analysis sitúa Gemini 3.8 Live Extended Thinking en 82,6 puntos en su índice de modelos voz a voz, por encima de la variante estándar, que aparece con 76. Es una señal favorable para tareas conversacionales, pero no demuestra por sí sola que el modelo sea mejor en atención al cliente, castellano de España o un proceso concreto. Cada prueba pondera determinadas tareas y condiciones.
BenchLM añade una cautela útil: todavía no muestra filas ponderadas comparables para este modelo en su evaluación general de texto y separa las métricas de audio publicadas por el fabricante. Por tanto, conviene tratar el lanzamiento como una mejora técnica prometedora, no como una victoria universal. La única prueba decisiva para una empresa es un piloto con conversaciones reales, criterios definidos y revisión humana.
Dónde puede aportar valor a una empresa
Atención y triaje
Un agente puede recoger el motivo de una llamada, pedir los datos estrictamente necesarios, consultar el estado de un pedido y derivar el caso con un resumen. El objetivo razonable no es eliminar a la persona que atiende, sino reducir esperas y evitar que el cliente repita la historia. Debe existir una salida clara hacia un humano cuando hay enfado, vulnerabilidad, fraude, una reclamación formal o baja confianza.
Soporte técnico visual
La entrada de imagen y vídeo permite que un usuario muestre un equipo mientras habla. El agente podría identificar el modelo, consultar un manual y guiar una comprobación segura. Es especialmente útil para el primer diagnóstico, pero no sustituye una inspección profesional cuando existe riesgo eléctrico, mecánico o sanitario.
Reservas y operaciones internas
El razonamiento en segundo plano encaja en agendas, viajes, inventario o soporte a empleados: tareas en las que hay que consultar varias fuentes y confirmar condiciones. El antecedente más cercano son agentes como Meta Muse en WhatsApp, aunque la propuesta de Google se ofrece como infraestructura para que cada organización construya su propia experiencia.
Cinco comprobaciones antes de ponerlo en producción
- Elegir un proceso acotado. Empezar por una tarea con reglas claras, datos disponibles y una vía de escalado. Una demo abierta oculta errores que aparecen en producción.
- Separar conversación y autorización. El agente puede preparar una reserva o un cambio, pero las operaciones irreversibles, pagos y datos sensibles deben pedir confirmación explícita.
- Medir calidad, no solo velocidad. Registrar resolución correcta, abandonos, derivaciones, latencia, coste por caso y correcciones humanas. Una conversación fluida puede seguir siendo equivocada.
- Aplicar minimización de datos. No enviar a la API más información de la necesaria. Documentar conservación, proveedores, accesos y transferencias conforme al RGPD y a la política de la organización.
- Ensayar fallos. Probar ruido, acentos, interrupciones, llamadas simultáneas, herramientas caídas y respuestas ambiguas. La aplicación debe reconocer límites y no inventar que una acción se ha completado.
Los límites siguen siendo importantes
El propio informe de modelo de Google reconoce alucinaciones, demoras ocasionales y tiempos de espera. La voz añade un riesgo: una respuesta segura y natural puede parecer más fiable de lo que es. Por eso, los datos críticos deberían mostrarse o repetirse antes de confirmarlos, y las respuestas basadas en documentos tendrían que conservar la referencia que permite auditarlas.
Extended Thinking tampoco significa que el modelo «piense» como una persona ni que sus pasos internos sean una explicación verificable. Describe una modalidad con más cómputo y coordinación. Puede mejorar problemas complejos, pero también aumentar latencia y coste. La selección entre ambos modelos debería hacerse por tipo de tarea, no por asumir que la opción más avanzada siempre es mejor.
Conclusión: la voz empieza a convertirse en interfaz de trabajo
Gemini 3.8 Live desplaza el foco desde el asistente que responde preguntas hacia el agente que mantiene una conversación mientras consulta y ejecuta herramientas. El precio publicado hace viable experimentar, y Extended Thinking amplía el abanico de procesos posibles. Sin embargo, la utilidad real dependerá de la integración, la protección de datos, el control de las acciones y la calidad de las derivaciones humanas. Para una empresa, el siguiente paso sensato es un piloto pequeño con métricas y límites claros, no una sustitución general de sus canales de atención.
Lecturas relacionadas
Fuentes consultadas
- Google: presentación de Gemini 3.8 Live y Extended Thinking.
- Google: construcción de aplicaciones de voz en tiempo real.
- Google DeepMind: informe de modelo de Gemini 3.8 Audio.
- Documentación de la Live API y herramientas asíncronas.
- Precios oficiales de la API de Gemini.
- Artificial Analysis: índice de modelos voz a voz.
- BenchLM: ficha y límites de comparación.
Fuentes consultadas el 15 de septiembre de 2026.


Deja una respuesta