Por Redacción Pangea IA · 27 de septiembre de 2026
Gemini 3.8 Live ya permite crear agentes conversacionales con avatar de vídeo en tiempo real dentro de Gemini Enterprise. La función Live Avatar sincroniza la voz generada con la cara del avatar, admite entrada de cámara, puede mantener una conversación mientras llama a herramientas y funciona con el modelo gemini-3.8-live. En esta guía explicamos cómo probarlo desde Google Cloud sin programar, qué necesitas antes de empezar, cómo configurarlo mediante API y qué límites conviene conocer.
La novedad parte de Gemini 3.8 Live, el modelo de Google orientado a conversaciones de baja latencia. Si quieres entender primero qué aporta el modelo base, puedes leer nuestro análisis de Gemini 3.8 Live y sus agentes de voz. Live Avatar añade la capa visual: una cara sintética habla, mueve los labios y expresa la respuesta generada por el agente.
Qué necesitas para usar Gemini 3.8 Live Avatar
La función está disponible de forma general para clientes de Gemini Enterprise y Google ofrece endpoints en Estados Unidos y la Unión Europea. El modelo también admite consumo estándar de pago por uso en regiones no globales. Para una prueba desde consola necesitas acceso a un proyecto de Google Cloud con Gemini Enterprise Agent Platform habilitado y permisos suficientes para utilizar Agent Platform.
- Un proyecto activo de Google Cloud.
- Acceso a Gemini Enterprise Agent Platform.
- El modelo
gemini-3.8-live. - Micrófono si quieres conversar por voz.
- Cámara opcional si quieres que el agente vea lo que tú ves.
- Un avatar y una voz de la biblioteca prediseñada.
No necesitas subir tu propia cara para empezar. De hecho, esa es la opción recomendable para una primera prueba porque los avatares personalizados están restringidos a clientes seleccionados que hayan superado el proceso de autorización de Google.
Cómo crear un avatar de IA en Gemini 3.8 Live paso a paso
1. Abre Agent Platform y entra en Stream en tiempo real
Dentro de Google Cloud, abre Agent Platform > Studio > Stream en tiempo real. Esa es la zona que Google utiliza para probar sesiones bidireccionales de voz y vídeo.
2. Cambia el modelo a gemini-3.8-live
Selecciona la opción para cambiar de modelo y elige gemini-3.8-live. Es importante no confundirlo con otros modelos Gemini pensados para texto, imagen o generación por lotes: Live Avatar necesita específicamente la variante Live compatible con vídeo conversacional.
3. Activa Live Avatar
En el panel principal activa Live Avatar. A partir de ese momento puedes seleccionar un avatar prediseñado y combinarlo con una de las voces compatibles.
4. Elige avatar y voz
Escoge primero el avatar y después la voz. No hace falta que ambos pertenezcan a un mismo “personaje”: la plataforma permite combinar avatares prediseñados con voces HD compatibles. Para una prueba de atención al cliente, por ejemplo, conviene elegir una voz clara y neutra antes de experimentar con estilos más expresivos.
Si lo que buscas es diseñar la identidad vocal del agente, también te puede resultar útil nuestra guía sobre Gemini 3.8 TTS y voces personalizadas, aunque Live Avatar y TTS son productos con objetivos distintos.
5. Añade instrucciones del sistema
Las instrucciones del sistema sirven para definir el papel, el tono y los límites del agente. Para una primera prueba es mejor ser concreto. Un ejemplo realista sería: “Eres un asistente de recepción de una clínica. Explica horarios y servicios generales, pero no des diagnósticos ni consejos médicos”.
Esta parte importa más de lo que parece. El avatar puede resultar convincente visualmente, pero el comportamiento sigue dependiendo del modelo y de las reglas que le marques. Un diseño facial atractivo no sustituye una buena definición de permisos, fuentes de datos y acciones permitidas.
6. Decide si el agente puede usar la cámara
Gemini 3.8 Live puede recibir vídeo en directo además de audio y texto. Si habilitas la cámara, el agente puede analizar lo que el usuario está mostrando durante la conversación. Google utiliza como ejemplo una toma inicial de daños para un siniestro de seguro, donde el usuario enseña el problema mientras el sistema completa información y otros agentes revisan reglas en segundo plano.
Activa esta función solo cuando aporte valor. Para un recepcionista virtual que únicamente responde preguntas, la cámara añade complejidad y tratamiento de datos sin una necesidad clara.
7. Inicia la sesión y prueba interrupciones
Pulsa Iniciar sesión y comienza a hablar. Una de las ventajas de Gemini 3.8 Live es que la conversación es nativa de voz a voz y permite interrumpir al agente. Google indica que el sistema puede recuperarse de una interrupción sin perder el contexto de la conversación ni las transacciones de backend que sigan ejecutándose.
Durante la prueba conviene comprobar tres cosas: que el avatar no tarde demasiado en responder, que las interrupciones funcionen de forma natural y que el agente no ejecute acciones que no estaban previstas en las instrucciones.
Ejemplo práctico: un recepcionista virtual para una pyme
Imagina una academia de formación que quiere atender consultas fuera del horario comercial. El avatar puede recibir al visitante, preguntarle qué curso le interesa, explicar horarios disponibles y consultar una herramienta interna para comprobar plazas. Mientras la API procesa esa consulta, Gemini 3.8 Live puede seguir conversando con el usuario en lugar de quedarse bloqueado esperando la respuesta.
El valor no está en “poner una cara a ChatGPT”, sino en combinar conversación, vídeo y herramientas. El agente puede escuchar, mirar una imagen o una pantalla cuando esté permitido, llamar a una API y continuar hablando. Para una pyme eso abre posibilidades en recepción, formación, soporte inicial, demostraciones de producto y orientación básica al cliente.
También hay un paralelismo con la creación audiovisual. Si tu objetivo no es una conversación en vivo sino producir un vídeo a partir de una imagen, el flujo adecuado es diferente. En ese caso consulta nuestra guía para crear un vídeo con Gemini a partir de una foto.
Cómo configurarlo mediante la API
Para una integración real en una web, una app o un kiosco, Google permite activar Live Avatar mediante la Gemini Live API. La conexión utiliza WebSocket con estado y autenticación OAuth 2.0.
{
"generation_config": {
"response_modalities": ["VIDEO"]
},
"avatar_config": {
"avatar_name": "Ben"
},
"speech_config": {
"voice_config": {
"prebuilt_voice_config": {
"voice_name": "Puck"
}
}
}
}
La idea principal es sencilla: response_modalities debe incluir VIDEO, el objeto avatar_config define el avatar y speech_config selecciona la voz. Google también proporciona ejemplos oficiales con WebSocket y con el SDK de Python.
La API acepta audio PCM de 16 bits a 16 kHz como entrada y produce audio de 24 kHz. Para Live Avatar la salida de vídeo se entrega como MP4. El modelo funciona mediante una conexión WebSocket persistente, lo que permite mantener una conversación bidireccional continua.
Qué pasa si quieres usar tu propia cara
Google permite generar un avatar personalizado a partir de una imagen de referencia, pero esta función no está abierta de forma general. Solo está disponible para clientes seleccionados y requiere solicitar acceso al equipo de Google Cloud.
La documentación exige que la persona de la imagen mire directamente a cámara, mantenga la cabeza nivelada y use una expresión neutra. También prohíbe utilizar imágenes de menores, celebridades o contenido ofensivo. El cliente es responsable de contar con los consentimientos y derechos necesarios sobre la cara y la voz utilizadas.
Además, Google afirma que las transmisiones de audio y vídeo generadas incorporan marcas de agua SynthID imperceptibles. El objetivo es que el contenido generado por IA pueda identificarse técnicamente aunque el usuario no vea una marca visible en pantalla.
Precio: cuánto cuesta Gemini 3.8 Live Avatar
Google publica tarifas separadas según la modalidad. A fecha de esta guía, para Gemini 3.8 Live API en región no global, la tabla oficial indica 0,75 dólares por millón de tokens de entrada de texto, 1 dólar para entrada de imagen o vídeo, 3 dólares para entrada de audio, 4,50 dólares para salida de texto, 12 dólares para salida de audio y 1 dólar por millón de tokens para salida de vídeo de avatar.
Estas cifras no deben interpretarse como un precio fijo por minuto de conversación. El coste real depende de las modalidades utilizadas, la duración, el volumen procesado y la arquitectura de la aplicación. Para un proyecto empresarial también puede existir consumo mediante capacidad aprovisionada. Antes de presupuestar un despliegue conviene revisar la página de precios vigente de Google Cloud.
Errores frecuentes y cómo evitarlos
- No aparece Live Avatar: comprueba que has seleccionado
gemini-3.8-livey que tu proyecto tiene acceso a Gemini Enterprise Agent Platform. - Intentas subir una cara propia y no aparece la opción: los avatares personalizados requieren autorización específica; usa uno prediseñado para empezar.
- El agente responde pero no ejecuta acciones: revisa la configuración de herramientas y los permisos de la integración; Live Avatar no añade automáticamente acceso a tus sistemas.
- El coste crece más de lo esperado: limita cámara y vídeo a los casos donde aporten valor y mide cada modalidad por separado.
- La conversación resulta incómoda: prueba interrupciones, ruido de fondo y cambios de idioma antes de poner el sistema delante de clientes.
Límites que conviene tener claros
Live Avatar no convierte automáticamente un agente en una persona digital perfecta. La sincronización labial y la generación de vídeo mejoran la presencia visual, pero el sistema sigue pudiendo equivocarse, interpretar mal una imagen o ejecutar una herramienta de forma incorrecta si la arquitectura no está bien controlada.
También existe una cuestión de transparencia. Cuanto más humano parece un agente, más importante es informar al usuario de que está conversando con un sistema de IA. Esto es especialmente relevante en atención al cliente, servicios financieros, salud, educación y cualquier contexto en el que la apariencia humana pueda generar una confianza excesiva.
¿Merece la pena probarlo?
Para una empresa que ya utiliza agentes de voz, Live Avatar es una evolución lógica: añade presencia visual sin obligar a separar voz, vídeo y llamadas a herramientas en sistemas independientes. Para una pyme que simplemente necesita un chatbot de preguntas frecuentes, probablemente sea más tecnología de la necesaria.
La prueba más sensata es empezar con un avatar prediseñado, una tarea muy concreta y sin cámara. Cuando la conversación, las interrupciones y las herramientas funcionen bien, se puede añadir vídeo de entrada y estudiar si un avatar personalizado aporta realmente valor.
Lecturas relacionadas
- Google lanza Gemini 3.8 Live: una IA de voz que piensa mientras habla
- Gemini 3.8 TTS crea voces personalizadas: guía y precios
- Cómo crear un vídeo con Gemini a partir de una foto, paso a paso
Fuentes consultadas
- Google Cloud: Gemini 3.8 Live with Live Avatar is now generally available. Consulta: 27 de septiembre de 2026.
- Google Cloud Documentation: Configura avatares en vivo. Consulta: 27 de septiembre de 2026.
- Google Cloud Documentation: API de Gemini Live. Consulta: 27 de septiembre de 2026.
- Google Cloud Documentation: Developer’s guide to Gemini 3.8 Live. Consulta: 27 de septiembre de 2026.
- Google Cloud: Agent Platform Pricing. Consulta: 27 de septiembre de 2026.


Deja una respuesta