Gemini 3.8 TTS crea voces personalizadas: guía y precios

Perfil de voz digital y onda sonora en un estudio de grabación, concepto de generación de voz con inteligencia artificial

Por Redacción Pangea IA · 23 de septiembre de 2026

Google ha lanzado Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos que convierten texto en voz y permiten diseñar una identidad vocal desde una descripción. También pueden replicar una voz con una muestra autorizada, dirigir la interpretación línea por línea y crear diálogos de dos hablantes. La novedad ya está llegando a Google AI Studio y a la API de Gemini. Esta guía explica qué modelo elegir, cuánto cuesta y cómo obtener una primera locución sin confundir esta función con Gemini Live.

Qué ha cambiado con Gemini 3.8 TTS

Hasta ahora, muchas herramientas de texto a voz obligaban a escoger una voz de catálogo y permitían modificar poco más que la velocidad o el tono. La propuesta presentada por Google el 23 de septiembre añade tres niveles de control: una biblioteca con más de 2.000 voces preparadas, el diseño de voces nuevas mediante lenguaje natural y la replicación de una voz existente cuando su propietario da un consentimiento verificable.

Gemini 3.8 Flash TTS es la opción orientada a la calidad, los acentos regionales, la actuación y la estabilidad en narraciones largas. Flash-Lite TTS comparte el mismo formato de API, pero está optimizado para menor latencia y producción a gran escala. Google propone el primero para audiolibros, ficción sonora, videojuegos o diálogos complejos, y el segundo para lectura automática, doblaje masivo y agentes de voz.

No es una actualización de Gemini 3.8 Live, la IA de voz que conversa y ejecuta tareas en tiempo real. Live acepta una conversación abierta y puede trabajar con herramientas; TTS recibe un texto cerrado y devuelve audio. Esa diferencia importa: TTS está pensado para recitar exactamente un guion y controlar cómo suena, no para improvisar una respuesta.

Gemini 3.8 Flash TTS frente a Flash-Lite TTS

CriterioFlash TTSFlash-Lite TTS
PrioridadCalidad, interpretación y acentosVelocidad, escala y coste
Idiomas admitidos130101
Usos recomendadosAudiolibros, podcasts narrativos, juegos, diálogos exigentesLectura automática, lotes, asistentes y locuciones sencillas
Precio estándar de salida hasta el 31-12-20269 dólares por millón de tokens de audio6 dólares por millón de tokens de audio
Precio estándar desde el 1-1-202718 dólares por millón12 dólares por millón
Diseño y replicación de vozSíSí

Google calcula el audio a razón de 25 tokens por segundo. Con la tarifa estándar promocional, un minuto de salida equivale aproximadamente a 0,0135 dólares con Flash TTS y a 0,009 dólares con Flash-Lite TTS. Es una estimación del audio generado: el texto de entrada se cobra aparte, aunque su impacto suele ser mucho menor. El procesamiento por lotes reduce a la mitad la tarifa de salida, a 4,50 y 3 dólares por millón de tokens respectivamente.

La API ofrece un nivel gratuito. Google indica que los datos del nivel gratuito pueden utilizarse para mejorar sus productos, mientras que en el nivel de pago no se usan con ese fin. Las cifras están expresadas en dólares, sin conversión a euros, impuestos ni posibles costes de otras herramientas. Además, los precios anunciados se duplican el 1 de enero de 2027, por lo que no conviene proyectar un presupuesto anual utilizando solo la promoción de lanzamiento.

Requisitos antes de crear una voz

  • Una cuenta de Google con acceso a Google AI Studio para probar el modelo.
  • Una clave de la API de Gemini si se va a integrar la voz en una aplicación.
  • Para Python, el SDK google-genai 2.25.0 o posterior; para JavaScript, @google/genai 2.24.0 o posterior.
  • Un guion propio o con derechos suficientes para producir la locución.
  • Si se replica una voz real, una grabación limpia de 10 a 30 segundos y otra grabación de consentimiento del mismo adulto.

Diseñar una voz ficticia y replicar una voz real son procesos distintos. En el primero se describe una identidad —por ejemplo, edad aproximada, timbre, acento y actitud— sin aportar una grabación. En el segundo se crea una copia vocal a partir de audio. La documentación exige que la muestra y el consentimiento pertenezcan a la misma persona adulta. No basta con disponer de un fragmento público de un actor, creador o familiar.

Cómo crear una voz personalizada en Google AI Studio

Google señala AI Studio como la vía más rápida para diseñar, escuchar y ajustar voces. El despliegue empezó el mismo día del anuncio, por lo que la disponibilidad puede ser gradual según la cuenta. Los nombres o la disposición de los controles pueden cambiar; estos son los pasos que se desprenden del flujo oficial, sin depender de una captura concreta.

  1. Abre el entorno de generación de voz de Google AI Studio. Comprueba que aparece uno de los modelos Gemini 3.8 TTS. Si todavía solo ves versiones anteriores, la función no ha llegado a tu cuenta.
  2. Elige el objetivo. Usa Flash TTS cuando la interpretación y el acento sean decisivos; elige Flash-Lite para probar grandes volúmenes o un lector sencillo.
  3. Parte de una voz de catálogo o diseña una. Para una voz nueva, describe en una o dos frases los rasgos permanentes: edad aproximada, textura, registro, acento y personalidad base.
  4. Escribe un texto de prueba. Empieza con dos o tres frases que incluyan cifras, nombres propios y signos de puntuación parecidos a los del proyecto real.
  5. Añade la dirección de la escena. Reserva las instrucciones de estilo para esa intervención: “serena y cercana”, “urgente, sin gritar” o “lenta y reflexiva”. No repitas toda la biografía de la voz en cada línea.
  6. Escucha y corrige una variable cada vez. Si falla una pronunciación, corrígela antes de cambiar el timbre. Si el ritmo es irregular, acorta las frases y simplifica la dirección.
  7. Guarda la voz si será recurrente. Una voz diseñada puede recibir un identificador persistente voice_... para reutilizarla desde la API.

Ejemplo práctico para un pódcast informativo

Una descripción útil sería: “Narradora española de unos 35 años, timbre cálido y claro, acento peninsular neutro, ritmo periodístico tranquilo y sin entonación publicitaria”. El guion de prueba podría decir: “Hoy, 23 de septiembre, Google ha presentado dos modelos de voz. La versión Flash prioriza la interpretación; Flash-Lite, el coste y la velocidad”. Para la primera prueba, la instrucción de estilo puede quedar en “informativa y cercana”.

Este ejemplo separa identidad, texto y actuación. Si se introduce todo en una sola frase, el modelo puede recitar parte de la instrucción o variar más de lo deseado. La documentación de Gemini 3.8 sitúa la identidad permanente en la voz diseñada y el estado emocional de cada turno en speech_metadata.style.

Cómo generar el archivo WAV desde Python

Después de instalar el SDK y configurar GEMINI_API_KEY como variable de entorno, una locución con una voz predefinida puede generarse con el siguiente patrón, adaptado a la documentación oficial:

import base64
from google import genai

client = genai.Client()

respuesta = client.interactions.create(
    model="gemini-3.8-flash-tts",
    input=[{
        "type": "user_input",
        "content": [{
            "type": "text",
            "text": "Bienvenidos. Hoy explicamos cómo funciona la nueva voz de Gemini.",
            "annotations": [{
                "type": "speech_metadata",
                "style": "informativa, clara y cercana",
            }],
        }],
    }],
    response_format={"type": "audio"},
    generation_config={
        "speech_config": [{"voice": "Kore"}]
    },
)

with open("locucion.wav", "wb") as archivo:
    archivo.write(base64.b64decode(respuesta.output_audio.data))

Gemini 3.8 devuelve WAV por defecto. Si una integración antigua envolvía manualmente audio PCM en una cabecera WAV, hay que retirar ese paso para evitar archivos corruptos. La API también admite formatos sin cabecera como audio/l16, mu-law o A-law cuando se solicitan expresamente.

Cómo replicar una voz sin saltarse el consentimiento

La replicación requiere dos grabaciones del mismo adulto. La muestra de referencia debe contener entre 10 y 30 segundos de habla clara; Google recomienda WAV mono de 24 kHz y 16 bits. La segunda grabación debe recitar la frase de consentimiento obligatoria en uno de los idiomas admitidos. AI Studio permite grabar o subir ambas piezas y escuchar el resultado antes de copiar el identificador.

Las voces guardadas en el proyecto tienen un límite conjunto de 200 y caducan al año. La modalidad sin almacenamiento en el servidor devuelve una clave cifrada gestionada por el cliente, con una validez de siete días. Google afirma que todo el audio generado incorpora SynthID y que la replicación incluye verificación de consentimiento. Son protecciones relevantes, pero no convierten cualquier uso en legítimo: siguen siendo necesarias la autorización contractual, la información a la audiencia y el cumplimiento de las normas de privacidad y derechos de imagen aplicables.

Este límite cobra especial importancia cuando las voces sintéticas se combinan con vídeo. Nuestra guía para crear un vídeo con Gemini a partir de una foto explica un flujo distinto; utilizar a la vez imagen y voz de una persona real exige permiso para ambos elementos.

Errores frecuentes y cómo resolverlos

La voz pronuncia las instrucciones

Gemini 3.8 trata el texto principal como una transcripción literal. Si se escribe “di con alegría” dentro del guion, puede pronunciar esas palabras. La solución es mover el estilo a speech_metadata y dejar en el campo de texto únicamente lo que debe oírse.

La personalidad cambia entre fragmentos

Conviene guardar una voz diseñada y reutilizar su identificador. Las características estables pertenecen a esa voz; el estilo de cada frase debe ser breve. Las indicaciones largas o contradictorias aumentan la variación. Google recomienda descripciones concisas de una o dos frases.

El diálogo mezcla a los hablantes

Una solicitud de dos voces debe identificar el hablante en cada turno y configurar ambos nombres de forma coherente. La generación multihablante en una sola solicitud admite hasta dos voces predefinidas. Para combinar voces diseñadas o replicadas, la documentación indica generar cada intervención por separado y unir después los fotogramas de audio PCM de 24 kHz.

El coste real supera la estimación

Los reintentos, las tomas descartadas y las versiones alternativas también consumen tokens. Para controlar el gasto, prueba primero un fragmento corto en Flash-Lite, bloquea la voz y el ritmo, y genera después el guion completo. Si el trabajo no es urgente, el procesamiento por lotes tiene una tarifa inferior.

Límites que conviene conocer

  • Los modelos TTS aceptan texto y devuelven audio; no analizan imágenes ni navegan por internet.
  • Flash TTS admite entradas de hasta 8.192 tokens y salidas de hasta 16.384 tokens según su ficha técnica.
  • La biblioteca cubre muchos idiomas, pero Flash-Lite ofrece menos que Flash y la calidad puede variar entre acentos.
  • Las posiciones en los rankings difundidas por Google proceden de Hume AI y Voice Arena; no equivalen a una garantía para cada idioma, micrófono o género de contenido.
  • “Larga duración” no elimina la necesidad de revisar pronunciación, nombres propios, cifras, cortes y continuidad.
  • La replicación solo debe utilizarse con la voz propia o con una autorización demostrable.

Conclusión: cuál elegir

Gemini 3.8 Flash TTS es la opción razonable cuando una voz forma parte del producto: narración larga, ficción, doblaje complejo o una identidad con acento y dirección detallados. Flash-Lite TTS encaja mejor en lectores, avisos, prototipos y grandes volúmenes, donde unos milisegundos y unos céntimos acumulados importan más que el último grado de interpretación.

La novedad más útil no es que la voz suene “más humana”, una afirmación difícil de medir sin pruebas propias, sino que Google ha unido catálogo, diseño, replicación autorizada, dirección por turnos y una API común. Antes de desplegarla, conviene validar la calidad con voces españolas, calcular el precio posterior a la promoción y documentar quién ha dado permiso para cada identidad vocal.

Fuentes consultadas

Fuentes consultadas el 23 de septiembre de 2026.

Recibe las nuevas publicaciones de Pangea IA

Suscríbete gratis y recibe por correo las nuevas noticias, guías y análisis sobre inteligencia artificial.

Respuesta

  1. Avatar de Cómo crear un avatar de IA con Gemini 3.8 Live – Pangea IA

    […] es diseñar la identidad vocal del agente, también te puede resultar útil nuestra guía sobre Gemini 3.8 TTS y voces personalizadas, aunque Live Avatar y TTS son productos con objetivos […]

    Me gusta

Deja una respuesta