Open TTS Leaderboard: evaluación escalable para TTS multilingüe y clonación de voz
Hugging Face presentó el Open TTS Leaderboard para evaluar modelos de text‑to‑speech con métricas objetivas (WER/CER, latencia y similitud de voz). Busca complementar las arenas de preferencia humana y facilitar comparaciones escalables entre modelos open‑source y comerciales.
Por qué nace un nuevo leaderboard para TTS
La cantidad de modelos de text‑to‑speech (TTS) open‑source ha crecido de forma explosiva: en el Hub de Hugging Face había, al 30 de septiembre de 2026, más de 8.000 modelos TTS disponibles. Sin embargo, la evaluación no ha seguido ese ritmo: sigue fragmentada y sin estándares únicos. Las evaluaciones basadas en preferencia humana (MOS, MUSHRA y comparaciones pareadas) siguen siendo el referente, pero escalan con dificultad.
Para enfrentar ese cuello de botella, Hugging Face lanzó el Open TTS Leaderboard, una tabla que prioriza métricas objetivas para medir aspectos complementarios del rendimiento: inteligibilidad, velocidad y preservación de identidad de la voz. La idea no es reemplazar las pruebas con humanos, sino ofrecer evaluaciones reproducibles y rápidas que permitan filtrar y priorizar modelos para evaluaciones humanas posteriores.
Limitaciones de las arenas de preferencia humana
Existen varias arenas populares (TTS Arena v2, Artificial Analysis, Voice Arena) que usan comparaciones pareadas y modelos estadísticos como Bradley–Terry para obtener un ranking tipo Elo. Estas métricas basadas en votos humanos son valiosas, pero presentan problemas prácticos:
- Escalabilidad: recolectar suficientes votos para muchos modelos y combinaciones de idiomas toma semanas.
- Sesgo de participación: los modelos con API son fáciles de añadir a una arena; en cambio, los modelos open‑weights requieren hospedaje y mantenimiento por parte del operador, lo que desplaza la representación a favor de proveedores comerciales. Ejemplo: al 30/09/2026 solo 16 de 92 modelos en Artificial Analysis eran de código abierto.
- Variabilidad en votantes: las preferencias humanas cambian en el tiempo y entre personas, lo que dificulta comparaciones estables a largo plazo.
Qué mide el Open TTS Leaderboard
El enfoque del nuevo leaderboard se apoya en métricas automáticas que se pueden calcular rápidamente y de forma reproducible:
- Inteligibilidad: se calcula el word error rate (WER) o character error rate (CER) entre el texto original y la transcripción del audio generado, usando el modelo de ASR Qwen3 (actualmente el mejor open‑source en el Open ASR Leaderboard). Esto actúa como proxy de qué tan comprensible es una síntesis.
- Velocidad: se evalúa el inverse real‑time factor (RTFx) para inferencia offline por lotes en GPU H200, y el time‑to‑first‑audio (TTFA) para medir la latencia en streaming con batch size 1 tanto en H200 como en CPU. TTFA es clave para agentes conversacionales y aplicaciones interactivas.
- Similitud de hablante: se calcula la similitud (SIM) como la similitud coseno entre embeddings de WavLM del audio generado y la referencia, lo que cuantifica cuánto se conserva la identidad de la voz cuando se usa clonación.
Al usar métricas objetivas, una evaluación que antes podía tardar semanas se reduce a horas, lo que permite iterar rápidamente y mantener el ranking actualizado conforme aparecen nuevos modelos.
Multilingüismo y clonación de voz
Por defecto, el leaderboard ordena modelos por WER promedio macro en las divisiones en inglés de Seed TTS Eval y CV3 Eval (zero‑shot). Algunos modelos que lideran en inglés son hexgrad/Kokoro‑82M, Supertone/supertonic‑3 y fishaudio/s2‑pro.
Pero el rendimiento en inglés no garantiza calidad en otros idiomas. El tablero permite alternar entre idiomas para comparar desempeño multilingüe. Seed TTS Eval solo incorpora audio en inglés y chino; para los demás idiomas se usa CV3 Eval en modo zero‑shot. En lenguajes de tipo caracter (chino, japonés, coreano) se reporta CER en lugar de WER.
Modelos destacados por su capacidad multilingüe son k2‑fsa/OmniVoice, fishaudio/s2‑pro y FunAudioLLM/Fun‑CosyVoice3‑0.5B‑2512. Además, el leaderboard permite activar un modo de “Voice cloning” para comparar modelos que admiten clonación en los idiomas seleccionados; en esa vista aparece la columna SIM para medir similitud de hablante. Algunos modelos, como bosonai/higgs‑tts‑3‑4b y openbmb/VoxCPM2, ven mejorar su WER cuando se usa una referencia de voz.
Visualización y comparación: Pareto y escucha
Además de las tablas, el tablero incluye gráficas Pareto que ayudan a visualizar trade‑offs entre WER (o SIM), velocidad de inferencia por lotes (RTFx) y tamaño del modelo. Esto es útil para equipos que buscan balancear calidad, costo de despliegue y latencia.
La pestaña “Listen” cubre una necesidad práctica: escuchar las salidas detrás de las métricas. Pueden compararse audios generados por modelos seleccionados o por selección aleatoria, activar clonación y dejar retroalimentación. Los votos de la comunidad podrían integrarse en el ranking, por lo que se recomienda iniciar sesión con la cuenta de Hugging Face para reducir spam y votaciones automatizadas.
Streaming: por qué importa la TTFA
En aplicaciones interactivas (asistentes, IVR, agentes de voz) lo que más importa no siempre es la calidad absoluta sino la percepción de fluidez. El leaderboard compara capacidades de streaming y ordena por TTFA: para modelos con API de streaming es el tiempo hasta que llega el primer chunk de audio; para modelos no‑streaming es el tiempo hasta que se genera toda la emisión (y por tanto se puede reproducir). Esta métrica ayuda a decidir qué modelo conviene para experiencias conversacionales en tiempo real.
Qué significa esto para organizaciones en América Latina
Para equipos e instituciones de la región, el Open TTS Leaderboard ofrece varias ventajas prácticas:
- Acelera la preselección de modelos open‑source para pruebas de campo, evitando pruebas humanas iniciales costosas.
- Permite comparar trade‑offs relevantes para despliegues locales: latencia (importante cuando hay conectividad inestable), tamaño del modelo (impacto en infraestructura y costos), y capacidad de clonación cuando se requiere personalización de voces locales.
- Señala el desafío estructural: los modelos open‑weights siguen en desventaja en arenas basadas en crowdsourcing porque requieren hospedaje para ser evaluados, lo que tiene un costo operativo que puede afectar su visibilidad.
Límites: métricas objetivas no reemplazan la experiencia humana
Es clave recordar que WER/CER y SIM son proxies: capturan inteligibilidad y preservación de identidad, pero no miden directamente naturalidad, expresividad o preferencia del oyente. Por eso el leaderboard está pensado como complemento, no sustituto, de las evaluaciones humanas.
Invitación a la comunidad
Hugging Face ha diseñado el Open TTS Leaderboard para que evolucione con el aporte de la comunidad. Si trabajan en proyectos de voz en América Latina —donde factores como la diversidad dialectal, latencia y costos de hospedaje son críticos— su retroalimentación ayudará a mantener las métricas y datasets relevantes. Escuchar, comparar y votar en la plataforma es una forma directa de influir en qué modelos reciben mayor atención y pruebas humanas posteriores.
En resumen, el Open TTS Leaderboard acelera y estandariza una parte clave del ciclo de evaluación de TTS, facilitando decisiones informadas en entornos donde el balance entre calidad, latencia y costo es decisivo.
Fuente original: Hugging Face Blog