Familia de modelos MARS8: especificaciones técnicas y resultados de benchmarks
Este informe técnico presenta MARS8 y ofrece benchmarks abiertos y detallados que evalúan su arquitectura, su rendimiento y sus capacidades de TTS en el mundo real.
Introducción
Hoy presentamos MARS8, nuestra primera familia completa de modelos de texto a voz (TTS). A través de despliegues en el mundo real en el entretenimiento, la retransmisión deportiva y los agentes de IA, aprendimos una lección fundamental: ningún modelo de TTS por sí solo puede sobresalir en todos los casos de uso. Los distintos dominios exigen diferentes compromisos entre expresividad, latencia, controlabilidad y robustez.
Nuestro recorrido comenzó con MARS5, el primer sistema de TTS capaz de manejar la prosodia de alta intensidad al nivel que exigen los comentarios deportivos en directo. MARS5 se liberó como código abierto en inglés y rápidamente escaló hasta el puesto n.º 3 en Hugging Face, situándose justo por debajo de modelos como Gemini y Llama. Después ampliamos con MARS6 y MARS7, que se convirtieron en los primeros modelos de TTS incorporados a AWS Bedrock y Google Model Garden, respectivamente.
En este documento presentamos las capacidades de MARS8, describimos los distintos modelos de la familia y compartimos evaluaciones detalladas de benchmarks técnicos y académicos. Evaluamos MARS8-Pro y MARS8-Flash frente a frente con los principales sistemas de TTS del sector, incluidos Cartesia Sonic-3, ElevenLabs Multilingual v2/v3 y Minimax Speech-2.6-HD. Todas las evaluaciones y conjuntos de datos son totalmente de código abierto, lo que garantiza que nuestros benchmarks sean transparentes y replicables por la comunidad más amplia de investigadores y desarrolladores.
Qué hace diferente a MARS8
La mayoría de los benchmarks de TTS evalúan los modelos en condiciones ideales: audio de referencia largo y limpio grabado en entornos de estudio. Pero las aplicaciones del mundo real rara vez disponen de ese lujo. Los usuarios aportan clips breves, a menudo grabados con teléfonos, con ruido de fondo y expresividad natural. Diseñamos MARS8 para destacar precisamente donde otros modelos tienen dificultades. La capacidad que lo define es un rendimiento excepcional a partir de datos limitados: incluso con audio tan breve como 2 segundos, MARS8 mantiene una identidad del locutor y un rendimiento sumamente consistentes, algo que normalmente requiere entre 10 y 30 segundos de audio limpio en los sistemas de la competencia.
MAMBA: el “Kobe Bryant” de los benchmarks de TTS
Para validar estas afirmaciones, desarrollamos el MAMBA Benchmark, una rigurosa prueba de estrés diseñada para reflejar las condiciones del mundo real más exigentes en lugar de entornos de estudio idealizados. Tres decisiones de diseño clave hacen que el conjunto de datos sea especialmente exigente: el 70 % de las muestras requiere clonación de voz entre idiomas; la duración media de referencia es de tan solo 2,3 segundos; y las referencias contienen expresividad natural en lugar de habla leída neutra. Estamos liberando MAMBA como código abierto para que la comunidad en general pueda replicar y validar de forma independiente nuestros resultados.
Resultados
En cuanto a la calidad del habla, MARS8 lidera en Content Enjoyment mientras iguala a los mejores en Production Quality. MARS8-Flash alcanza una tasa de error de caracteres del 5,67 %, lo que demuestra una sólida precisión de pronunciación en todo el conjunto de pruebas multilingüe. En similitud del locutor —donde MARS8 realmente brilla— MARS8-Pro obtiene las puntuaciones más altas en ambas métricas: 0,87 en similitud de coseno wavlm-base-sv y 0,71 en CAM++. La puntuación de 0,71 en CAM++ representa una mejora del 38 % sobre el siguiente mejor competidor y más del doble de la puntuación de ElevenLabs Multilingual v2, todo ello logrado con una longitud de referencia media de tan solo 2,3 segundos.
La familia MARS8
- MARS-Flash (600M): latencia ultrabaja, con TTFB de tan solo 100 ms. Para conversaciones con agentes: centros de llamadas y agentes de conversación en directo.
- MARS-Pro (600M): equilibrio entre velocidad y fidelidad, con TTFB de 800 ms a 2 s. Para doblaje expresivo, audiolibros y medios digitales.
- MARS-Instruct (1.2B): controles de emoción a nivel de director para producciones de televisión y cine de alta gama, donde el locutor y la prosodia pueden ajustarse de forma independiente.
- MARS-Nano (50M): altamente eficiente para aplicaciones en el dispositivo, con TTFB de tan solo 50 ms. Desplegado con socios como Broadcom.
MARS8-Flash, MARS8-Pro y MARS8-Instruct se están lanzando en varios idiomas que, en conjunto, cubren el 99 % de la población hablante del mundo, con niveles de soporte Premium y Standard que reflejan la escala de datos (no la calidad de salida). Más allá de esto, CAMB admite hasta 150 idiomas en la larga cola.
Localiza tu contenido con CAMB.AI
Dobla, traduce y da voz a tus contenidos en más de 150 idiomas.