Famille de modèles MARS8 : spécifications techniques et résultats de référence
Ce rapport technique présente MARS8 et propose des benchmarks détaillés et ouverts évaluant son architecture, ses performances et ses capacités TTS en conditions réelles.
Introduction
Nous présentons aujourd'hui MARS8, notre première famille complète de modèles de synthèse vocale (TTS). À travers des déploiements en conditions réelles dans le divertissement, la diffusion sportive et les agents d'IA, nous avons tiré une leçon fondamentale : aucun modèle TTS unique ne peut exceller dans tous les cas d'usage. Les différents domaines exigent des compromis différents entre expressivité, latence, contrôlabilité et robustesse.
Notre parcours a débuté avec MARS5, le premier système TTS capable de gérer une prosodie de haute intensité au niveau requis pour le commentaire sportif en direct. MARS5 a été publié en open source en anglais et est rapidement monté à la 3e place des tendances sur Hugging Face, juste derrière des modèles tels que Gemini et Llama. Nous avons ensuite étendu la gamme avec MARS6 et MARS7, qui sont devenus les premiers modèles TTS à intégrer respectivement AWS Bedrock et Google Model Garden.
Dans ce document, nous présentons les capacités de MARS8, décrivons les différents modèles de la famille et partageons des évaluations de référence techniques et académiques détaillées. Nous avons évalué MARS8-Pro et MARS8-Flash en confrontation directe avec les principaux systèmes TTS du secteur, notamment Cartesia Sonic-3, ElevenLabs Multilingual v2/v3 et Minimax Speech-2.6-HD. Toutes les évaluations et tous les jeux de données sont entièrement open source, ce qui garantit la transparence de nos benchmarks et leur reproductibilité par la communauté élargie des chercheurs et des développeurs.
Ce qui distingue MARS8
La plupart des benchmarks TTS évaluent les modèles dans des conditions idéales : des échantillons de référence longs et propres, enregistrés en studio. Mais les applications du monde réel bénéficient rarement de ce luxe. Les utilisateurs fournissent des extraits courts, souvent enregistrés sur téléphone, avec du bruit de fond et une expressivité naturelle. Nous avons conçu MARS8 pour exceller précisément là où les autres modèles peinent. Sa capacité déterminante est une performance exceptionnelle à partir de données limitées : même avec un audio aussi bref que 2 secondes, MARS8 conserve une identité et une performance du locuteur d'une grande cohérence — ce qui nécessite habituellement 10 à 30 secondes d'audio propre avec les systèmes concurrents.
MAMBA : le « Kobe Bryant » des benchmarks TTS
Pour valider ces affirmations, nous avons développé le benchmark MAMBA, un test de résistance rigoureux conçu pour refléter les conditions réelles les plus exigeantes plutôt que des environnements de studio idéalisés. Trois choix de conception clés rendent ce jeu de données particulièrement difficile : 70 % des échantillons nécessitent un clonage vocal interlingue ; la durée de référence moyenne n'est que de 2,3 secondes ; et les références contiennent une expressivité naturelle plutôt qu'une lecture neutre. Nous publions MAMBA en open source afin que la communauté élargie puisse reproduire et valider nos résultats de façon indépendante.
Résultats
Sur le plan de la qualité vocale, MARS8 se place en tête sur le critère du plaisir d'écoute (Content Enjoyment) tout en égalant les meilleurs sur la qualité de production (Production Quality). MARS8-Flash atteint un taux d'erreur sur les caractères de 5,67 %, démontrant une grande précision de prononciation sur l'ensemble du jeu de test multilingue. Sur la similarité du locuteur — domaine où MARS8 excelle véritablement — MARS8-Pro obtient les meilleurs scores sur les deux métriques : 0,87 en similarité cosinus wavlm-base-sv et 0,71 sur CAM++. Le score CAM++ de 0,71 représente une amélioration de 38 % par rapport au concurrent le plus proche et plus du double du score d'ElevenLabs Multilingual v2, le tout obtenu avec une longueur de référence moyenne de seulement 2,3 secondes.
La famille MARS8
- MARS-Flash (600M) : latence ultra-faible, TTFB pouvant descendre à 100 ms. Pour les conversations agentiques — centres d'appels et agents de conversation en direct.
- MARS-Pro (600M) : équilibre entre vitesse et fidélité, TTFB de 800 ms à 2 s. Pour le doublage expressif, les livres audio et les médias numériques.
- MARS-Instruct (1.2B) : contrôles émotionnels de niveau réalisateur pour la production télévisuelle et cinématographique haut de gamme, où le locuteur et la prosodie peuvent être réglés indépendamment.
- MARS-Nano (50M) : très efficace pour les applications embarquées, TTFB pouvant descendre à 50 ms. Déployé avec des partenaires tels que Broadcom.
MARS8-Flash, MARS8-Pro et MARS8-Instruct sont proposés dans de multiples langues, couvrant collectivement 99 % de la population parlante mondiale, avec des niveaux de prise en charge Premium et Standard reflétant l'ampleur des données (et non la qualité de sortie). Au-delà, CAMB prend en charge jusqu'à 150 langues sur la longue traîne.
Localisez votre contenu avec CAMB.AI
Doublez, traduisez et donnez voix à vos médias dans plus de 150 langues.