Tutte le novità
Research3 min

Famiglia di modelli MARS8: specifiche tecniche e risultati dei benchmark

Questo report tecnico presenta MARS8 e illustra benchmark dettagliati e aperti che ne valutano l'architettura, le prestazioni e le capacità TTS nel mondo reale.

camb.ai/news
Famiglia di modelli MARS8

Introduzione

Oggi presentiamo MARS8, la nostra prima famiglia completa di modelli di sintesi vocale (TTS). Attraverso implementazioni reali nell'intrattenimento, nelle trasmissioni sportive e negli agenti IA, abbiamo imparato una lezione fondamentale: nessun singolo modello TTS può eccellere in ogni caso d'uso. Domini diversi richiedono compromessi diversi tra espressività, latenza, controllabilità e robustezza.

Il nostro percorso è iniziato con MARS5, il primo sistema TTS capace di gestire una prosodia ad alta intensità al livello richiesto dal commento sportivo in diretta. MARS5 è stato reso open-source in inglese ed è rapidamente salito al 3° posto su Hugging Face, posizionandosi appena al di sotto di modelli come Gemini e Llama. Ci siamo poi ampliati con MARS6 e MARS7, che sono diventati rispettivamente i primi modelli TTS a essere inseriti in AWS Bedrock e Google Model Garden.

In questo documento presentiamo le capacità di MARS8, illustriamo i diversi modelli all'interno della famiglia e condividiamo valutazioni benchmark tecniche e accademiche dettagliate. Abbiamo valutato MARS8-Pro e MARS8-Flash a confronto diretto con i principali sistemi TTS del settore, tra cui Cartesia Sonic-3, ElevenLabs Multilingual v2/v3 e Minimax Speech-2.6-HD. Tutte le valutazioni e i dataset sono completamente open-source, garantendo che i nostri benchmark siano trasparenti e replicabili dall'intera comunità di ricercatori e sviluppatori.

Cosa rende MARS8 diverso

La maggior parte dei benchmark TTS valuta i modelli in condizioni ideali: audio di riferimento lunghi e puliti registrati in ambienti di studio. Ma le applicazioni reali raramente godono di questo lusso. Gli utenti forniscono clip brevi, spesso registrate con il telefono, con rumore di fondo ed espressività naturale. Abbiamo progettato MARS8 per eccellere proprio dove gli altri modelli faticano. La capacità distintiva è una performance eccezionale a partire da dati limitati: anche con audio di appena 2 secondi, MARS8 mantiene un'identità dello speaker e una performance estremamente coerenti, qualcosa che con i sistemi concorrenti richiede tipicamente 10-30 secondi di audio pulito.

MAMBA: il "Kobe Bryant" dei benchmark TTS

Per convalidare queste affermazioni, abbiamo sviluppato il MAMBA Benchmark, uno stress test rigoroso progettato per riflettere le condizioni reali più esigenti anziché ambienti di studio idealizzati. Tre scelte progettuali chiave rendono il dataset particolarmente impegnativo: il 70% dei campioni richiede la clonazione vocale cross-linguistica; la durata media del riferimento è di appena 2,3 secondi; e i riferimenti contengono un'espressività naturale anziché un parlato letto in tono neutro. Stiamo rendendo MAMBA open-source affinché l'intera comunità possa replicare e convalidare in modo indipendente i nostri risultati.

Risultati

In termini di qualità del parlato, MARS8 è in testa per Content Enjoyment, eguagliando i migliori per Production Quality. MARS8-Flash raggiunge un Character Error Rate del 5,67%, dimostrando una forte accuratezza di pronuncia sull'intero set di test multilingue. Sulla somiglianza dello speaker — dove MARS8 eccelle davvero — MARS8-Pro ottiene i punteggi più alti su entrambe le metriche: 0,87 sulla similarità coseno wavlm-base-sv e 0,71 su CAM++. Il punteggio CAM++ di 0,71 rappresenta un miglioramento del 38% rispetto al miglior concorrente successivo e più del doppio del punteggio di ElevenLabs Multilingual v2, il tutto ottenuto con una lunghezza media del riferimento di appena 2,3 secondi.

La famiglia MARS8

  • MARS-Flash (600M): latenza ultra-bassa, TTFB fino a 100ms. Per conversazioni agentiche: call center e agenti conversazionali in tempo reale.
  • MARS-Pro (600M): equilibrio tra velocità e fedeltà, TTFB da 800ms a 2s. Per doppiaggio espressivo, audiolibri e media digitali.
  • MARS-Instruct (1.2B): controlli emotivi a livello di regista per produzioni TV e cinematografiche di alto livello, dove speaker e prosodia possono essere regolati in modo indipendente.
  • MARS-Nano (50M): altamente efficiente per applicazioni on-device, TTFB fino a 50ms. Implementato con partner come Broadcom.

MARS8-Flash, MARS8-Pro e MARS8-Instruct vengono rilasciati in più lingue, coprendo collettivamente il 99% della popolazione parlante mondiale, con livelli di supporto Premium e Standard che riflettono la scala dei dati (non la qualità dell'output). Oltre a questo, CAMB supporta fino a 150 lingue nella long tail.

Localizza i tuoi contenuti con CAMB.AI

Doppia, traduci e dai voce ai tuoi media in oltre 150 lingue.

Inizia gratis