Alle News
Research3 min

MARS8-Modellfamilie: technische Spezifikationen und Benchmark-Ergebnisse

Dieser technische Bericht stellt MARS8 vor und präsentiert detaillierte, offene Benchmarks zur Bewertung von Architektur, Leistung und praxisnahen TTS-Fähigkeiten.

camb.ai/news
MARS8-Modellfamilie

Einleitung

Heute stellen wir MARS8 vor, unsere erste vollständige Familie von Text-to-Speech-Modellen (TTS). Durch den praktischen Einsatz in Unterhaltung, Sportübertragung und KI-Agenten haben wir eine grundlegende Lektion gelernt: Kein einzelnes TTS-Modell kann in jedem Anwendungsfall überzeugen. Verschiedene Bereiche verlangen unterschiedliche Kompromisse zwischen Ausdruckskraft, Latenz, Steuerbarkeit und Robustheit.

Unsere Reise begann mit MARS5, dem ersten TTS-System, das hochintensive Prosodie auf dem für Live-Sportkommentare erforderlichen Niveau bewältigen konnte. MARS5 wurde in englischer Sprache als Open Source veröffentlicht und stieg rasch auf Platz 3 der Trends bei Hugging Face – knapp hinter Modellen wie Gemini und Llama. Anschließend erweiterten wir das Angebot um MARS6 und MARS7, die zu den ersten TTS-Modellen wurden, die in AWS Bedrock bzw. Google Model Garden aufgenommen wurden.

In diesem Dokument stellen wir die Fähigkeiten von MARS8 vor, beschreiben die verschiedenen Modelle der Familie und teilen detaillierte technische und akademische Benchmark-Auswertungen. Wir haben MARS8-Pro und MARS8-Flash im direkten Vergleich mit führenden TTS-Systemen der Branche bewertet, darunter Cartesia Sonic-3, ElevenLabs Multilingual v2/v3 und Minimax Speech-2.6-HD. Alle Auswertungen und Datensätze sind vollständig Open Source, sodass unsere Benchmarks transparent und von der breiteren Forschungs- und Entwicklergemeinschaft reproduzierbar sind.

Was MARS8 auszeichnet

Die meisten TTS-Benchmarks bewerten Modelle unter Idealbedingungen: lange, saubere Referenzaufnahmen aus dem Studio. Doch reale Anwendungen haben diesen Luxus selten. Nutzer liefern kurze Clips, oft mit dem Telefon aufgenommen, mit Hintergrundgeräuschen und natürlicher Ausdruckskraft. Wir haben MARS8 so entwickelt, dass es genau dort überzeugt, wo andere Modelle scheitern. Die entscheidende Fähigkeit ist die außergewöhnliche Leistung bei begrenzten Daten: Selbst bei nur 2 Sekunden Audio bewahrt MARS8 eine äußerst konsistente Sprecheridentität und -leistung – etwas, das bei konkurrierenden Systemen in der Regel 10 bis 30 Sekunden sauberes Audio erfordert.

MAMBA: der „Kobe Bryant“ unter den TTS-Benchmarks

Um diese Aussagen zu belegen, haben wir den MAMBA-Benchmark entwickelt – einen strengen Belastungstest, der die anspruchsvollsten realen Bedingungen abbildet statt idealisierter Studioumgebungen. Drei zentrale Designentscheidungen machen den Datensatz besonders anspruchsvoll: 70 % der Stichproben erfordern sprachübergreifendes Stimmenklonen; die durchschnittliche Referenzdauer beträgt lediglich 2,3 Sekunden; und die Referenzen enthalten natürliche Ausdruckskraft statt neutral vorgelesener Sprache. Wir stellen MAMBA als Open Source bereit, damit die breitere Community unsere Ergebnisse unabhängig reproduzieren und validieren kann.

Ergebnisse

Bei der Sprachqualität führt MARS8 im Bereich Content Enjoyment und erreicht bei der Production Quality das Niveau der besten Anbieter. MARS8-Flash erzielt eine Zeichenfehlerrate von 5,67 % und belegt damit eine hohe Aussprachegenauigkeit über den mehrsprachigen Testsatz hinweg. Bei der Sprecherähnlichkeit – wo MARS8 wirklich glänzt – erreicht MARS8-Pro die höchsten Werte bei beiden Metriken: 0,87 bei der wavlm-base-sv-Kosinusähnlichkeit und 0,71 bei CAM++. Der CAM++-Wert von 0,71 bedeutet eine Verbesserung um 38 % gegenüber dem nächstbesten Wettbewerber und mehr als das Doppelte des Werts von ElevenLabs Multilingual v2 – und das alles bei einer durchschnittlichen Referenzlänge von nur 2,3 Sekunden.

Die MARS8-Familie

  • MARS-Flash (600M): extrem niedrige Latenz, TTFB bis hinunter zu 100 ms. Für agentische Konversationen – Callcenter- und Live-Gesprächsagenten.
  • MARS-Pro (600M): ausgewogenes Verhältnis von Geschwindigkeit und Wiedergabetreue, TTFB 800 ms–2 s. Für ausdrucksstarke Synchronisation, Hörbücher und digitale Medien.
  • MARS-Instruct (1.2B): emotionale Steuerung auf Regisseur-Niveau für hochwertige TV- und Filmproduktionen, bei denen Sprecher und Prosodie unabhängig voneinander abgestimmt werden können.
  • MARS-Nano (50M): hocheffizient für On-Device-Anwendungen, TTFB bis hinunter zu 50 ms. Im Einsatz bei Partnern wie Broadcom.

MARS8-Flash, MARS8-Pro und MARS8-Instruct werden in mehreren Sprachen veröffentlicht, die zusammen 99 % der sprechenden Weltbevölkerung abdecken, mit Premium- und Standard-Support-Stufen, die den Datenumfang widerspiegeln (nicht die Ausgabequalität). Darüber hinaus unterstützt CAMB im Long Tail bis zu 150 Sprachen.

Lokalisieren Sie Ihre Inhalte mit CAMB.AI

Synchronisieren, übersetzen und vertonen Sie Ihre Medien in über 150 Sprachen.

Kostenlos starten