生成音声の次なる時代

MARS8:本番環境向けに構築された多言語テキスト読み上げモデル

MARS8は本番環境レベルのテキスト読み上げモデルファミリーです。数百万人が耳を傾けるときでも、あらゆるユースケース、言語、音声プロファイルに同じ確かな信頼性を提供できるよう構築されています。

主要な計算プラットフォームすべてでネイティブに提供開始
Google
Fal.ai
AWS
Hugging Face
Modal
Replicate
Baseten
Simplismart
Hathora
Parasail
Cerebrium
Google
Fal.ai
AWS
Hugging Face
Modal
Replicate
Baseten
Simplismart
Hathora
Parasail
Cerebrium
世界初のTTSモデルファミリー

MARS8ファミリー - 各ユースケースに特化したモデル

研究ブログ記事の全文を読む
MARS8ファミリー
MARS8-Flash
MARS8.1-Pro
MARS8-Instruct
MARS8-Nano

MARS8-Flash

会話型AIエージェント向けの低遅延多言語TTS。

パラメータ: 600M
APIで試す
ユースケース
リアルタイム音声エージェント
コンタクトセンター
ライブ会話型AI
新着MARS8.1 がベータ版で登場。より高速で表現力豊か、API はそのまま。
ベンチマーク結果

TTSの新たな基準を再定義

ベンチマークを自分で実行する
MARS8-Pro
CAMB.AI
MARS8-Flash
CAMB.AI
Sonic-3
Cartesia
Speech-2.6-hd
Minimax
Multilingual_v2
ElevenLabs
Multilingual_v3
ElevenLabs
PQ ↑
MetaのAudiobox-Aestheticsモデルによる予測平均オピニオンスコア(1〜10)。高いほど制作品質が優れていることを示します。
7.4498
7.4523
6.9471
6.9468
7.4516
7.1934
WavLM SVコサイン類似度 ↑
wavlm-base-sv埋め込みモデルを使った、生成音声と参照音声の平均コサイン類似度。
0.8676
0.8666
0.8420
0.8666
0.8109
0.8253
CAM++ コサイン類似度 ↑
CAM++埋め込みモデルを使った、生成音声と参照音声の平均コサイン類似度。
0.7097
0.7066
0.5134
0.5878
0.3912
0.336
CE ↑
MetaのAudiobox-Aestheticsモデルによる予測平均オピニオンスコア(1〜10)。高いほどコンテンツの楽しさが大きいことを反映します。
5.4308
5.4299
5.0445
4.9877
5.4146
5.1816
CER ↓
Whisper ASRで測定した、生成出力における誤り文字の割合。低いほど優れています。
5.77%
5.67%
8.54%
11.30%
4.39%
14.62%
世界の99%をカバーする言語対応

グローバルな言語カバレッジ

MARS8は、視聴者が話し、聞く方法にネイティブでありながら、世界の99%をカバーできる多言語のバックボーンです。

English
Hindi (India)
French (France)
Spanish (Spain)
German
Japanese
Modern Standard Arabic
Korean
Chinese (Simplified)
Italian
Spanish (Mexico)
Portuguese (Portugal)
Portuguese (Brazil)
Indonesian
Dutch

技術的な全容を知りたいですか?

MARS8のアーキテクチャ、展開パターン、性能特性の詳細については、ブログの技術記事の全文をご覧ください。

あなたの条件で、構築・スケール・提携を

MARS8は、スタートアップ、エンタープライズ、インフラプロバイダーをまたいでスケールするよう設計されています。プロダクトを構築する場合でも、他社の構築を支える場合でも、すぐに始められる直接的な道があります。

無料で始める