语音
语音模型榜单
TTS Arena Elo、语音对话基准分数,以及语音转写 AA WER 指数(越低越好)。
快照 2026年7月24日 03:51
Elo Top 10
共 91 个模型
1Qwen-Audio-3.0-TTS-Plus
1,234
2Simba 3.2
1,230
3Gemini 3.1 Flash TTS
1,215
4Sonic 3.5
1,208
5Realtime TTS 1.5 Max
1,198
6Lightning V3.1 Pro (Jul 2026)
1,198
7Realtime TTS-2 - Research Preview
1,197
8Luna TTS
1,194
9Speech 2.8 HD
1,178
10StepAudio 2.5 TTS
1,176
91 / 91 结果
| # | |
|---|---|
| 1 | Qwen-Audio-3.0-TTS-PlusAlibaba 1,234±16 |
| 2 | Simba 3.2SpeechifyAI 1,230±16 |
| 3 | Gemini 3.1 Flash TTSGoogle 1,215±13 |
| 4 | Sonic 3.5Cartesia 1,208±14 |
| 5 | Realtime TTS 1.5 MaxInworld 1,198±14 |
| 6 | Lightning V3.1 Pro (Jul 2026)Smallest.ai 1,198±17 |
| 7 | Realtime TTS-2 - Research PreviewInworld 1,197±14 |
| 8 | Luna TTSVUI Labs 1,194±16 |
| 9 | Speech 2.8 HDMiniMax 1,178±12 |
| 10 | StepAudio 2.5 TTSStepFun 1,176±18 |
| 11 | Eleven v3ElevenLabs 1,175±12 |
| 12 | Async Flash v1.5async 1,164±15 |
| 13 | Speech 2.8 TurboMiniMax 1,150±12 |
| 14 | Lightning V3.1 Pro TTS (Jun 2026)Smallest.ai 1,146±15 |
| 15 | Step TTS 2 (Mar 2026)StepFun 1,142±14 |
| 16 | Async Pro v1.0async 1,140±15 |
| 17 | Speech 2.6 HDMiniMax 1,138±12 |
| 18 | Fish Audio S2.1 ProFish Audio 1,138±15 |
| 19 | Realtime TTS 1.5 MiniInworld 1,137±13 |
| 20 | Speech 2.6 TurboMiniMax 1,128±12 |
| 21 | Azure HD 2.5Microsoft 1,126±13 |
| 22 | Simba 3.0SpeechifyAI 1,122±14 |
| 23 | Fish Audio S2 ProFish Audio 1,120±14 |
| 24 | Step Audio EditX (Mar 2026)StepFun 1,113±14 |
| 25 | Speech-02-HDMiniMax 1,112±12 |
| 26 | SpaceXAI TTSSpaceXAI 1,108±21 |
| 27 | TTS-1 HDOpenAI 1,103±12 |
| 28 | Multilingual v2ElevenLabs 1,102±11 |
| 29 | Turbo v2.5ElevenLabs 1,102±11 |
| 30 | Maya 2 FlashMaya Research 1,089±17 |
| 31 | Gradium TTSGradium 1,088±15 |
| 32 | Flash v2.5ElevenLabs 1,086±11 |
| 33 | Speech-02-TurboMiniMax 1,084±12 |
| 34 | TTS-1OpenAI 1,083±11 |
| 35 | Chatterbox HDResemble AI 1,083±14 |
| 36 | Gemini 2.5 Flash Lite TTSGoogle 1,075±13 |
| 37 | Voxtral TTSMistral 1,075±14 |
| 38 | StudioGoogle 1,072±12 |
| 39 | Sonic 3Cartesia 1,070±12 |
| 40 | OpenAudio S1Fish Audio 1,068±12 |
| 41 | GPT-Realtime-2OpenAI 1,066±15 |
| 42 | Polly GenerativeAmazon 1,064±12 |
| 43 | SIMBA 1.6SpeechifyAI 1,064±14 |
| 44 | MiMo-V2.5-TTSXiaomi 1,064±14 |
| 45 | T2A-01-HDMiniMax 1,061±12 |
| 46 | Magpie-Multilingual 357M (Feb 2026)NVIDIA 1,060±14 |
| 47 | Kokoro 82M v1.0Kokoro 1,057±11 |
| 48 | Octave 2Hume AI 1,056±13 |
| 49 | Speech 2.6Hithink 1,055±15 |
| 50 | Chirp 3: HDGoogle 1,054±12 |
| 51 | Maya 2 GlobalMaya Research 1,048±17 |
| 52 | Polly Long-FormAmazon 1,047±14 |
| 53 | Async Flash v1.0async 1,046±12 |
| 54 | Maya1Maya Research 1,046±12 |
| 55 | OpenAudio S1 MiniFish Audio 1,045±20 |
| 56 | JourneyGoogle 1,043±14 |
| 57 | CodaRime 1,042±14 |
| 58 | Sonic English (Oct 2024)Cartesia 1,038±12 |
| 59 | Gemini 2.5 Flash TTS (Dec 2025)Google 1,037±13 |
| 60 | SIMBA 1.0SpeechifyAI 1,035±12 |
| 61 | Gemini 2.5 Pro (Dec 2025)Google 1,035±13 |
| 62 | MAI-Voice-1Microsoft 1,029±14 |
| 63 | Azure NeuralMicrosoft 1,027±19 |
| 64 | Octave TTSHume AI 1,025±12 |
| 65 | Lightning v3.1Smallest.ai 1,025±14 |
| 66 | T2A-01-TurboMiniMax 1,022±12 |
| 67 | MiMo-V2-TTSXiaomi 1,017±15 |
| 68 | ChatterboxResemble AI 1,013±12 |
| 69 | Magpie-Multilingual 357MNVIDIA 1,005±12 |
| 70 | Arcana v3Rime 1,003±14 |
| 71 | Zonos-v0.1Zyphra 1,000±0 |
| 72 | Murf Speech Gen 2Murf AI 972±12 |
| 73 | LMNTLMNT 970±13 |
| 74 | VibeVoice 1.5BMicrosoft 966±14 |
| 75 | VibeVoice 7BMicrosoft 957±14 |
| 76 | OpenVoice v2OpenVoice 956±14 |
| 77 | Magpie MultilingualNVIDIA 940±15 |
| 78 | Neuphonic TTSNeuphonic 934±14 |
| 79 | Qwen3 TTS FlashAlibaba 931±15 |
| 80 | Qwen3 TTSAlibaba 917±14 |
| 81 | XTTS v2Coqui 916±15 |
| 82 | WaveNetGoogle 902±12 |
| 83 | StyleTTS 2StyleTTS 890±16 |
| 84 | Mist V2Rime 885±15 |
| 85 | Neural2Google 883±12 |
| 86 | Polly NeuralAmazon 881±14 |
| 87 | StandardGoogle 876±12 |
| 88 | Falcon (Beta)Murf AI 857±15 |
| 89 | Noiz TTSNoiz 853±17 |
| 90 | MetaVoice v1MetaVoice 835±18 |
| 91 | Polly StandardAmazon 810±16 |
BBA 分数 Top 10
共 31 个模型
1Qwen3.5 Omni Plus Realtime
0.99
2Step-Audio R1.1 (Realtime)
0.98
3Fun-Realtime-Audiochat
0.98
4Gemini 3.1 Flash Audio Preview (Mar 2026) - High
0.97
5Grok Voice Think Fast 1.0
0.97
6GPT-Realtime-2 High
0.97
7Grok Voice Agent
0.93
8GPT-Realtime-2 Medium
0.93
9Gemini 2.5 Flash Native Audio Dialog Thinking
0.91
10Nova 2.0 Sonic
0.88
31 / 31 结果
| # | ||||
|---|---|---|---|---|
| 1 | Qwen3.5 Omni Plus RealtimeAlibaba | 0.99 | — | — |
| 2 | Step-Audio R1.1 (Realtime)StepFun | 0.98 | — | — |
| 3 | Fun-Realtime-AudiochatAlibaba | 0.98 | 0.98 | — |
| 4 | Gemini 3.1 Flash Audio Preview (Mar 2026) - HighGoogle | 0.97 | — | 0.38 |
| 5 | Grok Voice Think Fast 1.0SpaceXAI | 0.97 | 0.78 | 0.52 |
| 6 | GPT-Realtime-2 HighOpenAI | 0.97 | 0.95 | 0.4 |
| 7 | Grok Voice AgentSpaceXAI | 0.93 | 0.72 | 0.27 |
| 8 | GPT-Realtime-2 MediumOpenAI | 0.93 | 0.95 | 0.37 |
| 9 | Gemini 2.5 Flash Native Audio Dialog ThinkingGoogle | 0.91 | — | — |
| 10 | Nova 2.0 SonicAmazon | 0.88 | — | — |
| 11 | Deepslate OpalDeepslate | 0.85 | 0.86 | 0.18 |
| 12 | GPT Realtime (Aug 2025)OpenAI | 0.83 | 0.94 | 0.3 |
| 13 | GPT-Realtime-1.5OpenAI | 0.81 | 0.96 | 0.39 |
| 14 | GPT-Realtime-2 MinimalOpenAI | 0.72 | 0.96 | 0.31 |
| 15 | Gemini 3.1 Flash Audio Preview (Mar 2026) - MinimalGoogle | 0.71 | — | 0.26 |
| 16 | Gemini 2.5 Flash Native Audio DialogGoogle | 0.69 | — | — |
| 17 | GPT-4o mini Realtime (Dec '24)OpenAI | 0.69 | — | — |
| 18 | GPT Realtime Mini (Oct 2025)OpenAI | 0.64 | 0.96 | 0.15 |
| 19 | Qwen3.5 Omni Flash RealtimeAlibaba | 0.59 | — | — |
| 20 | Qwen3 Omni 30B A3B InstructAlibaba | 0.59 | 0.73 | — |
| 21 | Qwen3 Omni 30B A3B Instruct (Realtime)Alibaba | 0.57 | — | — |
| 22 | GPT 4o audio chatcompletionsOpenAI | 0.54 | — | — |
| 23 | Freeze-OmniVITA-MLLM | 0.33 | 0.59 | — |
| 24 | Nemotron 3 VoiceChat (V1)NVIDIA | 0.27 | 0.53 | — |
| 25 | PersonaPlexNVIDIA | 0.19 | 0.91 | — |
| 26 | FLM-AudioCofe AI | 0.16 | 0.62 | — |
| 27 | MoshiKyutai | 0.04 | 0.61 | — |
| 28 | GPT-5 (ChatGPT)OpenAI | — | — | — |
| 29 | Gemini 2.5 Flash Native Audio Preview (Sep 2025)Google | — | 0.3 | — |
| 30 | Gemini 2.5 Flash Native Audio Preview (Dec 2025)Google | — | 0.44 | 0.23 |
| 31 | GPT-4o Realtime (Dec 2024)OpenAI | — | 0.9 | 0.28 |
AA WER 指数(越低越好)
词错误率综合指数
1Cloud Speech-To-Text (Chirp), Google
0.3
2Gemini 2.5 Flash, Google
0.1
3Nova 2 Omni, Amazon
0.1
4Gemini 2.5 Lite, Google
0.1
5Speechmatics Standard
0.1
6Parakeet RNNT 1.1B, NVIDIA
0.1
7Parakeet TDT 0.6B V2, NVIDIA
0.1
8Gemma 4 12B, Google
0.1
9Gradium Speech-to-Text
0.1
10Nova-3, Deepgram
0.1
60 / 60 结果
| # | |
|---|---|
| 1 | GPT-4o Mini Transcribe, OpenAIOpenAI 0 |
| 2 | Speechmatics EnhancedSpeechmatics 0 |
| 3 | Voxtral Small, MistralMistral 0 |
| 4 | Solaria-1, GladiaGladia 0 |
| 5 | GPT-4o Transcribe, OpenAIOpenAI 0 |
| 6 | Smallest AI Pulse ProSmallest.ai 0 |
| 7 | Gemini 3 Flash (High), GoogleGoogle 0 |
| 8 | Nova 2 Pro, AmazonAmazon 0 |
| 9 | Gemini 2.0 Flash Lite, GoogleGoogle 0 |
| 10 | Fun-Realtime-ASR-previewAlibaba 0 |
| 11 | Chirp 3, GoogleGoogle 0 |
| 12 | Whisper Large v2, OpenAIOpenAI 0 |
| 13 | Universal, AssemblyAIAssemblyAI 0 |
| 14 | Gemini 3.1 Pro Preview (High)Google 0 |
| 15 | Gemini 3.1 Flash-Lite Preview (Minimal)Google 0 |
| 16 | Qwen3.5 Omni PlusAlibaba 0 |
| 17 | MAI-Transcribe-1Microsoft 0 |
| 18 | Soniox V4Soniox 0 |
| 19 | Gemini 2.5 Pro, GoogleGoogle 0 |
| 20 | Gemini 3.1 Pro Preview (Low)Google 0 |
| 21 | Voxtral Mini Transcribe 2, MistralMistral 0 |
| 22 | Scribe v2, ElevenLabsElevenLabs 0 |
| 23 | Universal-3 Pro, AssemblyAIAssemblyAI 0 |
| 24 | Whisper Large v3 Turbo, OpenAIOpenAI 0 |
| 25 | Cohere TranscribeCohere 0 |
| 26 | Smallest AI PulseSmallest.ai 0 |
| 27 | LLM Speech, AzureMicrosoft 0 |
| 28 | Modulate STT Batch English VFastModulate 0 |
| 29 | MAI-Transcribe-1.5Microsoft 0 |
| 30 | Universal-3.5 Pro, AssemblyAIAssemblyAI 0 |
| 31 | Grok Speech to Text, SpaceXAISpaceXAI 0 |
| 32 | MeliaSpeechmatics 0 |
| 33 | Resonant-1Reson8 0 |
| 34 | Canary Qwen 2.5B, NVIDIANVIDIA 0 |
| 35 | Solaria-3, GladiaGladia 0 |
| 36 | Amazon TranscribeAmazon 0 |
| 37 | Inkling (256K), Thinking MachinesThinking Machines 0 |
| 38 | Soniox v5 AsyncSoniox 0 |
| 39 | Whisper Large v3, OpenAIOpenAI 0 |
| 40 | Gemini 2.5 Flash, GoogleGoogle 0.1 |
| 41 | Nova 2 Omni, AmazonAmazon 0.1 |
| 42 | Gemini 2.5 Lite, GoogleGoogle 0.1 |
| 43 | Speechmatics StandardSpeechmatics 0.1 |
| 44 | Parakeet RNNT 1.1B, NVIDIANVIDIA 0.1 |
| 45 | Parakeet TDT 0.6B V2, NVIDIANVIDIA 0.1 |
| 46 | Gemma 4 12B, GoogleGoogle 0.1 |
| 47 | Gradium Speech-to-TextGradium 0.1 |
| 48 | Nova-3, DeepgramDeepgram 0.1 |
| 49 | Qwen3.5 Omni FlashAlibaba 0.1 |
| 50 | Chirp 2, GoogleGoogle 0.1 |
| 51 | Rev AIRev AI 0.1 |
| 52 | Qwen3 ASR Flash, AlibabaAlibaba 0.1 |
| 53 | Cloud Speech-To-Text (Chirp), GoogleGoogle 0.3 |
| 54 | WhisperXOpenAI — |
| 55 | Qwen3 ASR 1.7BAlibaba — |
| 56 | Gemini 3.1 Flash-Lite Preview (High)Google — |
| 57 | Qwen3 ASR 0.6BAlibaba — |
| 58 | Qwen3 Omni, AlibabaAlibaba — |
| 59 | Gemini 3 Flash (Minimal), GoogleGoogle — |
| 60 | Gemini 2.5 Pro (Low Budget Reasoning), GoogleGoogle — |
语音转写按 AA WER 指数升序(错误率越低越好)。语音对话使用 BBA / FDB / τ-Voice 分数,而非 Elo。