chris_hemsworth_15s, higher better); Health = deterministic defect triage of the published clip (β flags long internal silence / clipping / dead audio β a "go listen" cue, not a score). Switch Default / Cloning below; click any header to re-sort. Each score is the mean over the exact clips shown on Listen. Human votes are the preference ground truth; these objective metrics are backstops.| Model | Size | Released | UTMOS β | WER β | Health |
|---|---|---|---|---|---|
| Chatterbox | 1.2B | Apr 2025 | 4.423 | 0.061 | β |
| Chatterbox Turbo | 744M | Dec 2025 | 4.274 | 0.074 | β |
| Coqui XTTS-v2 | 750M | Oct 2023 | 4.056 | 0.065 | β |
| Dia 1.6B-0626 | 1.6B | Jun 2025 | 2.387 | 0.317 | β |
| dots.tts (soar) | 2B | Jun 2026 | 3.227 | 0.059 | β |
| DramaBox | 3.3B | Apr 2026 | 4.304 | 0.093 | β |
| F5-TTS v1 | 330M | Oct 2024 | 4.081 | 0.107 | β |
| Higgs Audio v3 TTS | 4B | Jun 2026 | 4.372 | 0.065 | β |
| IndexTTS-2 | 1.5B | Jun 2025 | 4.257 | 0.086 | β |
| KittenTTS Nano 0.1 | <100M | Aug 2025 | 3.665 | 0.093 | β |
| Kokoro | 82M | Dec 2024 | 4.302 | 0.065 | β |
| LFM2.5-Audio 1.5B | 1.5B | Dec 2025 | 4.383 | 0.066 | β |
| LongCat-AudioDiT 1B | 1.42B | Mar 2026 | 4.053 | 0.093 | β |
| LongCat-AudioDiT 3.5B | 3.83B | Mar 2026 | 4.341 | 0.080 | β |
| LuxTTS | 123M | Jan 2026 | 3.540 | 0.092 | β |
| Magpie-TTS | 357M | Dec 2025 | 4.199 | 0.087 | β |
| Mars5-TTS | 1.2B | Jun 2024 | 3.540 | 0.361 | β |
| Maya1 | 3B | Oct 2025 | 4.487 | 0.066 | β |
| MeloTTS | ~52M | Feb 2024 | 3.498 | 0.058 | β |
| MiraTTS | 0.5B | Dec 2025 | 3.803 | 0.100 | β |
| Miso TTS 8B | 8.2B | May 2026 | 4.232 | 0.586 | β |
| NeuTTS Air | 748M | Sep 2025 | 4.003 | 0.117 | β |
| NeuTTS Nano | 229M | Dec 2025 | 3.572 | 0.066 | β |
| OmniVoice | ~1B | Mar 2026 | 4.104 | 0.040 | β |
| Orpheus-TTS 3B | 3.3B | Mar 2025 | 4.005 | 0.102 | β |
| OuteTTS 1.0 1B | 1B | Apr 2025 | 4.386 | 0.070 | β |
| Parler-TTS Mini v1 | 878M | Jun 2024 | 3.757 | 0.149 | β gap (3) |
| Piper | ~25MB | Jan 2023 | 4.077 | 0.066 | β |
| Pocket-TTS | 100M | Jan 2026 | 4.097 | 0.054 | β |
| Qwen3-TTS 1.7B (CUDA-graph) | 1.7B | Jan 2026 | 4.323 | 0.065 | β |
| Qwen3-TTS 1.7B Base | 1.7B | Jan 2026 | 4.276 | 0.096 | β |
| Scylla's Band | ~103M | Jul 2026 | 4.444 | 0.081 | β |
| Sesame CSM-1B | 1B | Mar 2025 | 4.152 | 0.114 | β |
| Soprano 1.1 80M | 80M | Jan 2026 | 4.116 | 0.059 | β |
| Step-Audio-EditX | 3B | Oct 2025 | 4.399 | 0.044 | β |
| StyleTTS 2 | ~148M | Jun 2023 | 4.259 | 0.158 | β |
| Supertonic 3 | 99M | May 2026 | 4.195 | 0.065 | β |
| VibeVoice Realtime 0.5B | 0.5B | Dec 2025 | 4.043 | 0.148 | β |
| VoxCPM2 2B | 2B | Apr 2026 | 3.480 | 0.023 | β |
| Voxtral 4B TTS | 4B | Nov 2025 | 3.692 | 0.081 | β |
utmos22_strong (SpeechMOS), SIM canonical UniSpeech-SAT wavlm_large_finetune, WER Whisper-large-v3. Method follows seed-tts-eval. Human votes are the preference ground truth; these are objective backstops.