chris_hemsworth_15s, higher better); Health = deterministic defect triage of the published clip (β flags long internal silence / clipping / dead audio β a "go listen" cue, not a score). Switch Default / Cloning below; click any header to re-sort. Each score is the mean over the exact clips shown on Listen. Human votes are the preference ground truth; these objective metrics are backstops.| Model | Size | Released | UTMOS β | WER β | Health |
|---|---|---|---|---|---|
| Audio8 TTS 0.6B (compiled) | 601M | Aug 2026 | 4.153 | 0.034 | β |
| Audio8 TTS Preview 0.1B | 170M | Aug 2026 | 4.191 | 0.045 | β |
| Audio8 TTS Preview 0.6B | 601M | Jul 2026 | 4.238 | 0.045 | β |
| Chatterbox | 1.2B | Apr 2025 | 4.423 | 0.061 | β |
| Chatterbox Turbo | 744M | Dec 2025 | 4.274 | 0.074 | β |
| Coqui XTTS-v2 | 750M | Oct 2023 | 4.056 | 0.065 | β |
| Dia 1.6B-0626 | 1.6B | Jun 2025 | 2.387 | 0.317 | β |
| dots.tts (soar) | 2B | Jun 2026 | 3.227 | 0.059 | β |
| DramaBox | 3.3B | Apr 2026 | 4.304 | 0.093 | β |
| Higgs Audio v3 TTS | 4B | Jun 2026 | 4.372 | 0.065 | β |
| Inflect-Micro v2 | 9.36M | Jul 2026 | 4.389 | 0.030 | β |
| Inflect-Nano v2 | 3.96M | Jul 2026 | 4.354 | 0.059 | β |
| KittenTTS Nano 0.1 | <100M | Aug 2025 | 3.665 | 0.093 | β |
| Kokoro | 82M | Dec 2024 | 4.302 | 0.065 | β |
| LFM2.5-Audio 1.5B | 1.5B | Dec 2025 | 4.383 | 0.066 | β |
| LongCat-AudioDiT 1B | 1.42B | Mar 2026 | 4.053 | 0.093 | β |
| LongCat-AudioDiT 3.5B | 3.83B | Mar 2026 | 4.341 | 0.080 | β |
| Magpie-TTS | 357M | Dec 2025 | 4.199 | 0.087 | β |
| Mars5-TTS | 1.2B | Jun 2024 | 3.540 | 0.361 | β |
| Maya1 | 3B | Oct 2025 | 4.487 | 0.066 | β |
| MeloTTS | ~52M | Feb 2024 | 3.498 | 0.058 | β |
| MiraTTS | 0.5B | Dec 2025 | 3.803 | 0.100 | β |
| Miso TTS 8B | 8.2B | May 2026 | 4.232 | 0.586 | β |
| OmniVoice | ~1B | Mar 2026 | 4.104 | 0.040 | β |
| Orpheus-TTS 3B | 3.3B | Mar 2025 | 4.005 | 0.102 | β |
| OuteTTS 1.0 1B | 1B | Apr 2025 | 4.386 | 0.070 | β |
| Parler-TTS Mini v1 | 878M | Jun 2024 | 3.757 | 0.149 | β gap (3) |
| Piper | ~25MB | Jan 2023 | 4.077 | 0.066 | β |
| Qwen3-TTS 0.6B CustomVoice | 0.6B | Jan 2026 | 4.268 | 0.110 | β |
| sanoTTS Amy | 1.46M | Jul 2026 | 3.821 | 0.067 | β |
| sanoTTS Heart-Nano | 294K | Sep 2026 | 2.154 | 0.019 | β |
| Scylla's Band | ~103M | Jul 2026 | 4.444 | 0.081 | β |
| Sesame CSM-1B | 1B | Mar 2025 | 4.152 | 0.114 | β |
| Soprano 1.1 80M | 80M | Jan 2026 | 4.116 | 0.059 | β |
| StyleTTS 2 | ~148M | Jun 2023 | 4.259 | 0.158 | β |
| Supertonic 3 | 99M | May 2026 | 4.195 | 0.065 | β |
| Vaniq-Edge | 8.91M | Aug 2026 | 4.229 | 0.115 | β |
| VibeVoice Realtime 0.5B | 0.5B | Dec 2025 | 4.043 | 0.148 | β |
| VoxCPM2 2B | 2B | Apr 2026 | 3.480 | 0.023 | β |
| Voxtral 4B TTS | 4B | Nov 2025 | 3.692 | 0.081 | β |
utmos22_strong (SpeechMOS), SIM canonical UniSpeech-SAT wavlm_large_finetune, WER Whisper-large-v3. Method follows seed-tts-eval. Human votes are the preference ground truth; these are objective backstops.