Label: leaderboard-parity new models (default voice) — for merge into windows-default
5 prompt(s) · one section per prompt · all models ranked by warm TTFA (fastest first) within each
Each prompt section shows every model's audio output, ordered by warm TTFA (fastest first). Click any audio player to hear that model's rendering.
Prompt 1
[en]"Open the browser and read my email."
Rank
Model
Device
TTFA warm
Audio
1
StyleTTS 2
cpu
168ms
2
StyleTTS 2
cuda
175ms
3
Fish Speech 1.5
cuda
3.06s
4
Zonos v0.1
cuda
3.50s
5
Maya1
cuda
4.75s
6
VibeVoice 7B
cuda
7.64s
7
Fish Speech 1.5
cpu
15.07s
8
Zonos v0.1
cpu
19.96s
9
Maya1
cpu
49.55s
Prompt 2
[en]"I'll start a new git branch, push the changes, and open a pull request when the tests pass."
Rank
Model
Device
TTFA warm
Audio
1
StyleTTS 2
cuda
188ms
2
StyleTTS 2
cpu
198ms
3
VibeVoice 7B
cuda
3.78s
4
Fish Speech 1.5
cuda
7.07s
5
Zonos v0.1
cuda
7.78s
6
Maya1
cuda
10.54s
7
Fish Speech 1.5
cpu
31.14s
8
Zonos v0.1
cpu
45.49s
9
Maya1
cpu
97.77s
Prompt 3
[en]"The Parakeet TDT zero point six billion parameter model achieves one point six nine percent word error rate on LibriSpeech test-clean, beating Whisper Large V3 at two point seven percent while running at over two thousand times realtime on a single GPU."
Rank
Model
Device
TTFA warm
Audio
1
StyleTTS 2
cpu
328ms
2
StyleTTS 2
cuda
374ms
3
VibeVoice 7B
cuda
8.77s
4
Fish Speech 1.5
cuda
17.39s
5
Zonos v0.1
cuda
25.58s
6
Maya1
cuda
29.31s
7
Fish Speech 1.5
cpu
96.22s
8
Zonos v0.1
cpu
156.70s
Prompt 4
[en]"Run pytest tests slash test underscore voice dot py with verbose flag and capture flag set to no."
Rank
Model
Device
TTFA warm
Audio
1
StyleTTS 2
cpu
309ms
2
StyleTTS 2
cuda
323ms
3
VibeVoice 7B
cuda
4.48s
4
Fish Speech 1.5
cuda
6.90s
5
Zonos v0.1
cuda
9.44s
6
Maya1
cuda
14.58s
7
Fish Speech 1.5
cpu
42.69s
8
Zonos v0.1
cpu
49.69s
Prompt 5
[fr]"Bonjour, je m'appelle Cicero et je vais vous aider avec votre code aujourd'hui."