click any column header to sort

TTS Bench — Samples — linux-cloning

Rig: linux-3090 — AMD Ryzen 9 5900XT 16-Core Processor · NVIDIA GeForce RTX 3090 24GB · 63 GB RAM · Linux 6.8.0-117-generic
Label: cloning · chris_hemsworth voice (note: metavoice uses the 67s clip — it needs ≥30s ref — all other models use the 15s clip)
5 prompt(s) · one section per prompt · all models ranked by warm TTFA (fastest first) within each
Each prompt section shows every model's audio output, ordered by warm TTFA (fastest first). Click any audio player to hear that model's rendering.

Prompt 1

[en]"Open the browser and read my email."
Rank Model Device TTFA warm Audio
1 Pocket-TTS cpu 81ms
2 Sopro V2 Turbo (streaming) cuda 85ms
3 StyleTTS 2 cpu 142ms
4 StyleTTS 2 cuda 145ms
5 LuxTTS cuda 195ms
6 Sopro V2 Turbo cuda 201ms
7 OpenVoice v2 cuda 254ms
8 Breeze TTS 2 cuda 313ms
9 Audio8 TTS 0.6B (compiled) cuda 350ms
10 NeuTTS Nano cuda 359ms
11 NeuTTS Nano cpu 418ms
12 NeuTTS Air cuda 432ms
13 MiraTTS cuda 453ms
14 Coqui XTTS-v2 cuda 475ms
15 MioTTS 0.1B cuda 518ms
16 NeuTTS Air cpu 559ms
17 Chatterbox Turbo cuda 631ms
18 Qwen3-TTS 1.7B (CUDA-graph) cuda 767ms
19 Sopro V2 Turbo (streaming) cpu 767ms
20 Higgs Audio v3 TTS cuda 856ms
21 CosyVoice 3 0.5B cuda 985ms
22 OpenVoice v2 cpu 988ms
23 Zonos2 cuda 1.10s
24 LongCat-AudioDiT 1B cuda 1.12s
25 Chatterbox cuda 1.13s
26 OmniVoice cuda 1.14s
27 F5-TTS v1 cuda 1.14s
28 VoxCPM2 2B cuda 1.22s
29 LuxTTS cpu 1.29s
30 Dia 1.6B-0626 cuda 1.29s
31 Sopro V2 Turbo cpu 1.49s
32 MioTTS 0.6B cuda 1.93s
33 Fish Speech 1.5 cuda 1.93s
34 MOSS-TTS-Nano cuda 1.97s
35 MOSS-TTS v1.5 cuda 2.19s
36 MOSS-TTS v1.0 cuda 2.25s
37 Zonos v0.1 cuda 2.34s
38 MetaVoice-1B cuda 2.51s
39 IndexTTS-2 cpu 2.80s
40 Audio8 TTS Preview 0.1B cuda 2.97s
41 LongCat-AudioDiT 3.5B cuda 3.03s
42 IndexTTS-2 cuda 3.09s
43 Step-Audio-EditX cuda 3.10s
44 Coqui XTTS-v2 cpu 3.15s
45 Audio8 TTS Preview 0.6B cuda 3.24s
46 Sesame CSM-1B cuda 3.34s
47 dots.tts (soar) cuda 3.49s
48 MOSS-TTS-Nano cpu 3.52s
49 Chatterbox Turbo cpu 3.91s
50 VibeVoice 7B cuda 4.00s
51 WavTTS 0.67B cuda 4.33s
52 Echo-TTS cuda 4.34s
53 OuteTTS 1.0 1B cuda 4.67s
54 Miso TTS 8B cuda 4.86s
55 ZipVoice 123M cpu 6.97s
56 Chatterbox cpu 8.01s
57 DramaBox cuda 9.77s
58 Fish Speech S2-Pro cuda 10.52s
59 VoxCPM2 2B cpu 14.19s
60 Audio8 TTS Preview 0.1B cpu 15.38s
61 Zonos v0.1 cpu 18.48s
62 Audio8 TTS Preview 0.6B cpu 19.12s
63 Fish Speech 1.5 cpu 19.19s
64 Sesame CSM-1B cpu 27.72s
65 OmniVoice cpu 35.63s
66 F5-TTS v1 cpu 45.27s
67 Mars5-TTS cpu 68.86s
68 Mars5-TTS cuda 70.40s

Prompt 2

[en]"I'll start a new git branch, push the changes, and open a pull request when the tests pass."
Rank Model Device TTFA warm Audio
1 Sopro V2 Turbo (streaming) cuda 102ms
2 Pocket-TTS cpu 110ms
3 StyleTTS 2 cuda 197ms
4 StyleTTS 2 cpu 205ms
5 LuxTTS cuda 219ms
6 OpenVoice v2 cuda 272ms
7 Breeze TTS 2 cuda 302ms
8 Sopro V2 Turbo cuda 341ms
9 NeuTTS Nano cuda 343ms
10 NeuTTS Nano cpu 378ms
11 NeuTTS Air cuda 426ms
12 Sopro V2 Turbo (streaming) cpu 516ms
13 MioTTS 0.6B cuda 588ms
14 NeuTTS Air cpu 598ms
15 MioTTS 0.1B cuda 737ms
16 Audio8 TTS 0.6B (compiled) cuda 806ms
17 MiraTTS cuda 814ms
18 Coqui XTTS-v2 cuda 998ms
19 Chatterbox Turbo cuda 1.17s
20 LongCat-AudioDiT 1B cuda 1.20s
21 OmniVoice cuda 1.35s
22 F5-TTS v1 cuda 1.50s
23 Higgs Audio v3 TTS cuda 1.76s
24 LuxTTS cpu 2.08s
25 Chatterbox cuda 2.21s
26 OpenVoice v2 cpu 2.22s
27 Sopro V2 Turbo cpu 2.26s
28 MOSS-TTS-Nano cuda 2.27s
29 VoxCPM2 2B cuda 2.38s
30 Zonos2 cuda 2.44s
31 MOSS-TTS v1.0 cuda 3.14s
32 MOSS-TTS v1.5 cuda 3.19s
33 LongCat-AudioDiT 3.5B cuda 3.24s
34 CosyVoice 3 0.5B cuda 3.58s
35 IndexTTS-2 cpu 4.25s
36 Echo-TTS cuda 4.32s
37 IndexTTS-2 cuda 4.62s
38 Step-Audio-EditX cuda 4.62s
39 WavTTS 0.67B cuda 5.22s
40 MetaVoice-1B cuda 5.34s
41 MOSS-TTS-Nano cpu 5.40s
42 Fish Speech 1.5 cuda 5.62s
43 Zonos v0.1 cuda 5.65s
44 Audio8 TTS Preview 0.1B cuda 5.84s
45 Sesame CSM-1B cuda 6.49s
46 Audio8 TTS Preview 0.6B cuda 6.71s
47 Coqui XTTS-v2 cpu 6.81s
48 Chatterbox Turbo cpu 7.40s
49 Dia 1.6B-0626 cuda 7.86s
50 VibeVoice 7B cuda 7.98s
51 dots.tts (soar) cuda 8.43s
52 DramaBox cuda 10.81s
53 OuteTTS 1.0 1B cuda 11.19s
54 ZipVoice 123M cpu 13.29s
55 Chatterbox cpu 14.36s
56 Miso TTS 8B cuda 19.99s
57 Audio8 TTS Preview 0.1B cpu 24.47s
58 VoxCPM2 2B cpu 26.35s
59 Fish Speech S2-Pro cuda 27.16s
60 Sesame CSM-1B cpu 38.09s
61 Audio8 TTS Preview 0.6B cpu 38.09s
62 OmniVoice cpu 44.05s
63 Qwen3-TTS 1.7B (CUDA-graph) cuda 45.49s
64 Zonos v0.1 cpu 45.50s
65 F5-TTS v1 cpu 57.96s
66 Fish Speech 1.5 cpu 61.64s
67 Mars5-TTS cpu 72.55s
68 Mars5-TTS cuda 80.29s

Prompt 3

[en]"The Parakeet TDT zero point six billion parameter model achieves one point six nine percent word error rate on LibriSpeech test-clean, beating Whisper Large V3 at two point seven percent while running at over two thousand times realtime on a single GPU."
Rank Model Device TTFA warm Audio
1 Sopro V2 Turbo (streaming) cuda 86ms
2 Pocket-TTS cpu 135ms
3 Breeze TTS 2 cuda 293ms
4 LuxTTS cuda 332ms
5 NeuTTS Nano cuda 373ms
6 StyleTTS 2 cpu 412ms
7 StyleTTS 2 cuda 415ms
8 NeuTTS Nano cpu 449ms
9 NeuTTS Air cuda 531ms
10 Sopro V2 Turbo (streaming) cpu 534ms
11 OpenVoice v2 cuda 549ms
12 NeuTTS Air cpu 594ms
13 Sopro V2 Turbo cuda 1.11s
14 LongCat-AudioDiT 1B cuda 1.63s
15 MioTTS 0.6B cuda 1.77s
16 Audio8 TTS 0.6B (compiled) cuda 2.06s
17 MioTTS 0.1B cuda 2.09s
18 OmniVoice cuda 2.23s
19 MiraTTS cuda 2.32s
20 F5-TTS v1 cuda 3.14s
21 Chatterbox Turbo cuda 3.32s
22 Coqui XTTS-v2 cuda 3.65s
23 Qwen3-TTS 1.7B (CUDA-graph) cuda 3.85s
24 Echo-TTS cuda 4.34s
25 Higgs Audio v3 TTS cuda 4.77s
26 LongCat-AudioDiT 3.5B cuda 5.50s
27 LuxTTS cpu 5.76s
28 CosyVoice 3 0.5B cuda 5.98s
29 Chatterbox cuda 6.05s
30 MOSS-TTS-Nano cuda 6.81s
31 Zonos2 cuda 6.90s
32 Sopro V2 Turbo cpu 7.11s
33 MOSS-TTS v1.5 cuda 7.32s
34 VoxCPM2 2B cuda 7.42s
35 OpenVoice v2 cpu 7.54s
36 MOSS-TTS v1.0 cuda 7.68s
37 Step-Audio-EditX cuda 9.99s
38 WavTTS 0.67B cuda 11.39s
39 IndexTTS-2 cpu 11.39s
40 IndexTTS-2 cuda 12.24s
41 Sesame CSM-1B cuda 13.52s
42 MOSS-TTS-Nano cpu 14.54s
43 MetaVoice-1B cuda 14.56s
44 DramaBox cuda 14.62s
45 Fish Speech 1.5 cuda 15.11s
46 Zonos v0.1 cuda 17.67s
47 Audio8 TTS Preview 0.1B cuda 17.72s
48 Audio8 TTS Preview 0.6B cuda 19.98s
49 Chatterbox Turbo cpu 21.26s
50 Dia 1.6B-0626 cuda 21.73s
51 VibeVoice 7B cuda 24.87s
52 Coqui XTTS-v2 cpu 25.42s
53 OuteTTS 1.0 1B cuda 30.19s
54 dots.tts (soar) cuda 36.35s
55 Chatterbox cpu 42.09s
56 Audio8 TTS Preview 0.1B cpu 58.99s
57 VoxCPM2 2B cpu 67.86s
58 OmniVoice cpu 69.74s
59 Sesame CSM-1B cpu 80.94s
60 Fish Speech S2-Pro cuda 81.01s
61 Miso TTS 8B cuda 84.98s
62 Mars5-TTS cuda 104.33s
63 Audio8 TTS Preview 0.6B cpu 105.93s
64 Mars5-TTS cpu 111.83s
65 F5-TTS v1 cpu 141.44s
66 Fish Speech 1.5 cpu 143.99s
67 Zonos v0.1 cpu 164.17s

Prompt 4

[en]"Run pytest tests slash test underscore voice dot py with verbose flag and capture flag set to no."
Rank Model Device TTFA warm Audio
1 Sopro V2 Turbo (streaming) cuda 86ms
2 Pocket-TTS cpu 108ms
3 LuxTTS cuda 220ms
4 StyleTTS 2 cuda 254ms
5 StyleTTS 2 cpu 264ms
6 Breeze TTS 2 cuda 312ms
7 NeuTTS Nano cuda 366ms
8 OpenVoice v2 cuda 384ms
9 NeuTTS Nano cpu 428ms
10 Sopro V2 Turbo cuda 487ms
11 Sopro V2 Turbo (streaming) cpu 509ms
12 NeuTTS Air cuda 523ms
13 NeuTTS Air cpu 597ms
14 MioTTS 0.6B cuda 848ms
15 MioTTS 0.1B cuda 882ms
16 Audio8 TTS 0.6B (compiled) cuda 989ms
17 Chatterbox Turbo cuda 1.32s
18 MiraTTS cuda 1.35s
19 OmniVoice cuda 1.40s
20 LongCat-AudioDiT 1B cuda 1.41s
21 F5-TTS v1 cuda 1.56s
22 Coqui XTTS-v2 cuda 1.70s
23 LuxTTS cpu 2.24s
24 Higgs Audio v3 TTS cuda 2.52s
25 OpenVoice v2 cpu 2.63s
26 MOSS-TTS-Nano cuda 2.99s
27 Chatterbox cuda 3.04s
28 CosyVoice 3 0.5B cuda 3.07s
29 VoxCPM2 2B cuda 3.10s
30 Zonos2 cuda 3.16s
31 Sopro V2 Turbo cpu 3.17s
32 MOSS-TTS v1.0 cuda 3.43s
33 LongCat-AudioDiT 3.5B cuda 3.91s
34 MOSS-TTS v1.5 cuda 3.92s
35 Echo-TTS cuda 4.34s
36 IndexTTS-2 cpu 5.00s
37 Fish Speech 1.5 cuda 5.13s
38 WavTTS 0.67B cuda 5.34s
39 Step-Audio-EditX cuda 5.58s
40 MOSS-TTS-Nano cpu 5.89s
41 IndexTTS-2 cuda 6.00s
42 Zonos v0.1 cuda 6.11s
43 MetaVoice-1B cuda 7.53s
44 Audio8 TTS Preview 0.1B cuda 8.36s
45 Chatterbox Turbo cpu 8.85s
46 Dia 1.6B-0626 cuda 8.86s
47 Coqui XTTS-v2 cpu 8.87s
48 Audio8 TTS Preview 0.6B cuda 9.33s
49 Sesame CSM-1B cuda 9.56s
50 DramaBox cuda 10.95s
51 VibeVoice 7B cuda 11.79s
52 OuteTTS 1.0 1B cuda 12.30s
53 dots.tts (soar) cuda 12.70s
54 ZipVoice 123M cpu 15.77s
55 Miso TTS 8B cuda 17.72s
56 Chatterbox cpu 18.60s
57 Audio8 TTS Preview 0.1B cpu 29.91s
58 VoxCPM2 2B cpu 37.91s
59 OmniVoice cpu 45.42s
60 Qwen3-TTS 1.7B (CUDA-graph) cuda 45.62s
61 Audio8 TTS Preview 0.6B cpu 50.49s
62 Zonos v0.1 cpu 50.77s
63 Fish Speech S2-Pro cuda 57.62s
64 Sesame CSM-1B cpu 58.88s
65 F5-TTS v1 cpu 59.69s
66 Fish Speech 1.5 cpu 74.24s
67 Mars5-TTS cpu 90.10s
68 Mars5-TTS cuda 96.21s

Prompt 5

[fr]"Bonjour, je m'appelle Cicero et je vais vous aider avec votre code aujourd'hui."
Rank Model Device TTFA warm Audio
1 Sopro V2 Turbo (streaming) cuda 87ms
2 Sopro V2 Turbo cuda 293ms
3 Pocket-TTS cpu 320ms
4 NeuTTS Nano cuda 343ms
5 OpenVoice v2 cuda 352ms
6 NeuTTS Nano cpu 424ms
7 Sopro V2 Turbo (streaming) cpu 517ms
8 Audio8 TTS 0.6B (compiled) cuda 648ms
9 Coqui XTTS-v2 cuda 808ms
10 OmniVoice cuda 1.33s
11 VoxCPM2 2B cuda 1.37s
12 Qwen3-TTS 1.7B (CUDA-graph) cuda 1.41s
13 Higgs Audio v3 TTS cuda 1.42s
14 Sopro V2 Turbo cpu 1.57s
15 CosyVoice 3 0.5B cuda 2.05s
16 MOSS-TTS-Nano cuda 2.06s
17 OpenVoice v2 cpu 2.20s
18 MOSS-TTS v1.5 cuda 2.76s
19 MOSS-TTS v1.0 cuda 3.20s
20 dots.tts (soar) cuda 3.24s
21 Fish Speech 1.5 cuda 3.74s
22 MOSS-TTS-Nano cpu 3.79s
23 Zonos v0.1 cuda 3.97s
24 Audio8 TTS Preview 0.1B cuda 5.20s
25 Audio8 TTS Preview 0.6B cuda 5.83s
26 Coqui XTTS-v2 cpu 5.99s
27 OuteTTS 1.0 1B cuda 8.54s
28 ZipVoice 123M cpu 12.85s
29 VoxCPM2 2B cpu 18.72s
30 Audio8 TTS Preview 0.1B cpu 23.21s
31 Zonos v0.1 cpu 31.28s
32 Audio8 TTS Preview 0.6B cpu 31.52s
33 Fish Speech S2-Pro cuda 32.07s
34 OmniVoice cpu 42.37s
35 Fish Speech 1.5 cpu 61.05s