This commit is contained in:
Pascal
2026-05-31 17:49:31 +02:00
parent 08b79d1209
commit 8aba0f012a
32 changed files with 1010 additions and 1010 deletions
+25 -25
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -41,15 +41,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=40, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [40, 2048] first4: 0.022162 -0.009036 0.008171 -0.020198
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005331 0.008751 -0.004225 0.001141
[Debug] tts-pad-embed: [2048] first4: -0.005331 0.008751 -0.004225 0.001141
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005340 0.008744 -0.004225 0.001144
[Debug] tts-pad-embed: [2048] first4: -0.005340 0.008744 -0.004225 0.001144
[Debug] talker-hidden-prefill-l0: [40, 2048] first4: -0.461236 -0.069888 0.015923 -0.039241
[Debug] talker-hidden-prefill-l7: [40, 2048] first4: -1.533986 -0.008603 0.339766 1.792114
[Debug] talker-hidden-prefill-l14: [40, 2048] first4: -1.305678 0.188296 0.441046 1.758339
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -0.780654 0.169639 0.792474 1.128628
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 7.084507 -34.619846 -7.127215 28.750408
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.240913 -1.229361 -0.225207 0.891156
[Debug] talker-logits-prefill: [3072] first4: -4.125000 -6.406250 -1.015625 -3.218750
[Debug] talker-logits-prefill: [3072] first4: -4.250000 -6.406250 -1.007812 -3.234375
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -67,8 +67,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042911 -0.033715 -0.000281 0.188977
[Debug] talker-hidden-step1: [2048] first4: 1.721820 -2.524883 6.806560 0.705144
[Debug] next-emb-step0: [2048] first4: -0.042920 -0.033721 -0.000281 0.188979
[Debug] talker-hidden-step1: [2048] first4: 1.708929 -2.531821 6.804987 0.731748
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000016 0.000017
[Perf] PromptBuild 68.3 ms
[Perf] Prefill 10.7 ms (T_ctx prefill)
[Perf] TTFA 93.8 ms (first frame codes)
[Perf] TalkerDecode 237.2 ms (64 frames, 3.71 ms/frame)
[Perf] CodePredictor 466.0 ms (7.28 ms/frame)
[Perf] PromptBuild 43.5 ms
[Perf] Prefill 10.6 ms (T_ctx prefill)
[Perf] TTFA 76.9 ms (first frame codes)
[Perf] TalkerDecode 234.4 ms (64 frames, 3.66 ms/frame)
[Perf] CodePredictor 466.1 ms (7.28 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 57.7 ms
[Perf] Total 841.8 ms (64 frames, 11.00 ms/frame AR, audio 5.12 s, RTF 0.164)
[Perf] CodecDecode 50.1 ms
[Perf] Total 815.3 ms (64 frames, 10.96 ms/frame AR, audio 5.12 s, RTF 0.159)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999999 max: 8.5838e-04 mean: 3.6599e-05
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 0.999998 max: 3.7647e-02 mean: 2.7122e-04
[Cossim] L7 cos: 0.999995 max: 3.0321e+01 mean: 3.1394e-03
[Cossim] L14 cos: 0.999995 max: 3.0344e+01 mean: 5.0846e-03
[Cossim] L21 cos: 0.999995 max: 3.0316e+01 mean: 1.4271e-02
[Cossim] L27 cos: 0.999987 max: 3.3273e+01 mean: 8.4683e-02
[Cossim] Final cos: 0.999979 max: 6.6579e-01 mean: 5.2791e-03
[Cossim] Logits cos: 0.999960 max: 1.6273e-01 mean: 2.5387e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
[Cossim] TalkerHiddenStep1 cos: 0.999969 max: 9.8572e-02 mean: 1.4726e-02
[Cossim] Embed cos: 0.999999 max: 8.5838e-04 mean: 3.7402e-05
[Cossim] TrailingText cos: 1.000000 max: 3.5107e-05 mean: 2.5004e-06
[Cossim] TTSPadEmbed cos: 1.000000 max: 3.5107e-05 mean: 2.5004e-06
[Cossim] L0 cos: 0.999998 max: 3.7647e-02 mean: 2.7735e-04
[Cossim] L7 cos: 0.999995 max: 3.0321e+01 mean: 3.1378e-03
[Cossim] L14 cos: 0.999995 max: 3.0344e+01 mean: 5.0542e-03
[Cossim] L21 cos: 0.999995 max: 3.0316e+01 mean: 1.4086e-02
[Cossim] L27 cos: 0.999988 max: 3.3273e+01 mean: 8.2636e-02
[Cossim] Final cos: 0.999982 max: 5.2690e-01 mean: 5.0537e-03
[Cossim] Logits cos: 0.999992 max: 8.7725e-02 mean: 1.3164e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 3.5107e-05 mean: 2.5004e-06
[Cossim] TalkerHiddenStep1 cos: 0.999989 max: 5.4794e-02 mean: 9.0177e-03
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981072
[Cossim] WAV stft_cos: 0.988772 samples: 120960
+23 -23
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -49,7 +49,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -0.771866 0.171123 0.791460 1.111815
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 7.131226 -34.471634 -7.107933 28.674021
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.242833 -1.225767 -0.224904 0.890000
[Debug] talker-logits-prefill: [3072] first4: -4.249261 -6.401361 -1.000070 -3.238883
[Debug] talker-logits-prefill: [3072] first4: -4.248304 -6.401616 -0.999174 -3.239446
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -68,7 +68,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042911 -0.033715 -0.000281 0.188977
[Debug] talker-hidden-step1: [2048] first4: 1.686836 -2.523117 6.789655 0.738593
[Debug] talker-hidden-step1: [2048] first4: 1.686420 -2.523936 6.789628 0.738814
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000014 0.000016
[Perf] PromptBuild 60.7 ms
[Perf] Prefill 41.9 ms (T_ctx prefill)
[Perf] TTFA 155.9 ms (first frame codes)
[Perf] TalkerDecode 524.7 ms (64 frames, 8.20 ms/frame)
[Perf] CodePredictor 2730.7 ms (42.67 ms/frame)
[Perf] HostCompose 1.4 ms (c0 sample + next emb)
[Perf] CodecDecode 23.9 ms
[Perf] Total 3393.0 ms (64 frames, 50.89 ms/frame AR, audio 5.12 s, RTF 0.663)
[Perf] PromptBuild 27.1 ms
[Perf] Prefill 16.0 ms (T_ctx prefill)
[Perf] TTFA 53.7 ms (first frame codes)
[Perf] TalkerDecode 339.2 ms (64 frames, 5.30 ms/frame)
[Perf] CodePredictor 558.2 ms (8.72 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 20.2 ms
[Perf] Total 962.5 ms (64 frames, 14.04 ms/frame AR, audio 5.12 s, RTF 0.188)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.0431e-06 mean: 6.3183e-09
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 1.000000 max: 1.5564e-03 mean: 2.7918e-05
[Cossim] L7 cos: 1.000000 max: 6.8359e-02 mean: 1.0876e-04
[Cossim] L14 cos: 1.000000 max: 6.8848e-02 mean: 2.8019e-04
[Cossim] L21 cos: 1.000000 max: 7.0801e-02 mean: 9.3340e-04
[Cossim] L27 cos: 1.000000 max: 6.8030e-01 mean: 3.4462e-03
[Cossim] Final cos: 1.000000 max: 2.0235e-02 mean: 2.3836e-04
[Cossim] Logits cos: 1.000000 max: 1.8770e-02 mean: 2.5612e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.1272e-02 mean: 2.1148e-03
[Cossim] Embed cos: 1.000000 max: 1.1921e-07 mean: 4.6085e-09
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.1686e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.1686e-10
[Cossim] L0 cos: 1.000000 max: 1.5564e-03 mean: 2.7924e-05
[Cossim] L7 cos: 1.000000 max: 6.8359e-02 mean: 1.0849e-04
[Cossim] L14 cos: 1.000000 max: 6.8848e-02 mean: 2.8148e-04
[Cossim] L21 cos: 1.000000 max: 7.0801e-02 mean: 9.6293e-04
[Cossim] L27 cos: 1.000000 max: 1.4590e+00 mean: 3.9858e-03
[Cossim] Final cos: 1.000000 max: 2.0059e-02 mean: 2.4742e-04
[Cossim] Logits cos: 1.000000 max: 2.0794e-02 mean: 2.7992e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.2131e-10
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.1174e-02 mean: 2.0668e-03
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981624
[Cossim] WAV stft_cos: 0.989090 samples: 120960
+37 -37
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -41,15 +41,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=40, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [40, 2048] first4: 0.022053 -0.009240 0.008445 -0.019765
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] tts-pad-embed: [2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005412 0.008948 -0.004431 0.000663
[Debug] tts-pad-embed: [2048] first4: -0.005412 0.008948 -0.004431 0.000663
[Debug] talker-hidden-prefill-l0: [40, 2048] first4: -0.446298 -0.062077 0.007342 0.016826
[Debug] talker-hidden-prefill-l7: [40, 2048] first4: -9.013122 0.694596 0.439074 -0.090637
[Debug] talker-hidden-prefill-l14: [40, 2048] first4: -8.952490 1.042737 0.532324 -0.017739
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -8.755134 1.538783 1.103777 -0.622322
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 3.939303 -31.900080 -6.996501 22.184322
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.133724 -1.130800 -0.220690 0.686429
[Debug] talker-logits-prefill: [3072] first4: -7.149320 -5.010015 0.449039 -1.997734
[Debug] talker-logits-prefill: [3072] first4: -6.849827 -5.020791 0.270491 -1.903765
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=412 u=-1.0000000000 subseq=2
@@ -67,24 +67,24 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 412.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.000769 -0.046681 -0.010753 0.124454
[Debug] talker-hidden-step1: [2048] first4: 2.836347 -2.839039 6.639005 -0.895034
[Debug] next-emb-step0: [2048] first4: -0.000793 -0.046660 -0.010769 0.124437
[Debug] talker-hidden-step1: [2048] first4: 2.805634 -2.747847 6.485730 -0.904046
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1134 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=1176 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=947 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=819 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=625 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=1202 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=993 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1870 u=-1.0000000000 subseq=25
[Sample-CP] g=5 c=1085 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=108 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=930 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=455 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=743 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=903 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1677 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1759 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1845 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=31
[Sample-CP] g=10 c=1247 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1110 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=781 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 412.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000016 0.000016 0.000013 0.000013
[Perf] PromptBuild 97.2 ms
[Perf] Prefill 10.4 ms (T_ctx prefill)
[Perf] TTFA 116.9 ms (first frame codes)
[Perf] TalkerDecode 180.9 ms (64 frames, 2.83 ms/frame)
[Perf] CodePredictor 450.1 ms (7.03 ms/frame)
[Perf] PromptBuild 56.2 ms
[Perf] Prefill 9.2 ms (T_ctx prefill)
[Perf] TTFA 74.2 ms (first frame codes)
[Perf] TalkerDecode 181.4 ms (64 frames, 2.83 ms/frame)
[Perf] CodePredictor 449.4 ms (7.02 ms/frame)
[Perf] HostCompose 2.0 ms (c0 sample + next emb)
[Perf] CodecDecode 50.5 ms
[Perf] Total 791.8 ms (64 frames, 9.89 ms/frame AR, audio 5.12 s, RTF 0.155)
[Perf] CodecDecode 49.1 ms
[Perf] Total 748.0 ms (64 frames, 9.89 ms/frame AR, audio 5.12 s, RTF 0.146)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999678 max: 1.0564e-02 mean: 9.9803e-04
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] L0 cos: 0.999265 max: 6.5887e-01 mean: 6.6727e-03
[Cossim] L7 cos: 0.997457 max: 3.4175e+01 mean: 5.8671e-01
[Cossim] L14 cos: 0.997451 max: 3.4285e+01 mean: 6.7517e-01
[Cossim] L21 cos: 0.997233 max: 4.1672e+01 mean: 1.1005e+00
[Cossim] L27 cos: 0.983064 max: 1.6323e+03 mean: 5.0581e+00
[Cossim] Final cos: 0.943901 max: 2.4834e+01 mean: 3.0045e-01
[Cossim] Logits cos: 0.974259 max: 3.7648e+00 mean: 7.4210e-01
[Cossim] NextEmbStep0 cos: 0.804895 max: 2.9351e-01 mean: 3.5512e-02
[Cossim] TalkerHiddenStep1 cos: 0.739896 max: 7.9885e+00 mean: 1.3805e+00
[Cossim] CodesFull exact: 42.06% (1008 values)
[Cossim] Audio cos: 0.815255
[Cossim] WAV stft_cos: 0.877077 samples: 120960
[Cossim] Embed cos: 0.999678 max: 1.0564e-02 mean: 9.9887e-04
[Cossim] TrailingText cos: 0.999967 max: 1.5879e-03 mean: 2.3631e-04
[Cossim] TTSPadEmbed cos: 0.999967 max: 1.5879e-03 mean: 2.3631e-04
[Cossim] L0 cos: 0.999259 max: 6.7949e-01 mean: 6.7125e-03
[Cossim] L7 cos: 0.997457 max: 3.4175e+01 mean: 5.8674e-01
[Cossim] L14 cos: 0.997451 max: 3.4285e+01 mean: 6.7571e-01
[Cossim] L21 cos: 0.997225 max: 4.2803e+01 mean: 1.1050e+00
[Cossim] L27 cos: 0.983300 max: 1.6344e+03 mean: 5.0706e+00
[Cossim] Final cos: 0.944499 max: 2.4202e+01 mean: 3.0069e-01
[Cossim] Logits cos: 0.975382 max: 3.5753e+00 mean: 7.3846e-01
[Cossim] NextEmbStep0 cos: 0.804897 max: 2.9352e-01 mean: 3.5512e-02
[Cossim] TalkerHiddenStep1 cos: 0.740531 max: 7.5553e+00 mean: 1.3681e+00
[Cossim] CodesFull exact: 26.19% (1008 values)
[Cossim] Audio cos: 0.769272
[Cossim] WAV stft_cos: 0.842392 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -41,15 +41,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=40, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [40, 2048] first4: 0.021991 -0.008996 0.008355 -0.020301
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] tts-pad-embed: [2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] tts-pad-embed: [2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] talker-hidden-prefill-l0: [40, 2048] first4: -0.467374 -0.069750 0.014512 -0.037007
[Debug] talker-hidden-prefill-l7: [40, 2048] first4: -2.189883 0.158090 0.214502 1.593322
[Debug] talker-hidden-prefill-l14: [40, 2048] first4: -1.962598 0.346736 0.327780 1.567848
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -1.452356 0.302823 0.680714 0.976168
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 6.686141 -34.343998 -7.288419 28.600109
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.227555 -1.220578 -0.230492 0.887233
[Debug] talker-logits-prefill: [3072] first4: -4.273170 -6.352586 -1.052446 -3.138446
[Debug] talker-logits-prefill: [3072] first4: -4.194023 -6.330897 -1.037556 -3.247751
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -67,8 +67,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042839 -0.033702 -0.000574 0.188203
[Debug] talker-hidden-step1: [2048] first4: 1.613080 -2.494192 6.795578 0.693543
[Debug] next-emb-step0: [2048] first4: -0.042831 -0.033703 -0.000543 0.188216
[Debug] talker-hidden-step1: [2048] first4: 1.646660 -2.543247 6.817363 0.677318
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000014 0.000017 0.000015 0.000016
[Perf] PromptBuild 10.8 ms
[Perf] Prefill 10.7 ms (T_ctx prefill)
[Perf] TTFA 30.5 ms (first frame codes)
[Perf] TalkerDecode 210.5 ms (64 frames, 3.29 ms/frame)
[Perf] CodePredictor 450.8 ms (7.04 ms/frame)
[Perf] PromptBuild 4.0 ms
[Perf] Prefill 9.5 ms (T_ctx prefill)
[Perf] TTFA 22.3 ms (first frame codes)
[Perf] TalkerDecode 209.4 ms (64 frames, 3.27 ms/frame)
[Perf] CodePredictor 449.9 ms (7.03 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 48.8 ms
[Perf] Total 733.4 ms (64 frames, 10.35 ms/frame AR, audio 5.12 s, RTF 0.143)
[Perf] CodecDecode 48.4 ms
[Perf] Total 722.9 ms (64 frames, 10.32 ms/frame AR, audio 5.12 s, RTF 0.141)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999987 max: 2.3420e-03 mean: 1.9030e-04
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] L0 cos: 0.999988 max: 8.6182e-02 mean: 8.8736e-04
[Cossim] L7 cos: 0.999988 max: 3.3613e+00 mean: 4.3316e-02
[Cossim] L14 cos: 0.999987 max: 3.3760e+00 mean: 5.1382e-02
[Cossim] L21 cos: 0.999986 max: 3.4785e+00 mean: 8.8713e-02
[Cossim] L27 cos: 0.999897 max: 1.1408e+02 mean: 4.3219e-01
[Cossim] Final cos: 0.999043 max: 4.2595e+00 mean: 2.8839e-02
[Cossim] Logits cos: 0.999951 max: 2.1758e-01 mean: 3.1247e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1117e-03 mean: 2.2935e-04
[Cossim] TalkerHiddenStep1 cos: 0.999676 max: 3.2981e-01 mean: 4.7111e-02
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981665
[Cossim] WAV stft_cos: 0.989131 samples: 120960
[Cossim] Embed cos: 0.999986 max: 2.3420e-03 mean: 1.9062e-04
[Cossim] TrailingText cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] L0 cos: 0.999988 max: 8.1858e-02 mean: 8.8463e-04
[Cossim] L7 cos: 0.999988 max: 3.3613e+00 mean: 4.3392e-02
[Cossim] L14 cos: 0.999987 max: 3.3760e+00 mean: 5.1447e-02
[Cossim] L21 cos: 0.999986 max: 3.4785e+00 mean: 8.8100e-02
[Cossim] L27 cos: 0.999892 max: 1.1801e+02 mean: 4.2985e-01
[Cossim] Final cos: 0.999085 max: 3.6934e+00 mean: 2.8552e-02
[Cossim] Logits cos: 0.999928 max: 2.1671e-01 mean: 3.5390e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1459e-03 mean: 2.2969e-04
[Cossim] TalkerHiddenStep1 cos: 0.999676 max: 3.6926e-01 mean: 4.6989e-02
[Cossim] CodesFull exact: 99.31% (1008 values)
[Cossim] Audio cos: 0.981783
[Cossim] WAV stft_cos: 0.989206 samples: 120960
+23 -23
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -49,7 +49,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -0.769396 0.162826 0.799419 1.111035
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 7.051819 -34.400093 -7.071025 28.631334
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.240013 -1.222632 -0.223628 0.888246
[Debug] talker-logits-prefill: [3072] first4: -4.237288 -6.409130 -1.000882 -3.244113
[Debug] talker-logits-prefill: [3072] first4: -4.289595 -6.392793 -0.992494 -3.227396
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -68,7 +68,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042911 -0.033715 -0.000281 0.188977
[Debug] talker-hidden-step1: [2048] first4: 1.690565 -2.522467 6.791506 0.734965
[Debug] talker-hidden-step1: [2048] first4: 1.679285 -2.523743 6.788270 0.747907
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000015 0.000017
[Perf] PromptBuild 356.2 ms
[Perf] Prefill 102.2 ms (T_ctx prefill)
[Perf] TTFA 755.6 ms (first frame codes)
[Perf] TalkerDecode 230.0 ms (64 frames, 3.59 ms/frame)
[Perf] CodePredictor 713.0 ms (11.14 ms/frame)
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
[Perf] CodecDecode 253.2 ms
[Perf] Total 1656.4 ms (64 frames, 14.75 ms/frame AR, audio 5.12 s, RTF 0.324)
[Perf] PromptBuild 2.2 ms
[Perf] Prefill 38.8 ms (T_ctx prefill)
[Perf] TTFA 49.4 ms (first frame codes)
[Perf] TalkerDecode 258.1 ms (64 frames, 4.03 ms/frame)
[Perf] CodePredictor 432.6 ms (6.76 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 23.7 ms
[Perf] Total 757.2 ms (64 frames, 10.81 ms/frame AR, audio 5.12 s, RTF 0.148)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.4150e-04 mean: 1.2665e-05
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 0.999999 max: 7.2330e-02 mean: 1.2825e-04
[Cossim] L7 cos: 0.999999 max: 1.2875e+01 mean: 1.5097e-03
[Cossim] L14 cos: 0.999999 max: 1.2876e+01 mean: 2.5798e-03
[Cossim] L21 cos: 0.999999 max: 1.2882e+01 mean: 6.7605e-03
[Cossim] L27 cos: 0.999998 max: 1.0766e+01 mean: 3.7696e-02
[Cossim] Final cos: 0.999996 max: 3.8615e-01 mean: 2.3165e-03
[Cossim] Logits cos: 0.999998 max: 3.2601e-02 mean: 6.0310e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 2.0218e-02 mean: 3.3137e-03
[Cossim] Embed cos: 1.000000 max: 1.4150e-04 mean: 1.2664e-05
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] L0 cos: 0.999999 max: 7.2430e-02 mean: 1.2817e-04
[Cossim] L7 cos: 0.999999 max: 1.2875e+01 mean: 1.5119e-03
[Cossim] L14 cos: 0.999999 max: 1.2876e+01 mean: 2.5326e-03
[Cossim] L21 cos: 0.999999 max: 1.2882e+01 mean: 6.5790e-03
[Cossim] L27 cos: 0.999998 max: 1.0766e+01 mean: 3.9332e-02
[Cossim] Final cos: 0.999997 max: 1.6863e-01 mean: 2.1954e-03
[Cossim] Logits cos: 0.999998 max: 3.2225e-02 mean: 6.4152e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.4979e-10
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.2512e-02 mean: 2.2503e-03
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981091
[Cossim] WAV stft_cos: 0.988782 samples: 120960
+22 -22
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -49,7 +49,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -0.774088 0.167485 0.802750 1.108127
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 7.069299 -34.571785 -7.075340 28.513025
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.240926 -1.230360 -0.224060 0.885746
[Debug] talker-logits-prefill: [3072] first4: -4.292969 -6.421875 -0.983398 -3.244141
[Debug] talker-logits-prefill: [3072] first4: -4.261719 -6.421875 -0.998535 -3.265625
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -68,7 +68,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042911 -0.033715 -0.000281 0.188977
[Debug] talker-hidden-step1: [2048] first4: 1.662532 -2.524928 6.775098 0.748009
[Debug] talker-hidden-step1: [2048] first4: 1.653934 -2.523602 6.765848 0.756879
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000018 0.000016 0.000016
[Perf] PromptBuild 367.4 ms
[Perf] Prefill 1674.3 ms (T_ctx prefill)
[Perf] TTFA 2423.4 ms (first frame codes)
[Perf] TalkerDecode 517.6 ms (64 frames, 8.09 ms/frame)
[Perf] CodePredictor 890.9 ms (13.92 ms/frame)
[Perf] PromptBuild 2.4 ms
[Perf] Prefill 15.6 ms (T_ctx prefill)
[Perf] TTFA 27.4 ms (first frame codes)
[Perf] TalkerDecode 337.2 ms (64 frames, 5.27 ms/frame)
[Perf] CodePredictor 509.8 ms (7.96 ms/frame)
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
[Perf] CodecDecode 3328.1 ms
[Perf] Total 6780.2 ms (64 frames, 22.02 ms/frame AR, audio 5.12 s, RTF 1.324)
[Perf] CodecDecode 29.0 ms
[Perf] Total 895.9 ms (64 frames, 13.25 ms/frame AR, audio 5.12 s, RTF 0.175)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.9640e-05 mean: 1.5871e-06
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 0.999998 max: 7.0586e-02 mean: 2.3819e-04
[Cossim] L7 cos: 0.999998 max: 1.7607e+01 mean: 2.7930e-03
[Cossim] L14 cos: 0.999998 max: 1.7615e+01 mean: 4.6633e-03
[Cossim] L21 cos: 0.999998 max: 1.7685e+01 mean: 1.2512e-02
[Cossim] L27 cos: 0.999991 max: 3.1281e+01 mean: 8.7408e-02
[Cossim] Final cos: 0.999981 max: 4.9883e-01 mean: 4.7146e-03
[Cossim] Logits cos: 0.999995 max: 6.5789e-02 mean: 1.0788e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
[Cossim] TalkerHiddenStep1 cos: 0.999993 max: 4.3604e-02 mean: 7.3641e-03
[Cossim] Embed cos: 1.000000 max: 1.9640e-05 mean: 1.5854e-06
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] L0 cos: 0.999998 max: 7.0586e-02 mean: 2.3743e-04
[Cossim] L7 cos: 0.999998 max: 1.7607e+01 mean: 2.7829e-03
[Cossim] L14 cos: 0.999998 max: 1.7615e+01 mean: 4.7262e-03
[Cossim] L21 cos: 0.999998 max: 1.7685e+01 mean: 1.2758e-02
[Cossim] L27 cos: 0.999991 max: 3.2247e+01 mean: 8.4651e-02
[Cossim] Final cos: 0.999981 max: 5.0322e-01 mean: 4.8350e-03
[Cossim] Logits cos: 0.999989 max: 1.1462e-01 mean: 1.3836e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.4979e-10
[Cossim] TalkerHiddenStep1 cos: 0.999986 max: 6.3163e-02 mean: 1.0105e-02
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981673
[Cossim] WAV stft_cos: 0.989114 samples: 120960
+29 -29
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -41,15 +41,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=40, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [40, 2048] first4: 0.022060 -0.009214 0.008459 -0.019803
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] tts-pad-embed: [2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005416 0.008943 -0.004432 0.000657
[Debug] tts-pad-embed: [2048] first4: -0.005416 0.008943 -0.004432 0.000657
[Debug] talker-hidden-prefill-l0: [40, 2048] first4: -0.439122 -0.067648 0.007795 0.014498
[Debug] talker-hidden-prefill-l7: [40, 2048] first4: -8.846413 0.787868 0.504843 0.095287
[Debug] talker-hidden-prefill-l14: [40, 2048] first4: -8.781230 1.121946 0.607749 0.160504
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -8.663513 1.694570 1.111964 -0.793075
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 4.978741 -31.793024 -6.798384 21.846552
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.168058 -1.120660 -0.213233 0.672172
[Debug] talker-logits-prefill: [3072] first4: -6.781250 -4.988281 0.408203 -1.979492
[Debug] talker-logits-prefill: [3072] first4: -6.746094 -4.996094 0.395752 -1.987305
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=412 u=-1.0000000000 subseq=2
@@ -67,8 +67,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 412.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.000769 -0.046681 -0.010753 0.124454
[Debug] talker-hidden-step1: [2048] first4: 2.756753 -2.710360 6.438204 -0.809766
[Debug] next-emb-step0: [2048] first4: -0.000796 -0.046665 -0.010770 0.124431
[Debug] talker-hidden-step1: [2048] first4: 2.740271 -2.723420 6.474710 -0.808433
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1134 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 412.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000014 0.000014 0.000012 0.000014
[Perf] PromptBuild 380.2 ms
[Perf] Prefill 200.2 ms (T_ctx prefill)
[Perf] TTFA 742.6 ms (first frame codes)
[Perf] TalkerDecode 250.7 ms (64 frames, 3.92 ms/frame)
[Perf] CodePredictor 494.6 ms (7.73 ms/frame)
[Perf] HostCompose 2.1 ms (c0 sample + next emb)
[Perf] CodecDecode 1020.7 ms
[Perf] Total 2349.3 ms (64 frames, 11.68 ms/frame AR, audio 5.12 s, RTF 0.459)
[Perf] PromptBuild 3.1 ms
[Perf] Prefill 11.6 ms (T_ctx prefill)
[Perf] TTFA 21.7 ms (first frame codes)
[Perf] TalkerDecode 303.1 ms (64 frames, 4.74 ms/frame)
[Perf] CodePredictor 1368.5 ms (21.38 ms/frame)
[Perf] HostCompose 3.2 ms (c0 sample + next emb)
[Perf] CodecDecode 98.1 ms
[Perf] Total 1788.3 ms (64 frames, 26.17 ms/frame AR, audio 5.12 s, RTF 0.349)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999695 max: 1.0573e-02 mean: 9.7050e-04
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] L0 cos: 0.999277 max: 8.6724e-01 mean: 6.4670e-03
[Cossim] L7 cos: 0.997447 max: 4.5715e+01 mean: 5.8617e-01
[Cossim] L14 cos: 0.997441 max: 4.7274e+01 mean: 6.7446e-01
[Cossim] L21 cos: 0.997231 max: 4.6771e+01 mean: 1.0947e+00
[Cossim] L27 cos: 0.982508 max: 1.7338e+03 mean: 5.0126e+00
[Cossim] Final cos: 0.946255 max: 2.4124e+01 mean: 2.9486e-01
[Cossim] Logits cos: 0.976666 max: 3.3958e+00 mean: 7.0689e-01
[Cossim] NextEmbStep0 cos: 0.804895 max: 2.9351e-01 mean: 3.5512e-02
[Cossim] TalkerHiddenStep1 cos: 0.745183 max: 7.7115e+00 mean: 1.3585e+00
[Cossim] CodesFull exact: 28.57% (1008 values)
[Cossim] Audio cos: 0.786703
[Cossim] WAV stft_cos: 0.855754 samples: 120960
[Cossim] Embed cos: 0.999695 max: 1.0573e-02 mean: 9.7135e-04
[Cossim] TrailingText cos: 0.999967 max: 1.5749e-03 mean: 2.3645e-04
[Cossim] TTSPadEmbed cos: 0.999967 max: 1.5749e-03 mean: 2.3645e-04
[Cossim] L0 cos: 0.999281 max: 8.2229e-01 mean: 6.4588e-03
[Cossim] L7 cos: 0.997447 max: 4.5715e+01 mean: 5.8613e-01
[Cossim] L14 cos: 0.997441 max: 4.7274e+01 mean: 6.7429e-01
[Cossim] L21 cos: 0.997231 max: 4.6771e+01 mean: 1.0948e+00
[Cossim] L27 cos: 0.982430 max: 1.7347e+03 mean: 5.0179e+00
[Cossim] Final cos: 0.946163 max: 2.4150e+01 mean: 2.9506e-01
[Cossim] Logits cos: 0.976867 max: 3.3723e+00 mean: 7.0399e-01
[Cossim] NextEmbStep0 cos: 0.804898 max: 2.9352e-01 mean: 3.5512e-02
[Cossim] TalkerHiddenStep1 cos: 0.745810 max: 7.6808e+00 mean: 1.3562e+00
[Cossim] CodesFull exact: 27.98% (1008 values)
[Cossim] Audio cos: 0.786610
[Cossim] WAV stft_cos: 0.855933 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -41,15 +41,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=40, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [40, 2048] first4: 0.021991 -0.008996 0.008355 -0.020301
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] tts-pad-embed: [2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] tts-pad-embed: [2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] talker-hidden-prefill-l0: [40, 2048] first4: -0.462445 -0.072427 0.014970 -0.037452
[Debug] talker-hidden-prefill-l7: [40, 2048] first4: -2.202637 0.167428 0.202381 1.609037
[Debug] talker-hidden-prefill-l14: [40, 2048] first4: -1.978270 0.354012 0.308973 1.583308
[Debug] talker-hidden-prefill-l21: [40, 2048] first4: -1.464997 0.289494 0.668319 1.000694
[Debug] talker-hidden-prefill-l27: [40, 2048] first4: 6.706990 -34.569862 -7.394227 28.405701
[Debug] talker-hidden-prefill-final: [40, 2048] first4: 0.228430 -1.229495 -0.234007 0.881840
[Debug] talker-logits-prefill: [3072] first4: -4.078125 -6.398438 -1.076172 -3.267578
[Debug] talker-logits-prefill: [3072] first4: -4.085938 -6.386719 -1.058594 -3.251953
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -67,8 +67,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.042839 -0.033702 -0.000574 0.188203
[Debug] talker-hidden-step1: [2048] first4: 1.669997 -2.561916 6.818936 0.665801
[Debug] next-emb-step0: [2048] first4: -0.042831 -0.033703 -0.000543 0.188216
[Debug] talker-hidden-step1: [2048] first4: 1.661710 -2.566321 6.820588 0.670599
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1722 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=18
@@ -96,14 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000015 0.000017
[Perf] PromptBuild 320.9 ms
[Perf] Prefill 207.7 ms (T_ctx prefill)
[Perf] TTFA 699.3 ms (first frame codes)
[Perf] TalkerDecode 182.0 ms (64 frames, 2.84 ms/frame)
[Perf] CodePredictor 513.0 ms (8.02 ms/frame)
[Perf] PromptBuild 2.0 ms
[Perf] Prefill 11.3 ms (T_ctx prefill)
[Perf] TTFA 20.3 ms (first frame codes)
[Perf] TalkerDecode 176.9 ms (64 frames, 2.76 ms/frame)
[Perf] CodePredictor 357.2 ms (5.58 ms/frame)
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
[Perf] CodecDecode 1186.1 ms
[Perf] Total 2411.6 ms (64 frames, 10.88 ms/frame AR, audio 5.12 s, RTF 0.471)
[Perf] CodecDecode 51.3 ms
[Perf] Total 600.5 ms (64 frames, 8.36 ms/frame AR, audio 5.12 s, RTF 0.117)
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999987 max: 2.2803e-03 mean: 1.8378e-04
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] L0 cos: 0.999992 max: 7.5516e-02 mean: 6.3871e-04
[Cossim] L7 cos: 0.999986 max: 1.7577e+01 mean: 4.2015e-02
[Cossim] L14 cos: 0.999986 max: 1.7631e+01 mean: 4.8597e-02
[Cossim] L21 cos: 0.999985 max: 1.7777e+01 mean: 7.8546e-02
[Cossim] L27 cos: 0.999957 max: 5.4742e+01 mean: 3.4493e-01
[Cossim] Final cos: 0.999647 max: 4.1027e+00 mean: 2.1984e-02
[Cossim] Logits cos: 0.999928 max: 2.0065e-01 mean: 3.6855e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1117e-03 mean: 2.2935e-04
[Cossim] TalkerHiddenStep1 cos: 0.999814 max: 1.8624e-01 mean: 3.6437e-02
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.981689
[Cossim] WAV stft_cos: 0.989144 samples: 120960
[Cossim] Embed cos: 0.999987 max: 2.2803e-03 mean: 1.8409e-04
[Cossim] TrailingText cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] L0 cos: 0.999992 max: 7.5516e-02 mean: 6.3898e-04
[Cossim] L7 cos: 0.999986 max: 1.7577e+01 mean: 4.2023e-02
[Cossim] L14 cos: 0.999986 max: 1.7631e+01 mean: 4.8608e-02
[Cossim] L21 cos: 0.999985 max: 1.7777e+01 mean: 7.8441e-02
[Cossim] L27 cos: 0.999956 max: 5.4742e+01 mean: 3.4629e-01
[Cossim] Final cos: 0.999635 max: 4.0327e+00 mean: 2.2069e-02
[Cossim] Logits cos: 0.999941 max: 1.8112e-01 mean: 3.1768e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1459e-03 mean: 2.2969e-04
[Cossim] TalkerHiddenStep1 cos: 0.999824 max: 1.7569e-01 mean: 3.5396e-02
[Cossim] CodesFull exact: 99.90% (1008 values)
[Cossim] Audio cos: 0.981612
[Cossim] WAV stft_cos: 0.989094 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -63,8 +63,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=225, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=yes icl=yes
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [225, 2048] first4: 0.022162 -0.009036 0.008171 -0.020198
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005331 0.008751 -0.004225 0.001141
[Debug] tts-pad-embed: [2048] first4: -0.005331 0.008751 -0.004225 0.001141
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005340 0.008744 -0.004225 0.001144
[Debug] tts-pad-embed: [2048] first4: -0.005340 0.008744 -0.004225 0.001144
[Debug] spk-emb: [2048] first4: 0.098059 -0.023872 -0.011379 0.006934
[Debug] ref-codes: [16, 215] first4: 1221.000000 2042.000000 509.000000 1522.000000
[Debug] talker-hidden-prefill-l0: [225, 2048] first4: -0.461236 -0.069827 0.016106 -0.039241
@@ -73,7 +73,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -0.771681 0.167680 0.780671 1.118511
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 7.162132 -34.503532 -7.128798 28.739269
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.243477 -1.224848 -0.225186 0.890532
[Debug] talker-logits-prefill: [3072] first4: 0.867188 -7.875000 -6.625000 -10.312500
[Debug] talker-logits-prefill: [3072] first4: 0.871094 -7.875000 -6.593750 -10.375000
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
@@ -91,8 +91,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=1062 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=1094 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: 0.010340 -0.009316 0.074921 0.036954
[Debug] talker-hidden-step1: [2048] first4: 0.016260 2.936450 -0.774224 0.047897
[Debug] next-emb-step0: [2048] first4: 0.010331 -0.009322 0.074922 0.036956
[Debug] talker-hidden-step1: [2048] first4: 0.016130 2.930190 -0.767163 0.054849
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -120,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001310 -0.002270 -0.002123 -0.000994
[Perf] PromptBuild 13.8 ms
[Perf] Prefill 14.6 ms (T_ctx prefill)
[Perf] TTFA 39.3 ms (first frame codes)
[Perf] TalkerDecode 252.1 ms (64 frames, 3.94 ms/frame)
[Perf] CodePredictor 463.3 ms (7.24 ms/frame)
[Perf] HostCompose 1.2 ms (c0 sample + next emb)
[Perf] PromptBuild 1.2 ms
[Perf] Prefill 13.9 ms (T_ctx prefill)
[Perf] TTFA 25.1 ms (first frame codes)
[Perf] TalkerDecode 253.0 ms (64 frames, 3.95 ms/frame)
[Perf] CodePredictor 462.4 ms (7.23 ms/frame)
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
[Perf] CodecDecode 10.1 ms
[Perf] Total 756.1 ms (64 frames, 11.20 ms/frame AR, audio 5.12 s, RTF 0.148)
[Perf] Total 742.8 ms (64 frames, 11.20 ms/frame AR, audio 5.12 s, RTF 0.145)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -148,18 +148,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/clone/clone-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 78.52% (3440 values)
[Cossim] Embed cos: 0.965578 max: 1.9437e-01 mean: 9.8606e-03
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 0.984329 max: 8.0274e-01 mean: 1.3010e-02
[Cossim] L7 cos: 0.999981 max: 4.7523e+01 mean: 3.1982e-02
[Cossim] L14 cos: 0.999956 max: 4.7531e+01 mean: 7.0219e-02
[Cossim] L21 cos: 0.999568 max: 4.7566e+01 mean: 2.6792e-01
[Cossim] L27 cos: 0.998447 max: 4.7993e+01 mean: 6.0584e-01
[Cossim] Final cos: 0.991998 max: 1.5255e+01 mean: 1.9686e-01
[Cossim] Logits cos: 0.999480 max: 1.0044e+00 mean: 1.2252e-01
[Cossim] NextEmbStep0 cos: 0.829096 max: 1.5468e-01 mean: 2.9154e-02
[Cossim] TalkerHiddenStep1 cos: 0.991926 max: 2.2951e+00 mean: 2.7515e-01
[Cossim] Embed cos: 0.965578 max: 1.9438e-01 mean: 9.8620e-03
[Cossim] TrailingText cos: 1.000000 max: 3.5107e-05 mean: 2.5004e-06
[Cossim] TTSPadEmbed cos: 1.000000 max: 3.5107e-05 mean: 2.5004e-06
[Cossim] L0 cos: 0.984329 max: 8.0274e-01 mean: 1.3008e-02
[Cossim] L7 cos: 0.999981 max: 4.7523e+01 mean: 3.1978e-02
[Cossim] L14 cos: 0.999956 max: 4.7531e+01 mean: 7.0164e-02
[Cossim] L21 cos: 0.999567 max: 4.7566e+01 mean: 2.6764e-01
[Cossim] L27 cos: 0.998445 max: 4.7993e+01 mean: 6.0528e-01
[Cossim] Final cos: 0.991977 max: 1.5199e+01 mean: 1.9679e-01
[Cossim] Logits cos: 0.999456 max: 1.0356e+00 mean: 1.3008e-01
[Cossim] NextEmbStep0 cos: 0.829094 max: 1.5468e-01 mean: 2.9154e-02
[Cossim] TalkerHiddenStep1 cos: 0.992003 max: 2.2537e+00 mean: 2.7399e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 0.999973 max: 7.5789e-02 mean: 1.1867e-03
[Cossim] SpkASP cos: 0.999999 max: 3.9836e-03 mean: 2.4063e-04
[Cossim] SpeakerEmb cos: 1.000000 max: 1.7091e-03 mean: 2.1396e-04
[Cossim] CodesFull exact: 2.48% (1008 values)
[Cossim] Audio cos: 0.014691
[Cossim] WAV stft_cos: 0.215030 samples: 120960
[Cossim] CodesFull exact: 2.38% (1008 values)
[Cossim] Audio cos: 0.008950
[Cossim] WAV stft_cos: 0.294906 samples: 120960
+22 -22
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -73,7 +73,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -0.771863 0.171118 0.791448 1.111798
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 7.131224 -34.471714 -7.108000 28.674042
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.242833 -1.225771 -0.224906 0.890001
[Debug] talker-logits-prefill: [3072] first4: 1.169689 -7.795547 -6.822499 -10.286361
[Debug] talker-logits-prefill: [3072] first4: 1.171040 -7.796190 -6.822366 -10.286754
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
@@ -92,7 +92,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=541 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: 0.003672 0.000908 0.039506 0.094594
[Debug] talker-hidden-step1: [2048] first4: 0.754187 2.410173 -0.055172 0.159660
[Debug] talker-hidden-step1: [2048] first4: 0.754330 2.408696 -0.056724 0.159879
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -120,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001265 -0.002192 -0.002047 -0.000956
[Perf] PromptBuild 5.3 ms
[Perf] Prefill 27.7 ms (T_ctx prefill)
[Perf] TTFA 52.2 ms (first frame codes)
[Perf] TalkerDecode 358.3 ms (64 frames, 5.60 ms/frame)
[Perf] PromptBuild 1.2 ms
[Perf] Prefill 28.1 ms (T_ctx prefill)
[Perf] TTFA 48.6 ms (first frame codes)
[Perf] TalkerDecode 369.5 ms (64 frames, 5.77 ms/frame)
[Perf] CodePredictor 559.6 ms (8.74 ms/frame)
[Perf] HostCompose 1.2 ms (c0 sample + next emb)
[Perf] CodecDecode 10.2 ms
[Perf] Total 981.2 ms (64 frames, 14.36 ms/frame AR, audio 5.12 s, RTF 0.192)
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
[Perf] CodecDecode 10.0 ms
[Perf] Total 979.4 ms (64 frames, 14.54 ms/frame AR, audio 5.12 s, RTF 0.191)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -149,17 +149,17 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 82.41% (3440 values)
[Cossim] Embed cos: 0.972420 max: 1.7531e-01 mean: 8.3100e-03
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.1686e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.1686e-10
[Cossim] L0 cos: 0.986912 max: 6.6445e-01 mean: 1.1103e-02
[Cossim] L7 cos: 0.999992 max: 1.2569e+00 mean: 2.7510e-02
[Cossim] L14 cos: 0.999973 max: 2.1781e+00 mean: 5.9937e-02
[Cossim] L21 cos: 0.999718 max: 8.4983e+00 mean: 2.2272e-01
[Cossim] L27 cos: 0.998969 max: 2.4365e+01 mean: 5.1191e-01
[Cossim] Final cos: 0.994692 max: 7.4170e+00 mean: 1.6655e-01
[Cossim] Logits cos: 0.999740 max: 5.7071e-01 mean: 8.9440e-02
[Cossim] L7 cos: 0.999992 max: 1.2570e+00 mean: 2.7510e-02
[Cossim] L14 cos: 0.999973 max: 2.1782e+00 mean: 5.9937e-02
[Cossim] L21 cos: 0.999719 max: 8.3604e+00 mean: 2.2268e-01
[Cossim] L27 cos: 0.998971 max: 2.3989e+01 mean: 5.1174e-01
[Cossim] Final cos: 0.994704 max: 7.3139e+00 mean: 1.6649e-01
[Cossim] Logits cos: 0.999743 max: 5.7111e-01 mean: 8.8930e-02
[Cossim] NextEmbStep0 cos: 0.829216 max: 1.2523e-01 mean: 2.9129e-02
[Cossim] TalkerHiddenStep1 cos: 0.993844 max: 1.4404e+00 mean: 2.4228e-01
[Cossim] TalkerHiddenStep1 cos: 0.993859 max: 1.4381e+00 mean: 2.4190e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 3.8069e-04 mean: 1.3195e-06
[Cossim] SpkASP cos: 1.000000 max: 7.9870e-06 mean: 2.2269e-07
[Cossim] SpeakerEmb cos: 1.000000 max: 1.4305e-05 mean: 2.5463e-07
[Cossim] CodesFull exact: 3.17% (1008 values)
[Cossim] Audio cos: 0.040228
[Cossim] WAV stft_cos: 0.344329 samples: 120960
[Cossim] CodesFull exact: 3.27% (1008 values)
[Cossim] Audio cos: 0.053931
[Cossim] WAV stft_cos: 0.375521 samples: 120960
+59 -59
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -63,8 +63,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=225, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=yes icl=yes
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [225, 2048] first4: 0.022053 -0.009240 0.008445 -0.019765
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] tts-pad-embed: [2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005412 0.008948 -0.004431 0.000663
[Debug] tts-pad-embed: [2048] first4: -0.005412 0.008948 -0.004431 0.000663
[Debug] spk-emb: [2048] first4: 0.098318 -0.023761 -0.011860 0.006760
[Debug] ref-codes: [16, 215] first4: 1221.000000 2042.000000 696.000000 1522.000000
[Debug] talker-hidden-prefill-l0: [225, 2048] first4: -0.446298 -0.062077 0.007342 0.016826
@@ -73,42 +73,42 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -8.749888 1.534012 1.114061 -0.606226
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 4.146309 -31.912390 -6.918371 22.418171
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.140643 -1.130366 -0.218058 0.693131
[Debug] talker-logits-prefill: [3072] first4: -0.338212 -5.622369 -6.983281 -10.476706
[Debug] talker-logits-prefill: [3072] first4: -0.461190 -5.760653 -7.184410 -10.423358
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1534 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1233 u=-1.0000000000 subseq=2
[Sample-CP] g=2 c=362 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=442 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=1221 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=496 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=139 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=1819 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=1081 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=1256 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=925 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1671 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=833 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=1683 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=13 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1534.000000 1233.000000 362.000000
[Debug] next-emb-step0: [2048] first4: 0.012826 -0.006740 -0.010570 0.001879
[Debug] talker-hidden-step1: [2048] first4: -0.124214 1.995133 0.378428 0.731216
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=324 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=405 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=406 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=849 u=-1.0000000000 subseq=22
[Sample-CP] g=0 c=1042 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=390 u=-1.0000000000 subseq=2
[Sample-CP] g=2 c=881 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=405 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=1347 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=1640 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=470 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=488 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=153 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=1492 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=1029 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=863 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=111 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=262 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=735 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1042.000000 390.000000 881.000000
[Debug] next-emb-step0: [2048] first4: -0.033968 -0.020822 -0.037756 -0.013151
[Debug] talker-hidden-step1: [2048] first4: 1.290885 1.802708 -1.078711 1.471289
[Sample] step=1 c0=99 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=43 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1859 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=22 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=239 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=915 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=2019 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=329 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1857 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=692 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=223 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1887 u=-1.0000000000 subseq=27
[Sample-CP] g=7 c=996 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1673 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1652 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1615 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=914 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=344 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=55 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=766 u=-1.0000000000 subseq=31
[Sample-CP] g=13 c=85 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1435 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -118,16 +118,16 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generated 56 frames
[Pipeline] Generated 64 frames
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1534.000000 1233.000000 362.000000
[Debug] output-audio: [122880] first4: -0.001380 -0.002482 -0.002457 -0.001359
[Perf] PromptBuild 102.5 ms
[Perf] Prefill 16.7 ms (T_ctx prefill)
[Perf] TTFA 136.6 ms (first frame codes)
[Perf] TalkerDecode 200.8 ms (64 frames, 3.14 ms/frame)
[Perf] CodePredictor 450.7 ms (7.04 ms/frame)
[Perf] HostCompose 2.4 ms (c0 sample + next emb)
[Debug] codes-full: [64, 16] first4: 27.000000 1042.000000 390.000000 881.000000
[Debug] output-audio: [122880] first4: -0.001003 -0.001738 -0.001707 -0.000971
[Perf] PromptBuild 56.7 ms
[Perf] Prefill 15.2 ms (T_ctx prefill)
[Perf] TTFA 81.0 ms (first frame codes)
[Perf] TalkerDecode 199.4 ms (64 frames, 3.12 ms/frame)
[Perf] CodePredictor 450.5 ms (7.04 ms/frame)
[Perf] HostCompose 2.6 ms (c0 sample + next emb)
[Perf] CodecDecode 11.0 ms
[Perf] Total 793.4 ms (64 frames, 10.22 ms/frame AR, audio 5.12 s, RTF 0.155)
[Perf] Total 736.4 ms (64 frames, 10.20 ms/frame AR, audio 5.12 s, RTF 0.144)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -148,18 +148,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/clone/clone-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 50.87% (3440 values)
[Cossim] Embed cos: 0.918414 max: 1.9968e-01 mean: 2.1850e-02
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] L0 cos: 0.961554 max: 8.6505e-01 mean: 2.8452e-02
[Cossim] L7 cos: 0.997437 max: 3.4802e+01 mean: 1.6349e-01
[Cossim] L14 cos: 0.997361 max: 3.4910e+01 mean: 2.4912e-01
[Cossim] L21 cos: 0.995751 max: 4.1312e+01 mean: 7.9512e-01
[Cossim] L27 cos: 0.958560 max: 1.6208e+03 mean: 2.0507e+00
[Cossim] Final cos: 0.951458 max: 3.4139e+01 mean: 5.7232e-01
[Cossim] Logits cos: 0.992470 max: 3.0610e+00 mean: 4.5866e-01
[Cossim] NextEmbStep0 cos: 0.756048 max: 1.8307e-01 mean: 3.5136e-02
[Cossim] TalkerHiddenStep1 cos: 0.958651 max: 6.1932e+00 mean: 6.0951e-01
[Cossim] Embed cos: 0.918413 max: 1.9968e-01 mean: 2.1851e-02
[Cossim] TrailingText cos: 0.999967 max: 1.5879e-03 mean: 2.3631e-04
[Cossim] TTSPadEmbed cos: 0.999967 max: 1.5879e-03 mean: 2.3631e-04
[Cossim] L0 cos: 0.961531 max: 8.6635e-01 mean: 2.8467e-02
[Cossim] L7 cos: 0.997437 max: 3.4802e+01 mean: 1.6356e-01
[Cossim] L14 cos: 0.997361 max: 3.4910e+01 mean: 2.4941e-01
[Cossim] L21 cos: 0.995762 max: 4.1094e+01 mean: 7.9335e-01
[Cossim] L27 cos: 0.957952 max: 1.6442e+03 mean: 2.0441e+00
[Cossim] Final cos: 0.952287 max: 2.7175e+01 mean: 5.6964e-01
[Cossim] Logits cos: 0.991304 max: 3.3342e+00 mean: 4.9692e-01
[Cossim] NextEmbStep0 cos: 0.709511 max: 1.6319e-01 mean: 3.8936e-02
[Cossim] TalkerHiddenStep1 cos: 0.836398 max: 1.1069e+01 mean: 1.2096e+00
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 3.8069e-04 mean: 1.3207e-06
[Cossim] SpkASP cos: 1.000000 max: 7.8678e-06 mean: 2.2438e-07
[Cossim] SpeakerEmb cos: 1.000000 max: 1.4305e-05 mean: 2.5522e-07
[Cossim] CodesFull exact: 0.89% (1008 values)
[Cossim] Audio cos: 0.013127
[Cossim] WAV stft_cos: 0.193968 samples: 120960
[Cossim] CodesFull exact: 0.60% (1008 values)
[Cossim] Audio cos: 0.001172
[Cossim] WAV stft_cos: 0.129338 samples: 120960
+52 -52
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -63,8 +63,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=225, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=yes icl=yes
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [225, 2048] first4: 0.021991 -0.008996 0.008355 -0.020301
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] tts-pad-embed: [2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] tts-pad-embed: [2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] spk-emb: [2048] first4: 0.098318 -0.023761 -0.011860 0.006760
[Debug] ref-codes: [16, 215] first4: 1221.000000 2042.000000 509.000000 1522.000000
[Debug] talker-hidden-prefill-l0: [225, 2048] first4: -0.467374 -0.069750 0.014512 -0.037007
@@ -73,42 +73,42 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -1.452353 0.302821 0.680713 0.976167
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 6.677233 -34.349281 -7.298450 28.605591
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.227255 -1.220783 -0.230812 0.887415
[Debug] talker-logits-prefill: [3072] first4: 1.592249 -8.110142 -7.191648 -10.722010
[Debug] talker-logits-prefill: [3072] first4: 1.706040 -8.254342 -7.318320 -10.816376
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
[Sample-CP] g=2 c=417 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=442 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=1412 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=761 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=812 u=-1.0000000000 subseq=7
[Sample-CP] g=2 c=400 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=550 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=1506 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=970 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=470 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=1713 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=843 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=324 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=741 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1200 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=1956 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=660 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=20 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 417.000000
[Debug] next-emb-step0: [2048] first4: 0.031018 -0.042756 -0.008812 0.053004
[Debug] talker-hidden-step1: [2048] first4: 1.024369 2.399563 0.299808 -0.313571
[Sample-CP] g=8 c=1221 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=645 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=180 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1713 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=217 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=561 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=1681 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: -0.034936 -0.024575 0.029866 0.045185
[Debug] talker-hidden-step1: [2048] first4: 0.923327 2.394357 0.442331 -0.226438
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=324 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1501 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=1748 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1640 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=1544 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=734 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1673 u=-1.0000000000 subseq=25
[Sample-CP] g=3 c=350 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=985 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=853 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=329 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=564 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=692 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1702 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1603 u=-1.0000000000 subseq=27
[Sample-CP] g=10 c=437 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=729 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=344 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=85 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1435 u=-1.0000000000 subseq=31
[Sample-CP] g=14 c=1668 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -118,16 +118,16 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generated 56 frames
[Pipeline] Generated 64 frames
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 417.000000
[Debug] output-audio: [122880] first4: -0.001383 -0.002430 -0.002358 -0.001279
[Perf] PromptBuild 10.2 ms
[Perf] Prefill 15.5 ms (T_ctx prefill)
[Perf] TTFA 34.7 ms (first frame codes)
[Perf] TalkerDecode 225.5 ms (64 frames, 3.52 ms/frame)
[Perf] CodePredictor 450.2 ms (7.03 ms/frame)
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
[Perf] CodecDecode 10.3 ms
[Perf] Total 713.9 ms (64 frames, 10.58 ms/frame AR, audio 5.12 s, RTF 0.139)
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001528 -0.002728 -0.002590 -0.001367
[Perf] PromptBuild 1.4 ms
[Perf] Prefill 15.4 ms (T_ctx prefill)
[Perf] TTFA 25.7 ms (first frame codes)
[Perf] TalkerDecode 226.3 ms (64 frames, 3.54 ms/frame)
[Perf] CodePredictor 449.9 ms (7.03 ms/frame)
[Perf] HostCompose 1.2 ms (c0 sample + next emb)
[Perf] CodecDecode 10.4 ms
[Perf] Total 705.6 ms (64 frames, 10.59 ms/frame AR, audio 5.12 s, RTF 0.138)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -148,18 +148,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/clone/clone-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 80.23% (3440 values)
[Cossim] Embed cos: 0.968624 max: 1.6806e-01 mean: 9.6592e-03
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] L0 cos: 0.984968 max: 7.6804e-01 mean: 1.2815e-02
[Cossim] L7 cos: 0.999978 max: 3.6948e+00 mean: 3.8283e-02
[Cossim] L14 cos: 0.999955 max: 3.7148e+00 mean: 7.4631e-02
[Cossim] L21 cos: 0.999560 max: 1.7838e+01 mean: 2.7558e-01
[Cossim] L27 cos: 0.998089 max: 1.0573e+02 mean: 6.5386e-01
[Cossim] Final cos: 0.991260 max: 1.5561e+01 mean: 2.0542e-01
[Cossim] Logits cos: 0.999099 max: 1.1633e+00 mean: 1.7357e-01
[Cossim] NextEmbStep0 cos: 0.849360 max: 1.3903e-01 mean: 2.7786e-02
[Cossim] TalkerHiddenStep1 cos: 0.991650 max: 1.2042e+00 mean: 2.8223e-01
[Cossim] Embed cos: 0.968624 max: 1.6806e-01 mean: 9.6593e-03
[Cossim] TrailingText cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] L0 cos: 0.984964 max: 7.6776e-01 mean: 1.2815e-02
[Cossim] L7 cos: 0.999978 max: 3.6948e+00 mean: 3.8281e-02
[Cossim] L14 cos: 0.999955 max: 3.7148e+00 mean: 7.4563e-02
[Cossim] L21 cos: 0.999568 max: 1.7895e+01 mean: 2.7422e-01
[Cossim] L27 cos: 0.998158 max: 9.9299e+01 mean: 6.4856e-01
[Cossim] Final cos: 0.991511 max: 1.5600e+01 mean: 2.0381e-01
[Cossim] Logits cos: 0.998602 max: 1.4375e+00 mean: 2.2099e-01
[Cossim] NextEmbStep0 cos: 0.839291 max: 1.9986e-01 mean: 2.8325e-02
[Cossim] TalkerHiddenStep1 cos: 0.988487 max: 2.5975e+00 mean: 3.2991e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 3.8069e-04 mean: 1.3207e-06
[Cossim] SpkASP cos: 1.000000 max: 7.8678e-06 mean: 2.2438e-07
[Cossim] SpeakerEmb cos: 1.000000 max: 1.4305e-05 mean: 2.5522e-07
[Cossim] CodesFull exact: 1.69% (1008 values)
[Cossim] Audio cos: 0.005926
[Cossim] WAV stft_cos: 0.167804 samples: 120960
[Cossim] CodesFull exact: 2.78% (1008 values)
[Cossim] Audio cos: 0.034690
[Cossim] WAV stft_cos: 0.243983 samples: 120960
+21 -21
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -73,7 +73,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -0.769277 0.163230 0.799681 1.111220
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 7.051195 -34.399265 -7.070650 28.631254
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.239991 -1.222603 -0.223616 0.888243
[Debug] talker-logits-prefill: [3072] first4: 0.902484 -7.883992 -6.811989 -10.429354
[Debug] talker-logits-prefill: [3072] first4: 0.907549 -7.873562 -6.795165 -10.447464
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
@@ -92,7 +92,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=348 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: -0.008599 -0.015697 0.093591 0.086640
[Debug] talker-hidden-step1: [2048] first4: 0.459902 2.305680 -0.151696 0.227036
[Debug] talker-hidden-step1: [2048] first4: 0.463387 2.304747 -0.152458 0.223634
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -120,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001651 -0.002839 -0.002671 -0.001491
[Perf] PromptBuild 6.6 ms
[Perf] Prefill 31.8 ms (T_ctx prefill)
[Perf] TTFA 47.0 ms (first frame codes)
[Perf] TalkerDecode 236.2 ms (64 frames, 3.69 ms/frame)
[Perf] CodePredictor 426.7 ms (6.67 ms/frame)
[Perf] PromptBuild 2.0 ms
[Perf] Prefill 32.0 ms (T_ctx prefill)
[Perf] TTFA 42.0 ms (first frame codes)
[Perf] TalkerDecode 230.8 ms (64 frames, 3.61 ms/frame)
[Perf] CodePredictor 425.1 ms (6.64 ms/frame)
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
[Perf] CodecDecode 15.5 ms
[Perf] Total 719.1 ms (64 frames, 10.38 ms/frame AR, audio 5.12 s, RTF 0.140)
[Perf] CodecDecode 21.7 ms
[Perf] Total 713.9 ms (64 frames, 10.27 ms/frame AR, audio 5.12 s, RTF 0.139)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -149,17 +149,17 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 76.83% (3440 values)
[Cossim] Embed cos: 0.962709 max: 1.9437e-01 mean: 1.0689e-02
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] L0 cos: 0.983221 max: 7.7033e-01 mean: 1.3992e-02
[Cossim] L7 cos: 0.999989 max: 1.2872e+01 mean: 3.3232e-02
[Cossim] L14 cos: 0.999964 max: 1.2875e+01 mean: 7.1829e-02
[Cossim] L21 cos: 0.999531 max: 1.6985e+01 mean: 2.8083e-01
[Cossim] L27 cos: 0.998207 max: 4.0575e+01 mean: 6.4222e-01
[Cossim] Final cos: 0.990651 max: 1.5852e+01 mean: 2.0918e-01
[Cossim] Logits cos: 0.999284 max: 1.1179e+00 mean: 1.3581e-01
[Cossim] L14 cos: 0.999964 max: 1.2875e+01 mean: 7.1831e-02
[Cossim] L21 cos: 0.999532 max: 1.6953e+01 mean: 2.8047e-01
[Cossim] L27 cos: 0.998216 max: 4.0677e+01 mean: 6.4098e-01
[Cossim] Final cos: 0.990697 max: 1.5845e+01 mean: 2.0881e-01
[Cossim] Logits cos: 0.999304 max: 1.0959e+00 mean: 1.3300e-01
[Cossim] NextEmbStep0 cos: 0.818255 max: 1.4225e-01 mean: 3.0455e-02
[Cossim] TalkerHiddenStep1 cos: 0.993870 max: 1.7524e+00 mean: 2.3476e-01
[Cossim] TalkerHiddenStep1 cos: 0.993909 max: 1.7548e+00 mean: 2.3409e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 0.999979 max: 7.0797e-02 mean: 1.0370e-03
[Cossim] SpkASP cos: 1.000000 max: 2.3381e-03 mean: 1.5046e-04
[Cossim] SpeakerEmb cos: 1.000000 max: 6.5649e-04 mean: 1.2850e-04
[Cossim] CodesFull exact: 1.98% (1008 values)
[Cossim] Audio cos: -0.002162
[Cossim] WAV stft_cos: 0.263549 samples: 120960
[Cossim] CodesFull exact: 2.28% (1008 values)
[Cossim] Audio cos: 0.002591
[Cossim] WAV stft_cos: 0.228070 samples: 120960
+23 -23
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -73,7 +73,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -0.768596 0.168659 0.786884 1.106115
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 7.115746 -34.442368 -7.106302 28.621552
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.242316 -1.224780 -0.224862 0.888410
[Debug] talker-logits-prefill: [3072] first4: 1.002441 -7.728516 -6.866211 -10.271484
[Debug] talker-logits-prefill: [3072] first4: 1.007812 -7.740234 -6.858398 -10.242188
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
@@ -92,7 +92,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=552 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: 0.037001 -0.042584 0.009297 0.073590
[Debug] talker-hidden-step1: [2048] first4: 0.656977 2.473673 0.383985 0.282310
[Debug] talker-hidden-step1: [2048] first4: 0.657201 2.473228 0.382572 0.284397
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -120,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001606 -0.002810 -0.002527 -0.001049
[Perf] PromptBuild 6.0 ms
[Perf] Prefill 20.6 ms (T_ctx prefill)
[Perf] TTFA 36.2 ms (first frame codes)
[Perf] TalkerDecode 347.3 ms (64 frames, 5.43 ms/frame)
[Perf] CodePredictor 515.5 ms (8.05 ms/frame)
[Perf] PromptBuild 2.3 ms
[Perf] Prefill 19.8 ms (T_ctx prefill)
[Perf] TTFA 31.4 ms (first frame codes)
[Perf] TalkerDecode 349.5 ms (64 frames, 5.46 ms/frame)
[Perf] CodePredictor 517.3 ms (8.08 ms/frame)
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
[Perf] CodecDecode 13.2 ms
[Perf] Total 905.0 ms (64 frames, 13.50 ms/frame AR, audio 5.12 s, RTF 0.177)
[Perf] CodecDecode 12.8 ms
[Perf] Total 904.1 ms (64 frames, 13.56 ms/frame AR, audio 5.12 s, RTF 0.177)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -149,17 +149,17 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 82.41% (3440 values)
[Cossim] Embed cos: 0.972129 max: 1.9482e-01 mean: 8.1111e-03
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
[Cossim] L0 cos: 0.987066 max: 6.8545e-01 mean: 1.0819e-02
[Cossim] L7 cos: 0.999990 max: 1.4625e+01 mean: 2.7202e-02
[Cossim] L14 cos: 0.999971 max: 1.4619e+01 mean: 5.9838e-02
[Cossim] L21 cos: 0.999706 max: 1.4627e+01 mean: 2.2469e-01
[Cossim] L27 cos: 0.998902 max: 2.5745e+01 mean: 5.2269e-01
[Cossim] Final cos: 0.994347 max: 7.7912e+00 mean: 1.6944e-01
[Cossim] Logits cos: 0.999560 max: 8.4556e-01 mean: 1.1897e-01
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 5.6559e-10
[Cossim] L0 cos: 0.987066 max: 6.8550e-01 mean: 1.0819e-02
[Cossim] L7 cos: 0.999990 max: 1.4625e+01 mean: 2.7204e-02
[Cossim] L14 cos: 0.999971 max: 1.4619e+01 mean: 5.9834e-02
[Cossim] L21 cos: 0.999707 max: 1.4627e+01 mean: 2.2446e-01
[Cossim] L27 cos: 0.998906 max: 2.5748e+01 mean: 5.2196e-01
[Cossim] Final cos: 0.994367 max: 7.7750e+00 mean: 1.6925e-01
[Cossim] Logits cos: 0.999549 max: 8.4361e-01 mean: 1.2133e-01
[Cossim] NextEmbStep0 cos: 0.883765 max: 1.3749e-01 mean: 2.4548e-02
[Cossim] TalkerHiddenStep1 cos: 0.994873 max: 1.0157e+00 mean: 2.2029e-01
[Cossim] TalkerHiddenStep1 cos: 0.994868 max: 1.0153e+00 mean: 2.2038e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 8.9911e-03 mean: 1.3077e-04
[Cossim] SpkASP cos: 1.000000 max: 2.2933e-04 mean: 1.7414e-05
[Cossim] SpeakerEmb cos: 1.000000 max: 7.9088e-05 mean: 1.3439e-05
[Cossim] CodesFull exact: 4.27% (1008 values)
[Cossim] Audio cos: -0.022804
[Cossim] WAV stft_cos: 0.260492 samples: 120960
[Cossim] CodesFull exact: 3.67% (1008 values)
[Cossim] Audio cos: 0.012961
[Cossim] WAV stft_cos: 0.169275 samples: 120960
+55 -55
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -63,8 +63,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=225, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=yes icl=yes
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [225, 2048] first4: 0.022060 -0.009214 0.008459 -0.019803
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] tts-pad-embed: [2048] first4: -0.005388 0.008927 -0.004415 0.000679
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005416 0.008943 -0.004432 0.000657
[Debug] tts-pad-embed: [2048] first4: -0.005416 0.008943 -0.004432 0.000657
[Debug] spk-emb: [2048] first4: 0.098351 -0.023771 -0.011823 0.006760
[Debug] ref-codes: [16, 215] first4: 1221.000000 2042.000000 696.000000 1522.000000
[Debug] talker-hidden-prefill-l0: [225, 2048] first4: -0.437574 -0.067419 0.007751 0.014628
@@ -73,42 +73,42 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -8.652716 1.697395 1.098899 -0.791332
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 4.921398 -31.754539 -6.813190 21.707518
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.166135 -1.119393 -0.213715 0.667947
[Debug] talker-logits-prefill: [3072] first4: -0.145752 -5.545898 -7.072266 -10.578125
[Debug] talker-logits-prefill: [3072] first4: -0.132812 -5.521973 -7.044922 -10.550781
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
[Sample-CP] g=2 c=400 u=-1.0000000000 subseq=3
[Sample-CP] g=2 c=417 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=442 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=1084 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=517 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=1591 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=1205 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=1237 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=1523 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=1951 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1645 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=1684 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=990 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=147 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: 0.027753 -0.000856 0.028683 0.008918
[Debug] talker-hidden-step1: [2048] first4: 0.807104 2.230810 0.378460 1.502679
[Sample-CP] g=4 c=1412 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=823 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=470 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=996 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=318 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=223 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=426 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=625 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=866 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=1456 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=1047 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 417.000000
[Debug] next-emb-step0: [2048] first4: 0.005714 0.034105 -0.000204 0.073642
[Debug] talker-hidden-step1: [2048] first4: 0.586295 2.651410 0.840972 0.821965
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=324 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1210 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=985 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1640 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=470 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1058 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=103 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=541 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=248 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=729 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1529 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1845 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1435 u=-1.0000000000 subseq=31
[Sample-CP] g=3 c=405 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=390 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=447 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=1059 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=564 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1004 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1702 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1887 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1713 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=338 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=715 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1842 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -118,16 +118,16 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generated 56 frames
[Pipeline] Generated 64 frames
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001812 -0.003170 -0.003023 -0.001804
[Perf] PromptBuild 10.3 ms
[Perf] Prefill 1603.9 ms (T_ctx prefill)
[Perf] TTFA 1621.4 ms (first frame codes)
[Perf] TalkerDecode 158.0 ms (64 frames, 2.47 ms/frame)
[Perf] CodePredictor 345.7 ms (5.40 ms/frame)
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 417.000000
[Debug] output-audio: [122880] first4: -0.001181 -0.002022 -0.001853 -0.000890
[Perf] PromptBuild 2.7 ms
[Perf] Prefill 17.1 ms (T_ctx prefill)
[Perf] TTFA 26.5 ms (first frame codes)
[Perf] TalkerDecode 159.3 ms (64 frames, 2.49 ms/frame)
[Perf] CodePredictor 343.7 ms (5.37 ms/frame)
[Perf] HostCompose 2.6 ms (c0 sample + next emb)
[Perf] CodecDecode 14.1 ms
[Perf] Total 2135.5 ms (64 frames, 7.91 ms/frame AR, audio 5.12 s, RTF 0.417)
[Perf] CodecDecode 14.3 ms
[Perf] Total 540.5 ms (64 frames, 7.90 ms/frame AR, audio 5.12 s, RTF 0.106)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -148,18 +148,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/clone/clone-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 49.83% (3440 values)
[Cossim] Embed cos: 0.917129 max: 2.2247e-01 mean: 2.1853e-02
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
[Cossim] L0 cos: 0.961474 max: 8.6773e-01 mean: 2.8366e-02
[Cossim] L7 cos: 0.997433 max: 3.9399e+01 mean: 1.6338e-01
[Cossim] L14 cos: 0.997359 max: 3.8767e+01 mean: 2.4737e-01
[Cossim] L21 cos: 0.995878 max: 3.9008e+01 mean: 7.7246e-01
[Cossim] L27 cos: 0.956667 max: 1.7484e+03 mean: 1.9748e+00
[Cossim] Final cos: 0.955800 max: 3.3577e+01 mean: 5.4929e-01
[Cossim] Logits cos: 0.992517 max: 2.9832e+00 mean: 4.5371e-01
[Cossim] NextEmbStep0 cos: 0.812867 max: 1.5693e-01 mean: 3.0572e-02
[Cossim] TalkerHiddenStep1 cos: 0.963595 max: 3.7556e+00 mean: 5.7834e-01
[Cossim] Embed cos: 0.917128 max: 2.2245e-01 mean: 2.1853e-02
[Cossim] TrailingText cos: 0.999967 max: 1.5749e-03 mean: 2.3645e-04
[Cossim] TTSPadEmbed cos: 0.999967 max: 1.5749e-03 mean: 2.3645e-04
[Cossim] L0 cos: 0.961488 max: 8.1836e-01 mean: 2.8364e-02
[Cossim] L7 cos: 0.997433 max: 3.9399e+01 mean: 1.6337e-01
[Cossim] L14 cos: 0.997359 max: 3.8767e+01 mean: 2.4736e-01
[Cossim] L21 cos: 0.995877 max: 3.9008e+01 mean: 7.7251e-01
[Cossim] L27 cos: 0.956635 max: 1.7506e+03 mean: 1.9749e+00
[Cossim] Final cos: 0.955792 max: 3.3331e+01 mean: 5.4933e-01
[Cossim] Logits cos: 0.992697 max: 2.9549e+00 mean: 4.4853e-01
[Cossim] NextEmbStep0 cos: 0.819095 max: 1.4988e-01 mean: 3.0364e-02
[Cossim] TalkerHiddenStep1 cos: 0.957774 max: 3.9701e+00 mean: 6.2679e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 8.9911e-03 mean: 1.3077e-04
[Cossim] SpkASP cos: 1.000000 max: 2.2933e-04 mean: 1.7414e-05
[Cossim] SpeakerEmb cos: 1.000000 max: 7.9088e-05 mean: 1.3439e-05
[Cossim] CodesFull exact: 1.29% (1008 values)
[Cossim] Audio cos: -0.002083
[Cossim] WAV stft_cos: 0.103659 samples: 120960
[Cossim] CodesFull exact: 1.88% (1008 values)
[Cossim] Audio cos: -0.006096
[Cossim] WAV stft_cos: 0.202987 samples: 120960
+27 -27
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -63,8 +63,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=225, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=yes icl=yes
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [225, 2048] first4: 0.021991 -0.008996 0.008355 -0.020301
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] tts-pad-embed: [2048] first4: -0.005270 0.008716 -0.004355 0.001036
[Debug] trailing-text-hidden: [1, 2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] tts-pad-embed: [2048] first4: -0.005262 0.008715 -0.004324 0.001049
[Debug] spk-emb: [2048] first4: 0.098351 -0.023771 -0.011823 0.006760
[Debug] ref-codes: [16, 215] first4: 1221.000000 2042.000000 509.000000 1522.000000
[Debug] talker-hidden-prefill-l0: [225, 2048] first4: -0.463469 -0.072789 0.015072 -0.037665
@@ -73,7 +73,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [225, 2048] first4: -1.465379 0.288384 0.656437 1.015133
[Debug] talker-hidden-prefill-l27: [225, 2048] first4: 6.677526 -34.405407 -7.383842 28.511698
[Debug] talker-hidden-prefill-final: [225, 2048] first4: 0.227110 -1.221941 -0.233353 0.883898
[Debug] talker-logits-prefill: [3072] first4: 1.255371 -7.837891 -7.040527 -10.634766
[Debug] talker-logits-prefill: [3072] first4: 1.240234 -7.818359 -7.036621 -10.630859
[Sample] step=0 c0=27 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1408 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1824 u=-1.0000000000 subseq=2
@@ -91,8 +91,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=516 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] next-emb-step0: [2048] first4: 0.021538 -0.036059 0.003081 0.073169
[Debug] talker-hidden-step1: [2048] first4: 0.370579 2.557400 -0.079688 0.176973
[Debug] next-emb-step0: [2048] first4: 0.021546 -0.036059 0.003111 0.073181
[Debug] talker-hidden-step1: [2048] first4: 0.368557 2.554765 -0.075612 0.176847
[Sample] step=1 c0=1902 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1924 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=2025 u=-1.0000000000 subseq=18
@@ -120,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
[Debug] output-audio: [122880] first4: -0.001815 -0.003137 -0.002853 -0.001444
[Perf] PromptBuild 6.1 ms
[Perf] Prefill 2022.5 ms (T_ctx prefill)
[Perf] TTFA 2035.6 ms (first frame codes)
[Perf] TalkerDecode 185.1 ms (64 frames, 2.89 ms/frame)
[Perf] CodePredictor 348.3 ms (5.44 ms/frame)
[Perf] PromptBuild 3.1 ms
[Perf] Prefill 17.1 ms (T_ctx prefill)
[Perf] TTFA 27.0 ms (first frame codes)
[Perf] TalkerDecode 181.1 ms (64 frames, 2.83 ms/frame)
[Perf] CodePredictor 347.4 ms (5.43 ms/frame)
[Perf] HostCompose 1.4 ms (c0 sample + next emb)
[Perf] CodecDecode 13.7 ms
[Perf] Total 2578.2 ms (64 frames, 8.36 ms/frame AR, audio 5.12 s, RTF 0.504)
[Perf] Total 564.9 ms (64 frames, 8.28 ms/frame AR, audio 5.12 s, RTF 0.110)
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -148,18 +148,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/clone/clone-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] RefCodes exact: 81.16% (3440 values)
[Cossim] Embed cos: 0.970174 max: 1.9001e-01 mean: 8.9737e-03
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
[Cossim] L0 cos: 0.985827 max: 7.7038e-01 mean: 1.1813e-02
[Cossim] L7 cos: 0.999979 max: 5.4026e+00 mean: 3.6052e-02
[Cossim] L14 cos: 0.999957 max: 5.4250e+00 mean: 7.0614e-02
[Cossim] L21 cos: 0.999606 max: 1.8712e+01 mean: 2.5038e-01
[Cossim] L27 cos: 0.998546 max: 5.4983e+01 mean: 5.6873e-01
[Cossim] Final cos: 0.992861 max: 1.9019e+01 mean: 1.7999e-01
[Cossim] Logits cos: 0.999574 max: 7.9585e-01 mean: 1.0646e-01
[Cossim] NextEmbStep0 cos: 0.848334 max: 2.7271e-01 mean: 2.8037e-02
[Cossim] TalkerHiddenStep1 cos: 0.993791 max: 1.5125e+00 mean: 2.3976e-01
[Cossim] Embed cos: 0.970174 max: 1.9001e-01 mean: 8.9738e-03
[Cossim] TrailingText cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.9968e-04 mean: 4.5182e-05
[Cossim] L0 cos: 0.985827 max: 7.7032e-01 mean: 1.1813e-02
[Cossim] L7 cos: 0.999979 max: 5.4026e+00 mean: 3.6053e-02
[Cossim] L14 cos: 0.999957 max: 5.4250e+00 mean: 7.0620e-02
[Cossim] L21 cos: 0.999606 max: 1.8725e+01 mean: 2.5042e-01
[Cossim] L27 cos: 0.998546 max: 5.4983e+01 mean: 5.6850e-01
[Cossim] Final cos: 0.992857 max: 1.9049e+01 mean: 1.7996e-01
[Cossim] Logits cos: 0.999582 max: 7.9829e-01 mean: 1.0569e-01
[Cossim] NextEmbStep0 cos: 0.848337 max: 2.7267e-01 mean: 2.8037e-02
[Cossim] TalkerHiddenStep1 cos: 0.993807 max: 1.5080e+00 mean: 2.3942e-01
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
@@ -177,6 +177,6 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Cossim] SpkMFA cos: 1.000000 max: 8.9911e-03 mean: 1.3077e-04
[Cossim] SpkASP cos: 1.000000 max: 2.2933e-04 mean: 1.7414e-05
[Cossim] SpeakerEmb cos: 1.000000 max: 7.9088e-05 mean: 1.3439e-05
[Cossim] CodesFull exact: 2.48% (1008 values)
[Cossim] Audio cos: 0.009786
[Cossim] WAV stft_cos: 0.206154 samples: 120960
[Cossim] CodesFull exact: 3.87% (1008 values)
[Cossim] Audio cos: -0.021260
[Cossim] WAV stft_cos: 0.319623 samples: 120960
+29 -29
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=41, hidden=2048, lang=english (id=2050), speaker=vivian (id=3065) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [41, 2048] first4: 0.021552 -0.009410 0.007135 -0.019698
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003715 0.008406 -0.005009 -0.000409
[Debug] tts-pad-embed: [2048] first4: -0.003715 0.008406 -0.005009 -0.000409
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003711 0.008402 -0.005017 -0.000411
[Debug] tts-pad-embed: [2048] first4: -0.003711 0.008402 -0.005017 -0.000411
[Debug] talker-hidden-prefill-l0: [41, 2048] first4: -0.379815 -0.060772 0.002985 -0.014327
[Debug] talker-hidden-prefill-l7: [41, 2048] first4: -1.346465 0.269726 1.569094 2.175291
[Debug] talker-hidden-prefill-l14: [41, 2048] first4: -1.105307 0.433302 1.668352 2.121887
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -0.675624 0.342037 2.025074 1.566219
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -0.889476 -24.649376 -2.235569 26.374607
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.027474 -0.795056 -0.064163 0.742563
[Debug] talker-logits-prefill: [3072] first4: -0.707031 -8.125000 -2.765625 -4.968750
[Debug] talker-logits-prefill: [3072] first4: -0.671875 -8.062500 -2.796875 -5.000000
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039671 -0.032533 -0.000920 0.180072
[Debug] talker-hidden-step1: [2048] first4: 0.535949 -1.849469 3.002415 -1.185039
[Debug] next-emb-step0: [2048] first4: -0.039668 -0.032537 -0.000928 0.180070
[Debug] talker-hidden-step1: [2048] first4: 0.507531 -1.860892 3.026835 -1.178462
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000016 0.000017
[Perf] PromptBuild 51.2 ms
[Perf] Prefill 10.4 ms (T_ctx prefill)
[Perf] TTFA 76.3 ms (first frame codes)
[Perf] TalkerDecode 237.8 ms (64 frames, 3.71 ms/frame)
[Perf] CodePredictor 466.5 ms (7.29 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 44.0 ms
[Perf] Total 811.7 ms (64 frames, 11.02 ms/frame AR, audio 5.12 s, RTF 0.159)
[Perf] PromptBuild 57.9 ms
[Perf] Prefill 11.2 ms (T_ctx prefill)
[Perf] TTFA 84.4 ms (first frame codes)
[Perf] TalkerDecode 235.4 ms (64 frames, 3.68 ms/frame)
[Perf] CodePredictor 467.9 ms (7.31 ms/frame)
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
[Perf] CodecDecode 57.5 ms
[Perf] Total 831.6 ms (64 frames, 11.00 ms/frame AR, audio 5.12 s, RTF 0.162)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.0038e-03 mean: 3.5584e-05
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] L0 cos: 0.999997 max: 1.4417e-01 mean: 2.6730e-04
[Cossim] L7 cos: 0.999997 max: 1.8764e+01 mean: 3.1551e-03
[Cossim] L14 cos: 0.999997 max: 1.8774e+01 mean: 6.3004e-03
[Cossim] L21 cos: 0.999997 max: 1.8806e+01 mean: 2.0215e-02
[Cossim] L27 cos: 0.999989 max: 3.2072e+01 mean: 1.0380e-01
[Cossim] Final cos: 0.999964 max: 1.1374e+00 mean: 8.0259e-03
[Cossim] Logits cos: 0.999992 max: 9.2691e-02 mean: 1.5265e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.6814e-02 mean: 7.7878e-03
[Cossim] CodesFull exact: 15.87% (1008 values)
[Cossim] Audio cos: 0.169467
[Cossim] WAV stft_cos: 0.353257 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.0038e-03 mean: 3.6440e-05
[Cossim] TrailingText cos: 1.000000 max: 1.4782e-05 mean: 2.4371e-06
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.4782e-05 mean: 2.4371e-06
[Cossim] L0 cos: 0.999997 max: 1.4417e-01 mean: 2.6572e-04
[Cossim] L7 cos: 0.999997 max: 1.8764e+01 mean: 3.1097e-03
[Cossim] L14 cos: 0.999997 max: 1.8774e+01 mean: 6.5687e-03
[Cossim] L21 cos: 0.999997 max: 1.8806e+01 mean: 2.1198e-02
[Cossim] L27 cos: 0.999989 max: 3.1941e+01 mean: 1.0737e-01
[Cossim] Final cos: 0.999961 max: 1.5471e+00 mean: 8.0438e-03
[Cossim] Logits cos: 0.999989 max: 1.1075e-01 mean: 1.8298e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.4782e-05 mean: 2.4371e-06
[Cossim] TalkerHiddenStep1 cos: 0.999988 max: 8.8899e-02 mean: 8.1324e-03
[Cossim] CodesFull exact: 31.35% (1008 values)
[Cossim] Audio cos: 0.256919
[Cossim] WAV stft_cos: 0.426543 samples: 120960
+25 -25
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -0.674516 0.324478 2.041194 1.586644
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -0.925124 -24.436726 -2.204270 26.093655
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.028531 -0.786979 -0.063167 0.733517
[Debug] talker-logits-prefill: [3072] first4: -0.708294 -8.073184 -2.784069 -5.006032
[Debug] talker-logits-prefill: [3072] first4: -0.706617 -8.074141 -2.785939 -5.008051
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039671 -0.032533 -0.000920 0.180072
[Debug] talker-hidden-step1: [2048] first4: 0.532420 -1.853415 3.010569 -1.177851
[Debug] talker-hidden-step1: [2048] first4: 0.532989 -1.854648 3.010650 -1.177469
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000014 0.000016
[Perf] PromptBuild 35.3 ms
[Perf] Prefill 16.1 ms (T_ctx prefill)
[Perf] TTFA 71.5 ms (first frame codes)
[Perf] TalkerDecode 339.1 ms (64 frames, 5.30 ms/frame)
[Perf] CodePredictor 558.4 ms (8.72 ms/frame)
[Perf] PromptBuild 38.8 ms
[Perf] Prefill 20.4 ms (T_ctx prefill)
[Perf] TTFA 71.0 ms (first frame codes)
[Perf] TalkerDecode 339.9 ms (64 frames, 5.31 ms/frame)
[Perf] CodePredictor 561.1 ms (8.77 ms/frame)
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
[Perf] CodecDecode 20.5 ms
[Perf] Total 980.6 ms (64 frames, 14.04 ms/frame AR, audio 5.12 s, RTF 0.192)
[Perf] CodecDecode 49.3 ms
[Perf] Total 1011.3 ms (64 frames, 14.09 ms/frame AR, audio 5.12 s, RTF 0.198)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.3709e-06 mean: 6.4146e-09
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] L0 cos: 1.000000 max: 1.1368e-03 mean: 2.0051e-05
[Cossim] L7 cos: 1.000000 max: 1.4331e-01 mean: 1.6728e-04
[Cossim] L14 cos: 1.000000 max: 1.4355e-01 mean: 4.7609e-04
[Cossim] L21 cos: 1.000000 max: 1.3867e-01 mean: 1.7254e-03
[Cossim] L27 cos: 1.000000 max: 2.3953e+00 mean: 6.8882e-03
[Cossim] Final cos: 1.000000 max: 2.2782e-02 mean: 5.1288e-04
[Cossim] Logits cos: 1.000000 max: 1.8549e-02 mean: 1.8060e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.3854e-02 mean: 1.9640e-03
[Cossim] CodesFull exact: 100.00% (1008 values)
[Cossim] Audio cos: 0.999999
[Cossim] WAV stft_cos: 1.000000 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.1921e-07 mean: 4.5024e-09
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.7605e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.7605e-10
[Cossim] L0 cos: 1.000000 max: 1.1292e-03 mean: 2.0054e-05
[Cossim] L7 cos: 1.000000 max: 1.4331e-01 mean: 1.6481e-04
[Cossim] L14 cos: 1.000000 max: 1.4355e-01 mean: 4.6749e-04
[Cossim] L21 cos: 1.000000 max: 1.3867e-01 mean: 1.6926e-03
[Cossim] L27 cos: 1.000000 max: 3.0042e+00 mean: 6.8375e-03
[Cossim] Final cos: 1.000000 max: 2.8786e-02 mean: 5.1217e-04
[Cossim] Logits cos: 1.000000 max: 1.4814e-02 mean: 1.7547e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.7935e-10
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.4364e-02 mean: 2.0044e-03
[Cossim] CodesFull exact: 58.63% (1008 values)
[Cossim] Audio cos: 0.564482
[Cossim] WAV stft_cos: 0.705637 samples: 120960
+43 -43
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=41, hidden=2048, lang=english (id=2050), speaker=vivian (id=3065) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [41, 2048] first4: 0.020289 -0.009997 0.006191 -0.021695
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003884 0.008386 -0.004502 -0.000786
[Debug] tts-pad-embed: [2048] first4: -0.003884 0.008386 -0.004502 -0.000786
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003912 0.008341 -0.004548 -0.000740
[Debug] tts-pad-embed: [2048] first4: -0.003912 0.008341 -0.004548 -0.000740
[Debug] talker-hidden-prefill-l0: [41, 2048] first4: -0.355011 -0.050283 -0.043141 -0.003944
[Debug] talker-hidden-prefill-l7: [41, 2048] first4: 8.645360 -0.409176 6.265828 14.740660
[Debug] talker-hidden-prefill-l14: [41, 2048] first4: 8.633706 -0.117144 6.429363 14.546964
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: 8.566828 0.177386 6.694110 14.135141
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: 10.430892 -28.939522 -0.966624 39.405346
[Debug] talker-hidden-prefill-final: [41, 2048] first4: 0.320810 -0.929439 -0.027625 1.104689
[Debug] talker-logits-prefill: [3072] first4: -0.887401 -8.253203 -1.895066 -5.468317
[Debug] talker-logits-prefill: [3072] first4: -0.739150 -8.110693 -1.857955 -5.541620
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -65,24 +65,24 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.041045 -0.031131 0.000245 0.179301
[Debug] talker-hidden-step1: [2048] first4: 2.157689 -1.716751 2.875055 -1.246890
[Debug] next-emb-step0: [2048] first4: -0.041074 -0.031176 0.000198 0.179347
[Debug] talker-hidden-step1: [2048] first4: 2.373294 -1.774304 2.979298 -1.468646
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=821 u=-1.0000000000 subseq=18
[Sample-CP] g=0 c=1650 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=1605 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1631 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=859 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1138 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=122 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1842 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1252 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1532 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=501 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1567 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1060 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1799 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=570 u=-1.0000000000 subseq=31
[Sample-CP] g=3 c=656 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=462 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1614 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=1518 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=186 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=298 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1047 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=126 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=284 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1632 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1051 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=577 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000014 0.000015 0.000012 0.000016
[Perf] PromptBuild 92.7 ms
[Perf] Prefill 10.5 ms (T_ctx prefill)
[Perf] TTFA 112.0 ms (first frame codes)
[Perf] TalkerDecode 180.2 ms (64 frames, 2.82 ms/frame)
[Perf] CodePredictor 450.3 ms (7.04 ms/frame)
[Perf] HostCompose 1.7 ms (c0 sample + next emb)
[Perf] CodecDecode 49.7 ms
[Perf] Total 785.7 ms (64 frames, 9.88 ms/frame AR, audio 5.12 s, RTF 0.153)
[Perf] PromptBuild 58.0 ms
[Perf] Prefill 9.7 ms (T_ctx prefill)
[Perf] TTFA 76.7 ms (first frame codes)
[Perf] TalkerDecode 180.6 ms (64 frames, 2.82 ms/frame)
[Perf] CodePredictor 450.7 ms (7.04 ms/frame)
[Perf] HostCompose 2.0 ms (c0 sample + next emb)
[Perf] CodecDecode 55.1 ms
[Perf] Total 757.0 ms (64 frames, 9.90 ms/frame AR, audio 5.12 s, RTF 0.148)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999688 max: 1.6597e-01 mean: 1.0460e-03
[Cossim] TrailingText cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
[Cossim] TTSPadEmbed cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
[Cossim] L0 cos: 0.999273 max: 4.2797e-01 mean: 6.4054e-03
[Cossim] L7 cos: 0.997565 max: 7.8803e+01 mean: 5.9663e-01
[Cossim] L14 cos: 0.997546 max: 7.8470e+01 mean: 7.1838e-01
[Cossim] L21 cos: 0.997090 max: 8.2114e+01 mean: 1.3172e+00
[Cossim] L27 cos: 0.986996 max: 6.0917e+02 mean: 5.5279e+00
[Cossim] Final cos: 0.899728 max: 7.4843e+01 mean: 4.2324e-01
[Cossim] Logits cos: 0.987958 max: 3.4934e+00 mean: 5.0302e-01
[Cossim] NextEmbStep0 cos: 0.999915 max: 3.2489e-03 mean: 7.7490e-04
[Cossim] TalkerHiddenStep1 cos: 0.960377 max: 2.3371e+00 mean: 4.9011e-01
[Cossim] CodesFull exact: 2.88% (1008 values)
[Cossim] Audio cos: 0.004687
[Cossim] WAV stft_cos: 0.074930 samples: 120960
[Cossim] Embed cos: 0.999688 max: 1.6592e-01 mean: 1.0461e-03
[Cossim] TrailingText cos: 0.999970 max: 1.3497e-03 mean: 2.2447e-04
[Cossim] TTSPadEmbed cos: 0.999970 max: 1.3497e-03 mean: 2.2447e-04
[Cossim] L0 cos: 0.999260 max: 4.5659e-01 mean: 6.4688e-03
[Cossim] L7 cos: 0.997565 max: 7.8803e+01 mean: 5.9680e-01
[Cossim] L14 cos: 0.997546 max: 7.8470e+01 mean: 7.1914e-01
[Cossim] L21 cos: 0.997070 max: 8.2114e+01 mean: 1.3285e+00
[Cossim] L27 cos: 0.985133 max: 8.7350e+02 mean: 5.5949e+00
[Cossim] Final cos: 0.903518 max: 7.3380e+01 mean: 4.2497e-01
[Cossim] Logits cos: 0.989764 max: 3.2861e+00 mean: 4.6385e-01
[Cossim] NextEmbStep0 cos: 0.999915 max: 3.1787e-03 mean: 7.7489e-04
[Cossim] TalkerHiddenStep1 cos: 0.956822 max: 2.7100e+00 mean: 5.1082e-01
[Cossim] CodesFull exact: 2.98% (1008 values)
[Cossim] Audio cos: 0.005839
[Cossim] WAV stft_cos: 0.049973 samples: 120960
+35 -35
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=41, hidden=2048, lang=english (id=2050), speaker=vivian (id=3065) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [41, 2048] first4: 0.021718 -0.009369 0.007129 -0.019678
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003786 0.008339 -0.005023 -0.000287
[Debug] tts-pad-embed: [2048] first4: -0.003786 0.008339 -0.005023 -0.000287
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003815 0.008345 -0.005047 -0.000283
[Debug] tts-pad-embed: [2048] first4: -0.003815 0.008345 -0.005047 -0.000283
[Debug] talker-hidden-prefill-l0: [41, 2048] first4: -0.384365 -0.059787 0.002453 -0.015620
[Debug] talker-hidden-prefill-l7: [41, 2048] first4: -2.093254 0.143195 2.071138 1.088321
[Debug] talker-hidden-prefill-l14: [41, 2048] first4: -1.839362 0.303608 2.175983 1.043533
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -1.423596 0.237497 2.555897 0.549143
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -1.260551 -24.831875 -1.713859 25.105915
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.038971 -0.801676 -0.049235 0.707490
[Debug] talker-logits-prefill: [3072] first4: -1.008090 -8.001345 -2.583779 -4.787307
[Debug] talker-logits-prefill: [3072] first4: -1.173872 -7.927353 -2.511883 -4.746889
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039680 -0.032027 -0.001058 0.180065
[Debug] talker-hidden-step1: [2048] first4: 0.471793 -1.851035 2.951462 -1.229669
[Debug] next-emb-step0: [2048] first4: -0.039709 -0.032021 -0.001082 0.180069
[Debug] talker-hidden-step1: [2048] first4: 0.494764 -1.898864 2.974003 -1.256392
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -74,15 +74,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=3 c=1191 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=667 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1614 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=916 u=-1.0000000000 subseq=23
[Sample-CP] g=6 c=943 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1177 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1706 u=-1.0000000000 subseq=25
[Sample-CP] g=8 c=1907 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=944 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=126 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1032 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=763 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1976 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1790 u=-1.0000000000 subseq=31
[Sample-CP] g=11 c=1711 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=99 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1070 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=194 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000014 0.000017 0.000015 0.000016
[Perf] PromptBuild 11.0 ms
[Perf] Prefill 10.9 ms (T_ctx prefill)
[Perf] TTFA 30.8 ms (first frame codes)
[Perf] TalkerDecode 208.3 ms (64 frames, 3.25 ms/frame)
[Perf] CodePredictor 450.0 ms (7.03 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 48.8 ms
[Perf] Total 730.7 ms (64 frames, 10.30 ms/frame AR, audio 5.12 s, RTF 0.143)
[Perf] PromptBuild 4.1 ms
[Perf] Prefill 9.8 ms (T_ctx prefill)
[Perf] TTFA 22.7 ms (first frame codes)
[Perf] TalkerDecode 211.2 ms (64 frames, 3.30 ms/frame)
[Perf] CodePredictor 450.1 ms (7.03 ms/frame)
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
[Perf] CodecDecode 48.5 ms
[Perf] Total 725.4 ms (64 frames, 10.35 ms/frame AR, audio 5.12 s, RTF 0.142)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999961 max: 5.1095e-02 mean: 2.1504e-04
[Cossim] TrailingText cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
[Cossim] L0 cos: 0.999985 max: 5.4441e-02 mean: 8.8865e-04
[Cossim] L7 cos: 0.999986 max: 1.1478e+01 mean: 4.6665e-02
[Cossim] L14 cos: 0.999986 max: 1.1491e+01 mean: 6.0387e-02
[Cossim] L21 cos: 0.999981 max: 1.1623e+01 mean: 1.2132e-01
[Cossim] L27 cos: 0.999839 max: 6.2433e+01 mean: 5.6098e-01
[Cossim] Final cos: 0.998141 max: 1.3384e+01 mean: 4.4882e-02
[Cossim] Logits cos: 0.999743 max: 4.1474e-01 mean: 7.7901e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1319e-03 mean: 2.3562e-04
[Cossim] TalkerHiddenStep1 cos: 0.999401 max: 8.3859e-01 mean: 5.7508e-02
[Cossim] CodesFull exact: 4.37% (1008 values)
[Cossim] Audio cos: -0.014937
[Cossim] WAV stft_cos: 0.293525 samples: 120960
[Cossim] Embed cos: 0.999961 max: 5.1083e-02 mean: 2.1530e-04
[Cossim] TrailingText cos: 0.999999 max: 2.2450e-04 mean: 4.4874e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.2450e-04 mean: 4.4874e-05
[Cossim] L0 cos: 0.999985 max: 5.4441e-02 mean: 8.8191e-04
[Cossim] L7 cos: 0.999986 max: 1.1478e+01 mean: 4.6861e-02
[Cossim] L14 cos: 0.999985 max: 1.1491e+01 mean: 6.1126e-02
[Cossim] L21 cos: 0.999980 max: 1.1623e+01 mean: 1.2524e-01
[Cossim] L27 cos: 0.999808 max: 7.6073e+01 mean: 5.8787e-01
[Cossim] Final cos: 0.998111 max: 1.2330e+01 mean: 4.6281e-02
[Cossim] Logits cos: 0.999614 max: 5.4759e-01 mean: 9.6963e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1177e-03 mean: 2.3569e-04
[Cossim] TalkerHiddenStep1 cos: 0.999529 max: 6.1422e-01 mean: 5.2179e-02
[Cossim] CodesFull exact: 5.95% (1008 values)
[Cossim] Audio cos: 0.057746
[Cossim] WAV stft_cos: 0.183723 samples: 120960
+25 -25
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -0.673058 0.328821 2.038815 1.582232
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -0.925302 -24.484262 -2.207966 26.156094
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.028526 -0.788209 -0.063249 0.734991
[Debug] talker-logits-prefill: [3072] first4: -0.683818 -8.068936 -2.790065 -5.015890
[Debug] talker-logits-prefill: [3072] first4: -0.669965 -8.085880 -2.790195 -5.023310
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039671 -0.032533 -0.000920 0.180072
[Debug] talker-hidden-step1: [2048] first4: 0.540044 -1.853709 3.011116 -1.180285
[Debug] talker-hidden-step1: [2048] first4: 0.534400 -1.847465 3.016824 -1.180515
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000015 0.000017
[Perf] PromptBuild 4.6 ms
[Perf] Prefill 37.3 ms (T_ctx prefill)
[Perf] TTFA 49.9 ms (first frame codes)
[Perf] TalkerDecode 234.6 ms (64 frames, 3.67 ms/frame)
[Perf] CodePredictor 423.7 ms (6.62 ms/frame)
[Perf] PromptBuild 2.9 ms
[Perf] Prefill 38.0 ms (T_ctx prefill)
[Perf] TTFA 49.2 ms (first frame codes)
[Perf] TalkerDecode 235.7 ms (64 frames, 3.68 ms/frame)
[Perf] CodePredictor 428.4 ms (6.69 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 23.4 ms
[Perf] Total 725.5 ms (64 frames, 10.30 ms/frame AR, audio 5.12 s, RTF 0.142)
[Perf] CodecDecode 23.7 ms
[Perf] Total 730.4 ms (64 frames, 10.39 ms/frame AR, audio 5.12 s, RTF 0.143)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.5879e-04 mean: 1.2286e-05
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] L0 cos: 1.000000 max: 4.7047e-02 mean: 1.1847e-04
[Cossim] L7 cos: 0.999997 max: 2.0109e+01 mean: 1.9553e-03
[Cossim] L14 cos: 0.999997 max: 2.0134e+01 mean: 3.7671e-03
[Cossim] L21 cos: 0.999997 max: 2.0128e+01 mean: 1.1339e-02
[Cossim] L27 cos: 0.999996 max: 1.9382e+01 mean: 5.9284e-02
[Cossim] Final cos: 0.999989 max: 3.7538e-01 mean: 4.2944e-03
[Cossim] Logits cos: 0.999997 max: 5.1167e-02 mean: 8.8435e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
[Cossim] TalkerHiddenStep1 cos: 0.999997 max: 3.4212e-02 mean: 4.0743e-03
[Cossim] CodesFull exact: 50.99% (1008 values)
[Cossim] Audio cos: 0.370959
[Cossim] WAV stft_cos: 0.457849 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.5879e-04 mean: 1.2284e-05
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 6.1144e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 6.1144e-10
[Cossim] L0 cos: 1.000000 max: 4.7001e-02 mean: 1.1822e-04
[Cossim] L7 cos: 0.999997 max: 2.0109e+01 mean: 1.9695e-03
[Cossim] L14 cos: 0.999997 max: 2.0134e+01 mean: 3.8866e-03
[Cossim] L21 cos: 0.999997 max: 2.0128e+01 mean: 1.1929e-02
[Cossim] L27 cos: 0.999996 max: 1.9382e+01 mean: 5.9562e-02
[Cossim] Final cos: 0.999989 max: 6.5244e-01 mean: 4.1805e-03
[Cossim] Logits cos: 0.999997 max: 5.2141e-02 mean: 9.5104e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.6872e-10
[Cossim] TalkerHiddenStep1 cos: 0.999997 max: 5.3356e-02 mean: 4.1440e-03
[Cossim] CodesFull exact: 11.90% (1008 values)
[Cossim] Audio cos: 0.102062
[Cossim] WAV stft_cos: 0.247664 samples: 120960
+25 -25
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -0.667860 0.314923 2.050196 1.588315
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -0.985937 -24.421753 -2.187177 25.895386
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.030451 -0.787641 -0.062769 0.729003
[Debug] talker-logits-prefill: [3072] first4: -0.724609 -8.062500 -2.769531 -4.972656
[Debug] talker-logits-prefill: [3072] first4: -0.727051 -8.062500 -2.744141 -4.957031
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039671 -0.032533 -0.000920 0.180072
[Debug] talker-hidden-step1: [2048] first4: 0.541132 -1.856774 3.021543 -1.184640
[Debug] talker-hidden-step1: [2048] first4: 0.530596 -1.852759 3.024868 -1.176871
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000018 0.000016 0.000016
[Perf] PromptBuild 4.9 ms
[Perf] Prefill 14.5 ms (T_ctx prefill)
[Perf] TTFA 28.4 ms (first frame codes)
[Perf] TalkerDecode 345.8 ms (64 frames, 5.40 ms/frame)
[Perf] CodePredictor 514.5 ms (8.04 ms/frame)
[Perf] PromptBuild 2.8 ms
[Perf] Prefill 15.2 ms (T_ctx prefill)
[Perf] TTFA 27.3 ms (first frame codes)
[Perf] TalkerDecode 346.0 ms (64 frames, 5.41 ms/frame)
[Perf] CodePredictor 515.1 ms (8.05 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 20.7 ms
[Perf] Total 902.2 ms (64 frames, 13.46 ms/frame AR, audio 5.12 s, RTF 0.176)
[Perf] CodecDecode 22.2 ms
[Perf] Total 903.0 ms (64 frames, 13.47 ms/frame AR, audio 5.12 s, RTF 0.176)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.7583e-05 mean: 1.5190e-06
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
[Cossim] L0 cos: 0.999998 max: 5.8418e-02 mean: 2.1386e-04
[Cossim] L7 cos: 0.999997 max: 1.9661e+01 mean: 3.1486e-03
[Cossim] L14 cos: 0.999997 max: 1.9681e+01 mean: 5.9397e-03
[Cossim] L21 cos: 0.999996 max: 1.9747e+01 mean: 1.7527e-02
[Cossim] L27 cos: 0.999993 max: 1.9449e+01 mean: 9.8409e-02
[Cossim] Final cos: 0.999974 max: 1.1404e+00 mean: 6.6964e-03
[Cossim] Logits cos: 0.999993 max: 9.0520e-02 mean: 1.3486e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
[Cossim] TalkerHiddenStep1 cos: 0.999988 max: 1.2599e-01 mean: 7.9705e-03
[Cossim] CodesFull exact: 51.09% (1008 values)
[Cossim] Audio cos: 0.352463
[Cossim] WAV stft_cos: 0.447080 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.7583e-05 mean: 1.5171e-06
[Cossim] TrailingText cos: 1.000000 max: 5.9605e-08 mean: 6.1144e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 5.9605e-08 mean: 6.1144e-10
[Cossim] L0 cos: 0.999998 max: 5.8418e-02 mean: 2.1380e-04
[Cossim] L7 cos: 0.999997 max: 1.9661e+01 mean: 3.1661e-03
[Cossim] L14 cos: 0.999997 max: 1.9681e+01 mean: 5.8656e-03
[Cossim] L21 cos: 0.999996 max: 1.9747e+01 mean: 1.7076e-02
[Cossim] L27 cos: 0.999992 max: 2.4651e+01 mean: 9.4464e-02
[Cossim] Final cos: 0.999980 max: 5.1343e-01 mean: 6.4391e-03
[Cossim] Logits cos: 0.999992 max: 9.8179e-02 mean: 1.4742e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 5.9605e-08 mean: 5.6872e-10
[Cossim] TalkerHiddenStep1 cos: 0.999982 max: 1.3266e-01 mean: 9.8017e-03
[Cossim] CodesFull exact: 37.20% (1008 values)
[Cossim] Audio cos: 0.402590
[Cossim] WAV stft_cos: 0.628384 samples: 120960
+40 -40
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=41, hidden=2048, lang=english (id=2050), speaker=vivian (id=3065) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [41, 2048] first4: 0.020286 -0.009986 0.006201 -0.021657
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003884 0.008386 -0.004502 -0.000786
[Debug] tts-pad-embed: [2048] first4: -0.003884 0.008386 -0.004502 -0.000786
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003918 0.008332 -0.004545 -0.000757
[Debug] tts-pad-embed: [2048] first4: -0.003918 0.008332 -0.004545 -0.000757
[Debug] talker-hidden-prefill-l0: [41, 2048] first4: -0.342263 -0.050818 -0.036913 0.000224
[Debug] talker-hidden-prefill-l7: [41, 2048] first4: 8.699647 -0.419024 6.300213 14.780064
[Debug] talker-hidden-prefill-l14: [41, 2048] first4: 8.683900 -0.141477 6.466504 14.615826
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: 8.628358 0.137804 6.816316 14.245395
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: 10.501489 -29.153868 -0.910335 39.360046
[Debug] talker-hidden-prefill-final: [41, 2048] first4: 0.321740 -0.932725 -0.025916 1.099179
[Debug] talker-logits-prefill: [3072] first4: -0.810059 -8.140625 -1.744141 -5.519531
[Debug] talker-logits-prefill: [3072] first4: -0.788574 -8.117188 -1.712891 -5.527344
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -65,23 +65,23 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.041045 -0.031131 0.000245 0.179301
[Debug] talker-hidden-step1: [2048] first4: 2.223578 -1.757181 2.988722 -1.225833
[Debug] next-emb-step0: [2048] first4: -0.041080 -0.031184 0.000201 0.179330
[Debug] talker-hidden-step1: [2048] first4: 2.257318 -1.751209 3.010710 -1.236013
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=821 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=1605 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1631 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=859 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1138 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=122 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1842 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1252 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1532 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=501 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1567 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1060 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1799 u=-1.0000000000 subseq=30
[Sample-CP] g=3 c=362 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=867 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1042 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=43 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=885 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=484 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=294 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1443 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=259 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=433 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=151 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=570 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000011 0.000016
[Perf] PromptBuild 4.2 ms
[Perf] Prefill 11.3 ms (T_ctx prefill)
[Perf] TTFA 22.2 ms (first frame codes)
[Perf] TalkerDecode 157.9 ms (64 frames, 2.47 ms/frame)
[Perf] CodePredictor 347.3 ms (5.43 ms/frame)
[Perf] HostCompose 1.9 ms (c0 sample + next emb)
[Perf] CodecDecode 22.4 ms
[Perf] Total 545.7 ms (64 frames, 7.92 ms/frame AR, audio 5.12 s, RTF 0.107)
[Perf] PromptBuild 2.0 ms
[Perf] Prefill 12.2 ms (T_ctx prefill)
[Perf] TTFA 20.7 ms (first frame codes)
[Perf] TalkerDecode 156.4 ms (64 frames, 2.44 ms/frame)
[Perf] CodePredictor 348.8 ms (5.45 ms/frame)
[Perf] HostCompose 1.8 ms (c0 sample + next emb)
[Perf] CodecDecode 22.0 ms
[Perf] Total 544.0 ms (64 frames, 7.92 ms/frame AR, audio 5.12 s, RTF 0.106)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999698 max: 1.6597e-01 mean: 1.0161e-03
[Cossim] TrailingText cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
[Cossim] TTSPadEmbed cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
[Cossim] L0 cos: 0.999314 max: 3.9985e-01 mean: 6.1714e-03
[Cossim] L7 cos: 0.997560 max: 7.2758e+01 mean: 5.9683e-01
[Cossim] L14 cos: 0.997543 max: 7.2381e+01 mean: 7.1753e-01
[Cossim] L21 cos: 0.997086 max: 7.6007e+01 mean: 1.3170e+00
[Cossim] L27 cos: 0.986253 max: 6.7182e+02 mean: 5.4990e+00
[Cossim] Final cos: 0.904035 max: 7.0011e+01 mean: 4.1551e-01
[Cossim] Logits cos: 0.989857 max: 3.2177e+00 mean: 4.6453e-01
[Cossim] NextEmbStep0 cos: 0.999915 max: 3.2489e-03 mean: 7.7490e-04
[Cossim] TalkerHiddenStep1 cos: 0.959258 max: 2.4423e+00 mean: 4.9678e-01
[Cossim] CodesFull exact: 3.97% (1008 values)
[Cossim] Audio cos: 0.039709
[Cossim] WAV stft_cos: 0.125819 samples: 120960
[Cossim] Embed cos: 0.999698 max: 1.6592e-01 mean: 1.0161e-03
[Cossim] TrailingText cos: 0.999971 max: 1.2915e-03 mean: 2.2418e-04
[Cossim] TTSPadEmbed cos: 0.999971 max: 1.2915e-03 mean: 2.2418e-04
[Cossim] L0 cos: 0.999310 max: 3.9985e-01 mean: 6.1906e-03
[Cossim] L7 cos: 0.997560 max: 7.2758e+01 mean: 5.9684e-01
[Cossim] L14 cos: 0.997543 max: 7.2381e+01 mean: 7.1744e-01
[Cossim] L21 cos: 0.997087 max: 7.6007e+01 mean: 1.3161e+00
[Cossim] L27 cos: 0.986422 max: 6.5484e+02 mean: 5.4943e+00
[Cossim] Final cos: 0.904361 max: 6.9780e+01 mean: 4.1490e-01
[Cossim] Logits cos: 0.989713 max: 3.2500e+00 mean: 4.6759e-01
[Cossim] NextEmbStep0 cos: 0.999915 max: 3.1838e-03 mean: 7.7451e-04
[Cossim] TalkerHiddenStep1 cos: 0.958985 max: 2.4614e+00 mean: 4.9839e-01
[Cossim] CodesFull exact: 3.17% (1008 values)
[Cossim] Audio cos: 0.005176
[Cossim] WAV stft_cos: 0.097897 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=0, T_ctx=41, hidden=2048, lang=english (id=2050), speaker=vivian (id=3065) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [41, 2048] first4: 0.021718 -0.009369 0.007129 -0.019678
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003786 0.008339 -0.005023 -0.000287
[Debug] tts-pad-embed: [2048] first4: -0.003786 0.008339 -0.005023 -0.000287
[Debug] trailing-text-hidden: [1, 2048] first4: -0.003815 0.008345 -0.005047 -0.000283
[Debug] tts-pad-embed: [2048] first4: -0.003815 0.008345 -0.005047 -0.000283
[Debug] talker-hidden-prefill-l0: [41, 2048] first4: -0.380321 -0.062937 0.001099 -0.016046
[Debug] talker-hidden-prefill-l7: [41, 2048] first4: -2.109848 0.164757 2.020530 1.130142
[Debug] talker-hidden-prefill-l14: [41, 2048] first4: -1.859514 0.329631 2.120106 1.083235
[Debug] talker-hidden-prefill-l21: [41, 2048] first4: -1.446755 0.266681 2.494964 0.577370
[Debug] talker-hidden-prefill-l27: [41, 2048] first4: -1.404861 -24.704107 -1.774197 24.936502
[Debug] talker-hidden-prefill-final: [41, 2048] first4: -0.043405 -0.797034 -0.050935 0.702261
[Debug] talker-logits-prefill: [3072] first4: -0.811035 -8.015625 -2.671875 -4.843750
[Debug] talker-logits-prefill: [3072] first4: -0.797852 -8.000000 -2.703125 -4.839844
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1159 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=355 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=901 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] next-emb-step0: [2048] first4: -0.039680 -0.032027 -0.001058 0.180065
[Debug] talker-hidden-step1: [2048] first4: 0.583368 -1.895007 3.011910 -1.211491
[Debug] next-emb-step0: [2048] first4: -0.039709 -0.032021 -0.001082 0.180069
[Debug] talker-hidden-step1: [2048] first4: 0.584582 -1.898573 3.029192 -1.221801
[Sample] step=1 c0=259 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=259 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1160 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000015 0.000017
[Perf] PromptBuild 4.3 ms
[Perf] Prefill 10.6 ms (T_ctx prefill)
[Perf] TTFA 21.2 ms (first frame codes)
[Perf] TalkerDecode 193.9 ms (64 frames, 3.03 ms/frame)
[Perf] CodePredictor 350.7 ms (5.48 ms/frame)
[Perf] PromptBuild 2.8 ms
[Perf] Prefill 11.0 ms (T_ctx prefill)
[Perf] TTFA 20.2 ms (first frame codes)
[Perf] TalkerDecode 199.2 ms (64 frames, 3.11 ms/frame)
[Perf] CodePredictor 351.9 ms (5.50 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 21.8 ms
[Perf] Total 583.1 ms (64 frames, 8.53 ms/frame AR, audio 5.12 s, RTF 0.114)
[Perf] CodecDecode 23.2 ms
[Perf] Total 589.8 ms (64 frames, 8.63 ms/frame AR, audio 5.12 s, RTF 0.115)
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -116,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999962 max: 5.1095e-02 mean: 2.0833e-04
[Cossim] TrailingText cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
[Cossim] L0 cos: 0.999990 max: 5.8628e-02 mean: 6.5103e-04
[Cossim] L7 cos: 0.999982 max: 2.1607e+01 mean: 4.4860e-02
[Cossim] L14 cos: 0.999982 max: 2.1537e+01 mean: 5.5432e-02
[Cossim] L21 cos: 0.999979 max: 2.1858e+01 mean: 1.0403e-01
[Cossim] L27 cos: 0.999877 max: 7.6894e+01 mean: 4.5622e-01
[Cossim] Final cos: 0.998980 max: 1.0111e+01 mean: 3.4557e-02
[Cossim] Logits cos: 0.999883 max: 3.6396e-01 mean: 5.8559e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1319e-03 mean: 2.3562e-04
[Cossim] TalkerHiddenStep1 cos: 0.999782 max: 3.5262e-01 mean: 3.5847e-02
[Cossim] CodesFull exact: 7.34% (1008 values)
[Cossim] Audio cos: 0.074544
[Cossim] WAV stft_cos: 0.345793 samples: 120960
[Cossim] Embed cos: 0.999962 max: 5.1083e-02 mean: 2.0858e-04
[Cossim] TrailingText cos: 0.999999 max: 2.2450e-04 mean: 4.4874e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.2450e-04 mean: 4.4874e-05
[Cossim] L0 cos: 0.999990 max: 5.8628e-02 mean: 6.5153e-04
[Cossim] L7 cos: 0.999982 max: 2.1607e+01 mean: 4.4834e-02
[Cossim] L14 cos: 0.999982 max: 2.1537e+01 mean: 5.5475e-02
[Cossim] L21 cos: 0.999979 max: 2.1858e+01 mean: 1.0392e-01
[Cossim] L27 cos: 0.999883 max: 6.6968e+01 mean: 4.5412e-01
[Cossim] Final cos: 0.998996 max: 9.8778e+00 mean: 3.4441e-02
[Cossim] Logits cos: 0.999884 max: 3.5614e-01 mean: 5.9515e-02
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1177e-03 mean: 2.3569e-04
[Cossim] TalkerHiddenStep1 cos: 0.999753 max: 3.8159e-01 mean: 3.7885e-02
[Cossim] CodesFull exact: 5.95% (1008 values)
[Cossim] Audio cos: 0.078188
[Cossim] WAV stft_cos: 0.223316 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=12, T_ctx=52, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [52, 2048] first4: 0.018727 -0.007901 0.004592 -0.013309
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004532 0.007560 -0.004596 -0.000724
[Debug] tts-pad-embed: [2048] first4: -0.004532 0.007560 -0.004596 -0.000724
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004528 0.007558 -0.004598 -0.000718
[Debug] tts-pad-embed: [2048] first4: -0.004528 0.007558 -0.004598 -0.000718
[Debug] talker-hidden-prefill-l0: [52, 2048] first4: -0.378245 -0.053189 -0.040086 -0.055057
[Debug] talker-hidden-prefill-l7: [52, 2048] first4: -0.913287 0.544263 0.936098 0.987041
[Debug] talker-hidden-prefill-l14: [52, 2048] first4: -0.693041 0.740130 1.053631 0.897233
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.291059 0.672281 1.312454 0.484646
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -6.573664 -28.454243 -2.757126 31.734982
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.297283 -1.343485 -0.115349 1.308717
[Debug] talker-logits-prefill: [3072] first4: -3.093750 -10.062500 -1.562500 -3.015625
[Debug] talker-logits-prefill: [3072] first4: -3.046875 -10.062500 -1.554688 -3.031250
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004818 -0.029755 0.017770 0.080159
[Debug] talker-hidden-step1: [2048] first4: 0.542476 -0.642450 7.083525 -3.779171
[Debug] next-emb-step0: [2048] first4: 0.004822 -0.029757 0.017768 0.080165
[Debug] talker-hidden-step1: [2048] first4: 0.544759 -0.638723 7.078557 -3.790526
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000048 0.000058 0.000047 0.000050
[Perf] PromptBuild 51.7 ms
[Perf] Prefill 28.7 ms (T_ctx prefill)
[Perf] TTFA 94.6 ms (first frame codes)
[Perf] TalkerDecode 235.6 ms (64 frames, 3.68 ms/frame)
[Perf] CodePredictor 465.6 ms (7.28 ms/frame)
[Perf] PromptBuild 46.4 ms
[Perf] Prefill 10.6 ms (T_ctx prefill)
[Perf] TTFA 71.3 ms (first frame codes)
[Perf] TalkerDecode 235.0 ms (64 frames, 3.67 ms/frame)
[Perf] CodePredictor 466.5 ms (7.29 ms/frame)
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
[Perf] CodecDecode 41.9 ms
[Perf] Total 825.3 ms (64 frames, 10.97 ms/frame AR, audio 5.12 s, RTF 0.161)
[Perf] CodecDecode 42.1 ms
[Perf] Total 802.4 ms (64 frames, 10.98 ms/frame AR, audio 5.12 s, RTF 0.157)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999999 max: 1.1206e-03 mean: 3.1131e-05
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] L0 cos: 0.999996 max: 1.6263e-01 mean: 3.0107e-04
[Cossim] L7 cos: 0.999997 max: 1.4358e+01 mean: 2.8334e-03
[Cossim] L14 cos: 0.999997 max: 1.4371e+01 mean: 5.5941e-03
[Cossim] L21 cos: 0.999997 max: 1.4399e+01 mean: 1.6069e-02
[Cossim] L27 cos: 0.999986 max: 5.5600e+01 mean: 8.6568e-02
[Cossim] Final cos: 0.999973 max: 8.4513e-01 mean: 9.5251e-03
[Cossim] Logits cos: 0.999968 max: 1.3380e-01 mean: 2.4371e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.1161e-02 mean: 1.0040e-02
[Cossim] CodesFull exact: 10.42% (1008 values)
[Cossim] Audio cos: 0.160630
[Cossim] WAV stft_cos: 0.411574 samples: 120960
[Cossim] Embed cos: 0.999999 max: 1.1206e-03 mean: 3.1755e-05
[Cossim] TrailingText cos: 1.000000 max: 2.1867e-05 mean: 2.3897e-06
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.1867e-05 mean: 2.3897e-06
[Cossim] L0 cos: 0.999996 max: 1.6263e-01 mean: 3.0004e-04
[Cossim] L7 cos: 0.999997 max: 1.4358e+01 mean: 2.8210e-03
[Cossim] L14 cos: 0.999997 max: 1.4371e+01 mean: 5.5198e-03
[Cossim] L21 cos: 0.999997 max: 1.4399e+01 mean: 1.6232e-02
[Cossim] L27 cos: 0.999982 max: 6.2098e+01 mean: 8.9341e-02
[Cossim] Final cos: 0.999972 max: 8.4513e-01 mean: 9.7859e-03
[Cossim] Logits cos: 0.999982 max: 1.0386e-01 mean: 1.9016e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 2.1860e-05 mean: 2.3897e-06
[Cossim] TalkerHiddenStep1 cos: 0.999992 max: 5.1730e-02 mean: 8.9382e-03
[Cossim] CodesFull exact: 12.00% (1008 values)
[Cossim] Audio cos: 0.177311
[Cossim] WAV stft_cos: 0.459578 samples: 120960
+25 -25
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.293831 0.674101 1.303767 0.486516
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -6.642353 -28.852940 -2.780969 32.031685
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.300769 -1.364028 -0.116493 1.322619
[Debug] talker-logits-prefill: [3072] first4: -3.028953 -10.120714 -1.571011 -3.059533
[Debug] talker-logits-prefill: [3072] first4: -3.027786 -10.120416 -1.571886 -3.060836
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004818 -0.029755 0.017770 0.080159
[Debug] talker-hidden-step1: [2048] first4: 0.547696 -0.655166 7.058888 -3.805778
[Debug] talker-hidden-step1: [2048] first4: 0.549840 -0.653901 7.058165 -3.805066
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000048 0.000056 0.000045 0.000048
[Perf] PromptBuild 37.1 ms
[Perf] Prefill 15.4 ms (T_ctx prefill)
[Perf] TTFA 63.0 ms (first frame codes)
[Perf] TalkerDecode 341.4 ms (64 frames, 5.33 ms/frame)
[Perf] CodePredictor 560.0 ms (8.75 ms/frame)
[Perf] PromptBuild 30.6 ms
[Perf] Prefill 15.0 ms (T_ctx prefill)
[Perf] TTFA 56.1 ms (first frame codes)
[Perf] TalkerDecode 341.1 ms (64 frames, 5.33 ms/frame)
[Perf] CodePredictor 560.6 ms (8.76 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 20.6 ms
[Perf] Total 976.1 ms (64 frames, 14.10 ms/frame AR, audio 5.12 s, RTF 0.191)
[Perf] CodecDecode 41.4 ms
[Perf] Total 990.2 ms (64 frames, 14.10 ms/frame AR, audio 5.12 s, RTF 0.193)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.9538e-04 mean: 1.9707e-06
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] L0 cos: 1.000000 max: 7.1602e-03 mean: 2.8518e-05
[Cossim] L7 cos: 1.000000 max: 1.6060e+00 mean: 2.0806e-04
[Cossim] L14 cos: 1.000000 max: 1.6064e+00 mean: 4.3786e-04
[Cossim] L21 cos: 1.000000 max: 1.6055e+00 mean: 1.2727e-03
[Cossim] L27 cos: 1.000000 max: 1.6216e+00 mean: 4.3521e-03
[Cossim] Final cos: 1.000000 max: 6.5773e-02 mean: 6.2780e-04
[Cossim] Logits cos: 1.000000 max: 9.5885e-03 mean: 9.8726e-04
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
[Cossim] TalkerHiddenStep1 cos: 1.000000 max: 9.1410e-03 mean: 1.8990e-03
[Cossim] CodesFull exact: 21.73% (1008 values)
[Cossim] Audio cos: 0.367625
[Cossim] WAV stft_cos: 0.640372 samples: 120960
[Cossim] Embed cos: 1.000000 max: 2.6208e-04 mean: 2.3495e-06
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.2736e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.2736e-10
[Cossim] L0 cos: 1.000000 max: 7.1602e-03 mean: 3.0212e-05
[Cossim] L7 cos: 1.000000 max: 1.3188e+00 mean: 2.0030e-04
[Cossim] L14 cos: 1.000000 max: 1.3188e+00 mean: 4.3997e-04
[Cossim] L21 cos: 1.000000 max: 1.3179e+00 mean: 1.3047e-03
[Cossim] L27 cos: 1.000000 max: 1.3149e+00 mean: 4.4246e-03
[Cossim] Final cos: 1.000000 max: 6.5773e-02 mean: 6.4912e-04
[Cossim] Logits cos: 1.000000 max: 8.3647e-03 mean: 1.0684e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 2.9802e-08 mean: 4.9695e-10
[Cossim] TalkerHiddenStep1 cos: 1.000000 max: 9.0551e-03 mean: 1.3394e-03
[Cossim] CodesFull exact: 66.96% (1008 values)
[Cossim] Audio cos: 0.848133
[Cossim] WAV stft_cos: 0.945239 samples: 120960
+54 -54
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,50 +39,50 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=12, T_ctx=52, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [52, 2048] first4: 0.017985 -0.008412 0.002880 -0.014425
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004540 0.007622 -0.004462 -0.000982
[Debug] tts-pad-embed: [2048] first4: -0.004540 0.007622 -0.004462 -0.000982
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004586 0.007551 -0.004515 -0.000979
[Debug] tts-pad-embed: [2048] first4: -0.004586 0.007551 -0.004515 -0.000979
[Debug] talker-hidden-prefill-l0: [52, 2048] first4: -0.374121 -0.027120 -0.019008 -0.093047
[Debug] talker-hidden-prefill-l7: [52, 2048] first4: -11.125328 0.671356 5.810454 -2.366840
[Debug] talker-hidden-prefill-l14: [52, 2048] first4: -10.697063 0.601268 5.949415 -2.471097
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -9.728454 -0.267116 6.584153 -1.839725
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -13.886957 -29.504847 7.155929 29.007040
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.656418 -1.456094 0.312920 1.250320
[Debug] talker-logits-prefill: [3072] first4: -5.912702 -8.496762 0.731068 0.080141
[Debug] talker-logits-prefill: [3072] first4: -5.530341 -8.835611 0.531635 -0.183483
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
[Sample-CP] g=2 c=2030 u=-1.0000000000 subseq=3
[Sample-CP] g=3 c=6 u=-1.0000000000 subseq=4
[Sample-CP] g=4 c=2026 u=-1.0000000000 subseq=5
[Sample-CP] g=5 c=359 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=1643 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=1822 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=1625 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=743 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=437 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1677 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=1484 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=1008 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=1409 u=-1.0000000000 subseq=15
[Sample-CP] g=5 c=1751 u=-1.0000000000 subseq=6
[Sample-CP] g=6 c=99 u=-1.0000000000 subseq=7
[Sample-CP] g=7 c=249 u=-1.0000000000 subseq=8
[Sample-CP] g=8 c=1221 u=-1.0000000000 subseq=9
[Sample-CP] g=9 c=1241 u=-1.0000000000 subseq=10
[Sample-CP] g=10 c=248 u=-1.0000000000 subseq=11
[Sample-CP] g=11 c=1713 u=-1.0000000000 subseq=12
[Sample-CP] g=12 c=1529 u=-1.0000000000 subseq=13
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
[Debug] next-emb-step0: [2048] first4: 0.044637 -0.061040 0.027481 0.069659
[Debug] talker-hidden-step1: [2048] first4: 1.038941 -2.293870 4.431493 -2.766184
[Debug] next-emb-step0: [2048] first4: 0.042880 -0.081546 0.023394 0.069948
[Debug] talker-hidden-step1: [2048] first4: 1.206863 -0.303423 5.463121 -3.003377
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=85 u=-1.0000000000 subseq=17
[Sample-CP] g=0 c=1782 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=282 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=371 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=286 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1579 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=370 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1253 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1179 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=324 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=903 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=527 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1956 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=586 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=31
[Sample-CP] g=2 c=1336 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1531 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=278 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1155 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=1902 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1311 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=1124 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1076 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1603 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=1108 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=1759 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1772 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=1435 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -93,15 +93,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generated 64 frames
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
[Debug] output-audio: [122880] first4: 0.000068 0.000090 0.000094 0.000090
[Perf] PromptBuild 97.6 ms
[Perf] Prefill 11.2 ms (T_ctx prefill)
[Perf] TTFA 117.7 ms (first frame codes)
[Perf] TalkerDecode 180.4 ms (64 frames, 2.82 ms/frame)
[Perf] CodePredictor 449.4 ms (7.02 ms/frame)
[Perf] HostCompose 2.1 ms (c0 sample + next emb)
[Perf] CodecDecode 50.2 ms
[Perf] Total 791.6 ms (64 frames, 9.87 ms/frame AR, audio 5.12 s, RTF 0.155)
[Debug] output-audio: [122880] first4: 0.000058 0.000075 0.000070 0.000064
[Perf] PromptBuild 103.8 ms
[Perf] Prefill 10.7 ms (T_ctx prefill)
[Perf] TTFA 123.6 ms (first frame codes)
[Perf] TalkerDecode 182.0 ms (64 frames, 2.84 ms/frame)
[Perf] CodePredictor 452.1 ms (7.06 ms/frame)
[Perf] HostCompose 2.3 ms (c0 sample + next emb)
[Perf] CodecDecode 53.0 ms
[Perf] Total 804.7 ms (64 frames, 9.94 ms/frame AR, audio 5.12 s, RTF 0.157)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999658 max: 1.0957e-02 mean: 9.8301e-04
[Cossim] TrailingText cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
[Cossim] L0 cos: 0.999164 max: 6.9857e-01 mean: 6.7331e-03
[Cossim] L7 cos: 0.997482 max: 1.4649e+02 mean: 4.3740e-01
[Cossim] L14 cos: 0.997455 max: 1.4771e+02 mean: 5.4496e-01
[Cossim] L21 cos: 0.997039 max: 1.4597e+02 mean: 1.0211e+00
[Cossim] L27 cos: 0.988740 max: 5.5027e+02 mean: 4.5528e+00
[Cossim] Final cos: 0.934222 max: 3.1475e+01 mean: 5.1201e-01
[Cossim] Logits cos: 0.891928 max: 8.8856e+00 mean: 1.7015e+00
[Cossim] NextEmbStep0 cos: 0.823251 max: 1.5745e-01 mean: 3.2172e-02
[Cossim] TalkerHiddenStep1 cos: 0.708432 max: 1.1653e+01 mean: 1.7145e+00
[Cossim] CodesFull exact: 0.69% (1008 values)
[Cossim] Audio cos: 0.009317
[Cossim] WAV stft_cos: 0.143536 samples: 120960
[Cossim] Embed cos: 0.999657 max: 1.1973e-02 mean: 9.8548e-04
[Cossim] TrailingText cos: 0.999968 max: 2.3494e-03 mean: 2.2353e-04
[Cossim] TTSPadEmbed cos: 0.999968 max: 2.3494e-03 mean: 2.2353e-04
[Cossim] L0 cos: 0.999166 max: 6.9266e-01 mean: 6.7311e-03
[Cossim] L7 cos: 0.997456 max: 1.7415e+02 mean: 4.3722e-01
[Cossim] L14 cos: 0.997429 max: 1.7533e+02 mean: 5.4428e-01
[Cossim] L21 cos: 0.997012 max: 1.7359e+02 mean: 1.0220e+00
[Cossim] L27 cos: 0.988338 max: 5.2267e+02 mean: 4.5817e+00
[Cossim] Final cos: 0.932149 max: 3.1475e+01 mean: 5.1778e-01
[Cossim] Logits cos: 0.900092 max: 8.3374e+00 mean: 1.6179e+00
[Cossim] NextEmbStep0 cos: 0.820738 max: 1.5121e-01 mean: 3.1572e-02
[Cossim] TalkerHiddenStep1 cos: 0.735051 max: 9.1576e+00 mean: 1.6423e+00
[Cossim] CodesFull exact: 1.39% (1008 values)
[Cossim] Audio cos: -0.002664
[Cossim] WAV stft_cos: 0.170066 samples: 120960
+42 -42
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=12, T_ctx=52, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [52, 2048] first4: 0.018681 -0.007813 0.004704 -0.013309
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004554 0.007647 -0.004656 -0.000707
[Debug] tts-pad-embed: [2048] first4: -0.004554 0.007647 -0.004656 -0.000707
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004584 0.007664 -0.004639 -0.000675
[Debug] tts-pad-embed: [2048] first4: -0.004584 0.007664 -0.004639 -0.000675
[Debug] talker-hidden-prefill-l0: [52, 2048] first4: -0.382533 -0.050962 -0.040130 -0.050671
[Debug] talker-hidden-prefill-l7: [52, 2048] first4: -1.392710 0.385573 1.523267 0.551711
[Debug] talker-hidden-prefill-l14: [52, 2048] first4: -1.165522 0.584058 1.651479 0.464033
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.757398 0.477059 1.961465 0.098216
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -6.859597 -29.645920 -2.003496 31.726250
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.308366 -1.391411 -0.083320 1.300563
[Debug] talker-logits-prefill: [3072] first4: -2.945350 -10.090734 -1.752324 -3.033525
[Debug] talker-logits-prefill: [3072] first4: -2.892906 -10.090289 -1.768137 -3.035595
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -65,24 +65,24 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004793 -0.029425 0.017809 0.080303
[Debug] talker-hidden-step1: [2048] first4: 0.513910 -0.639665 7.075348 -3.944325
[Debug] next-emb-step0: [2048] first4: 0.004763 -0.029409 0.017827 0.080335
[Debug] talker-hidden-step1: [2048] first4: 0.609090 -0.777700 7.020017 -3.937526
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=1879 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=371 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=628 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=1799 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=187 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=645 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=834 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=1355 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=132 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=251 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=772 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=898 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=649 u=-1.0000000000 subseq=31
[Sample-CP] g=1 c=1697 u=-1.0000000000 subseq=18
[Sample-CP] g=2 c=11 u=-1.0000000000 subseq=19
[Sample-CP] g=3 c=1614 u=-1.0000000000 subseq=20
[Sample-CP] g=4 c=951 u=-1.0000000000 subseq=21
[Sample-CP] g=5 c=85 u=-1.0000000000 subseq=22
[Sample-CP] g=6 c=130 u=-1.0000000000 subseq=23
[Sample-CP] g=7 c=1409 u=-1.0000000000 subseq=24
[Sample-CP] g=8 c=179 u=-1.0000000000 subseq=25
[Sample-CP] g=9 c=418 u=-1.0000000000 subseq=26
[Sample-CP] g=10 c=1293 u=-1.0000000000 subseq=27
[Sample-CP] g=11 c=620 u=-1.0000000000 subseq=28
[Sample-CP] g=12 c=914 u=-1.0000000000 subseq=29
[Sample-CP] g=13 c=1126 u=-1.0000000000 subseq=30
[Sample-CP] g=14 c=665 u=-1.0000000000 subseq=31
[Pipeline] Generated 8 frames
[Pipeline] Generated 16 frames
[Pipeline] Generated 24 frames
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000048 0.000057 0.000046 0.000047
[Perf] PromptBuild 11.1 ms
[Perf] Prefill 11.5 ms (T_ctx prefill)
[Perf] TTFA 31.4 ms (first frame codes)
[Perf] TalkerDecode 208.4 ms (64 frames, 3.26 ms/frame)
[Perf] CodePredictor 450.3 ms (7.04 ms/frame)
[Perf] PromptBuild 4.5 ms
[Perf] Prefill 10.4 ms (T_ctx prefill)
[Perf] TTFA 23.8 ms (first frame codes)
[Perf] TalkerDecode 212.2 ms (64 frames, 3.32 ms/frame)
[Perf] CodePredictor 449.4 ms (7.02 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 47.8 ms
[Perf] Total 730.7 ms (64 frames, 10.31 ms/frame AR, audio 5.12 s, RTF 0.143)
[Perf] CodecDecode 48.5 ms
[Perf] Total 726.6 ms (64 frames, 10.35 ms/frame AR, audio 5.12 s, RTF 0.142)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999988 max: 2.2665e-03 mean: 1.7603e-04
[Cossim] TrailingText cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
[Cossim] L0 cos: 0.999985 max: 2.3760e-02 mean: 9.3925e-04
[Cossim] L7 cos: 0.999987 max: 1.3056e+01 mean: 3.4056e-02
[Cossim] L14 cos: 0.999987 max: 1.3224e+01 mean: 4.4997e-02
[Cossim] L21 cos: 0.999983 max: 1.2932e+01 mean: 9.2455e-02
[Cossim] L27 cos: 0.999893 max: 1.4175e+02 mean: 4.1420e-01
[Cossim] Final cos: 0.999401 max: 3.4479e+00 mean: 4.8895e-02
[Cossim] Logits cos: 0.999824 max: 3.1808e-01 mean: 5.5622e-02
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0252e-03 mean: 2.4056e-04
[Cossim] TalkerHiddenStep1 cos: 0.999498 max: 3.7477e-01 mean: 6.9993e-02
[Cossim] CodesFull exact: 4.96% (1008 values)
[Cossim] Audio cos: 0.095440
[Cossim] WAV stft_cos: 0.360164 samples: 120960
[Cossim] Embed cos: 0.999988 max: 2.2665e-03 mean: 1.7630e-04
[Cossim] TrailingText cos: 0.999999 max: 2.0327e-04 mean: 4.3886e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.0327e-04 mean: 4.3886e-05
[Cossim] L0 cos: 0.999985 max: 2.2167e-02 mean: 9.4027e-04
[Cossim] L7 cos: 0.999987 max: 9.9766e+00 mean: 3.3999e-02
[Cossim] L14 cos: 0.999987 max: 1.0096e+01 mean: 4.5082e-02
[Cossim] L21 cos: 0.999983 max: 9.8130e+00 mean: 9.1481e-02
[Cossim] L27 cos: 0.999859 max: 1.7468e+02 mean: 4.2090e-01
[Cossim] Final cos: 0.999413 max: 2.4943e+00 mean: 4.8565e-02
[Cossim] Logits cos: 0.999833 max: 3.5697e-01 mean: 5.6132e-02
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0488e-03 mean: 2.4124e-04
[Cossim] TalkerHiddenStep1 cos: 0.999359 max: 4.0041e-01 mean: 7.8479e-02
[Cossim] CodesFull exact: 2.58% (1008 values)
[Cossim] Audio cos: 0.021264
[Cossim] WAV stft_cos: 0.285559 samples: 120960
+26 -26
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.293386 0.670719 1.304075 0.480947
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -6.649920 -28.831331 -2.730258 32.029514
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.301338 -1.364034 -0.114455 1.323527
[Debug] talker-logits-prefill: [3072] first4: -3.015606 -10.121025 -1.579408 -3.072892
[Debug] talker-logits-prefill: [3072] first4: -3.044844 -10.108796 -1.573887 -3.074317
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004818 -0.029755 0.017770 0.080159
[Debug] talker-hidden-step1: [2048] first4: 0.554118 -0.650167 7.059322 -3.799908
[Debug] talker-hidden-step1: [2048] first4: 0.551232 -0.651829 7.061804 -3.801106
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000048 0.000057 0.000046 0.000050
[Perf] PromptBuild 6.0 ms
[Perf] Prefill 40.8 ms (T_ctx prefill)
[Perf] TTFA 54.2 ms (first frame codes)
[Perf] TalkerDecode 236.3 ms (64 frames, 3.69 ms/frame)
[Perf] CodePredictor 425.5 ms (6.65 ms/frame)
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
[Perf] CodecDecode 23.6 ms
[Perf] Total 734.0 ms (64 frames, 10.36 ms/frame AR, audio 5.12 s, RTF 0.143)
[Perf] PromptBuild 3.4 ms
[Perf] Prefill 38.2 ms (T_ctx prefill)
[Perf] TTFA 49.9 ms (first frame codes)
[Perf] TalkerDecode 236.9 ms (64 frames, 3.70 ms/frame)
[Perf] CodePredictor 431.8 ms (6.75 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 23.7 ms
[Perf] Total 735.7 ms (64 frames, 10.46 ms/frame AR, audio 5.12 s, RTF 0.144)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.4023e-04 mean: 1.3036e-05
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] L0 cos: 1.000000 max: 3.9482e-02 mean: 1.3481e-04
[Cossim] L7 cos: 0.999999 max: 9.3010e+00 mean: 1.5662e-03
[Cossim] L14 cos: 0.999999 max: 9.2749e+00 mean: 2.9958e-03
[Cossim] L21 cos: 0.999999 max: 9.2729e+00 mean: 8.1525e-03
[Cossim] L27 cos: 0.999997 max: 2.2991e+01 mean: 4.0734e-02
[Cossim] Final cos: 0.999993 max: 3.8317e-01 mean: 4.6836e-03
[Cossim] Logits cos: 0.999996 max: 5.6216e-02 mean: 8.2254e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 3.5449e-02 mean: 3.7840e-03
[Cossim] CodesFull exact: 10.62% (1008 values)
[Cossim] Audio cos: 0.171297
[Cossim] WAV stft_cos: 0.425931 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.4023e-04 mean: 1.3794e-05
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.4494e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.4494e-10
[Cossim] L0 cos: 1.000000 max: 3.8864e-02 mean: 1.3533e-04
[Cossim] L7 cos: 0.999999 max: 9.2673e+00 mean: 1.5871e-03
[Cossim] L14 cos: 0.999999 max: 9.2402e+00 mean: 3.0659e-03
[Cossim] L21 cos: 0.999999 max: 9.2405e+00 mean: 8.3757e-03
[Cossim] L27 cos: 0.999997 max: 2.2374e+01 mean: 4.5652e-02
[Cossim] Final cos: 0.999993 max: 3.4711e-01 mean: 4.7577e-03
[Cossim] Logits cos: 0.999996 max: 5.4571e-02 mean: 8.4845e-03
[Cossim] NextEmbStep0 cos: 1.000000 max: 2.9802e-08 mean: 5.3146e-10
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 2.0412e-02 mean: 3.1455e-03
[Cossim] CodesFull exact: 66.96% (1008 values)
[Cossim] Audio cos: 0.848242
[Cossim] WAV stft_cos: 0.945342 samples: 120960
+26 -26
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -47,7 +47,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.289999 0.677390 1.300594 0.487551
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -6.569641 -29.104300 -2.837480 32.018822
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.298846 -1.382246 -0.119408 1.328176
[Debug] talker-logits-prefill: [3072] first4: -3.060547 -10.125000 -1.578125 -3.080078
[Debug] talker-logits-prefill: [3072] first4: -3.035156 -10.117188 -1.516602 -3.039062
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -66,7 +66,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004818 -0.029755 0.017770 0.080159
[Debug] talker-hidden-step1: [2048] first4: 0.529472 -0.658489 7.077869 -3.804044
[Debug] talker-hidden-step1: [2048] first4: 0.537636 -0.655385 7.067036 -3.810875
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000047 0.000055 0.000045 0.000047
[Perf] PromptBuild 4.5 ms
[Perf] Prefill 15.4 ms (T_ctx prefill)
[Perf] TTFA 29.0 ms (first frame codes)
[Perf] TalkerDecode 364.1 ms (64 frames, 5.69 ms/frame)
[Perf] CodePredictor 516.8 ms (8.07 ms/frame)
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
[Perf] CodecDecode 21.8 ms
[Perf] Total 924.3 ms (64 frames, 13.78 ms/frame AR, audio 5.12 s, RTF 0.181)
[Perf] PromptBuild 3.1 ms
[Perf] Prefill 16.1 ms (T_ctx prefill)
[Perf] TTFA 28.6 ms (first frame codes)
[Perf] TalkerDecode 358.0 ms (64 frames, 5.59 ms/frame)
[Perf] CodePredictor 554.2 ms (8.66 ms/frame)
[Perf] HostCompose 1.5 ms (c0 sample + next emb)
[Perf] CodecDecode 22.3 ms
[Perf] Total 956.0 ms (64 frames, 14.28 ms/frame AR, audio 5.12 s, RTF 0.187)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 1.000000 max: 1.8746e-05 mean: 1.6375e-06
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
[Cossim] L0 cos: 0.999998 max: 3.6650e-02 mean: 2.3488e-04
[Cossim] L7 cos: 0.999997 max: 2.3656e+01 mean: 3.0020e-03
[Cossim] L14 cos: 0.999997 max: 2.3634e+01 mean: 5.2402e-03
[Cossim] L21 cos: 0.999997 max: 2.3635e+01 mean: 1.3776e-02
[Cossim] L27 cos: 0.999993 max: 2.5778e+01 mean: 7.8860e-02
[Cossim] Final cos: 0.999975 max: 6.7772e-01 mean: 9.1281e-03
[Cossim] Logits cos: 0.999989 max: 8.6272e-02 mean: 1.4754e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
[Cossim] TalkerHiddenStep1 cos: 0.999987 max: 6.1182e-02 mean: 1.1015e-02
[Cossim] CodesFull exact: 10.32% (1008 values)
[Cossim] Audio cos: 0.173195
[Cossim] WAV stft_cos: 0.496584 samples: 120960
[Cossim] Embed cos: 1.000000 max: 1.8746e-05 mean: 1.7275e-06
[Cossim] TrailingText cos: 1.000000 max: 2.9802e-08 mean: 5.4494e-10
[Cossim] TTSPadEmbed cos: 1.000000 max: 2.9802e-08 mean: 5.4494e-10
[Cossim] L0 cos: 0.999998 max: 4.4460e-02 mean: 2.3586e-04
[Cossim] L7 cos: 0.999998 max: 2.6257e+01 mean: 3.0930e-03
[Cossim] L14 cos: 0.999998 max: 2.6221e+01 mean: 5.4449e-03
[Cossim] L21 cos: 0.999997 max: 2.6244e+01 mean: 1.4610e-02
[Cossim] L27 cos: 0.999992 max: 2.5753e+01 mean: 7.9559e-02
[Cossim] Final cos: 0.999974 max: 6.7772e-01 mean: 9.1997e-03
[Cossim] Logits cos: 0.999989 max: 8.1202e-02 mean: 1.4057e-02
[Cossim] NextEmbStep0 cos: 1.000000 max: 2.9802e-08 mean: 5.3146e-10
[Cossim] TalkerHiddenStep1 cos: 0.999991 max: 4.9562e-02 mean: 9.2015e-03
[Cossim] CodesFull exact: 10.71% (1008 values)
[Cossim] Audio cos: 0.182237
[Cossim] WAV stft_cos: 0.525978 samples: 120960
+29 -29
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=12, T_ctx=52, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [52, 2048] first4: 0.017777 -0.008612 0.002384 -0.014713
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004540 0.007622 -0.004462 -0.000982
[Debug] tts-pad-embed: [2048] first4: -0.004540 0.007622 -0.004462 -0.000982
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004587 0.007558 -0.004509 -0.000970
[Debug] tts-pad-embed: [2048] first4: -0.004587 0.007558 -0.004509 -0.000970
[Debug] talker-hidden-prefill-l0: [52, 2048] first4: -0.365096 -0.027762 -0.021214 -0.090946
[Debug] talker-hidden-prefill-l7: [52, 2048] first4: -11.056854 0.711653 5.837515 -2.340098
[Debug] talker-hidden-prefill-l14: [52, 2048] first4: -10.623413 0.635837 5.978893 -2.448013
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -9.651576 -0.162840 6.661537 -1.739873
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -13.708377 -29.526840 7.488002 30.091181
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.651999 -1.466224 0.329473 1.305102
[Debug] talker-logits-prefill: [3072] first4: -5.988281 -8.539062 0.579590 -0.133789
[Debug] talker-logits-prefill: [3072] first4: -5.980469 -8.515625 0.596191 -0.128174
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=812 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=1435 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
[Debug] next-emb-step0: [2048] first4: 0.052074 -0.063247 0.048163 0.061720
[Debug] talker-hidden-step1: [2048] first4: 1.124936 -1.231052 4.484270 -3.341861
[Debug] next-emb-step0: [2048] first4: 0.052027 -0.063311 0.048115 0.061732
[Debug] talker-hidden-step1: [2048] first4: 1.105580 -1.211798 4.458313 -3.393091
[Sample] step=1 c0=215 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1782 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
[Debug] output-audio: [122880] first4: 0.000102 0.000140 0.000144 0.000138
[Perf] PromptBuild 4.8 ms
[Perf] Prefill 11.3 ms (T_ctx prefill)
[Perf] TTFA 22.4 ms (first frame codes)
[Perf] TalkerDecode 165.4 ms (64 frames, 2.58 ms/frame)
[Perf] CodePredictor 348.8 ms (5.45 ms/frame)
[Perf] HostCompose 1.7 ms (c0 sample + next emb)
[Perf] CodecDecode 22.1 ms
[Perf] Total 554.8 ms (64 frames, 8.06 ms/frame AR, audio 5.12 s, RTF 0.108)
[Perf] PromptBuild 2.9 ms
[Perf] Prefill 10.9 ms (T_ctx prefill)
[Perf] TTFA 20.3 ms (first frame codes)
[Perf] TalkerDecode 163.0 ms (64 frames, 2.55 ms/frame)
[Perf] CodePredictor 351.7 ms (5.50 ms/frame)
[Perf] HostCompose 1.8 ms (c0 sample + next emb)
[Perf] CodecDecode 22.9 ms
[Perf] Total 553.8 ms (64 frames, 8.07 ms/frame AR, audio 5.12 s, RTF 0.108)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-Q4_K_M.gguf --codec ../models/qwen-tokenizer-12hz-Q4_K_M.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999680 max: 1.3244e-02 mean: 9.5245e-04
[Cossim] TrailingText cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
[Cossim] TTSPadEmbed cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
[Cossim] L0 cos: 0.999207 max: 7.6311e-01 mean: 6.5139e-03
[Cossim] L7 cos: 0.997488 max: 1.4404e+02 mean: 4.3667e-01
[Cossim] L14 cos: 0.997462 max: 1.4487e+02 mean: 5.4271e-01
[Cossim] L21 cos: 0.997070 max: 1.4280e+02 mean: 1.0091e+00
[Cossim] L27 cos: 0.988935 max: 5.3251e+02 mean: 4.5243e+00
[Cossim] Final cos: 0.934961 max: 2.8912e+01 mean: 5.0838e-01
[Cossim] Logits cos: 0.892438 max: 8.9615e+00 mean: 1.6785e+00
[Cossim] NextEmbStep0 cos: 0.784060 max: 1.5974e-01 mean: 3.5553e-02
[Cossim] TalkerHiddenStep1 cos: 0.696972 max: 9.2397e+00 mean: 1.7850e+00
[Cossim] CodesFull exact: 0.30% (1008 values)
[Cossim] Audio cos: 0.000331
[Cossim] WAV stft_cos: 0.087055 samples: 120960
[Cossim] Embed cos: 0.999680 max: 1.3244e-02 mean: 9.5229e-04
[Cossim] TrailingText cos: 0.999968 max: 2.3339e-03 mean: 2.2358e-04
[Cossim] TTSPadEmbed cos: 0.999968 max: 2.3339e-03 mean: 2.2358e-04
[Cossim] L0 cos: 0.999208 max: 7.3571e-01 mean: 6.5145e-03
[Cossim] L7 cos: 0.997483 max: 1.5604e+02 mean: 4.3664e-01
[Cossim] L14 cos: 0.997457 max: 1.5690e+02 mean: 5.4278e-01
[Cossim] L21 cos: 0.997065 max: 1.5484e+02 mean: 1.0094e+00
[Cossim] L27 cos: 0.988993 max: 5.3198e+02 mean: 4.5191e+00
[Cossim] Final cos: 0.935086 max: 2.8912e+01 mean: 5.0801e-01
[Cossim] Logits cos: 0.891894 max: 9.0006e+00 mean: 1.6877e+00
[Cossim] NextEmbStep0 cos: 0.784063 max: 1.5973e-01 mean: 3.5553e-02
[Cossim] TalkerHiddenStep1 cos: 0.696018 max: 9.2302e+00 mean: 1.7883e+00
[Cossim] CodesFull exact: 0.40% (1008 values)
[Cossim] Audio cos: 0.000294
[Cossim] WAV stft_cos: 0.086511 samples: 120960
+28 -28
View File
@@ -1,4 +1,4 @@
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
[Qwen] qwentts.cpp 199a658 (2026-05-31)
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
@@ -39,15 +39,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Prompt] Built: 38 ids, N_text=30, N_instruct=12, T_ctx=52, hidden=2048, lang=english (id=2050), speaker=none (id=-1) ref_spk_emb=no icl=no
[Debug] prompt-ids: [38] first4: 151644.000000 77091.000000 198.000000 80.000000
[Debug] talker-input-embed: [52, 2048] first4: 0.018656 -0.007835 0.004682 -0.013331
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004554 0.007647 -0.004656 -0.000707
[Debug] tts-pad-embed: [2048] first4: -0.004554 0.007647 -0.004656 -0.000707
[Debug] trailing-text-hidden: [1, 2048] first4: -0.004584 0.007664 -0.004639 -0.000675
[Debug] tts-pad-embed: [2048] first4: -0.004584 0.007664 -0.004639 -0.000675
[Debug] talker-hidden-prefill-l0: [52, 2048] first4: -0.379720 -0.055122 -0.040873 -0.052027
[Debug] talker-hidden-prefill-l7: [52, 2048] first4: -1.401856 0.409711 1.509710 0.573916
[Debug] talker-hidden-prefill-l14: [52, 2048] first4: -1.175223 0.614676 1.632030 0.488298
[Debug] talker-hidden-prefill-l21: [52, 2048] first4: -0.784744 0.496327 1.930501 0.109632
[Debug] talker-hidden-prefill-l27: [52, 2048] first4: -7.069296 -29.683353 -2.160596 31.778461
[Debug] talker-hidden-prefill-final: [52, 2048] first4: -0.319484 -1.400580 -0.090332 1.309634
[Debug] talker-logits-prefill: [3072] first4: -2.990234 -10.054688 -1.530273 -3.050781
[Debug] talker-logits-prefill: [3072] first4: -2.974609 -10.078125 -1.567383 -3.076172
[Sample] step=0 c0=1995 u=-1.0000000000 subseq=0
[Sample-CP] g=0 c=1642 u=-1.0000000000 subseq=1
[Sample-CP] g=1 c=1398 u=-1.0000000000 subseq=2
@@ -65,8 +65,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Sample-CP] g=13 c=82 u=-1.0000000000 subseq=14
[Sample-CP] g=14 c=803 u=-1.0000000000 subseq=15
[Debug] codes-step0: [16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] next-emb-step0: [2048] first4: 0.004793 -0.029425 0.017809 0.080303
[Debug] talker-hidden-step1: [2048] first4: 0.535881 -0.678888 7.106958 -3.852412
[Debug] next-emb-step0: [2048] first4: 0.004763 -0.029409 0.017827 0.080335
[Debug] talker-hidden-step1: [2048] first4: 0.537608 -0.666361 7.108305 -3.848543
[Sample] step=1 c0=2042 u=-1.0000000000 subseq=16
[Sample-CP] g=0 c=1230 u=-1.0000000000 subseq=17
[Sample-CP] g=1 c=141 u=-1.0000000000 subseq=18
@@ -94,14 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[Pipeline] Generation done : 64 frames
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
[Debug] output-audio: [122880] first4: 0.000047 0.000055 0.000042 0.000045
[Perf] PromptBuild 4.3 ms
[Perf] Prefill 10.8 ms (T_ctx prefill)
[Perf] TTFA 21.8 ms (first frame codes)
[Perf] TalkerDecode 183.7 ms (64 frames, 2.87 ms/frame)
[Perf] CodePredictor 349.0 ms (5.45 ms/frame)
[Perf] PromptBuild 2.8 ms
[Perf] Prefill 11.0 ms (T_ctx prefill)
[Perf] TTFA 20.1 ms (first frame codes)
[Perf] TalkerDecode 179.6 ms (64 frames, 2.81 ms/frame)
[Perf] CodePredictor 352.6 ms (5.51 ms/frame)
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
[Perf] CodecDecode 22.9 ms
[Perf] Total 572.4 ms (64 frames, 8.34 ms/frame AR, audio 5.12 s, RTF 0.112)
[Perf] CodecDecode 22.4 ms
[Perf] Total 570.0 ms (64 frames, 8.33 ms/frame AR, audio 5.12 s, RTF 0.111)
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
@@ -117,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-Q8_0.gguf --codec ../models/qwen-tokenizer-12hz-Q8_0.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
[Cossim] PromptIDs exact: 100.00% (38 values)
[Cossim] Embed cos: 0.999989 max: 2.2115e-03 mean: 1.6760e-04
[Cossim] TrailingText cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
[Cossim] L0 cos: 0.999992 max: 5.2092e-02 mean: 6.6198e-04
[Cossim] L7 cos: 0.999986 max: 1.8314e+01 mean: 3.1960e-02
[Cossim] L14 cos: 0.999986 max: 1.8215e+01 mean: 4.0318e-02
[Cossim] L21 cos: 0.999984 max: 1.8407e+01 mean: 7.6007e-02
[Cossim] L27 cos: 0.999943 max: 7.4065e+01 mean: 3.3577e-01
[Cossim] Final cos: 0.999670 max: 1.5096e+00 mean: 3.7530e-02
[Cossim] Logits cos: 0.999795 max: 3.7739e-01 mean: 6.0399e-02
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0252e-03 mean: 2.4056e-04
[Cossim] TalkerHiddenStep1 cos: 0.999734 max: 2.9197e-01 mean: 4.9954e-02
[Cossim] CodesFull exact: 5.16% (1008 values)
[Cossim] Audio cos: 0.025097
[Cossim] WAV stft_cos: 0.334440 samples: 120960
[Cossim] Embed cos: 0.999989 max: 2.2115e-03 mean: 1.6705e-04
[Cossim] TrailingText cos: 0.999999 max: 2.0327e-04 mean: 4.3886e-05
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.0327e-04 mean: 4.3886e-05
[Cossim] L0 cos: 0.999992 max: 4.5467e-02 mean: 6.5877e-04
[Cossim] L7 cos: 0.999986 max: 1.8326e+01 mean: 3.2049e-02
[Cossim] L14 cos: 0.999986 max: 1.8230e+01 mean: 4.0413e-02
[Cossim] L21 cos: 0.999983 max: 1.8402e+01 mean: 7.5638e-02
[Cossim] L27 cos: 0.999941 max: 7.3009e+01 mean: 3.3853e-01
[Cossim] Final cos: 0.999670 max: 1.5096e+00 mean: 3.7486e-02
[Cossim] Logits cos: 0.999802 max: 3.5444e-01 mean: 5.7470e-02
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0488e-03 mean: 2.4124e-04
[Cossim] TalkerHiddenStep1 cos: 0.999738 max: 3.0568e-01 mean: 4.9818e-02
[Cossim] CodesFull exact: 8.93% (1008 values)
[Cossim] Audio cos: 0.192399
[Cossim] WAV stft_cos: 0.480952 samples: 120960