logs
This commit is contained in:
+18
-10
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000016 0.000017
|
||||
[Perf] PromptBuild 68.3 ms
|
||||
[Perf] Prefill 10.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 93.8 ms (first frame codes)
|
||||
[Perf] TalkerDecode 237.2 ms (64 frames, 3.71 ms/frame)
|
||||
[Perf] CodePredictor 466.0 ms (7.28 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 57.7 ms
|
||||
[Perf] Total 841.8 ms (64 frames, 11.00 ms/frame AR, audio 5.12 s, RTF 0.164)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 0.999999 max: 8.5837e-04 mean: 3.6599e-05
|
||||
[Cossim] Embed cos: 0.999999 max: 8.5838e-04 mean: 3.6599e-05
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.999998 max: 3.7647e-02 mean: 2.7122e-04
|
||||
[Cossim] L7 cos: 0.999995 max: 3.0318e+01 mean: 3.1394e-03
|
||||
[Cossim] L14 cos: 0.999995 max: 3.0341e+01 mean: 5.0846e-03
|
||||
[Cossim] L21 cos: 0.999995 max: 3.0313e+01 mean: 1.4271e-02
|
||||
[Cossim] L27 cos: 0.999987 max: 3.3272e+01 mean: 8.4683e-02
|
||||
[Cossim] Final cos: 0.999979 max: 6.6584e-01 mean: 5.2791e-03
|
||||
[Cossim] Logits cos: 0.999960 max: 1.6272e-01 mean: 2.5386e-02
|
||||
[Cossim] L7 cos: 0.999995 max: 3.0321e+01 mean: 3.1394e-03
|
||||
[Cossim] L14 cos: 0.999995 max: 3.0344e+01 mean: 5.0846e-03
|
||||
[Cossim] L21 cos: 0.999995 max: 3.0316e+01 mean: 1.4271e-02
|
||||
[Cossim] L27 cos: 0.999987 max: 3.3273e+01 mean: 8.4683e-02
|
||||
[Cossim] Final cos: 0.999979 max: 6.6579e-01 mean: 5.2791e-03
|
||||
[Cossim] Logits cos: 0.999960 max: 1.6273e-01 mean: 2.5387e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999969 max: 9.8571e-02 mean: 1.4726e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999969 max: 9.8572e-02 mean: 1.4726e-02
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981071
|
||||
[Cossim] Audio cos: 0.981072
|
||||
[Cossim] WAV stft_cos: 0.988772 samples: 120960
|
||||
|
||||
+18
-10
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000014 0.000016
|
||||
[Perf] PromptBuild 60.7 ms
|
||||
[Perf] Prefill 41.9 ms (T_ctx prefill)
|
||||
[Perf] TTFA 155.9 ms (first frame codes)
|
||||
[Perf] TalkerDecode 524.7 ms (64 frames, 8.20 ms/frame)
|
||||
[Perf] CodePredictor 2730.7 ms (42.67 ms/frame)
|
||||
[Perf] HostCompose 1.4 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 23.9 ms
|
||||
[Perf] Total 3393.0 ms (64 frames, 50.89 ms/frame AR, audio 5.12 s, RTF 0.663)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.0431e-06 mean: 3.4064e-09
|
||||
[Cossim] Embed cos: 1.000000 max: 1.0431e-06 mean: 6.3183e-09
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 1.000000 max: 1.5564e-03 mean: 2.7919e-05
|
||||
[Cossim] L7 cos: 1.000000 max: 7.1289e-02 mean: 1.0879e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 7.1777e-02 mean: 2.8023e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 7.3730e-02 mean: 9.3342e-04
|
||||
[Cossim] L27 cos: 1.000000 max: 6.8005e-01 mean: 3.4462e-03
|
||||
[Cossim] Final cos: 1.000000 max: 2.0256e-02 mean: 2.3832e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 1.8763e-02 mean: 2.5604e-03
|
||||
[Cossim] L0 cos: 1.000000 max: 1.5564e-03 mean: 2.7918e-05
|
||||
[Cossim] L7 cos: 1.000000 max: 6.8359e-02 mean: 1.0876e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 6.8848e-02 mean: 2.8019e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 7.0801e-02 mean: 9.3340e-04
|
||||
[Cossim] L27 cos: 1.000000 max: 6.8030e-01 mean: 3.4462e-03
|
||||
[Cossim] Final cos: 1.000000 max: 2.0235e-02 mean: 2.3836e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 1.8770e-02 mean: 2.5612e-03
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.1268e-02 mean: 2.1145e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.1272e-02 mean: 2.1148e-03
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981624
|
||||
[Cossim] WAV stft_cos: 0.989090 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 412.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000016 0.000016 0.000013 0.000013
|
||||
[Perf] PromptBuild 97.2 ms
|
||||
[Perf] Prefill 10.4 ms (T_ctx prefill)
|
||||
[Perf] TTFA 116.9 ms (first frame codes)
|
||||
[Perf] TalkerDecode 180.9 ms (64 frames, 2.83 ms/frame)
|
||||
[Perf] CodePredictor 450.1 ms (7.03 ms/frame)
|
||||
[Perf] HostCompose 2.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 50.5 ms
|
||||
[Perf] Total 791.8 ms (64 frames, 9.89 ms/frame AR, audio 5.12 s, RTF 0.155)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000014 0.000017 0.000015 0.000016
|
||||
[Perf] PromptBuild 10.8 ms
|
||||
[Perf] Prefill 10.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 30.5 ms (first frame codes)
|
||||
[Perf] TalkerDecode 210.5 ms (64 frames, 3.29 ms/frame)
|
||||
[Perf] CodePredictor 450.8 ms (7.04 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 48.8 ms
|
||||
[Perf] Total 733.4 ms (64 frames, 10.35 ms/frame AR, audio 5.12 s, RTF 0.143)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -114,13 +122,13 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] L0 cos: 0.999988 max: 8.6182e-02 mean: 8.8736e-04
|
||||
[Cossim] L7 cos: 0.999988 max: 3.3613e+00 mean: 4.3316e-02
|
||||
[Cossim] L14 cos: 0.999987 max: 3.3760e+00 mean: 5.1383e-02
|
||||
[Cossim] L14 cos: 0.999987 max: 3.3760e+00 mean: 5.1382e-02
|
||||
[Cossim] L21 cos: 0.999986 max: 3.4785e+00 mean: 8.8713e-02
|
||||
[Cossim] L27 cos: 0.999897 max: 1.1408e+02 mean: 4.3219e-01
|
||||
[Cossim] Final cos: 0.999043 max: 4.2595e+00 mean: 2.8839e-02
|
||||
[Cossim] Logits cos: 0.999951 max: 2.1758e-01 mean: 3.1247e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1117e-03 mean: 2.2935e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999676 max: 3.2980e-01 mean: 4.7111e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999676 max: 3.2981e-01 mean: 4.7111e-02
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981665
|
||||
[Cossim] WAV stft_cos: 0.989131 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000015 0.000017
|
||||
[Perf] PromptBuild 356.2 ms
|
||||
[Perf] Prefill 102.2 ms (T_ctx prefill)
|
||||
[Perf] TTFA 755.6 ms (first frame codes)
|
||||
[Perf] TalkerDecode 230.0 ms (64 frames, 3.59 ms/frame)
|
||||
[Perf] CodePredictor 713.0 ms (11.14 ms/frame)
|
||||
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 253.2 ms
|
||||
[Perf] Total 1656.4 ms (64 frames, 14.75 ms/frame AR, audio 5.12 s, RTF 0.324)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -113,14 +121,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.999999 max: 7.2330e-02 mean: 1.2825e-04
|
||||
[Cossim] L7 cos: 0.999999 max: 1.2878e+01 mean: 1.5098e-03
|
||||
[Cossim] L14 cos: 0.999999 max: 1.2879e+01 mean: 2.5799e-03
|
||||
[Cossim] L21 cos: 0.999999 max: 1.2885e+01 mean: 6.7605e-03
|
||||
[Cossim] L27 cos: 0.999998 max: 1.0770e+01 mean: 3.7695e-02
|
||||
[Cossim] Final cos: 0.999996 max: 3.8617e-01 mean: 2.3165e-03
|
||||
[Cossim] Logits cos: 0.999998 max: 3.2596e-02 mean: 6.0306e-03
|
||||
[Cossim] L7 cos: 0.999999 max: 1.2875e+01 mean: 1.5097e-03
|
||||
[Cossim] L14 cos: 0.999999 max: 1.2876e+01 mean: 2.5798e-03
|
||||
[Cossim] L21 cos: 0.999999 max: 1.2882e+01 mean: 6.7605e-03
|
||||
[Cossim] L27 cos: 0.999998 max: 1.0766e+01 mean: 3.7696e-02
|
||||
[Cossim] Final cos: 0.999996 max: 3.8615e-01 mean: 2.3165e-03
|
||||
[Cossim] Logits cos: 0.999998 max: 3.2601e-02 mean: 6.0310e-03
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 2.0217e-02 mean: 3.3136e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 2.0218e-02 mean: 3.3137e-03
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981091
|
||||
[Cossim] WAV stft_cos: 0.988782 samples: 120960
|
||||
|
||||
+18
-10
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000018 0.000016 0.000016
|
||||
[Perf] PromptBuild 367.4 ms
|
||||
[Perf] Prefill 1674.3 ms (T_ctx prefill)
|
||||
[Perf] TTFA 2423.4 ms (first frame codes)
|
||||
[Perf] TalkerDecode 517.6 ms (64 frames, 8.09 ms/frame)
|
||||
[Perf] CodePredictor 890.9 ms (13.92 ms/frame)
|
||||
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 3328.1 ms
|
||||
[Perf] Total 6780.2 ms (64 frames, 22.02 ms/frame AR, audio 5.12 s, RTF 1.324)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-base-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --lang english --max-new 64 --dump cpp/base -o cpp/base/base-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/base/base-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.9625e-05 mean: 1.5871e-06
|
||||
[Cossim] Embed cos: 1.000000 max: 1.9640e-05 mean: 1.5871e-06
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.999998 max: 7.0588e-02 mean: 2.3819e-04
|
||||
[Cossim] L7 cos: 0.999998 max: 1.7610e+01 mean: 2.7930e-03
|
||||
[Cossim] L14 cos: 0.999998 max: 1.7618e+01 mean: 4.6634e-03
|
||||
[Cossim] L21 cos: 0.999998 max: 1.7688e+01 mean: 1.2512e-02
|
||||
[Cossim] L27 cos: 0.999991 max: 3.1282e+01 mean: 8.7409e-02
|
||||
[Cossim] Final cos: 0.999981 max: 4.9885e-01 mean: 4.7146e-03
|
||||
[Cossim] Logits cos: 0.999995 max: 6.5796e-02 mean: 1.0788e-02
|
||||
[Cossim] L0 cos: 0.999998 max: 7.0586e-02 mean: 2.3819e-04
|
||||
[Cossim] L7 cos: 0.999998 max: 1.7607e+01 mean: 2.7930e-03
|
||||
[Cossim] L14 cos: 0.999998 max: 1.7615e+01 mean: 4.6633e-03
|
||||
[Cossim] L21 cos: 0.999998 max: 1.7685e+01 mean: 1.2512e-02
|
||||
[Cossim] L27 cos: 0.999991 max: 3.1281e+01 mean: 8.7408e-02
|
||||
[Cossim] Final cos: 0.999981 max: 4.9883e-01 mean: 4.7146e-03
|
||||
[Cossim] Logits cos: 0.999995 max: 6.5789e-02 mean: 1.0788e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.0431e-06 mean: 9.3270e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999993 max: 4.3605e-02 mean: 7.3642e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999993 max: 4.3604e-02 mean: 7.3641e-03
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981673
|
||||
[Cossim] WAV stft_cos: 0.989114 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 412.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000014 0.000014 0.000012 0.000014
|
||||
[Perf] PromptBuild 380.2 ms
|
||||
[Perf] Prefill 200.2 ms (T_ctx prefill)
|
||||
[Perf] TTFA 742.6 ms (first frame codes)
|
||||
[Perf] TalkerDecode 250.7 ms (64 frames, 3.92 ms/frame)
|
||||
[Perf] CodePredictor 494.6 ms (7.73 ms/frame)
|
||||
[Perf] HostCompose 2.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 1020.7 ms
|
||||
[Perf] Total 2349.3 ms (64 frames, 11.68 ms/frame AR, audio 5.12 s, RTF 0.459)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -113,12 +121,12 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
|
||||
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
|
||||
[Cossim] L0 cos: 0.999277 max: 8.6724e-01 mean: 6.4670e-03
|
||||
[Cossim] L7 cos: 0.997447 max: 4.5718e+01 mean: 5.8617e-01
|
||||
[Cossim] L14 cos: 0.997441 max: 4.7277e+01 mean: 6.7446e-01
|
||||
[Cossim] L21 cos: 0.997231 max: 4.6773e+01 mean: 1.0947e+00
|
||||
[Cossim] L7 cos: 0.997447 max: 4.5715e+01 mean: 5.8617e-01
|
||||
[Cossim] L14 cos: 0.997441 max: 4.7274e+01 mean: 6.7446e-01
|
||||
[Cossim] L21 cos: 0.997231 max: 4.6771e+01 mean: 1.0947e+00
|
||||
[Cossim] L27 cos: 0.982508 max: 1.7338e+03 mean: 5.0126e+00
|
||||
[Cossim] Final cos: 0.946255 max: 2.4124e+01 mean: 2.9486e-01
|
||||
[Cossim] Logits cos: 0.976666 max: 3.3958e+00 mean: 7.0688e-01
|
||||
[Cossim] Logits cos: 0.976666 max: 3.3958e+00 mean: 7.0689e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.804895 max: 2.9351e-01 mean: 3.5512e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.745183 max: 7.7115e+00 mean: 1.3585e+00
|
||||
[Cossim] CodesFull exact: 28.57% (1008 values)
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -96,6 +96,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000015 0.000017
|
||||
[Perf] PromptBuild 320.9 ms
|
||||
[Perf] Prefill 207.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 699.3 ms (first frame codes)
|
||||
[Perf] TalkerDecode 182.0 ms (64 frames, 2.84 ms/frame)
|
||||
[Perf] CodePredictor 513.0 ms (8.02 ms/frame)
|
||||
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 1186.1 ms
|
||||
[Perf] Total 2411.6 ms (64 frames, 10.88 ms/frame AR, audio 5.12 s, RTF 0.471)
|
||||
[WAV] Wrote cpp/base/base-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/base/base-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -112,15 +120,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999987 max: 2.2803e-03 mean: 1.8378e-04
|
||||
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] L0 cos: 0.999992 max: 7.5518e-02 mean: 6.3872e-04
|
||||
[Cossim] L7 cos: 0.999986 max: 1.7580e+01 mean: 4.2016e-02
|
||||
[Cossim] L14 cos: 0.999986 max: 1.7634e+01 mean: 4.8597e-02
|
||||
[Cossim] L21 cos: 0.999985 max: 1.7780e+01 mean: 7.8546e-02
|
||||
[Cossim] L0 cos: 0.999992 max: 7.5516e-02 mean: 6.3871e-04
|
||||
[Cossim] L7 cos: 0.999986 max: 1.7577e+01 mean: 4.2015e-02
|
||||
[Cossim] L14 cos: 0.999986 max: 1.7631e+01 mean: 4.8597e-02
|
||||
[Cossim] L21 cos: 0.999985 max: 1.7777e+01 mean: 7.8546e-02
|
||||
[Cossim] L27 cos: 0.999957 max: 5.4742e+01 mean: 3.4493e-01
|
||||
[Cossim] Final cos: 0.999647 max: 4.1028e+00 mean: 2.1984e-02
|
||||
[Cossim] Final cos: 0.999647 max: 4.1027e+00 mean: 2.1984e-02
|
||||
[Cossim] Logits cos: 0.999928 max: 2.0065e-01 mean: 3.6855e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1117e-03 mean: 2.2935e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999814 max: 1.8623e-01 mean: 3.6436e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999814 max: 1.8624e-01 mean: 3.6437e-02
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.981689
|
||||
[Cossim] WAV stft_cos: 0.989144 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001310 -0.002270 -0.002123 -0.000994
|
||||
[Perf] PromptBuild 13.8 ms
|
||||
[Perf] Prefill 14.6 ms (T_ctx prefill)
|
||||
[Perf] TTFA 39.3 ms (first frame codes)
|
||||
[Perf] TalkerDecode 252.1 ms (64 frames, 3.94 ms/frame)
|
||||
[Perf] CodePredictor 463.3 ms (7.24 ms/frame)
|
||||
[Perf] HostCompose 1.2 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 10.1 ms
|
||||
[Perf] Total 756.1 ms (64 frames, 11.20 ms/frame AR, audio 5.12 s, RTF 0.148)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,10 +152,10 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.984329 max: 8.0274e-01 mean: 1.3010e-02
|
||||
[Cossim] L7 cos: 0.999981 max: 4.7525e+01 mean: 3.1982e-02
|
||||
[Cossim] L14 cos: 0.999956 max: 4.7533e+01 mean: 7.0219e-02
|
||||
[Cossim] L21 cos: 0.999568 max: 4.7568e+01 mean: 2.6792e-01
|
||||
[Cossim] L27 cos: 0.998447 max: 4.7995e+01 mean: 6.0584e-01
|
||||
[Cossim] L7 cos: 0.999981 max: 4.7523e+01 mean: 3.1982e-02
|
||||
[Cossim] L14 cos: 0.999956 max: 4.7531e+01 mean: 7.0219e-02
|
||||
[Cossim] L21 cos: 0.999568 max: 4.7566e+01 mean: 2.6792e-01
|
||||
[Cossim] L27 cos: 0.998447 max: 4.7993e+01 mean: 6.0584e-01
|
||||
[Cossim] Final cos: 0.991998 max: 1.5255e+01 mean: 1.9686e-01
|
||||
[Cossim] Logits cos: 0.999480 max: 1.0044e+00 mean: 1.2252e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.829096 max: 1.5468e-01 mean: 2.9154e-02
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001265 -0.002192 -0.002047 -0.000956
|
||||
[Perf] PromptBuild 5.3 ms
|
||||
[Perf] Prefill 27.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 52.2 ms (first frame codes)
|
||||
[Perf] TalkerDecode 358.3 ms (64 frames, 5.60 ms/frame)
|
||||
[Perf] CodePredictor 559.6 ms (8.74 ms/frame)
|
||||
[Perf] HostCompose 1.2 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 10.2 ms
|
||||
[Perf] Total 981.2 ms (64 frames, 14.36 ms/frame AR, audio 5.12 s, RTF 0.192)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -146,10 +154,10 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] L0 cos: 0.986912 max: 6.6445e-01 mean: 1.1103e-02
|
||||
[Cossim] L7 cos: 0.999992 max: 1.2569e+00 mean: 2.7510e-02
|
||||
[Cossim] L14 cos: 0.999973 max: 2.1781e+00 mean: 5.9937e-02
|
||||
[Cossim] L21 cos: 0.999718 max: 8.4985e+00 mean: 2.2272e-01
|
||||
[Cossim] L21 cos: 0.999718 max: 8.4983e+00 mean: 2.2272e-01
|
||||
[Cossim] L27 cos: 0.998969 max: 2.4365e+01 mean: 5.1191e-01
|
||||
[Cossim] Final cos: 0.994692 max: 7.4171e+00 mean: 1.6655e-01
|
||||
[Cossim] Logits cos: 0.999740 max: 5.7070e-01 mean: 8.9439e-02
|
||||
[Cossim] Final cos: 0.994692 max: 7.4170e+00 mean: 1.6655e-01
|
||||
[Cossim] Logits cos: 0.999740 max: 5.7071e-01 mean: 8.9440e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.829216 max: 1.2523e-01 mean: 2.9129e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.993844 max: 1.4404e+00 mean: 2.4228e-01
|
||||
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
|
||||
@@ -162,7 +170,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] SeanetStage1 cos: 0.999865 max: 7.6868e-01 mean: 4.9571e-03
|
||||
[Cossim] SeanetStage3 cos: 0.999995 max: 1.6565e+00 mean: 3.9086e-02
|
||||
[Cossim] SeanetOut cos: 0.999963 max: 4.1938e-01 mean: 1.7123e-02
|
||||
[Cossim] EncTransformer cos: 0.999975 max: 3.4209e-01 mean: 7.3239e-03
|
||||
[Cossim] EncTransformer cos: 0.999975 max: 3.4209e-01 mean: 7.3238e-03
|
||||
[Cossim] CodecPreFSQ cos: 0.999972 max: 4.4734e-01 mean: 1.8065e-02
|
||||
[Cossim] SpkFrontend cos: 1.000000 max: 2.1511e-04 mean: 1.4495e-06
|
||||
[Cossim] SpkBlock3 cos: 1.000000 max: 3.2926e-04 mean: 4.3974e-06
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1534.000000 1233.000000 362.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001380 -0.002482 -0.002457 -0.001359
|
||||
[Perf] PromptBuild 102.5 ms
|
||||
[Perf] Prefill 16.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 136.6 ms (first frame codes)
|
||||
[Perf] TalkerDecode 200.8 ms (64 frames, 3.14 ms/frame)
|
||||
[Perf] CodePredictor 450.7 ms (7.04 ms/frame)
|
||||
[Perf] HostCompose 2.4 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 11.0 ms
|
||||
[Perf] Total 793.4 ms (64 frames, 10.22 ms/frame AR, audio 5.12 s, RTF 0.155)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 417.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001383 -0.002430 -0.002358 -0.001279
|
||||
[Perf] PromptBuild 10.2 ms
|
||||
[Perf] Prefill 15.5 ms (T_ctx prefill)
|
||||
[Perf] TTFA 34.7 ms (first frame codes)
|
||||
[Perf] TalkerDecode 225.5 ms (64 frames, 3.52 ms/frame)
|
||||
[Perf] CodePredictor 450.2 ms (7.03 ms/frame)
|
||||
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 10.3 ms
|
||||
[Perf] Total 713.9 ms (64 frames, 10.58 ms/frame AR, audio 5.12 s, RTF 0.139)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,14 +152,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] L0 cos: 0.984968 max: 7.6804e-01 mean: 1.2815e-02
|
||||
[Cossim] L7 cos: 0.999978 max: 3.6929e+00 mean: 3.8283e-02
|
||||
[Cossim] L14 cos: 0.999955 max: 3.7129e+00 mean: 7.4631e-02
|
||||
[Cossim] L7 cos: 0.999978 max: 3.6948e+00 mean: 3.8283e-02
|
||||
[Cossim] L14 cos: 0.999955 max: 3.7148e+00 mean: 7.4631e-02
|
||||
[Cossim] L21 cos: 0.999560 max: 1.7838e+01 mean: 2.7558e-01
|
||||
[Cossim] L27 cos: 0.998089 max: 1.0573e+02 mean: 6.5386e-01
|
||||
[Cossim] Final cos: 0.991260 max: 1.5561e+01 mean: 2.0542e-01
|
||||
[Cossim] Logits cos: 0.999099 max: 1.1633e+00 mean: 1.7357e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.849360 max: 1.3903e-01 mean: 2.7786e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.991649 max: 1.2042e+00 mean: 2.8223e-01
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.991650 max: 1.2042e+00 mean: 2.8223e-01
|
||||
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
|
||||
[Cossim] MelBasis cos: 1.000000 max: 1.7881e-07 mean: 3.9379e-10
|
||||
[Cossim] MelMag cos: 1.000000 max: 3.1307e-05 mean: 5.6396e-07
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001651 -0.002839 -0.002671 -0.001491
|
||||
[Perf] PromptBuild 6.6 ms
|
||||
[Perf] Prefill 31.8 ms (T_ctx prefill)
|
||||
[Perf] TTFA 47.0 ms (first frame codes)
|
||||
[Perf] TalkerDecode 236.2 ms (64 frames, 3.69 ms/frame)
|
||||
[Perf] CodePredictor 426.7 ms (6.67 ms/frame)
|
||||
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 15.5 ms
|
||||
[Perf] Total 719.1 ms (64 frames, 10.38 ms/frame AR, audio 5.12 s, RTF 0.140)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,8 +152,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.983221 max: 7.7033e-01 mean: 1.3992e-02
|
||||
[Cossim] L7 cos: 0.999989 max: 1.2870e+01 mean: 3.3232e-02
|
||||
[Cossim] L14 cos: 0.999964 max: 1.2874e+01 mean: 7.1829e-02
|
||||
[Cossim] L7 cos: 0.999989 max: 1.2872e+01 mean: 3.3232e-02
|
||||
[Cossim] L14 cos: 0.999964 max: 1.2875e+01 mean: 7.1829e-02
|
||||
[Cossim] L21 cos: 0.999531 max: 1.6985e+01 mean: 2.8083e-01
|
||||
[Cossim] L27 cos: 0.998207 max: 4.0575e+01 mean: 6.4222e-01
|
||||
[Cossim] Final cos: 0.990651 max: 1.5852e+01 mean: 2.0918e-01
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001606 -0.002810 -0.002527 -0.001049
|
||||
[Perf] PromptBuild 6.0 ms
|
||||
[Perf] Prefill 20.6 ms (T_ctx prefill)
|
||||
[Perf] TTFA 36.2 ms (first frame codes)
|
||||
[Perf] TalkerDecode 347.3 ms (64 frames, 5.43 ms/frame)
|
||||
[Perf] CodePredictor 515.5 ms (8.05 ms/frame)
|
||||
[Perf] HostCompose 1.3 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 13.2 ms
|
||||
[Perf] Total 905.0 ms (64 frames, 13.50 ms/frame AR, audio 5.12 s, RTF 0.177)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,12 +152,12 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.0431e-06 mean: 9.3737e-09
|
||||
[Cossim] L0 cos: 0.987066 max: 6.8545e-01 mean: 1.0819e-02
|
||||
[Cossim] L7 cos: 0.999990 max: 1.4627e+01 mean: 2.7202e-02
|
||||
[Cossim] L14 cos: 0.999971 max: 1.4621e+01 mean: 5.9838e-02
|
||||
[Cossim] L21 cos: 0.999706 max: 1.4629e+01 mean: 2.2469e-01
|
||||
[Cossim] L27 cos: 0.998902 max: 2.5746e+01 mean: 5.2269e-01
|
||||
[Cossim] Final cos: 0.994347 max: 7.7913e+00 mean: 1.6944e-01
|
||||
[Cossim] Logits cos: 0.999560 max: 8.4555e-01 mean: 1.1897e-01
|
||||
[Cossim] L7 cos: 0.999990 max: 1.4625e+01 mean: 2.7202e-02
|
||||
[Cossim] L14 cos: 0.999971 max: 1.4619e+01 mean: 5.9838e-02
|
||||
[Cossim] L21 cos: 0.999706 max: 1.4627e+01 mean: 2.2469e-01
|
||||
[Cossim] L27 cos: 0.998902 max: 2.5745e+01 mean: 5.2269e-01
|
||||
[Cossim] Final cos: 0.994347 max: 7.7912e+00 mean: 1.6944e-01
|
||||
[Cossim] Logits cos: 0.999560 max: 8.4556e-01 mean: 1.1897e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.883765 max: 1.3749e-01 mean: 2.4548e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.994873 max: 1.0157e+00 mean: 2.2029e-01
|
||||
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001812 -0.003170 -0.003023 -0.001804
|
||||
[Perf] PromptBuild 10.3 ms
|
||||
[Perf] Prefill 1603.9 ms (T_ctx prefill)
|
||||
[Perf] TTFA 1621.4 ms (first frame codes)
|
||||
[Perf] TalkerDecode 158.0 ms (64 frames, 2.47 ms/frame)
|
||||
[Perf] CodePredictor 345.7 ms (5.40 ms/frame)
|
||||
[Perf] HostCompose 2.6 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 14.1 ms
|
||||
[Perf] Total 2135.5 ms (64 frames, 7.91 ms/frame AR, audio 5.12 s, RTF 0.417)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,9 +152,9 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
|
||||
[Cossim] TTSPadEmbed cos: 0.999969 max: 1.4858e-03 mean: 2.2947e-04
|
||||
[Cossim] L0 cos: 0.961474 max: 8.6773e-01 mean: 2.8366e-02
|
||||
[Cossim] L7 cos: 0.997433 max: 3.9397e+01 mean: 1.6338e-01
|
||||
[Cossim] L14 cos: 0.997359 max: 3.8765e+01 mean: 2.4737e-01
|
||||
[Cossim] L21 cos: 0.995878 max: 3.9006e+01 mean: 7.7246e-01
|
||||
[Cossim] L7 cos: 0.997433 max: 3.9399e+01 mean: 1.6338e-01
|
||||
[Cossim] L14 cos: 0.997359 max: 3.8767e+01 mean: 2.4737e-01
|
||||
[Cossim] L21 cos: 0.995878 max: 3.9008e+01 mean: 7.7246e-01
|
||||
[Cossim] L27 cos: 0.956667 max: 1.7484e+03 mean: 1.9748e+00
|
||||
[Cossim] Final cos: 0.955800 max: 3.3577e+01 mean: 5.4929e-01
|
||||
[Cossim] Logits cos: 0.992517 max: 2.9832e+00 mean: 4.5371e-01
|
||||
@@ -163,7 +171,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] SeanetStage3 cos: 0.999995 max: 1.4657e+00 mean: 3.8722e-02
|
||||
[Cossim] SeanetOut cos: 0.999963 max: 4.0791e-01 mean: 1.6984e-02
|
||||
[Cossim] EncTransformer cos: 0.992979 max: 3.5659e+00 mean: 1.6375e-01
|
||||
[Cossim] CodecPreFSQ cos: 0.996263 max: 2.2477e+00 mean: 2.4022e-01
|
||||
[Cossim] CodecPreFSQ cos: 0.996263 max: 2.2478e+00 mean: 2.4022e-01
|
||||
[Cossim] SpkFrontend cos: 1.000000 max: 2.6600e-03 mean: 1.1964e-04
|
||||
[Cossim] SpkBlock3 cos: 1.000000 max: 1.2137e-02 mean: 5.2077e-04
|
||||
[Cossim] SpkMFA cos: 1.000000 max: 8.9911e-03 mean: 1.3077e-04
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -120,6 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 27.000000 1408.000000 1824.000000 400.000000
|
||||
[Debug] output-audio: [122880] first4: -0.001815 -0.003137 -0.002853 -0.001444
|
||||
[Perf] PromptBuild 6.1 ms
|
||||
[Perf] Prefill 2022.5 ms (T_ctx prefill)
|
||||
[Perf] TTFA 2035.6 ms (first frame codes)
|
||||
[Perf] TalkerDecode 185.1 ms (64 frames, 2.89 ms/frame)
|
||||
[Perf] CodePredictor 348.3 ms (5.44 ms/frame)
|
||||
[Perf] HostCompose 1.4 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 13.7 ms
|
||||
[Perf] Total 2578.2 ms (64 frames, 8.36 ms/frame AR, audio 5.12 s, RTF 0.504)
|
||||
[WAV] Wrote cpp/clone/clone-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/clone/clone-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -144,12 +152,12 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 2.1233e-04 mean: 4.3863e-05
|
||||
[Cossim] L0 cos: 0.985827 max: 7.7038e-01 mean: 1.1813e-02
|
||||
[Cossim] L7 cos: 0.999979 max: 5.4033e+00 mean: 3.6052e-02
|
||||
[Cossim] L14 cos: 0.999957 max: 5.4258e+00 mean: 7.0614e-02
|
||||
[Cossim] L7 cos: 0.999979 max: 5.4026e+00 mean: 3.6052e-02
|
||||
[Cossim] L14 cos: 0.999957 max: 5.4250e+00 mean: 7.0614e-02
|
||||
[Cossim] L21 cos: 0.999606 max: 1.8712e+01 mean: 2.5038e-01
|
||||
[Cossim] L27 cos: 0.998546 max: 5.4981e+01 mean: 5.6873e-01
|
||||
[Cossim] L27 cos: 0.998546 max: 5.4983e+01 mean: 5.6873e-01
|
||||
[Cossim] Final cos: 0.992861 max: 1.9019e+01 mean: 1.7999e-01
|
||||
[Cossim] Logits cos: 0.999574 max: 7.9584e-01 mean: 1.0646e-01
|
||||
[Cossim] Logits cos: 0.999574 max: 7.9585e-01 mean: 1.0646e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.848334 max: 2.7271e-01 mean: 2.8037e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.993791 max: 1.5125e+00 mean: 2.3976e-01
|
||||
[Cossim] MelHann cos: 1.000000 max: 1.7881e-07 mean: 3.2043e-08
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000016 0.000017
|
||||
[Perf] PromptBuild 51.2 ms
|
||||
[Perf] Prefill 10.4 ms (T_ctx prefill)
|
||||
[Perf] TTFA 76.3 ms (first frame codes)
|
||||
[Perf] TalkerDecode 237.8 ms (64 frames, 3.71 ms/frame)
|
||||
[Perf] CodePredictor 466.5 ms (7.29 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 44.0 ms
|
||||
[Perf] Total 811.7 ms (64 frames, 11.02 ms/frame AR, audio 5.12 s, RTF 0.159)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -112,14 +120,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] L0 cos: 0.999997 max: 1.4417e-01 mean: 2.6730e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 1.8768e+01 mean: 3.1552e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.8778e+01 mean: 6.3006e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 1.8810e+01 mean: 2.0215e-02
|
||||
[Cossim] L7 cos: 0.999997 max: 1.8764e+01 mean: 3.1551e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.8774e+01 mean: 6.3004e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 1.8806e+01 mean: 2.0215e-02
|
||||
[Cossim] L27 cos: 0.999989 max: 3.2072e+01 mean: 1.0380e-01
|
||||
[Cossim] Final cos: 0.999964 max: 1.1374e+00 mean: 8.0261e-03
|
||||
[Cossim] Logits cos: 0.999992 max: 9.2689e-02 mean: 1.5266e-02
|
||||
[Cossim] Final cos: 0.999964 max: 1.1374e+00 mean: 8.0259e-03
|
||||
[Cossim] Logits cos: 0.999992 max: 9.2691e-02 mean: 1.5265e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.6821e-02 mean: 7.7880e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.6814e-02 mean: 7.7878e-03
|
||||
[Cossim] CodesFull exact: 15.87% (1008 values)
|
||||
[Cossim] Audio cos: 0.169467
|
||||
[Cossim] WAV stft_cos: 0.353257 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000014 0.000016
|
||||
[Perf] PromptBuild 35.3 ms
|
||||
[Perf] Prefill 16.1 ms (T_ctx prefill)
|
||||
[Perf] TTFA 71.5 ms (first frame codes)
|
||||
[Perf] TalkerDecode 339.1 ms (64 frames, 5.30 ms/frame)
|
||||
[Perf] CodePredictor 558.4 ms (8.72 ms/frame)
|
||||
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 20.5 ms
|
||||
[Perf] Total 980.6 ms (64 frames, 14.04 ms/frame AR, audio 5.12 s, RTF 0.192)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -108,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.3709e-06 mean: 3.5790e-09
|
||||
[Cossim] Embed cos: 1.000000 max: 1.3709e-06 mean: 6.4146e-09
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] L0 cos: 1.000000 max: 1.1368e-03 mean: 2.0051e-05
|
||||
[Cossim] L7 cos: 1.000000 max: 1.4111e-01 mean: 1.6729e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 1.4136e-01 mean: 4.7605e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 1.3647e-01 mean: 1.7254e-03
|
||||
[Cossim] L27 cos: 1.000000 max: 2.3984e+00 mean: 6.8904e-03
|
||||
[Cossim] Final cos: 1.000000 max: 2.2728e-02 mean: 5.1290e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 1.8555e-02 mean: 1.8060e-03
|
||||
[Cossim] L7 cos: 1.000000 max: 1.4331e-01 mean: 1.6728e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 1.4355e-01 mean: 4.7609e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 1.3867e-01 mean: 1.7254e-03
|
||||
[Cossim] L27 cos: 1.000000 max: 2.3953e+00 mean: 6.8882e-03
|
||||
[Cossim] Final cos: 1.000000 max: 2.2782e-02 mean: 5.1288e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 1.8549e-02 mean: 1.8060e-03
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.3859e-02 mean: 1.9640e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999999 max: 1.3854e-02 mean: 1.9640e-03
|
||||
[Cossim] CodesFull exact: 100.00% (1008 values)
|
||||
[Cossim] Audio cos: 0.999999
|
||||
[Cossim] WAV stft_cos: 1.000000 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000014 0.000015 0.000012 0.000016
|
||||
[Perf] PromptBuild 92.7 ms
|
||||
[Perf] Prefill 10.5 ms (T_ctx prefill)
|
||||
[Perf] TTFA 112.0 ms (first frame codes)
|
||||
[Perf] TalkerDecode 180.2 ms (64 frames, 2.82 ms/frame)
|
||||
[Perf] CodePredictor 450.3 ms (7.04 ms/frame)
|
||||
[Perf] HostCompose 1.7 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 49.7 ms
|
||||
[Perf] Total 785.7 ms (64 frames, 9.88 ms/frame AR, audio 5.12 s, RTF 0.153)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -119,7 +127,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Final cos: 0.899728 max: 7.4843e+01 mean: 4.2324e-01
|
||||
[Cossim] Logits cos: 0.987958 max: 3.4934e+00 mean: 5.0302e-01
|
||||
[Cossim] NextEmbStep0 cos: 0.999915 max: 3.2489e-03 mean: 7.7490e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.960377 max: 2.3372e+00 mean: 4.9011e-01
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.960377 max: 2.3371e+00 mean: 4.9011e-01
|
||||
[Cossim] CodesFull exact: 2.88% (1008 values)
|
||||
[Cossim] Audio cos: 0.004687
|
||||
[Cossim] WAV stft_cos: 0.074930 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000014 0.000017 0.000015 0.000016
|
||||
[Perf] PromptBuild 11.0 ms
|
||||
[Perf] Prefill 10.9 ms (T_ctx prefill)
|
||||
[Perf] TTFA 30.8 ms (first frame codes)
|
||||
[Perf] TalkerDecode 208.3 ms (64 frames, 3.25 ms/frame)
|
||||
[Perf] CodePredictor 450.0 ms (7.03 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 48.8 ms
|
||||
[Perf] Total 730.7 ms (64 frames, 10.30 ms/frame AR, audio 5.12 s, RTF 0.143)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -111,13 +119,13 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999961 max: 5.1095e-02 mean: 2.1504e-04
|
||||
[Cossim] TrailingText cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
|
||||
[Cossim] L0 cos: 0.999985 max: 5.4441e-02 mean: 8.8864e-04
|
||||
[Cossim] L0 cos: 0.999985 max: 5.4441e-02 mean: 8.8865e-04
|
||||
[Cossim] L7 cos: 0.999986 max: 1.1478e+01 mean: 4.6665e-02
|
||||
[Cossim] L14 cos: 0.999986 max: 1.1491e+01 mean: 6.0387e-02
|
||||
[Cossim] L21 cos: 0.999981 max: 1.1623e+01 mean: 1.2132e-01
|
||||
[Cossim] L27 cos: 0.999839 max: 6.2433e+01 mean: 5.6098e-01
|
||||
[Cossim] Final cos: 0.998141 max: 1.3384e+01 mean: 4.4881e-02
|
||||
[Cossim] Logits cos: 0.999743 max: 4.1475e-01 mean: 7.7901e-02
|
||||
[Cossim] Final cos: 0.998141 max: 1.3384e+01 mean: 4.4882e-02
|
||||
[Cossim] Logits cos: 0.999743 max: 4.1474e-01 mean: 7.7901e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1319e-03 mean: 2.3562e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999401 max: 8.3859e-01 mean: 5.7508e-02
|
||||
[Cossim] CodesFull exact: 4.37% (1008 values)
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000016 0.000020 0.000015 0.000017
|
||||
[Perf] PromptBuild 4.6 ms
|
||||
[Perf] Prefill 37.3 ms (T_ctx prefill)
|
||||
[Perf] TTFA 49.9 ms (first frame codes)
|
||||
[Perf] TalkerDecode 234.6 ms (64 frames, 3.67 ms/frame)
|
||||
[Perf] CodePredictor 423.7 ms (6.62 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 23.4 ms
|
||||
[Perf] Total 725.5 ms (64 frames, 10.30 ms/frame AR, audio 5.12 s, RTF 0.142)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -108,18 +116,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-customvoice-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --speaker vivian --lang english --max-new 64 --dump cpp/customvoice -o cpp/customvoice/customvoice-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.5882e-04 mean: 1.2286e-05
|
||||
[Cossim] Embed cos: 1.000000 max: 1.5879e-04 mean: 1.2286e-05
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] L0 cos: 1.000000 max: 4.7047e-02 mean: 1.1847e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 2.0107e+01 mean: 1.9552e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 2.0133e+01 mean: 3.7669e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 2.0126e+01 mean: 1.1339e-02
|
||||
[Cossim] L27 cos: 0.999996 max: 1.9380e+01 mean: 5.9283e-02
|
||||
[Cossim] Final cos: 0.999989 max: 3.7543e-01 mean: 4.2943e-03
|
||||
[Cossim] Logits cos: 0.999997 max: 5.1159e-02 mean: 8.8430e-03
|
||||
[Cossim] L7 cos: 0.999997 max: 2.0109e+01 mean: 1.9553e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 2.0134e+01 mean: 3.7671e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 2.0128e+01 mean: 1.1339e-02
|
||||
[Cossim] L27 cos: 0.999996 max: 1.9382e+01 mean: 5.9284e-02
|
||||
[Cossim] Final cos: 0.999989 max: 3.7538e-01 mean: 4.2944e-03
|
||||
[Cossim] Logits cos: 0.999997 max: 5.1167e-02 mean: 8.8435e-03
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999997 max: 3.4218e-02 mean: 4.0743e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999997 max: 3.4212e-02 mean: 4.0743e-03
|
||||
[Cossim] CodesFull exact: 50.99% (1008 values)
|
||||
[Cossim] Audio cos: 0.370959
|
||||
[Cossim] WAV stft_cos: 0.457849 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000018 0.000016 0.000016
|
||||
[Perf] PromptBuild 4.9 ms
|
||||
[Perf] Prefill 14.5 ms (T_ctx prefill)
|
||||
[Perf] TTFA 28.4 ms (first frame codes)
|
||||
[Perf] TalkerDecode 345.8 ms (64 frames, 5.40 ms/frame)
|
||||
[Perf] CodePredictor 514.5 ms (8.04 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 20.7 ms
|
||||
[Perf] Total 902.2 ms (64 frames, 13.46 ms/frame AR, audio 5.12 s, RTF 0.176)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -111,15 +119,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 1.000000 max: 1.7583e-05 mean: 1.5190e-06
|
||||
[Cossim] TrailingText cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 1.3709e-06 mean: 9.3464e-09
|
||||
[Cossim] L0 cos: 0.999998 max: 5.8426e-02 mean: 2.1386e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 1.9663e+01 mean: 3.1486e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.9683e+01 mean: 5.9398e-03
|
||||
[Cossim] L21 cos: 0.999996 max: 1.9749e+01 mean: 1.7527e-02
|
||||
[Cossim] L27 cos: 0.999993 max: 1.9449e+01 mean: 9.8408e-02
|
||||
[Cossim] Final cos: 0.999974 max: 1.1404e+00 mean: 6.6963e-03
|
||||
[Cossim] Logits cos: 0.999993 max: 9.0528e-02 mean: 1.3487e-02
|
||||
[Cossim] L0 cos: 0.999998 max: 5.8418e-02 mean: 2.1386e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 1.9661e+01 mean: 3.1486e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.9681e+01 mean: 5.9397e-03
|
||||
[Cossim] L21 cos: 0.999996 max: 1.9747e+01 mean: 1.7527e-02
|
||||
[Cossim] L27 cos: 0.999993 max: 1.9449e+01 mean: 9.8409e-02
|
||||
[Cossim] Final cos: 0.999974 max: 1.1404e+00 mean: 6.6964e-03
|
||||
[Cossim] Logits cos: 0.999993 max: 9.0520e-02 mean: 1.3486e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 1.3709e-06 mean: 9.4380e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999988 max: 1.2600e-01 mean: 7.9711e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999988 max: 1.2599e-01 mean: 7.9705e-03
|
||||
[Cossim] CodesFull exact: 51.09% (1008 values)
|
||||
[Cossim] Audio cos: 0.352463
|
||||
[Cossim] WAV stft_cos: 0.447080 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000011 0.000016
|
||||
[Perf] PromptBuild 4.2 ms
|
||||
[Perf] Prefill 11.3 ms (T_ctx prefill)
|
||||
[Perf] TTFA 22.2 ms (first frame codes)
|
||||
[Perf] TalkerDecode 157.9 ms (64 frames, 2.47 ms/frame)
|
||||
[Perf] CodePredictor 347.3 ms (5.43 ms/frame)
|
||||
[Perf] HostCompose 1.9 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 22.4 ms
|
||||
[Perf] Total 545.7 ms (64 frames, 7.92 ms/frame AR, audio 5.12 s, RTF 0.107)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -111,10 +119,10 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999698 max: 1.6597e-01 mean: 1.0161e-03
|
||||
[Cossim] TrailingText cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
|
||||
[Cossim] TTSPadEmbed cos: 0.999971 max: 1.2941e-03 mean: 2.2429e-04
|
||||
[Cossim] L0 cos: 0.999314 max: 3.9986e-01 mean: 6.1714e-03
|
||||
[Cossim] L0 cos: 0.999314 max: 3.9985e-01 mean: 6.1714e-03
|
||||
[Cossim] L7 cos: 0.997560 max: 7.2758e+01 mean: 5.9683e-01
|
||||
[Cossim] L14 cos: 0.997543 max: 7.2381e+01 mean: 7.1753e-01
|
||||
[Cossim] L21 cos: 0.997086 max: 7.6006e+01 mean: 1.3170e+00
|
||||
[Cossim] L21 cos: 0.997086 max: 7.6007e+01 mean: 1.3170e+00
|
||||
[Cossim] L27 cos: 0.986253 max: 6.7182e+02 mean: 5.4990e+00
|
||||
[Cossim] Final cos: 0.904035 max: 7.0011e+01 mean: 4.1551e-01
|
||||
[Cossim] Logits cos: 0.989857 max: 3.2177e+00 mean: 4.6453e-01
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1159.000000 355.000000 22.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000015 0.000017 0.000015 0.000017
|
||||
[Perf] PromptBuild 4.3 ms
|
||||
[Perf] Prefill 10.6 ms (T_ctx prefill)
|
||||
[Perf] TTFA 21.2 ms (first frame codes)
|
||||
[Perf] TalkerDecode 193.9 ms (64 frames, 3.03 ms/frame)
|
||||
[Perf] CodePredictor 350.7 ms (5.48 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 21.8 ms
|
||||
[Perf] Total 583.1 ms (64 frames, 8.53 ms/frame AR, audio 5.12 s, RTF 0.114)
|
||||
[WAV] Wrote cpp/customvoice/customvoice-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/customvoice/customvoice-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -111,15 +119,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999962 max: 5.1095e-02 mean: 2.0833e-04
|
||||
[Cossim] TrailingText cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8678e-04 mean: 4.3506e-05
|
||||
[Cossim] L0 cos: 0.999990 max: 5.8636e-02 mean: 6.5103e-04
|
||||
[Cossim] L7 cos: 0.999982 max: 2.1609e+01 mean: 4.4860e-02
|
||||
[Cossim] L14 cos: 0.999982 max: 2.1539e+01 mean: 5.5432e-02
|
||||
[Cossim] L21 cos: 0.999979 max: 2.1860e+01 mean: 1.0403e-01
|
||||
[Cossim] L27 cos: 0.999877 max: 7.6896e+01 mean: 4.5622e-01
|
||||
[Cossim] L0 cos: 0.999990 max: 5.8628e-02 mean: 6.5103e-04
|
||||
[Cossim] L7 cos: 0.999982 max: 2.1607e+01 mean: 4.4860e-02
|
||||
[Cossim] L14 cos: 0.999982 max: 2.1537e+01 mean: 5.5432e-02
|
||||
[Cossim] L21 cos: 0.999979 max: 2.1858e+01 mean: 1.0403e-01
|
||||
[Cossim] L27 cos: 0.999877 max: 7.6894e+01 mean: 4.5622e-01
|
||||
[Cossim] Final cos: 0.998980 max: 1.0111e+01 mean: 3.4557e-02
|
||||
[Cossim] Logits cos: 0.999883 max: 3.6397e-01 mean: 5.8559e-02
|
||||
[Cossim] Logits cos: 0.999883 max: 3.6396e-01 mean: 5.8559e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999992 max: 1.1319e-03 mean: 2.3562e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999782 max: 3.5262e-01 mean: 3.5846e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999782 max: 3.5262e-01 mean: 3.5847e-02
|
||||
[Cossim] CodesFull exact: 7.34% (1008 values)
|
||||
[Cossim] Audio cos: 0.074544
|
||||
[Cossim] WAV stft_cos: 0.345793 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000048 0.000058 0.000047 0.000050
|
||||
[Perf] PromptBuild 51.7 ms
|
||||
[Perf] Prefill 28.7 ms (T_ctx prefill)
|
||||
[Perf] TTFA 94.6 ms (first frame codes)
|
||||
[Perf] TalkerDecode 235.6 ms (64 frames, 3.68 ms/frame)
|
||||
[Perf] CodePredictor 465.6 ms (7.28 ms/frame)
|
||||
[Perf] HostCompose 0.9 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 41.9 ms
|
||||
[Perf] Total 825.3 ms (64 frames, 10.97 ms/frame AR, audio 5.12 s, RTF 0.161)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -112,15 +120,15 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999999 max: 1.1206e-03 mean: 3.1131e-05
|
||||
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] L0 cos: 0.999996 max: 1.6261e-01 mean: 3.0107e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 1.4355e+01 mean: 2.8333e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.4368e+01 mean: 5.5940e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 1.4396e+01 mean: 1.6069e-02
|
||||
[Cossim] L27 cos: 0.999986 max: 5.5601e+01 mean: 8.6566e-02
|
||||
[Cossim] Final cos: 0.999973 max: 8.4519e-01 mean: 9.5250e-03
|
||||
[Cossim] L0 cos: 0.999996 max: 1.6263e-01 mean: 3.0107e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 1.4358e+01 mean: 2.8334e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 1.4371e+01 mean: 5.5941e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 1.4399e+01 mean: 1.6069e-02
|
||||
[Cossim] L27 cos: 0.999986 max: 5.5600e+01 mean: 8.6568e-02
|
||||
[Cossim] Final cos: 0.999973 max: 8.4513e-01 mean: 9.5251e-03
|
||||
[Cossim] Logits cos: 0.999968 max: 1.3380e-01 mean: 2.4371e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.1152e-02 mean: 1.0040e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999990 max: 6.1161e-02 mean: 1.0040e-02
|
||||
[Cossim] CodesFull exact: 10.42% (1008 values)
|
||||
[Cossim] Audio cos: 0.160630
|
||||
[Cossim] WAV stft_cos: 0.411574 samples: 120960
|
||||
|
||||
+18
-10
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000048 0.000056 0.000045 0.000048
|
||||
[Perf] PromptBuild 37.1 ms
|
||||
[Perf] Prefill 15.4 ms (T_ctx prefill)
|
||||
[Perf] TTFA 63.0 ms (first frame codes)
|
||||
[Perf] TalkerDecode 341.4 ms (64 frames, 5.33 ms/frame)
|
||||
[Perf] CodePredictor 560.0 ms (8.75 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 20.6 ms
|
||||
[Perf] Total 976.1 ms (64 frames, 14.10 ms/frame AR, audio 5.12 s, RTF 0.191)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.9544e-04 mean: 1.9685e-06
|
||||
[Cossim] Embed cos: 1.000000 max: 1.9538e-04 mean: 1.9707e-06
|
||||
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] L0 cos: 1.000000 max: 7.1564e-03 mean: 2.8523e-05
|
||||
[Cossim] L7 cos: 1.000000 max: 1.6069e+00 mean: 2.0807e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 1.6074e+00 mean: 4.3788e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 1.6064e+00 mean: 1.2728e-03
|
||||
[Cossim] L27 cos: 1.000000 max: 1.6226e+00 mean: 4.3520e-03
|
||||
[Cossim] Final cos: 1.000000 max: 6.5765e-02 mean: 6.2782e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 9.5849e-03 mean: 9.8702e-04
|
||||
[Cossim] L0 cos: 1.000000 max: 7.1602e-03 mean: 2.8518e-05
|
||||
[Cossim] L7 cos: 1.000000 max: 1.6060e+00 mean: 2.0806e-04
|
||||
[Cossim] L14 cos: 1.000000 max: 1.6064e+00 mean: 4.3786e-04
|
||||
[Cossim] L21 cos: 1.000000 max: 1.6055e+00 mean: 1.2727e-03
|
||||
[Cossim] L27 cos: 1.000000 max: 1.6216e+00 mean: 4.3521e-03
|
||||
[Cossim] Final cos: 1.000000 max: 6.5773e-02 mean: 6.2780e-04
|
||||
[Cossim] Logits cos: 1.000000 max: 9.5885e-03 mean: 9.8726e-04
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 1.000000 max: 9.1391e-03 mean: 1.8985e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 1.000000 max: 9.1410e-03 mean: 1.8990e-03
|
||||
[Cossim] CodesFull exact: 21.73% (1008 values)
|
||||
[Cossim] Audio cos: 0.367625
|
||||
[Cossim] WAV stft_cos: 0.640372 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000068 0.000090 0.000094 0.000090
|
||||
[Perf] PromptBuild 97.6 ms
|
||||
[Perf] Prefill 11.2 ms (T_ctx prefill)
|
||||
[Perf] TTFA 117.7 ms (first frame codes)
|
||||
[Perf] TalkerDecode 180.4 ms (64 frames, 2.82 ms/frame)
|
||||
[Perf] CodePredictor 449.4 ms (7.02 ms/frame)
|
||||
[Perf] HostCompose 2.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 50.2 ms
|
||||
[Perf] Total 791.6 ms (64 frames, 9.87 ms/frame AR, audio 5.12 s, RTF 0.155)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -112,7 +120,7 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999658 max: 1.0957e-02 mean: 9.8301e-04
|
||||
[Cossim] TrailingText cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
|
||||
[Cossim] TTSPadEmbed cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
|
||||
[Cossim] L0 cos: 0.999164 max: 6.9859e-01 mean: 6.7331e-03
|
||||
[Cossim] L0 cos: 0.999164 max: 6.9857e-01 mean: 6.7331e-03
|
||||
[Cossim] L7 cos: 0.997482 max: 1.4649e+02 mean: 4.3740e-01
|
||||
[Cossim] L14 cos: 0.997455 max: 1.4771e+02 mean: 5.4496e-01
|
||||
[Cossim] L21 cos: 0.997039 max: 1.4597e+02 mean: 1.0211e+00
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000048 0.000057 0.000046 0.000047
|
||||
[Perf] PromptBuild 11.1 ms
|
||||
[Perf] Prefill 11.5 ms (T_ctx prefill)
|
||||
[Perf] TTFA 31.4 ms (first frame codes)
|
||||
[Perf] TalkerDecode 208.4 ms (64 frames, 3.26 ms/frame)
|
||||
[Perf] CodePredictor 450.3 ms (7.04 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 47.8 ms
|
||||
[Perf] Total 730.7 ms (64 frames, 10.31 ms/frame AR, audio 5.12 s, RTF 0.143)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -113,12 +121,12 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
|
||||
[Cossim] L0 cos: 0.999985 max: 2.3760e-02 mean: 9.3925e-04
|
||||
[Cossim] L7 cos: 0.999987 max: 1.3055e+01 mean: 3.4056e-02
|
||||
[Cossim] L14 cos: 0.999987 max: 1.3223e+01 mean: 4.4997e-02
|
||||
[Cossim] L21 cos: 0.999983 max: 1.2931e+01 mean: 9.2455e-02
|
||||
[Cossim] L7 cos: 0.999987 max: 1.3056e+01 mean: 3.4056e-02
|
||||
[Cossim] L14 cos: 0.999987 max: 1.3224e+01 mean: 4.4997e-02
|
||||
[Cossim] L21 cos: 0.999983 max: 1.2932e+01 mean: 9.2455e-02
|
||||
[Cossim] L27 cos: 0.999893 max: 1.4175e+02 mean: 4.1420e-01
|
||||
[Cossim] Final cos: 0.999401 max: 3.4478e+00 mean: 4.8895e-02
|
||||
[Cossim] Logits cos: 0.999824 max: 3.1809e-01 mean: 5.5623e-02
|
||||
[Cossim] Final cos: 0.999401 max: 3.4479e+00 mean: 4.8895e-02
|
||||
[Cossim] Logits cos: 0.999824 max: 3.1808e-01 mean: 5.5622e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0252e-03 mean: 2.4056e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999498 max: 3.7477e-01 mean: 6.9993e-02
|
||||
[Cossim] CodesFull exact: 4.96% (1008 values)
|
||||
|
||||
+18
-10
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000048 0.000057 0.000046 0.000050
|
||||
[Perf] PromptBuild 6.0 ms
|
||||
[Perf] Prefill 40.8 ms (T_ctx prefill)
|
||||
[Perf] TTFA 54.2 ms (first frame codes)
|
||||
[Perf] TalkerDecode 236.3 ms (64 frames, 3.69 ms/frame)
|
||||
[Perf] CodePredictor 425.5 ms (6.65 ms/frame)
|
||||
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 23.6 ms
|
||||
[Perf] Total 734.0 ms (64 frames, 10.36 ms/frame AR, audio 5.12 s, RTF 0.143)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,18 +117,18 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-BF16.gguf --codec ../models/qwen-tokenizer-12hz-BF16.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.4028e-04 mean: 1.3036e-05
|
||||
[Cossim] Embed cos: 1.000000 max: 1.4023e-04 mean: 1.3036e-05
|
||||
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] L0 cos: 1.000000 max: 3.9463e-02 mean: 1.3480e-04
|
||||
[Cossim] L7 cos: 0.999999 max: 9.3035e+00 mean: 1.5662e-03
|
||||
[Cossim] L14 cos: 0.999999 max: 9.2773e+00 mean: 2.9958e-03
|
||||
[Cossim] L21 cos: 0.999999 max: 9.2754e+00 mean: 8.1524e-03
|
||||
[Cossim] L27 cos: 0.999997 max: 2.2996e+01 mean: 4.0733e-02
|
||||
[Cossim] Final cos: 0.999993 max: 3.8322e-01 mean: 4.6836e-03
|
||||
[Cossim] Logits cos: 0.999996 max: 5.6217e-02 mean: 8.2250e-03
|
||||
[Cossim] L0 cos: 1.000000 max: 3.9482e-02 mean: 1.3481e-04
|
||||
[Cossim] L7 cos: 0.999999 max: 9.3010e+00 mean: 1.5662e-03
|
||||
[Cossim] L14 cos: 0.999999 max: 9.2749e+00 mean: 2.9958e-03
|
||||
[Cossim] L21 cos: 0.999999 max: 9.2729e+00 mean: 8.1525e-03
|
||||
[Cossim] L27 cos: 0.999997 max: 2.2991e+01 mean: 4.0734e-02
|
||||
[Cossim] Final cos: 0.999993 max: 3.8317e-01 mean: 4.6836e-03
|
||||
[Cossim] Logits cos: 0.999996 max: 5.6216e-02 mean: 8.2254e-03
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 3.5453e-02 mean: 3.7844e-03
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999998 max: 3.5449e-02 mean: 3.7840e-03
|
||||
[Cossim] CodesFull exact: 10.62% (1008 values)
|
||||
[Cossim] Audio cos: 0.171297
|
||||
[Cossim] WAV stft_cos: 0.425931 samples: 120960
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000047 0.000055 0.000045 0.000047
|
||||
[Perf] PromptBuild 4.5 ms
|
||||
[Perf] Prefill 15.4 ms (T_ctx prefill)
|
||||
[Perf] TTFA 29.0 ms (first frame codes)
|
||||
[Perf] TalkerDecode 364.1 ms (64 frames, 5.69 ms/frame)
|
||||
[Perf] CodePredictor 516.8 ms (8.07 ms/frame)
|
||||
[Perf] HostCompose 1.1 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 21.8 ms
|
||||
[Perf] Total 924.3 ms (64 frames, 13.78 ms/frame AR, audio 5.12 s, RTF 0.181)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -109,16 +117,16 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[GGML] Cmd: ../build/qwen-tts --model ../models/qwen-talker-1.7b-voicedesign-F32.gguf --codec ../models/qwen-tokenizer-12hz-F32.gguf --seed 42 --instruct male, young adult, moderate pitch --lang english --max-new 64 --dump cpp/tts -o cpp/tts/tts-cpp.wav --greedy
|
||||
[GGML] Audio: 122880 samples 24000 Hz 5.12s -> cpp/tts/tts-cpp.wav
|
||||
[Cossim] PromptIDs exact: 100.00% (38 values)
|
||||
[Cossim] Embed cos: 1.000000 max: 1.8738e-05 mean: 1.6375e-06
|
||||
[Cossim] Embed cos: 1.000000 max: 1.8746e-05 mean: 1.6375e-06
|
||||
[Cossim] TrailingText cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] TTSPadEmbed cos: 1.000000 max: 7.7486e-07 mean: 9.1737e-09
|
||||
[Cossim] L0 cos: 0.999998 max: 3.6650e-02 mean: 2.3488e-04
|
||||
[Cossim] L7 cos: 0.999997 max: 2.3659e+01 mean: 3.0020e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 2.3636e+01 mean: 5.2403e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 2.3638e+01 mean: 1.3776e-02
|
||||
[Cossim] L27 cos: 0.999993 max: 2.5783e+01 mean: 7.8860e-02
|
||||
[Cossim] Final cos: 0.999975 max: 6.7773e-01 mean: 9.1282e-03
|
||||
[Cossim] Logits cos: 0.999989 max: 8.6271e-02 mean: 1.4753e-02
|
||||
[Cossim] L7 cos: 0.999997 max: 2.3656e+01 mean: 3.0020e-03
|
||||
[Cossim] L14 cos: 0.999997 max: 2.3634e+01 mean: 5.2402e-03
|
||||
[Cossim] L21 cos: 0.999997 max: 2.3635e+01 mean: 1.3776e-02
|
||||
[Cossim] L27 cos: 0.999993 max: 2.5778e+01 mean: 7.8860e-02
|
||||
[Cossim] Final cos: 0.999975 max: 6.7772e-01 mean: 9.1281e-03
|
||||
[Cossim] Logits cos: 0.999989 max: 8.6272e-02 mean: 1.4754e-02
|
||||
[Cossim] NextEmbStep0 cos: 1.000000 max: 8.3447e-07 mean: 9.2106e-09
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999987 max: 6.1182e-02 mean: 1.1015e-02
|
||||
[Cossim] CodesFull exact: 10.32% (1008 values)
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 2030.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000102 0.000140 0.000144 0.000138
|
||||
[Perf] PromptBuild 4.8 ms
|
||||
[Perf] Prefill 11.3 ms (T_ctx prefill)
|
||||
[Perf] TTFA 22.4 ms (first frame codes)
|
||||
[Perf] TalkerDecode 165.4 ms (64 frames, 2.58 ms/frame)
|
||||
[Perf] CodePredictor 348.8 ms (5.45 ms/frame)
|
||||
[Perf] HostCompose 1.7 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 22.1 ms
|
||||
[Perf] Total 554.8 ms (64 frames, 8.06 ms/frame AR, audio 5.12 s, RTF 0.108)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -112,8 +120,8 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] Embed cos: 0.999680 max: 1.3244e-02 mean: 9.5245e-04
|
||||
[Cossim] TrailingText cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
|
||||
[Cossim] TTSPadEmbed cos: 0.999969 max: 2.4252e-03 mean: 2.2081e-04
|
||||
[Cossim] L0 cos: 0.999207 max: 7.6313e-01 mean: 6.5139e-03
|
||||
[Cossim] L7 cos: 0.997488 max: 1.4405e+02 mean: 4.3667e-01
|
||||
[Cossim] L0 cos: 0.999207 max: 7.6311e-01 mean: 6.5139e-03
|
||||
[Cossim] L7 cos: 0.997488 max: 1.4404e+02 mean: 4.3667e-01
|
||||
[Cossim] L14 cos: 0.997462 max: 1.4487e+02 mean: 5.4271e-01
|
||||
[Cossim] L21 cos: 0.997070 max: 1.4280e+02 mean: 1.0091e+00
|
||||
[Cossim] L27 cos: 0.988935 max: 5.3251e+02 mean: 4.5243e+00
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
[Qwen] qwentts.cpp a62fde6 (2026-05-30)
|
||||
[Qwen] qwentts.cpp 5442c2f (2026-05-31)
|
||||
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 97247 MiB):
|
||||
Device 0: NVIDIA RTX PRO 6000 Blackwell Workstation Edition, compute capability 12.0, VMM: yes, VRAM: 97247 MiB
|
||||
load_backend: loaded CUDA backend from /mnt/workspace/qwentts.cpp/build/libggml-cuda.so
|
||||
@@ -94,6 +94,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Pipeline] Generation done : 64 frames
|
||||
[Debug] codes-full: [64, 16] first4: 1995.000000 1642.000000 1398.000000 1703.000000
|
||||
[Debug] output-audio: [122880] first4: 0.000047 0.000055 0.000042 0.000045
|
||||
[Perf] PromptBuild 4.3 ms
|
||||
[Perf] Prefill 10.8 ms (T_ctx prefill)
|
||||
[Perf] TTFA 21.8 ms (first frame codes)
|
||||
[Perf] TalkerDecode 183.7 ms (64 frames, 2.87 ms/frame)
|
||||
[Perf] CodePredictor 349.0 ms (5.45 ms/frame)
|
||||
[Perf] HostCompose 1.0 ms (c0 sample + next emb)
|
||||
[Perf] CodecDecode 22.9 ms
|
||||
[Perf] Total 572.4 ms (64 frames, 8.34 ms/frame AR, audio 5.12 s, RTF 0.112)
|
||||
[WAV] Wrote cpp/tts/tts-cpp.wav: 122880 samples, 24000 Hz, mono S16
|
||||
[Pipeline] Wrote 122880 samples (5.12 s) -> cpp/tts/tts-cpp.wav
|
||||
[Input] Prompt: 100 chars: qwentts.cpp is a minimal C++17 and GGML port of Qwen3-TTS fo...
|
||||
@@ -113,14 +121,14 @@ load_backend: loaded CPU backend from /mnt/workspace/qwentts.cpp/build/libggml-c
|
||||
[Cossim] TrailingText cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
|
||||
[Cossim] TTSPadEmbed cos: 0.999999 max: 1.8711e-04 mean: 4.2146e-05
|
||||
[Cossim] L0 cos: 0.999992 max: 5.2092e-02 mean: 6.6198e-04
|
||||
[Cossim] L7 cos: 0.999986 max: 1.8315e+01 mean: 3.1960e-02
|
||||
[Cossim] L14 cos: 0.999986 max: 1.8216e+01 mean: 4.0318e-02
|
||||
[Cossim] L21 cos: 0.999984 max: 1.8408e+01 mean: 7.6007e-02
|
||||
[Cossim] L27 cos: 0.999943 max: 7.4066e+01 mean: 3.3577e-01
|
||||
[Cossim] L7 cos: 0.999986 max: 1.8314e+01 mean: 3.1960e-02
|
||||
[Cossim] L14 cos: 0.999986 max: 1.8215e+01 mean: 4.0318e-02
|
||||
[Cossim] L21 cos: 0.999984 max: 1.8407e+01 mean: 7.6007e-02
|
||||
[Cossim] L27 cos: 0.999943 max: 7.4065e+01 mean: 3.3577e-01
|
||||
[Cossim] Final cos: 0.999670 max: 1.5096e+00 mean: 3.7530e-02
|
||||
[Cossim] Logits cos: 0.999795 max: 3.7740e-01 mean: 6.0399e-02
|
||||
[Cossim] Logits cos: 0.999795 max: 3.7739e-01 mean: 6.0399e-02
|
||||
[Cossim] NextEmbStep0 cos: 0.999990 max: 1.0252e-03 mean: 2.4056e-04
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999734 max: 2.9196e-01 mean: 4.9954e-02
|
||||
[Cossim] TalkerHiddenStep1 cos: 0.999734 max: 2.9197e-01 mean: 4.9954e-02
|
||||
[Cossim] CodesFull exact: 5.16% (1008 values)
|
||||
[Cossim] Audio cos: 0.025097
|
||||
[Cossim] WAV stft_cos: 0.334440 samples: 120960
|
||||
|
||||
Reference in New Issue
Block a user