OpenWeightsTerminal

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next

RTX PRO 6000 · Q4_XL · llama.cpp b11412

Decode · tok/s
92.8
Prefill
—
tok/100W
15.5
使用GPUは、RTX PRO 6000。Qwen3.8-flash-next-q4xl … 生成 92.82 t/s … GPURAM 81.07 GB。llama.cpp(build 11412)、500文字までの日本語生成。

First-person llama.cpp bench. Rank is the quoted 92.82 generation t/s. Filename quant is q4xl.

Officialclaimed
Open pair