
Qwen3.8-27B
272.8
—
109.1
同じQwen3.8-27B NVFP4重みのdecodeはTensorFold 272.8/vLLM 151.4 tok/s。RTX PRO 6000 Blackwell Max-Q・250W、1件・code greedy・256出力。下書き方式は異なります。

同じQwen3.8-27B NVFP4重みのdecodeはTensorFold 272.8/vLLM 151.4 tok/s。RTX PRO 6000 Blackwell Max-Q・250W、1件・code greedy・256出力。下書き方式は異なります。