MLXがglobal-scale NVFP4のgather量子化行列積をmatrix kernelへ移すPR
MLX PR #4481はglobal scale付きgather_qqmmを新しいgather_qmm matrix kernelへdispatchし、Qwen3.6-35B-A3BのNVFP4 MLP-only(p2048/g128)でM5 Maxのprefillを1,257.0→3,105.3 tok/s、M3 Ultraを1,627.3→2,673.2 tok/sと報告した。generationはほぼ不変。続く#4483はqmm_t kernelにもglobal scale読み込みを追加し、#4481との組み合わせでM5 Max 4,256.2 tok/s、M3 Ultra 2,819.9 tok/sを報告している。両PRは2026-09-10時点でopen。
所感
量子化形式そのものより、global scaleという量子化メタデータの有無で高速matrix pathから外れるだけでprefillが数倍変わり得ることを示している。独自MLX runtimeではbits/group sizeだけでなくscale方式・weight layout・phaseまでKernelPlanのdispatch keyに含め、NVFP4系のprefill crossoverを実測する価値が高い。