oMLXでpaged cache blockをモデル形状ではなくworkloadに合わせる効果が顕在化
oMLX PR #3557では、Qwen3.8-27Bのモデル形状由来4096-token blockが約3.6k-tokenのcoding-agent system promptを丸ごと再利用不能にしていた。M3 Max 64GBでblockを512へ変更すると、20タスクの中央値でprefix hit率59.8%→88.7%、再prefill token数-64.3%、TTFT 18.35→5.92秒、suite wall time -38.5%となり、decodeは-3.6%だった。
所感
cache block sizeをモデルのrecurrent/prefill geometryだけで決めると、実際の安定prefix長との境界ずれで大きな再計算が起きる。独自runtimeではprefill演算粒度とcache persistence粒度を分離し、workload統計からblock sizeを選ぶautotune対象にする価値が高い。