oMLXでragged multi-token MTPを一回のbatched verifyにまとめるPR
oMLX PR #3533は複数MTP requestを一回の(N,k+1) verify forwardへまとめ、各row固有のaccept長に応じてragged commitとper-row rollbackを行うexperimental pathを追加する。M5 Max / Qwen3.8-Flash-Next / greedyでk=2・8-way時51.6 tok/s aggregate、既存row-wise batched MTPの約6倍と報告し、12〜16-wayでは約53 tok/sで飽和した。ただしQSA cacheのragged rollbackにはmlx-vlm PR #2197が必要で、2026-09-10時点では両PRともopen。非greedyやlogits processor等はfallbackする。
所感
speculative decodingをsingle-stream最適化ではなくcontinuous batchingと統合する設計例として重要で、将来M5 Ultra上で複数coding agentを並列実行するときに効く。一方でrollback依存が未mergeで、対応範囲もgreedyなGDN+PLE系に限定されるため、現時点では実装を取り込むよりstate transactionとragged rollback contractの設計資料として保持する。