HOLD

oMLXでragged multi-token MTPを一回のbatched verifyにまとめるPR

oMLX PR #3533は複数MTP requestを一回の(N,k+1) verify forwardへまとめ、各row固有のaccept長に応じてragged commitとper-row rollbackを行うexperimental pathを追加する。M5 Max / Qwen3.8-Flash-Next / greedyでk=2・8-way時51.6 tok/s aggregate、既存row-wise batched MTPの約6倍と報告し、12〜16-wayでは約53 tok/sで飽和した。ただしQSA cacheのragged rollbackにはmlx-vlm PR #2197が必要で、2026-09-10時点では両PRともopen。非greedyやlogits processor等はfallbackする。

speculative decodingをsingle-stream最適化ではなくcontinuous batchingと統合する設計例として重要で、将来M5 Ultra上で複数coding agentを並列実行するときに効く。一方でrollback依存が未mergeで、対応範囲もgreedyなGDN+PLE系に限定されるため、現時点では実装を取り込むよりstate transactionとragged rollback contractの設計資料として保持する。

  • omlx
  • mlx-vlm
  • apple-silicon
  • m5
  • qwen3.8
  • mtp
  • speculative-decoding
  • continuous-batching
  • rollback