TRY

copy-draftをsampling・prefix cache・MLX tile境界まで含めて適応制御

Rapid-MLXはprompt copy-draftをsampling中にも正しい補正付きで利用できるようにし、prefix cache hit時も物理batch tailではなくrequest全体のprompt token列からcopy indexを構築するよう修正した。さらにverify幅をMLX量子化matmulの32-row tile境界と実測acceptanceに合わせて適応させ、M4 ProのQwen3.8-27B 4bitではcode renameで約+21.6%、bugfixで約+30.8%の改善を報告している。3-turn会話ではcache hit後のturnで約23 tok/sから45〜47 tok/sまで伸びた。

coding agentでは過去prompt内のコードを再出力・編集する局面が多い。speculation controllerを固定depthではなく、論理履歴・sampling correctness・kernelのtile cost・そのturnのacceptanceをまとめて制御する設計は独自runtimeへそのまま持ち込む価値が高い。

  • MLX
  • speculative-decoding
  • MTP
  • agent
  • scheduling