oMLXがMTP停止中もdraft headをprimed状態に保つ再入戦略を提案
oMLXのQwen3.8-Flash-Next向けPRでは、適応MTPが一時的に通常decodeへ戻った際にdraft head cacheを捨てず、通常decode中のhidden stateと次tokenを32 token単位でまとめてMTP headへ流して追従させる。68k token級のprose例では、154 token後にMTPをparkした後も再試行時に約68.6kまでprimedされた状態から復帰し、残り742 tokenをMTPで処理できた。
所感
speculationを単純なon/offではなく、parked-but-primedを含む永続的な状態機械として設計する根拠になる。既存のmtp_forwardを使う制御・state管理中心の変更なので、MLXベースの独自runtimeへ比較的移植しやすい。