oMLXがSSD-backed PLEをhost一括assemblyと次chunk先読みでprefillから隠すPR
oMLX PR #3534はQwen3.8-Flash-NextのSSD-backed PLEで、chunk内の多数shardを個別upload/dequantizeする代わりにhost側でtensor familyごとの連続bufferへ組み立てて各family一回だけuploadし、さらにschedulerが次chunkのtokenを事前通知して現在chunkのGPU実行中に単一workerで次のPLE rowをgatherする。M5 Maxでは2048-token chunkのPLE layerが248→35 ms、16K/63K/134K/229K prefillがそれぞれ約+33%/+18%/+13%/+12%。decodeはほぼ不変で、PRはopen。
所感
既存の並列pread最適化の次段として、I/Oを速くするだけでなく『多数shardのpublicationを一括化する』『schedulerが未来のchunkをモデルへ知らせてI/OをGPU計算と重ねる』という責務境界が有効だと示す。SSD offloadを使う独自runtimeでは、operator側のprefetch hookとscheduler側のlookaheadを明示APIにする価値がある。