TRY

oMLXがQwen4-ExpのYaRN長文拡張を実装し、fast pathとの能力差を明示

oMLX PR #3594は、Qwen3.8-Flash-Nextのrope_parametersに指定されたstatic YaRNがpinned mlx-vlmでは無視され、262,144 token超でunscaled RoPEのまま動く問題を修正する。attention、QSA indexer、MTPで同じrotary stateを共有し、未知のRoPE形式はfail-closedにする。Metal fused mRoPEはattention scalingを表現できない場合eagerへfallbackし、SpecPrefillはscaled RoPEと非互換として扱う。M5 Max 128GBで350K tokenまでfield validationされている。

長文拡張はmodel settingではなくexecution semanticsであり、attention本体だけでなくsparse index、speculative path、fused kernelまで同じposition transformを共有しなければ静かに誤る。独自runtimeではRoPE capabilityをExecutionPlanの合法性条件に含めるべき。

  • mlx
  • qwen
  • long-context
  • rope
  • correctness