DeepSeek V4.1 FlashのREAP 2-bit実測でexpert数削減の速度限界が確認
Rapid-MLX 0.14.1はDeepSeek V4.1 Flashのnative affine 2-bit REAP実験を公開した。384 routed expertsを336へ削り、平均99.9949%のrouting massを保持した約199 GiBのartifactはM3 Ultra 256 GiBで213.51 GBのMLX memoryを使用し、best short-decodeでも7.92 tok/sだった。Rapid-MLXの12 tok/s product gateを通らずcatalogには追加されていない。報告ではexpert総数を減らしても各tokenが実行する6 expertsの幅は変わらず、保存容量の削減がdecode compute削減へ直結しないことを明示している。
所感
REAP系のexpert pruningを大規模MoEのApple Silicon適合策として見る際、容量削減とdecode高速化を分けて考える必要があるという実測。64GB機では対象外だが、今後より大きなMoEをローカル化する設計判断に有用な負の結果。