GPT-6 AstraのSystem Cardに収録されたUK AISIの外部評価では、Chain of Thoughtを使わない単一forward passで解ける数学問題の50% reliability time horizonが30.9分となり、GPT-5.6 Solの3.6分を大きく上回った。CoT controllabilityも93%対48%に上昇し、raw reasoningはより圧縮された表現になった。一方、OpenAIの公開資料はrecurrent depthやlooped Transformerを採用したとは明記しておらず、具体的な内部アーキテクチャは未確認である。
所感
出力CoTを長くする以外にも、1 tokenを出す前の内部処理側へ推論能力が移る可能性を示す強いproduction evidenceになる。将来のローカルモデルでは、出力token数やdecode tok/sだけでは思考量を表せず、可変な内部computeやlatent iterationを扱うruntime設計が重要になる可能性がある。ただし現時点ではweightsもarchitectureも非公開なので実装・試用対象ではない。
- reasoning
- latent-reasoning
- test-time-compute
- architecture
- gpt-6-astra
情報源
MLXのdraft PR #4476は、D256 causal attentionの短いprefill(fp16/bf16、query 512〜1023、key最大1536)をNAX split-head-dimension kernelへ広げ、M5 Maxのoperator測定で約1.07〜1.38倍を報告した。key長1537のcontrolはほぼ中立だった。PR #4477は同じD256でGQA=8のsingle-token decode、key長8192以上にtwo-pass vector kernelを追加し約1.11〜1.18倍。どちらも通常の浮動小数点KV cacheが対象で、whole-model throughputは未測定。
所感
同じhead_dimでもprefillとdecode、さらにcontext境界で最適kernelが変わることが明瞭になった。M5 Ultra実機で phase・qL・kL・dtype・GQA比・KV形式を掃くautotunerを早期に作り、correctness gate後にcrossover tableを生成する価値がある。
- apple-silicon
- mlx
- m5
- attention
- nax
- gqa
- autotuning
情報源
oMLX mainのcommit fc69aecは、Qwen4-Exp/Qwen3.8-Flash-NextでSSDに置いたPLE(n-gram bank)の散在row lookupを、mmap上の逐次page faultから複数os.preadの並列prefetchへ変更した。開発者のM4 Max内蔵NVMe測定では500件の4KB random readが約9.1kから98.8k IOPSへ伸び、40K-token cold promptでは特定のQwen3.8-Flash-Next checkpointでTTFT 216.85秒から6.54秒、generation 43.70から59.92 tok/sを報告している。row結果はbyte-identicalで、対象はSSD-backed PLE modeのみ。最新stableは依然0.6.4である。
所感
64GB級Apple SiliconでQwen3.8-Flash-Nextの大きなPLEをSSD offloadする際の実ボトルネックを直接潰す変更で、ユーザーの既存運用に最も近い。ただし数値は開発側測定で、0.6.4にはagent loopのprefix-cache regressionが複数報告されたまま。#3287を含むstable releaseと、M4 Pro 64GBでprefix reuse・長時間agent loopのcorrectnessを保った独立A/Bが揃うまでは導入しない。
- omlx
- apple-silicon
- qwen3.8
- qwen4
- ssd-offload
- ple
- inference
情報源
oMLX PR #3520 は Qwen3.8-Flash-Next の gathered QSA で、各stepにKV全体をtranspose+reshapeしていた経路を、保存レイアウトのtoken軸から直接 mx.take する方式へ変更した。M5 Maxでは206K tokenのcacheでQSA 1 layer・1 tokenあたり1.83msから0.27msへ短縮。さらに長文のtext-only decodeとMTP verifyをgathered QSAへ通し、serial decodeは63K/134K/229Kで約+8%/+19%/+30%、greedyのadaptive MTPは約+13%/+34%/+40%を報告している。損益分岐はserial・sampled MTP・greedy MTPで異なる。
所感
自前MLX runtimeでは、sparse attentionの前処理で物理cache layoutを壊さないことを原則にし、text-only等の意味的な事実はtensor値から毎step推定せずscheduler metadataとして運ぶ価値がある。またQSA routeの閾値はcontext長だけでなくphase・sampling・speculation depthを含むExecutionPlanのdispatch keyにすべきという具体的な実測になる。
- apple-silicon
- mlx
- qwen3.8
- qsa
- long-context
- mtp
- scheduling
情報源
oMLX PR #3525 は、次ターンのchat historyがthinking/reasoningを保持する場合にpromptだけでなく生成outputもprefix cacheへ保存する。M5 MaxのQwen3.8-Flash-Nextで3126-token promptと6000-token answerを使った2-turn probeでは、従来2048 tokenだけだった保存・再利用が8192 tokenまで増えた。tool-callで終わるturnにも同じ規則を適用する。また短いpromptではMTPのblock-boundary alignmentが最初のcaptureまでarmされず、2048境界が2047/2049へずれることがある問題も、request追加時にalignmentをarmすることで修正している。
所感
coding-agent loopでは長いreasoningやtool callの再prefillを避けられる。cacheabilityは「reasoningか否か」ではなく、次のpromptがそのtoken列を同一に再レンダリングするかというtranscript identityで判定する方が一般化しやすい。state checkpointの境界契約もdecode中に遅延初期化せずrequest開始時点で確立すべきだと分かる。
- apple-silicon
- mlx
- prefix-cache
- reasoning
- agent-loop
- mtp
- state
情報源