2026-08

AI関連論文

Apple MPSのLLM推論はなぜ急に遅くなる?KV Cacheと非単調レイテンシを解説

Apple MPSのLLM推論で、生成長を少し増やすと最大21倍遅くなり、その後回復する現象を報告した論文を解説。KV Cache、prefillとdecode、メモリ使用量、M3 Max・M3 Proでの実験、Macでの測定方法を整理します。
AI関連論文

LLMはいつ危険な回答へ傾く?Fusion-Fission予測式を詳しく解説

LLMが望ましい回答から望ましくない回答へ傾く時点を、C・B・DベクトルとD-B方向から予測するFusion-Fission論文を解説。式の符号、3レジーム、転換時刻、Python実装、限界を図解します。
AI関連論文

OP4KSRとは?4K超解像をパッチ分割なし・1ステップで高速化する仕組み

OP4KSRは、F16 VAEで圧縮した4K画像をパッチ分割せず1ステップで超解像する手法です。圧縮と最終画質の関係、2D-RoPEの周波数スケーリング、自己相関損失による32 pixel周期アーティファクト抑制を数式と実験結果から解説します。
AI関連論文

オンデバイスAIエージェントを高速化するAgent-Xとは?仕組みを解説

Agent-Xとは、オンデバイスAIエージェントのprefillとdecodeをソフトウェアだけで高速化する手法です。PromptWeaverのKV Cache再利用、ExSpecの追加LLMなし投機的デコーディング、M4 Proで1.61倍となった実験結果と課題を解説します。
スポンサーリンク