AI研究・論文解説

AI論文記事のカテゴリ画像自分が読んだAI関連の論文について、日本語解説していきます。

特に、AI(LLM, Diffusionモデルなど)を用いた画像処理(Denoiseや画像再構成、超解像などについての技術論文と
上記技術をエッジデバイスなどに搭載するために必要な縮小・軽量化(Quantization, LoRAなど)がメインになります。

AI研究・論文解説

推論LLMは枝刈りで遅くなる?Reasoning-Aware Compression論文解説

推論LLMを通常の方法で枝刈りすると、思考トークンが増えて遅くなる場合があります。CoTの活性値を使うReasoning-Aware Compression(RAC)の仕組み、精度、実行時間、導入時の注意点を原論文から解説します。
AI研究・論文解説

FP8ロールアウトはなぜLLM強化学習を不安定にする?AISの仕組みを解説

FP8 rolloutとBF16 trainerでLLM強化学習の勾配がずれる原因を、量子化誤差と数値例から解説。誤差が初期には探索、後期にはbiasへ変わる理由と、AISの確率比・3指標・勾配補正を詳しく整理します。
AI研究・論文解説

Apple MPSのLLM推論はなぜ急に遅くなる?KV Cacheと非単調レイテンシを解説

Apple MPSのLLM推論で、生成長を少し増やすと最大21倍遅くなり、その後回復する現象を報告した論文を解説。KV Cache、prefillとdecode、メモリ使用量、M3 Max・M3 Proでの実験、Macでの測定方法を整理します。
AI研究・論文解説

LLMはいつ危険な回答へ傾く?Fusion-Fission予測式を詳しく解説

LLMが望ましい回答から望ましくない回答へ傾く時点を、C・B・DベクトルとD-B方向から予測するFusion-Fission論文を解説。式の符号、3レジーム、転換時刻、Python実装、限界を図解します。
AI研究・論文解説

OP4KSRとは?4K超解像をパッチ分割なし・1ステップで高速化する仕組み

OP4KSRは、F16 VAEで圧縮した4K画像をパッチ分割せず1ステップで超解像する手法です。圧縮と最終画質の関係、2D-RoPEの周波数スケーリング、自己相関損失による32 pixel周期アーティファクト抑制を数式と実験結果から解説します。
AI研究・論文解説

オンデバイスAIエージェントを高速化するAgent-Xとは?仕組みを解説

Agent-Xとは、オンデバイスAIエージェントのprefillとdecodeをソフトウェアだけで高速化する手法です。PromptWeaverのKV Cache再利用、ExSpecの追加LLMなし投機的デコーディング、M4 Proで1.61倍となった実験結果と課題を解説します。
AI研究・論文解説

LLM量子化の精度劣化を抑えるSARQCとは?仕組みと効果を解説

SARQCとは、LLMの学習後量子化で再構成誤差と重みドリフトを同時に抑え、重要チャネルを保護する手法です。RQCとの違い、AWQ・GPTQへの統合、INT4〜INT2の実験結果を論文ベースで解説します。
AI研究・論文解説

FlashAttentionとは?AttentionをIO-awareに高速化する仕組み

FlashAttentionとは、Self-Attentionを近似せず、GPUのHBMとSRAM間のIOを減らして高速・省メモリ化する手法です。tiling、online softmax、recomputation、Block-sparse FlashAttention、実験結果を論文ベースで解説します。
AI研究・論文解説

WiCERとは?LLMの長文知識をWiki-memoryとして圧縮・改善する仕組み

WiCERとは、LLM向けに長文知識をWiki-memoryへ圧縮し、診断プローブで欠落事実を見つけて反復改善する手法です。RAG、full-context KV cache、compilation gapとの違いを論文ベースで解説します。
AI研究・論文解説

Patch Forcingとは?画像生成をパッチごとの難しさで適応的に進める仕組み

Patch Forcingとは、画像をパッチごとの難しさに応じて異なる速度で生成する適応サンプリング手法です。LTG sampler、difficulty head、dual-loop、look-aheadの仕組みを、Flow Matchingの数式とImageNet・Text-to-Imageの実験結果から解説します。
スポンサーリンク