AI関連論文

AI論文記事のカテゴリ画像自分が読んだAI関連の論文について、日本語解説していきます。

特に、AI(LLM, Diffusionモデルなど)を用いた画像処理(Denoiseや画像再構成、超解像などについての技術論文と
上記技術をエッジデバイスなどに搭載するために必要な縮小・軽量化(Quantization, LoRAなど)がメインになります。

AI関連論文

Apple MPSのLLM推論はなぜ急に遅くなる?KV Cacheと非単調レイテンシを解説

Apple MPSのLLM推論で、生成長を少し増やすと最大21倍遅くなり、その後回復する現象を報告した論文を解説。KV Cache、prefillとdecode、メモリ使用量、M3 Max・M3 Proでの実験、Macでの測定方法を整理します。
AI関連論文

LLMはいつ危険な回答へ傾く?Fusion-Fission予測式を詳しく解説

LLMが望ましい回答から望ましくない回答へ傾く時点を、C・B・DベクトルとD-B方向から予測するFusion-Fission論文を解説。式の符号、3レジーム、転換時刻、Python実装、限界を図解します。
AI関連論文

OP4KSRとは?4K超解像をパッチ分割なし・1ステップで高速化する仕組み

OP4KSRは、F16 VAEで圧縮した4K画像をパッチ分割せず1ステップで超解像する手法です。圧縮と最終画質の関係、2D-RoPEの周波数スケーリング、自己相関損失による32 pixel周期アーティファクト抑制を数式と実験結果から解説します。
AI関連論文

オンデバイスAIエージェントを高速化するAgent-Xとは?仕組みを解説

Agent-Xとは、オンデバイスAIエージェントのprefillとdecodeをソフトウェアだけで高速化する手法です。PromptWeaverのKV Cache再利用、ExSpecの追加LLMなし投機的デコーディング、M4 Proで1.61倍となった実験結果と課題を解説します。
AI関連論文

LLM量子化の精度劣化を抑えるSARQCとは?仕組みと効果を解説

SARQCとは、LLMの学習後量子化で再構成誤差と重みドリフトを同時に抑え、重要チャネルを保護する手法です。RQCとの違い、AWQ・GPTQへの統合、INT4〜INT2の実験結果を論文ベースで解説します。
AI関連論文

FlashAttentionとは?AttentionをIO-awareに高速化する仕組み

FlashAttentionとは、Self-Attentionを近似せず、GPUのHBMとSRAM間のIOを減らして高速・省メモリ化する手法です。tiling、online softmax、recomputation、Block-sparse FlashAttention、実験結果を論文ベースで解説します。
AI関連論文

WiCERとは?LLMの長文知識をWiki-memoryとして圧縮・改善する仕組み

WiCERとは、LLM向けに長文知識をWiki-memoryへ圧縮し、診断プローブで欠落事実を見つけて反復改善する手法です。RAG、full-context KV cache、compilation gapとの違いを論文ベースで解説します。
AI関連論文

Patch Forcingとは?画像生成をパッチごとの難しさで適応的に進める仕組み

Patch Forcingとは、画像をパッチごとの難しさに応じて異なる速度で生成する適応サンプリング手法です。LTG sampler、difficulty head、dual-loop、look-aheadの仕組みを、Flow Matchingの数式とImageNet・Text-to-Imageの実験結果から解説します。
AI関連論文

学習率とは?DALS論文で見る最適化手法の進化と使い分け

学習率とは何か、SGD、cosine decay、AdamW、RAdam、LARS、Grokfast、DALSの違いを論文ベースで解説します。DALSが提案する層と学習フェーズに応じた最適化、scratch学習とfine-tuningでの使い分け、実験結果の読み方を整理します。
AI関連論文

Decoder-only Transformerとは?GPT系LLMの構造と生成の仕組みを理解する

Decoder-only Transformerは、GPT系LLMで使われる自己回帰型のTransformer構造です。GPT-2論文をもとに、次token予測、causal mask、Encoder-Decoderとの違い、GPT-2の設計、KV Cacheとの関係を初心者にも分かりやすく解説します。
スポンサーリンク