AI・テクノロジー

AI技術・仕組み

Stable Diffusionの基本:Latent Diffusionとは?

Stable Diffusionの仕組みを、Diffusionのノイズ予測、VAEによる潜在圧縮、U-NetとCross-Attention、学習・生成の違い、StepsとGuidance Scaleまで図解します。
AI技術・仕組み

LLaVAとは?画像対話AIの作り方

LLaVAとは何かを、text-only GPT-4による画像指示データ生成、158Kの内訳、CLIP・Projector・LLM、二段階学習、answer loss、評価条件まで図解します。
AI技術・仕組み

VLMとは?画像を理解する大規模言語モデル

VLM(Vision-Language Model)とは何かを、Vision Encoder、Connector、LLM、visual tokenのshape、LLaVA・Flamingo・BLIP-2の構造比較、学習方法、限界まで図解します。
AI技術・仕組み

ViTとは?画像をパッチとして読むTransformer

Vision Transformer(ViT)とは何かを、画像のpatch分割、Patch Embedding、Class Token、Position Embedding、Self-Attention、CNNとの違いまで図解します。
AI技術・仕組み

CLIPとは?画像とテキストを同じ空間で扱う技術

CLIPとは何かを、Image EncoderとText Encoder、Contrastive Learning、共有Embedding空間、zero-shot画像分類の流れから図解。prompt設計、用途、限界も解説します。
AI技術・仕組み

Mambaとは?Transformer以外の系列モデル

Mambaと状態空間モデルを、SSMの離散化、入力依存のDelta・B・C、Selective Scan、Mamba block、Transformerとの違いまで数式と図で解説します。
AI技術・仕組み

Long Contextとは?LLMが長文を扱う仕組み

LLMのLong Contextを、Dense Attentionの二乗計算、Longformer、RoPE Scaling、KV Cache、実効context長まで数式と具体例で図解します。
AI技術・仕組み

Switch Transformerとは?巨大モデルを効率化するMoE

Switch Transformerとは何かを、T5内の構造、Top-1 Routingの数式、Routerの学習、Expert Capacity、負荷分散loss、Selective Precision、Expert Parallelismまで図解します。
AI技術・仕組み

MoEとは?複数の専門家を使うLLM構造

MoE(Mixture of Experts)とは何かを、Dense LLMとの違い、RouterのTop-k選択、総parameterとactive parameter、負荷分散、expert capacity、All-to-All通信、Python例まで図解します。
AI技術・仕組み

AI Agentとは?ReActでLLMが考えて行動する仕組み

AI Agentとは何かを、ReActのThought・Action・Observation、Function Callingや固定workflowとの違い、状態管理、停止条件、権限、人間承認、Python実装、評価まで図解します。
スポンサーリンク