Kas

AI技術・仕組み

RAGのChunkingとは?文書分割・Hybrid Search・Rerankerを解説

RAGのChunkingを、固定長・overlap・意味単位・parent-child・Late Chunkingまで比較。Hybrid Search、RRF、Cross EncoderによるRerank、段階別評価の考え方を図解します。
AI技術・仕組み

Embedding検索とは?Dense Retrievalの仕組みをDPR論文から解説

Embedding検索とDense Retrievalの仕組みをDPR論文から解説。Dual Encoder、positive・negative学習、内積とcosine similarity、exact検索とANN、Recall@k、検索漏れの診断まで整理します。
AI技術・仕組み

RAGとは?LLMに外部知識を使わせる仕組み

RAGとは何かを、文書のindexing、検索、context構築、LLM生成の流れから図解。Fine-tuningとの違い、vector検索、権限・鮮度、精度評価、よくある失敗と改善方法まで解説します。
AI技術・仕組み

vLLMとは?LLMサーバーを高速化する仕組み

vLLMとは何かを、PagedAttentionによるKV Cache管理、continuous batching、prefix cachingの違いから図解。メモリ容量の計算、OpenAI互換APIの起動例、導入時の測定項目も解説します。
AI技術・仕組み

Speculative Decodingとは?LLM生成を速くする方法

Speculative Decodingの仕組みを図解。draft modelの候補生成、target modelの一括検証、samplingの受理・棄却、高速化条件と実測方法を解説します。
AI技術・仕組み

GQA/MQAとは?KV Cacheを減らすAttention改良

GQAとMQAの仕組みを図解。MHAとのhead構成の違い、KV Cache容量の計算、group数とgroup size、品質・速度のtrade-off、実装確認を解説します。
AI技術・仕組み

FlashAttentionとは?Attentionを高速化する技術

FlashAttentionの仕組みを図解。N×N中間行列、HBMとSRAM、online softmax、メモリ削減、KV Cacheとの違い、PyTorchでの確認方法を解説します。
AI技術・仕組み

量子化とは?LLMを軽くする省メモリ技術

LLMの量子化を図解。scaleとzero point、INT8・INT4、W4A16・W8A8、GPTQ・AWQの違いと、容量・速度・品質の測り方を解説します。
AI技術・仕組み

KV Cacheとは?LLMの生成を高速化する仕組み

LLMのKV Cacheを図解。過去のKeyとValueを再利用する理由、prefillとdecode、メモリ使用量の計算、長いcontextでのボトルネックを解説します。
AI技術・仕組み

QLoRAとは?NF4・Double Quantization・Paged Optimizerと実装上の注意点

QLoRAの仕組みを、4-bit保存とBF16計算、LoRA更新に分けて解説。NF4、Double Quantization、Paged Optimizer、メモリ計算、実装・保存・評価の注意点まで整理します。
スポンサーリンク