AI技術・仕組み LLMは並列計算できるのに、なぜ1文字ずつ答える?PrefillとDecodeの違い
LLMは並列計算できるのに、なぜ答えを少しずつ生成するのか。PrefillとDecodeの違い、KVキャッシュを追加するタイミング、最初の応答までのTTFTと生成間隔を図解します。
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み
AI技術・仕組み