AI関連論文 Apple MPSのLLM推論はなぜ急に遅くなる?KV Cacheと非単調レイテンシを解説
Apple MPSのLLM推論で、生成長を少し増やすと最大21倍遅くなり、その後回復する現象を報告した論文を解説。KV Cache、prefillとdecode、メモリ使用量、M3 Max・M3 Proでの実験、Macでの測定方法を整理します。
AI関連論文
AI関連論文
AI関連論文
AI関連論文