載入中...
Allen KB Articles
共 1 篇;目前第 1 / 1 頁,每頁 24 篇。
Chris Chien 整理 LLM 記憶體議題中的六大 KV Cache 優化方向:Memory Allocation、Prefix Reuse、Hierarchical Cache、Compression、Eviction、Disaggregation。這是部署 LLM serving 時的核心成本框架:不只看模型參數量,還要看長上下文、並發請求、prefill 重用、GPU/CPU/SSD 分層、量化壓縮與跨節點共享。