📝AI 洞察与研究
了解人工智能、机器学习及新兴技术的最新趋势、研究与实践,洞察正在塑造商业未来的技术力量。
长上下文推理的瓶颈在 KV 缓存而不在模型权重:上下文达到 256K 时,仅缓存就要占用 4.6 GiB 显存,解码速度跌至 13 token/s。本文分析这笔开销的来源,并梳理一种分页式方案——GPU 上只保留固定容量的 KV 池,冷块按需在显存与主机内存之间换入换出,全程比特级无损。
该分类下暂无博客文章。