#LLM推理
24GB显存能部署多大模型?详解KV Cache与大模型显存需求计算
模型量化后只有 4GB 左右,显卡 24GB,为什么一开长上下文或多人并发就不够用了?原因是,模型文件大小不等于部署时的显存需求,大语言模型的推理部署也不能只看模型权重。
模型权重只是 GPU 的核心占用。模型运行时,还要为已经读过的内容保…
模型如何获得更好的推理表现:8 种测试时计算机制详解
让大语言模型(LLM)获得更强推理表现的方法,主要可以归为两类:
并行扩展(parallel scaling):对同一个提示多次采样,再从多个候选结果中进行选择。
顺序扩展(sequential scaling):在给出最终答案前,延长单…