你的技术前沿之旅,从这里开始
先定成本与延迟预算,再选模型
把预算写下来,比反复对比模型参数更有意义。

一、延迟由多段构成
端到端延迟包含网络、排队、预填充与逐字解码。缩短输出长度通常比优化某一段更有效。
二、批处理与缓存
连续对话场景下,前缀缓存可以复用系统提示与历史部分,对重复输入多的应用收益明显。PagedAttention 通过分页管理键值缓存,降低显存浪费。投机解码用小模型草拟、大模型验证来减少解码步数。
三、按路由分流
不是所有请求都需要同一档能力。按任务难度把请求路由到不同规模的模型,往往比统一配置更省。
四、把预算写进设计文档
先确定单次调用的成本上限与延迟上限,再反推模型档位、缓存策略与并发上限。没有预算约束时,任何优化都无法判断是否值得。
五、可核对的来源
Efficient Memory Management for Large Language Model Serving with PagedAttention,arXiv:2309.06180。Fast Inference from Transformers via Speculative Decoding,arXiv:2211.17192。
六、适用边界
本文给出的是拆解与优化方向。具体收益依赖硬件、并发与输入分布,需自行压测。