人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

先定成本与延迟预算,再选模型

把预算写下来,比反复对比模型参数更有意义。

深色工位上的功率计与秒表,旁侧键盘,背景近乎纯黑,指示读数为暖黄与琥珀色。
推理成本与延迟测量示意。

一、延迟由多段构成

端到端延迟包含网络、排队、预填充与逐字解码。缩短输出长度通常比优化某一段更有效。

二、批处理与缓存

连续对话场景下,前缀缓存可以复用系统提示与历史部分,对重复输入多的应用收益明显。PagedAttention 通过分页管理键值缓存,降低显存浪费。投机解码用小模型草拟、大模型验证来减少解码步数。

三、按路由分流

不是所有请求都需要同一档能力。按任务难度把请求路由到不同规模的模型,往往比统一配置更省。

四、把预算写进设计文档

先确定单次调用的成本上限与延迟上限,再反推模型档位、缓存策略与并发上限。没有预算约束时,任何优化都无法判断是否值得。

五、可核对的来源

Efficient Memory Management for Large Language Model Serving with PagedAttention,arXiv:2309.06180。Fast Inference from Transformers via Speculative Decoding,arXiv:2211.17192。

六、适用边界

本文给出的是拆解与优化方向。具体收益依赖硬件、并发与输入分布,需自行压测。