人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

大模型架构为什么收敛到同一种形式

注意力机制成为通用选择之后,架构变体主要在位置处理与长程结构上做文章。

昏暗的服务器通道,两侧机柜指示灯向远处延伸,其中一格亮着暖黄色指示灯。
大模型基础设施场景示意。

一、从循环结构到注意力

循环神经网络按时间步顺序处理,天然顺序依赖使并行训练受限。自注意力让任意两个位置直接交互,训练可以完全并行,长程依赖也不必经过多步传递。这是架构被广泛采用的主要原因。

二、注意力带来的新问题

注意力把顺序信息交给位置编码处理,并且计算量随序列长度平方增长。多头注意力让模型在不同子空间并行计算表示,再拼接起来。

三、解码器统一成为主流

encoder-decoder 适合序列到序列的转换任务,decoder-only 结构在通用语言建模上更简洁,以因果掩码进行下一词预测。原始Transformer论文采用编码器—解码器结构完成机器翻译;不能把后来的decoder-only语言模型说成原论文的另一种翻译架构。

四、架构变体的方向

后续变体主要围绕三个问题:如何更有效地编码位置、如何降低注意力开销、如何处理超长输入。分组查询注意力通过共享键值头减少缓存占用,是推理侧常见的工程改动。

五、训练与推理的工程代价

参数量的增长会同时放大显存与带宽压力。训练阶段需要为反向传播保存或重新计算中间激活,推理阶段无需反向传播,但自回归生成通常还需保存各层的键值缓存。两者的优化方向不同,因此同一套架构在训练框架与推理引擎里的实现往往差别很大。

六、可核对的来源

Attention Is All You Need,arXiv:1706.03762。