人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司云南省全部文章

你的技术前沿之旅,从这里开始

中文分词为什么会改变上下文预算

同样的字数,不同分词器可能产生不同的输入长度。

昏暗的服务器通道,两侧机柜指示灯向远处延伸,其中一格亮着暖黄色指示灯。
大模型基础设施场景示意。

字数与令牌数

中文段落的字符数不等于模型接收的令牌数。分词器会把文本拆成词片段,数字、网址、代码和少见字符的切分方式又不同。按字数估计预算容易让长文在最后一步超限;应使用目标模型对应的分词器,对完整请求计数,而不只计算用户正文。

建立自己的样本表

选取新闻、表格、程序日志和口语四类输入,分别保留原文长度、令牌数和输出上限。加入系统说明、检索材料及对话历史后重新统计。这样能发现真正占空间的是重复历史还是资料片段,避免为了省空间删掉关键证据。分词器升级后应重跑样本,不沿用旧比例。

截断的处理顺序

先删重复内容,再按任务相关性筛选材料,最后才限制单段长度。保留标题、时间与来源标识,让被截断的段落仍可理解。重要结论不能只出现在被丢掉的尾部。如果压缩后仍超过容量,就拆成多个有明确交接信息的任务;上下文足够长也不代表全部信息都会被正确利用。

延伸阅读

Transformers Tokenizer 官方文档:https://huggingface.co/docs/transformers/main_classes/tokenizer 。资料供核对相关基础概念;本文流程建议需结合具体任务验证。