你的技术前沿之旅,从这里开始
中文分词为什么会改变上下文预算
同样的字数,不同分词器可能产生不同的输入长度。

字数与令牌数
中文段落的字符数不等于模型接收的令牌数。分词器会把文本拆成词片段,数字、网址、代码和少见字符的切分方式又不同。按字数估计预算容易让长文在最后一步超限;应使用目标模型对应的分词器,对完整请求计数,而不只计算用户正文。
建立自己的样本表
选取新闻、表格、程序日志和口语四类输入,分别保留原文长度、令牌数和输出上限。加入系统说明、检索材料及对话历史后重新统计。这样能发现真正占空间的是重复历史还是资料片段,避免为了省空间删掉关键证据。分词器升级后应重跑样本,不沿用旧比例。
截断的处理顺序
先删重复内容,再按任务相关性筛选材料,最后才限制单段长度。保留标题、时间与来源标识,让被截断的段落仍可理解。重要结论不能只出现在被丢掉的尾部。如果压缩后仍超过容量,就拆成多个有明确交接信息的任务;上下文足够长也不代表全部信息都会被正确利用。
延伸阅读
Transformers Tokenizer 官方文档:https://huggingface.co/docs/transformers/main_classes/tokenizer 。资料供核对相关基础概念;本文流程建议需结合具体任务验证。