0先建立共识:什么是 Token
Token 是模型运算的最小单位——它不是字符,也不是单词,而是「子词」或「词片段」。模型只在 token 空间里做数学运算,一切文本、图像、音频都要先变成一串整数 id,模型才「读得懂」。
模型的眼里没有「字」和「词」,只有 token id。所以「字数 / 词数」和「token 数」是两回事,计费、上下文上限、推理速度全按 token 走。
整条链路是一个闭环:文本 → 编码成 token → 模型消费并生成 → 解码回文本。下面这张图先给你全貌:
1Token 是怎么「产生」的(编码 / Tokenization)
模型读不懂字符,只能处理整数 id。把文本变成 id 的过程就是分词,分三步:
- 归一化 / 预分词:统一空白、大小写,按正则把数字、缩写、非拉丁字符先切好边界(GPT-4o 的 o200k 词表已能正确处理中日韩字符)。
- 按算法切分:用训练好的「合并规则」把文本切成子词片段。
- 查词表映射:每个片段查表得到一个整数 token id,送进模型。
三大分词算法族(2026 现状)
| 算法 | 思路 | 代表模型 | 词表大小 |
| BPE(字节级) | 从 256 个字节起,迭代合并最高频相邻对 | GPT 系列、Claude、Llama 4、DeepSeek-V3、Qwen3、Mistral | 65K–202K |
| SentencePiece(BPE 或 Unigram) | 把空格当普通字符 ▁,直接在原始字节上训练,原生支持无空格语言(中日泰) | Gemini 3、T5、Gemma | 最大 262K |
| WordPiece | 按「似然增益」合并,续接片段用 ## 标记 | BERT 系(主要用于编码器模型) | — |
三个关键事实
- 词表三年涨了约 8 倍:Llama 2 的 32K(2023)→ Gemini 3 的 262K(2025)。词表越大,序列越短、多语覆盖越好,但 embedding 矩阵也越大。
- 同一段中文,不同模型 token 数不同。中文无词边界,常按字或常见词块切,1 个汉字 ≈ 0.6–1.5 个 token;英文 1 词 ≈ 1.3 个 token。所以中文相对「更费 token」。
- 隐藏 token 也占额度:
<bos> / <eos>、对话 role 标记、system 提示里的隐藏结构,都会悄悄吃掉上下文。
不要拿「字数」估算成本或上下文占用。同一句话在 GPT-4o(200K 词表)和老模型(100K 词表)下 token 数能差出近一倍——永远用目标模型对应的分词器来数。
2Token 是怎么「消耗」的(推理 / Inference)
模型推理分两个阶段,这正是 token「被消费」和「被产生」的分水岭:
- Prefill 预填充(消费输入):把整段 prompt 的所有 token 一次性并行喂入,算出 KV Cache。消耗 = 输入 token 数,并行计算、快。
- Decode 自回归(产生输出):模型一个字一个字地生成。每生成 1 个新 token,都要把前面所有 token(含刚生成的)再过一遍注意力。串行、慢、贵——输出 token 数 = 生成步数。
总消耗 = 输入 token + 输出 token;二者之和不能超过上下文窗口上限。下面这张「token 账本」把一次对话拆开看:
KV Cache 才是长上下文「贵」的真凶:它随序列长度线性吃掉显存,注意力计算量随长度平方增长。所以「长文档」贵,不只是算力,更是显存。
3为什么计费「输入便宜、输出贵」
因为生成的每一步都要重算注意力:输出阶段是串行的,每多一个 token,注意力计算量就随已生成长度线性增长;而输入阶段是一次性并行算完的。所以厂商普遍把输出单价定得高于输入(常见输入价约为输出的 1/3~1/2,部分模型输出可达输入 2–4 倍)。
省 token 的实战方法
- 精简 system 提示:能结构化(JSON / 模板)就别用自然语言散文。
- 长文档用 RAG / 向量检索取相关片段,而非整篇塞进上下文。
- 压缩或裁剪历史:多轮对话只保留关键结论,不保留全部原文。
- 简单任务用大模型:小模型干简单活,大模型只在难任务上「贵得值」。
- 数字加分隔符:如
1,234 能让模型对齐数位,提升算术准确率(研究实测可提升 20%+)。
2 段
推理:Prefill 消费 + Decode 产生
★一句话总结
Token 由分词器(BPE / SentencePiece / WordPiece)按词表产生为整数 id;在推理时,输入 token 被 Prefill 一次性消费、输出 token 被 Decode 逐字产生,二者之和受上下文窗口约束,并共同决定费用。中文因无词边界,单位字符的 token 成本普遍高于英文。
想真正省成本,核心就一句话:让输入更短、让输出更少、让模型更小。分词器决定了「短不短」,架构决定了「贵不贵」。
← 返回原创指南列表