Token
1. 定义
Token 不等于字、不等于单词,它是模型训练时学出来的”最小语义/统计单元”
“你好世界” → [你好, 世界] 或 [你, 好, 世, 界] (取决于tokenizer) “unhappiness” → [un, happi, ness] (英文常见子词切分)
2. 常见分词算法
BPE (Byte Pair Encoding) ← GPT系列用 WordPiece ← BERT用 SentencePiece ← 支持多语言,Llama系用
3. Token 的实际影响(上下文窗口、计费、中英文差异)
上下文窗口限制:模型的 context window 是按 token 算的,不是按字数 计费:API 调用按 token 数收费 中英文差异:同样意思,中文通常比英文占更多 token(因为多数模型训练语料英文为主)
4. Token vs Text Splitter 辨析
| 维度 | 目的 | 输出 | 使用阶段 | 操作对象 |
|---|---|---|---|---|
| Text Splitter | 把长文档切成适合检索的块 | 若干个文本字符串 | 索引阶段,预处理 | 文档级别 |
| Tokenizer | 把文本转成模型能读的数字序列 | 数字 ID 的列表(token ids) | 模型推理阶段,实时转换 | 句子/词级别 |
5. Token 与 Embedding 的衔接
文本 → Tokenizer切分 → Token IDs → 模型 Embedding层 → 向量