Token

1. 定义

Token 不等于字、不等于单词,它是模型训练时学出来的”最小语义/统计单元”

“你好世界” → [你好, 世界] 或 [你, 好, 世, 界] (取决于tokenizer) “unhappiness” → [un, happi, ness] (英文常见子词切分)

2. 常见分词算法

BPE (Byte Pair Encoding) ← GPT系列用 WordPiece ← BERT用 SentencePiece ← 支持多语言,Llama系用

3. Token 的实际影响(上下文窗口、计费、中英文差异)

上下文窗口限制:模型的 context window 是按 token 算的,不是按字数 计费:API 调用按 token 数收费 中英文差异:同样意思,中文通常比英文占更多 token(因为多数模型训练语料英文为主)

4. Token vs Text Splitter 辨析

维度目的输出使用阶段操作对象
Text Splitter把长文档切成适合检索的块若干个文本字符串索引阶段,预处理文档级别
Tokenizer把文本转成模型能读的数字序列数字 ID 的列表(token ids)模型推理阶段,实时转换句子/词级别

5. Token 与 Embedding 的衔接

文本 → Tokenizer切分 → Token IDs → 模型 Embedding层 → 向量