Token 是大语言模型处理文本时的最小单位。模型并不直接认识完整的单词或句子,而是将输入文本切分成一个个 Token,再将这些 Token 映射为数字 ID 进行计算。一个 Token 可以是一个完整的单词(如 apple)、单词的一部分(如 un、believe、able),甚至是标点符号或空格。
你可以把它理解为 AI 世界的“乐高积木”——无论多复杂的句子,最终都会被拆成一粒粒积木,模型用这些积木拼出理解与回答。
Token 的核心特性:
- 分词粒度:不同模型的分词器不同,英文约 1 个单词 ≈ 1–2 个 Token,中文约 1 个字 ≈ 1–2 个 Token
- 上下文窗口:模型能处理的 Token 数量有限制(如 4K、8K、128K),超出则无法记住
- 计费单位:大多数 AI API 按 Token 计费(输入 + 输出)
- 编码方式:常用 BPE(Byte Pair Encoding)算法分词
大白话理解:
没有 Token 概念的时候:
- 你觉得 AI 是“一个字一个字看懂”的 → 实际上它根本不认识字
- 你写了一篇 5000 字的文章 → AI 说“太长了我记不住”,你不知道为什么
- 你问 API 为什么收了这么多钱 → 看不懂账单上的“Token 消耗”
有了 Token 概念之后:
- 你知道 AI 把“我喜欢吃苹果”切成
["我", "喜欢", "吃", "苹果"]四个 Token - 你算了一下 5000 字 ≈ 6000–8000 Token,超过模型 4K 窗口,自然记不住开头
- 你看懂了 API 账单:1 次对话用了 1200 个 Token,单价 × 用量 = 费用
打个比方:
|
传统方式 |
Token 方式 |
|---|---|
|
你觉得 AI 像人一样读完整句话 |
AI 像流水线工人,把句子拆成零件逐个处理 |
|
你跟 AI 聊了很久,它突然忘了开头 |
上下文窗口满了,最早的 Token 被挤出去了 |
|
API 按字符收费,你觉得贵 |
按 Token 收费更公平,因为中文一个字可能占 2 个 Token |
一句话总结:
Token 是 AI 理解语言的最小单元,也是模型能力和计费的基准刻度。