什么是 Token?大模型计费和上下文的基本单位
AI 按 Token 计费、上下文按 Token 算长度,但 Token 到底是什么?一个汉字算几个 Token、为什么 AI 数不清 strawberry 有几个 r,一文讲清。
用 AI 绕不开一个词:Token。API 按 Token 计费,上下文窗口按 Token 算长度,模型速度按「每秒多少 Token」衡量。但 Token 到底是个什么单位?一个字?一个词?这篇用大白话讲清楚。
Token 是什么:AI 眼里的「一口饭」
大模型不是一个字一个字读文本的。喂给它之前,有一个叫分词器(Tokenizer)的组件会先把文本切成一小段一小段,每段就是一个 Token。
Token 的颗粒度介于「字」和「词」之间:
- 英文里,常见词是一个 Token(
apple),长词会被拆开(unbelievable→un+believ+able) - 中文里,一个汉字通常是 1~2 个 Token,常见词组也可能整体算一个
- 标点、空格、表情符号,都要占 Token
粗略换算可以记住:1000 个 Token ≈ 750 个英文单词 ≈ 500~800 个汉字。各家分词器不同,只做估算用。
为什么不直接按「字」或「词」切
- 按字切:序列太长,处理效率低——“internationalization” 要 20 步才读完
- 按词切:词表爆炸,而且新词、错别字、代码变量名都成了「没见过的词」
Token 是两者的折中:常见的组合切得粗,罕见的组合切得细。任何文本——包括新词、乱码、代码——都能被拆成已知 Token 的组合,模型永远不会「不认识」。
Token 决定了你的三件事
1. 花多少钱
API 计费就是数 Token:输入(你发的)和输出(它回的)分开计价,输出通常贵几倍。更容易被忽略的是:推理模型的「思考过程」也是输出 Token,同样计费——一道难题的思考量可能是答案的几十倍。API 计费的完整说明见API 充值指南。
2. 能记多少
上下文窗口的「128K」「200K」,单位就是 Token。你的问题、它的回答、贴进去的文档,都在消耗这个额度——用完了,最早的内容就被「挤」出去。
3. 等多久
模型是一个 Token 一个 Token 往外「吐」的(这就是打字机效果的由来,原理见大模型工作原理)。生成速度按 Token/秒算——回答越长,等得越久。
为什么 AI 数不清 strawberry 有几个 r
经典翻车现场,根源就在 Token:模型看到的不是 s-t-r-a-w-b-e-r-r-y 这些字母,而是切好的 Token 块(比如 str + awberry)。字母级别的信息在分词时就被「打包」了,它数的不是字母,是在凭印象猜。同理,让它倒着拼单词、数汉字笔画也容易错——不是它笨,是它「看到」的世界和你不一样。
省 Token 的几个实用技巧
- 提示词说重点:客套话、重复背景都在烧钱(尤其走 API 时)
- 长对话适时开新会话:历史记录每轮都会重新计入,越聊越贵
- 控制输出长度:明确说「用三句话回答」「只给结论」
- 难题才开深度思考:思考 Token 很贵,简单问题别浪费
小结
Token 是大模型世界的「基本粒子」:文本先被分词器切成 Token,模型再一个一个往外生成——计费数它、上下文量它、速度看它。理解了 Token,你就明白了账单为什么这么算、AI 为什么数不清字母、长对话为什么越来越贵。想继续深入原理,可读大模型是怎么工作的和什么是上下文窗口。