什么是 Token?大模型计费和上下文的基本单位

AI 按 Token 计费、上下文按 Token 算长度,但 Token 到底是什么?一个汉字算几个 Token、为什么 AI 数不清 strawberry 有几个 r,一文讲清。

什么是 Token?大模型计费和上下文的基本单位
编辑部 ·

用 AI 绕不开一个词:Token。API 按 Token 计费,上下文窗口按 Token 算长度,模型速度按「每秒多少 Token」衡量。但 Token 到底是个什么单位?一个字?一个词?这篇用大白话讲清楚。

Token 是什么:AI 眼里的「一口饭」

大模型不是一个字一个字读文本的。喂给它之前,有一个叫分词器(Tokenizer)的组件会先把文本切成一小段一小段,每段就是一个 Token。

Token 的颗粒度介于「字」和「词」之间:

  • 英文里,常见词是一个 Token(apple),长词会被拆开(unbelievableun + believ + able
  • 中文里,一个汉字通常是 1~2 个 Token,常见词组也可能整体算一个
  • 标点、空格、表情符号,都要占 Token

粗略换算可以记住:1000 个 Token ≈ 750 个英文单词 ≈ 500~800 个汉字。各家分词器不同,只做估算用。

为什么不直接按「字」或「词」切

  • 按字切:序列太长,处理效率低——“internationalization” 要 20 步才读完
  • 按词切:词表爆炸,而且新词、错别字、代码变量名都成了「没见过的词」

Token 是两者的折中:常见的组合切得粗,罕见的组合切得细。任何文本——包括新词、乱码、代码——都能被拆成已知 Token 的组合,模型永远不会「不认识」。

Token 决定了你的三件事

1. 花多少钱

API 计费就是数 Token:输入(你发的)和输出(它回的)分开计价,输出通常贵几倍。更容易被忽略的是:推理模型的「思考过程」也是输出 Token,同样计费——一道难题的思考量可能是答案的几十倍。API 计费的完整说明见API 充值指南

2. 能记多少

上下文窗口的「128K」「200K」,单位就是 Token。你的问题、它的回答、贴进去的文档,都在消耗这个额度——用完了,最早的内容就被「挤」出去。

3. 等多久

模型是一个 Token 一个 Token 往外「吐」的(这就是打字机效果的由来,原理见大模型工作原理)。生成速度按 Token/秒算——回答越长,等得越久。

为什么 AI 数不清 strawberry 有几个 r

经典翻车现场,根源就在 Token:模型看到的不是 s-t-r-a-w-b-e-r-r-y 这些字母,而是切好的 Token 块(比如 str + awberry)。字母级别的信息在分词时就被「打包」了,它数的不是字母,是在凭印象猜。同理,让它倒着拼单词、数汉字笔画也容易错——不是它笨,是它「看到」的世界和你不一样。

省 Token 的几个实用技巧

  • 提示词说重点:客套话、重复背景都在烧钱(尤其走 API 时)
  • 长对话适时开新会话:历史记录每轮都会重新计入,越聊越贵
  • 控制输出长度:明确说「用三句话回答」「只给结论」
  • 难题才开深度思考:思考 Token 很贵,简单问题别浪费

小结

Token 是大模型世界的「基本粒子」:文本先被分词器切成 Token,模型再一个一个往外生成——计费数它、上下文量它、速度看它。理解了 Token,你就明白了账单为什么这么算、AI 为什么数不清字母、长对话为什么越来越贵。想继续深入原理,可读大模型是怎么工作的什么是上下文窗口