什么是参数量?7B、70B 到底是什么意思

模型名字里的 7B、70B、405B 是什么意思?参数量代表什么、是不是越大越好、为什么小模型也能很能打、本地能跑多大的模型,一文用大白话讲清。

什么是参数量?7B、70B 到底是什么意思
编辑部 ·

逛 AI 圈总能看到一堆带 B 的名字:Llama 3 8B、DeepSeek 70B、某某 405B……这个 B 到底是什么?是不是数字越大模型就越聪明?本地电脑能跑多大的?这篇用大白话把「参数量」讲清楚。

B 是什么:模型的”脑细胞”数量

B 是 Billion(十亿) 的缩写。7B 就是 70 亿个参数,70B 就是 700 亿个参数。

那「参数」又是什么?你可以把它理解成模型内部一大堆可调的旋钮大模型在训练时,就是在海量文本上反复微调这些旋钮,直到能准确地「预测下一个词」。参数量,就是这些旋钮的总数——粗略地说,它衡量了一个模型「脑容量」的上限。

一个不严谨但好懂的类比:参数量像大脑的神经元连接数。连接越多,能记住和处理的模式就越复杂——但也不是唯一决定聪明程度的因素。

参数越多越好吗?不一定

大有大的本事,小有小的好处,这是关键:

参数多(如 70B、405B):

  • 知识更广、最难的任务(多步推理、复杂代码、长文档)表现更强
  • 又慢又贵又吃显存推理时成本高

参数少(如 7B、8B):

  • 快、便宜、能在本地设备上跑
  • 日常问答、写作、简单代码往往**「够用了」**
  • 缺点是遇到硬核难题容易露怯

所以选模型不是「越大越好」,而是**「够用就好」**——用杀鸡的场景没必要上牛刀。

为什么现在的小模型越来越能打

早两年大家还在盲目堆参数,这两年风向变了:同样 7B,今天的模型比两年前的强得多。原因是——

  • 训练数据质量更高:喂的「教材」更好更多
  • 训练方法更成熟:对齐、蒸馏等技术让小模型「学到」大模型的本事
  • 架构优化:比如用「混合专家」(MoE)等设计,用更少的实际计算办更多的事

一句话:参数量只是上限,能不能发挥出来,还看数据和训练。这也是为什么不能只看 B 数论英雄。

参数量 ≠ 上下文长度,别搞混

新手常把两个「大」搞混:

  • 参数量:模型本身多大、多聪明(70 亿个旋钮)——练好就固定了
  • 上下文窗口:一次能读多少字(比如 128K token)——是每次对话的「工作台面积」

一个是脑子多大,一个是一次能看多少材料,两者独立。小参数模型也可以有长上下文,反之亦然。

本地能跑多大的模型?

想在自己电脑上跑开源模型,最大瓶颈是显存/内存。一个极粗的经验(以常见的量化版本计):

模型规模大致门槛
7B / 8B主流独显(8–16G 显存)或较新的笔记本可跑
13B / 14B建议 16G 以上显存
70B需要高端多卡 / 大内存,个人较吃力

具体还看量化精度和推理框架,但方向是:参数越大,对硬件越苛刻。个人本地玩,7B~14B 是最舒适的区间。

小结

模型名里的 B 就是十亿个参数——它是模型「脑容量」的上限,但不是越大越好:大模型强在最难的任务,小模型胜在快、省、能本地跑,而且如今的小模型靠更好的数据和训练已经相当能打。选型记住一句话:看任务难度配模型大小,够用就好。想进一步了解开源和闭源怎么选,见开源 vs 闭源大模型;想搞懂这些参数是怎么练出来的,见大模型是怎么工作的