Model Naming Conventions
模型名称通常包含系列名、参数量、版本号、精调类型等信息。掌握命名规则后,仅凭名称就能判断一个模型的大致定位。
基础结构
大多数模型名称遵循这种模式:
''系列名-版本号-参数量-精调类型''
例如 Qwen2.5-7B-Instruct:
| 部分 | 含义 |
|---|---|
Qwen | 系列名(通义千问) |
2.5 | 版本号 |
7B | 参数量(70亿) |
Instruct | 精调类型(指令微调) |
不是所有模型都完整包含这四部分,但参数量和精调类型通常是必有的。
参数量标识
参数量是衡量模型能力的关键指标之一。
常见单位:
- B(Billion)— 十亿参数。如 7B、8B、13B、70B、405B
- M(Million)— 百万参数。如 500M、1.5B(实际是 1.5B 即 1500M)
MoE 模型的两个参数量:
MoE 模型名称中的「参数量」通常只标总参数量,但需要根据路由规则推算激活参数量:
| 名称格式 | 含义 | 示例 | 总参数 | 激活参数 |
|---|---|---|---|---|
NxM | N 个专家,每个 M 参数 | Mixtral-8x7B | 47B | 13B(每 token 2 个专家) |
总参数量 B | 仅标总参数量 | DeepSeek-R1-671B | 671B | 37B(256专家激活8个) |
总参数量-MoE | MoE 架构标识 | Qwen2.5-MoE | 42B | 14B |
判断关键:名称中的数字不代表激活量,需要查该模型的路由配置(每 token 激活几个专家)。
参数量与能力的对应关系(大致):
| 参数量 | 级别 | 典型应用 |
|---|---|---|
| <1B | 极轻量 | 移动端、嵌入式设备 |
| 1B~3B | 轻量 | 简单分类、文本补全 |
| 7B~14B | 中等 | 对话、代码生成、翻译 |
| 30B~70B | 大型 | 复杂推理、专业领域 |
| 100B+ | 超大规模 | 顶尖性能(GPT-4、Claude 级别) |
参数越多不一定越好——小模型在特定任务上通过微调可能超过通用大模型,且推理速度更快、部署成本更低。
精调类型后缀
同一个基座模型往往有多个精调版本,通过后缀区分:
常见后缀:
| 后缀 | 含义 | 说明 |
|---|---|---|
Base | 基座模型 | 仅预训练,未进行指令微调,适合二次开发 |
Instruct / Chat / it | 指令/对话微调 | 经过 SFT + RLHF,适合对话场景 |
R1 / Reasoning | 推理增强 | 通过强化学习增强推理能力1) |
Coder | 代码优化 | 在代码数据上继续训练2) |
Vision / VL | 多模态 | 支持图像输入 |
Audio | 语音 | 支持音频输入 |
Math | 数学优化 | 在数学数据上强化 |
基座模型(Base)和指令模型(Chat/Instruct)的行为差异很大,下载时要注意选对版本。
版本号
版本号标识模型的代际。常见格式:
- 语义版本:v1、v2、v3、v3.1。如
LLaMA-3.1-8B - 年份版本:2024、2025。如
Gemma-2-9B - 日期版本:0225(2025年2月)。如
Qwen2.5-7B-0225
版本号越新通常意味着训练数据更优、架构改进、能力提升,但需要注意配套的 tokenizer 和推理代码可能不兼容旧版本。
量化标识
量化是指将模型权重从高精度(FP16/BF16)压缩为低精度(INT4/INT8),以减小模型体积和加快推理速度。量化后的模型会在名称中标注量化格式:
| 格式 | 说明 | 典型文件扩展名 |
|---|---|---|
| GGUF | llama.cpp 系列工具使用的格式(llama.cpp) | .gguf |
| GPTQ | 基于后训练量化(Post-Training Quantization)(GPTQ 论文) | 无统一后缀 |
| AWQ | 基于激活感知的量化(AWQ 论文) | 无统一后缀 |
| BNB | bitsandbytes 库的 4-bit/8-bit 量化 | 无统一后缀 |
GGUF 是最常见的量化格式,Ollama、llama.cpp 等都使用它。文件名中会有 q4_0、q4_K_M、q8_0 等标识精度:
| GGUF 精度标识 | 含义 |
|---|---|
q2_K | 2-bit 量化,最小体积但质量损失大 |
q3_K / q3_K_M / q3_K_L | 3-bit 量化 |
q4_0 | 4-bit 基础量化 |
q4_K_M | 4-bit 中等量化(推荐,最常用) |
q5_K_M | 5-bit 中等量化 |
q8_0 | 8-bit 量化,体积较大但几乎无损 |
f16 | 16-bit 半精度(未量化,原始精度) |
蒸馏标识
知识蒸馏(Knowledge Distillation)3) 是用一个大模型教一个小模型的学习方法。名称中的蒸馏标识:
| 标识 | 含义 | 示例 |
|---|---|---|
Distill | 蒸馏版本 | DeepSeek-R1-Distill-Qwen-7B — 用 DeepSeek R1 蒸馏出的 Qwen 7B 版本 |
Tiny | 极小版本 | TinyLLaMA-1.1B |
Mini | 轻量版本 | MiniCPM-2B |
Lite | 精简版本 | Gemma-2-2B-it 的轻量变体 |
蒸馏模型在相同参数量下通常优于从头训练的模型,因为继承了大模型的「知识」。
各厂商命名规则举例
LLaMA(Meta):
Meta-Llama-3.1-8B-Instruct
→ 系列=LLaMA 3.1,参数量=8B,精调=Instruct
Qwen(阿里巴巴):
Qwen2.5-72B-Chat-Int4
→ 系列=Qwen 2.5,参数量=72B,精调=Chat(对话),量化=Int4
Qwen2.5-Coder-7B-Instruct
→ 系列=Qwen 2.5 Coder(代码版),参数量=7B,精调=Instruct
DeepSeek(深度求索):
DeepSeek-R1-671B
→ 系列=DeepSeek R1(推理增强),参数量=671B(MoE 总参数)
DeepSeek-R1-Distill-Qwen-7B
→ 蒸馏自 DeepSeek R1 的 Qwen 7B 版本
Mistral AI:
Mistral-7B-v0.3
→ 系列=Mistral,参数量=7B,版本=v0.3
Mixtral-8x22B-v0.1
→ 系列=Mixtral(MoE),8 个专家,每个 22B,总参数量 176B,激活约 44B
Gemma(Google):
Gemma-2-9B-it
→ 系列=Gemma 2,参数量=9B,精调=it(instruction-tuned)
Phi(Microsoft):
Phi-3.5-mini-4k-instruct
→ 系列=Phi 3.5,规格=mini,上下文=4k,精调=instruct
Phi-3.5-vision-128k-instruct
→ 系列=Phi 3.5,能力=vision(多模态),上下文=128k
总结
从模型名称中读参数量、精调类型和版本号是选择模型的第一步。关键判断路径:
- 需要对话?→ 选 Instruct/Chat/it 后缀,不要 Base
- 资源有限?→ 选 7B~14B 参数量,配合 GGUF q4_K_M 量化
- 需要推理能力?→ 选 R1/Reasoning 后缀或蒸馏版本
- 部署到边缘设备?→ 选 Tiny/Mini/Lite 系列 + 更低比特量化