目录

Model Naming Conventions

模型名称通常包含系列名、参数量、版本号、精调类型等信息。掌握命名规则后,仅凭名称就能判断一个模型的大致定位。

基础结构

大多数模型名称遵循这种模式:

''系列名-版本号-参数量-精调类型''

例如 Qwen2.5-7B-Instruct:

部分 含义
Qwen 系列名(通义千问)
2.5 版本号
7B 参数量(70亿)
Instruct 精调类型(指令微调)

不是所有模型都完整包含这四部分,但参数量和精调类型通常是必有的。

参数量标识

参数量是衡量模型能力的关键指标之一。

常见单位:

MoE 模型的两个参数量:

MoE 模型名称中的「参数量」通常只标总参数量,但需要根据路由规则推算激活参数量:

名称格式 含义 示例 总参数 激活参数
NxM N 个专家,每个 M 参数 Mixtral-8x7B 47B 13B(每 token 2 个专家)
总参数量 B 仅标总参数量 DeepSeek-R1-671B 671B 37B(256专家激活8个)
总参数量-MoE MoE 架构标识 Qwen2.5-MoE 42B 14B

判断关键:名称中的数字不代表激活量,需要查该模型的路由配置(每 token 激活几个专家)。

参数量与能力的对应关系(大致):

参数量 级别 典型应用
<1B 极轻量 移动端、嵌入式设备
1B~3B 轻量 简单分类、文本补全
7B~14B 中等 对话、代码生成、翻译
30B~70B 大型 复杂推理、专业领域
100B+ 超大规模 顶尖性能(GPT-4、Claude 级别)

参数越多不一定越好——小模型在特定任务上通过微调可能超过通用大模型,且推理速度更快、部署成本更低。

精调类型后缀

同一个基座模型往往有多个精调版本,通过后缀区分:

常见后缀:

后缀 含义 说明
Base 基座模型 仅预训练,未进行指令微调,适合二次开发
Instruct / Chat / it 指令/对话微调 经过 SFT + RLHF,适合对话场景
R1 / Reasoning 推理增强 通过强化学习增强推理能力1)
Coder 代码优化 在代码数据上继续训练2)
Vision / VL 多模态 支持图像输入
Audio 语音 支持音频输入
Math 数学优化 在数学数据上强化

基座模型(Base)和指令模型(Chat/Instruct)的行为差异很大,下载时要注意选对版本。

版本号

版本号标识模型的代际。常见格式:

版本号越新通常意味着训练数据更优、架构改进、能力提升,但需要注意配套的 tokenizer 和推理代码可能不兼容旧版本。

量化标识

量化是指将模型权重从高精度(FP16/BF16)压缩为低精度(INT4/INT8),以减小模型体积和加快推理速度。量化后的模型会在名称中标注量化格式:

格式 说明 典型文件扩展名
GGUF llama.cpp 系列工具使用的格式(llama.cpp) .gguf
GPTQ 基于后训练量化(Post-Training Quantization)(GPTQ 论文) 无统一后缀
AWQ 基于激活感知的量化(AWQ 论文) 无统一后缀
BNB bitsandbytes 库的 4-bit/8-bit 量化 无统一后缀

GGUF 是最常见的量化格式,Ollama、llama.cpp 等都使用它。文件名中会有 q4_0、q4_K_M、q8_0 等标识精度:

GGUF 精度标识 含义
q2_K 2-bit 量化,最小体积但质量损失大
q3_K / q3_K_M / q3_K_L 3-bit 量化
q4_0 4-bit 基础量化
q4_K_M 4-bit 中等量化(推荐,最常用)
q5_K_M 5-bit 中等量化
q8_0 8-bit 量化,体积较大但几乎无损
f16 16-bit 半精度(未量化,原始精度)

蒸馏标识

知识蒸馏(Knowledge Distillation)3) 是用一个大模型教一个小模型的学习方法。名称中的蒸馏标识:

标识 含义 示例
Distill 蒸馏版本 DeepSeek-R1-Distill-Qwen-7B — 用 DeepSeek R1 蒸馏出的 Qwen 7B 版本
Tiny 极小版本 TinyLLaMA-1.1B
Mini 轻量版本 MiniCPM-2B
Lite 精简版本 Gemma-2-2B-it 的轻量变体

蒸馏模型在相同参数量下通常优于从头训练的模型,因为继承了大模型的「知识」。

各厂商命名规则举例

LLaMA(Meta):

Meta-Llama-3.1-8B-Instruct → 系列=LLaMA 3.1,参数量=8B,精调=Instruct

Qwen(阿里巴巴):

Qwen2.5-72B-Chat-Int4 → 系列=Qwen 2.5,参数量=72B,精调=Chat(对话),量化=Int4

Qwen2.5-Coder-7B-Instruct → 系列=Qwen 2.5 Coder(代码版),参数量=7B,精调=Instruct

DeepSeek(深度求索):

DeepSeek-R1-671B → 系列=DeepSeek R1(推理增强),参数量=671B(MoE 总参数)

DeepSeek-R1-Distill-Qwen-7B → 蒸馏自 DeepSeek R1 的 Qwen 7B 版本

Mistral AI:

Mistral-7B-v0.3 → 系列=Mistral,参数量=7B,版本=v0.3

Mixtral-8x22B-v0.1 → 系列=Mixtral(MoE),8 个专家,每个 22B,总参数量 176B,激活约 44B

Gemma(Google):

Gemma-2-9B-it → 系列=Gemma 2,参数量=9B,精调=it(instruction-tuned)

Phi(Microsoft):

Phi-3.5-mini-4k-instruct → 系列=Phi 3.5,规格=mini,上下文=4k,精调=instruct

Phi-3.5-vision-128k-instruct → 系列=Phi 3.5,能力=vision(多模态),上下文=128k

总结

从模型名称中读参数量、精调类型和版本号是选择模型的第一步。关键判断路径: