====== Model Naming Conventions ====== 模型名称通常包含系列名、参数量、版本号、精调类型等信息。掌握命名规则后,仅凭名称就能判断一个模型的大致定位。 ===== 基础结构 ===== 大多数模型名称遵循这种模式: ''系列名-版本号-参数量-精调类型'' 例如 ''Qwen2.5-7B-Instruct'': ^ 部分 ^ 含义 ^ | ''Qwen'' | 系列名(通义千问) | | ''2.5'' | 版本号 | | ''7B'' | 参数量(70亿) | | ''Instruct'' | 精调类型(指令微调) | 不是所有模型都完整包含这四部分,但参数量和精调类型通常是必有的。 ===== 参数量标识 ===== 参数量是衡量模型能力的关键指标之一。 **常见单位:** * **B**(Billion)— 十亿参数。如 7B、8B、13B、70B、405B * **M**(Million)— 百万参数。如 500M、1.5B(实际是 1.5B 即 1500M) **MoE 模型的两个参数量:** MoE 模型名称中的「参数量」通常只标总参数量,但需要根据路由规则推算激活参数量: ^ 名称格式 ^ 含义 ^ 示例 ^ 总参数 ^ 激活参数 ^ | ''NxM'' | N 个专家,每个 M 参数 | ''Mixtral-8x7B'' | 47B | 13B(每 token 2 个专家) | | ''总参数量 B'' | 仅标总参数量 | ''DeepSeek-R1-671B'' | 671B | 37B(256专家激活8个) | | ''总参数量-MoE'' | MoE 架构标识 | ''Qwen2.5-MoE'' | 42B | 14B | 判断关键:**名称中的数字不代表激活量**,需要查该模型的路由配置(每 token 激活几个专家)。 **参数量与能力的对应关系(大致):** ^ 参数量 ^ 级别 ^ 典型应用 ^ | <1B | 极轻量 | 移动端、嵌入式设备 | | 1B~3B | 轻量 | 简单分类、文本补全 | | 7B~14B | 中等 | 对话、代码生成、翻译 | | 30B~70B | 大型 | 复杂推理、专业领域 | | 100B+ | 超大规模 | 顶尖性能(GPT-4、Claude 级别) | 参数越多不一定越好——小模型在特定任务上通过微调可能超过通用大模型,且推理速度更快、部署成本更低。 ===== 精调类型后缀 ===== 同一个基座模型往往有多个精调版本,通过后缀区分: **常见后缀:** ^ 后缀 ^ 含义 ^ 说明 ^ | ''Base'' | 基座模型 | 仅预训练,未进行指令微调,适合二次开发 | | ''Instruct'' / ''Chat'' / ''it'' | 指令/对话微调 | 经过 SFT + RLHF,适合对话场景 | | ''R1'' / ''Reasoning'' | 推理增强 | 通过强化学习增强推理能力(([[https://arxiv.org/abs/2412.19437|DeepSeek-R1]])) | | ''Coder'' | 代码优化 | 在代码数据上继续训练(([[https://arxiv.org/abs/2401.14112|CodeGemma]])) | | ''Vision'' / ''VL'' | 多模态 | 支持图像输入 | | ''Audio'' | 语音 | 支持音频输入 | | ''Math'' | 数学优化 | 在数学数据上强化 | 基座模型(Base)和指令模型(Chat/Instruct)的行为差异很大,下载时要注意选对版本。 ===== 版本号 ===== 版本号标识模型的代际。常见格式: * **语义版本**:v1、v2、v3、v3.1。如 ''LLaMA-3.1-8B'' * **年份版本**:2024、2025。如 ''Gemma-2-9B'' * **日期版本**:0225(2025年2月)。如 ''Qwen2.5-7B-0225'' 版本号越新通常意味着训练数据更优、架构改进、能力提升,但需要注意配套的 tokenizer 和推理代码可能不兼容旧版本。 ===== 量化标识 ===== 量化是指将模型权重从高精度(FP16/BF16)压缩为低精度(INT4/INT8),以减小模型体积和加快推理速度。量化后的模型会在名称中标注量化格式: ^ 格式 ^ 说明 ^ 典型文件扩展名 ^ | GGUF | llama.cpp 系列工具使用的格式([[https://github.com/ggml-org/llama.cpp|llama.cpp]]) | ''.gguf'' | | GPTQ | 基于后训练量化(Post-Training Quantization)([[https://arxiv.org/abs/2210.17323|GPTQ 论文]]) | 无统一后缀 | | AWQ | 基于激活感知的量化([[https://arxiv.org/abs/2306.00978|AWQ 论文]]) | 无统一后缀 | | BNB | bitsandbytes 库的 4-bit/8-bit 量化 | 无统一后缀 | GGUF 是最常见的量化格式,Ollama、llama.cpp 等都使用它。文件名中会有 q4_0、q4_K_M、q8_0 等标识精度: ^ GGUF 精度标识 ^ 含义 ^ | ''q2_K'' | 2-bit 量化,最小体积但质量损失大 | | ''q3_K'' / ''q3_K_M'' / ''q3_K_L'' | 3-bit 量化 | | ''q4_0'' | 4-bit 基础量化 | | ''q4_K_M'' | 4-bit 中等量化(推荐,最常用) | | ''q5_K_M'' | 5-bit 中等量化 | | ''q8_0'' | 8-bit 量化,体积较大但几乎无损 | | ''f16'' | 16-bit 半精度(未量化,原始精度) | ===== 蒸馏标识 ===== 知识蒸馏(Knowledge Distillation)(([[https://arxiv.org/abs/1503.02531|Distilling the Knowledge in a Neural Network - Hinton et al. 2015]])) 是用一个大模型教一个小模型的学习方法。名称中的蒸馏标识: ^ 标识 ^ 含义 ^ 示例 ^ | ''Distill'' | 蒸馏版本 | ''DeepSeek-R1-Distill-Qwen-7B'' — 用 DeepSeek R1 蒸馏出的 Qwen 7B 版本 | | ''Tiny'' | 极小版本 | ''TinyLLaMA-1.1B'' | | ''Mini'' | 轻量版本 | ''MiniCPM-2B'' | | ''Lite'' | 精简版本 | ''Gemma-2-2B-it'' 的轻量变体 | 蒸馏模型在相同参数量下通常优于从头训练的模型,因为继承了大模型的「知识」。 ===== 各厂商命名规则举例 ===== **LLaMA(Meta):** ''Meta-Llama-3.1-8B-Instruct'' → 系列=LLaMA 3.1,参数量=8B,精调=Instruct **Qwen(阿里巴巴):** ''Qwen2.5-72B-Chat-Int4'' → 系列=Qwen 2.5,参数量=72B,精调=Chat(对话),量化=Int4 ''Qwen2.5-Coder-7B-Instruct'' → 系列=Qwen 2.5 Coder(代码版),参数量=7B,精调=Instruct **DeepSeek(深度求索):** ''DeepSeek-R1-671B'' → 系列=DeepSeek R1(推理增强),参数量=671B(MoE 总参数) ''DeepSeek-R1-Distill-Qwen-7B'' → 蒸馏自 DeepSeek R1 的 Qwen 7B 版本 **Mistral AI:** ''Mistral-7B-v0.3'' → 系列=Mistral,参数量=7B,版本=v0.3 ''Mixtral-8x22B-v0.1'' → 系列=Mixtral(MoE),8 个专家,每个 22B,总参数量 176B,激活约 44B **Gemma(Google):** ''Gemma-2-9B-it'' → 系列=Gemma 2,参数量=9B,精调=it(instruction-tuned) **Phi(Microsoft):** ''Phi-3.5-mini-4k-instruct'' → 系列=Phi 3.5,规格=mini,上下文=4k,精调=instruct ''Phi-3.5-vision-128k-instruct'' → 系列=Phi 3.5,能力=vision(多模态),上下文=128k ===== 总结 ===== 从模型名称中读参数量、精调类型和版本号是选择模型的第一步。关键判断路径: * 需要对话?→ 选 Instruct/Chat/it 后缀,不要 Base * 资源有限?→ 选 7B~14B 参数量,配合 GGUF q4_K_M 量化 * 需要推理能力?→ 选 R1/Reasoning 后缀或蒸馏版本 * 部署到边缘设备?→ 选 Tiny/Mini/Lite 系列 + 更低比特量化