目录
Large Language Model
大语言模型(Large Language Model,LLM)是一类基于海量文本数据训练的深度学习模型,核心架构是 Transformer1)
核心架构:Transformer
2017 年 Google 发表的 Attention Is All You Need2) 提出了 Transformer 架构,核心创新是 Self-Attention 机制——让模型在处理每个词时能「关注」输入序列中的所有其他词,而不是像 RNN 那样逐步传递。
Transformer 的组成:
- 多头自注意力(Multi-Head Self-Attention):并行计算多组注意力权重,捕获不同粒度的依赖关系
- 前馈网络(Feed-Forward Network):对注意力输出做非线性变换
- 层归一化(Layer Normalization):稳定训练过程3)
- 位置编码(Positional Encoding):为模型提供 token 位置信息
原始 Transformer 是 Encoder-Decoder 结构,但当今的 LLM 主要分为三类架构:
当前大多数主流 LLM(GPT-4、Claude、LLaMA、Qwen、DeepSeek 等)采用 Decoder-only 架构。
训练流程
LLM 的训练通常分三个阶段8):
| 阶段 | 名称 | 数据 | 目标 |
|---|---|---|---|
| 1 | 预训练(Pre-training) | 海量无标注文本(TB 级) | 预测下一个 token |
| 2 | 有监督微调(SFT) | 高质量指令-回答对 | 让模型学会遵循指令 |
| 3 | 人类反馈强化学习(RLHF) | 人类偏好标注 | 对齐人类价值观9) |
预训练
预训练是 LLM 最耗资源的阶段。以 LLaMA 65B 为例,在 2048 张 A100 GPU 上训练了 21 天10)。训练数据通常涵盖网页、书籍、学术论文、代码等,经过过滤、去重、分词等处理。
预训练目标函数是 自回归语言建模——给定前文预测下一个词。这个简单的目标在足够的数据和参数规模下,能产生强大的语言理解和生成能力。
有监督微调(SFT)
人类反馈强化学习(RLHF)
RLHF 分为三步13):
- 收集人类对模型输出的偏好比较数据
- 训练一个奖励模型(Reward Model)来预测人类偏好14)
- 用 PPO 算法微调 LLM,使其输出获得更高的奖励分数
RLHF 的替代方案包括 DPO(Direct Preference Optimization)15),直接使用偏好对优化模型,不需要单独训练奖励模型。
推理与解码
LLM 生成文本时使用自回归解码——逐个 token 生成,每次将已生成的内容作为输入预测下一个 token。常用的解码策略:
扩展定律
Scaling Laws18) 揭示了模型性能与三个因素之间的幂律关系:参数量、数据量、计算量。增加任意一个都能提升性能。但 Chinchilla 定律19) 进一步指出,大多数模型的数据量不足——对给定的计算预算,最优的模型和数据配比是模型增大同时按比例增加数据。
涌现能力
当模型规模超过某个阈值时,会涌现出小模型不具备的能力20):
主流模型与开源生态
| 模型 | 组织 | 参数规模 | 开源 | 特点 |
|---|---|---|---|---|
| GPT-423) | OpenAI | 未公开 | 否 | 多模态、强大的推理能力 |
| Claude 3/4 | Anthropic | 未公开 | 否 | 长上下文、安全对齐 |
| LLaMA 324) | Meta | 8B/70B/405B | 是 | 开源标杆,社区生态丰富 |
| Qwen 2.525) | 阿里巴巴 | 0.5B~72B | 是 | 中文优化,多语言 |
| DeepSeek R126) | 深度求索 | 671B MoE | 是 | MoE 架构、推理强 |
| Mistral27) | Mistral AI | 7B~123B | 是 | 高效、多语言 |
| Gemma28) | 2B~27B | 是 | 轻量级,移动端友好 | |
| Command R+29) | Cohere | 104B | 是 | 企业级 RAG 优化 |