大语言模型(Large Language Model,LLM)是一类基于海量文本数据训练的深度学习模型,核心架构是 Transformer1)
2017 年 Google 发表的 Attention Is All You Need2) 提出了 Transformer 架构,核心创新是 Self-Attention 机制——让模型在处理每个词时能「关注」输入序列中的所有其他词,而不是像 RNN 那样逐步传递。
Transformer 的组成:
原始 Transformer 是 Encoder-Decoder 结构,但当今的 LLM 主要分为三类架构:
当前大多数主流 LLM(GPT-4、Claude、LLaMA、Qwen、DeepSeek 等)采用 Decoder-only 架构。
LLM 的训练通常分三个阶段8):
| 阶段 | 名称 | 数据 | 目标 |
|---|---|---|---|
| 1 | 预训练(Pre-training) | 海量无标注文本(TB 级) | 预测下一个 token |
| 2 | 有监督微调(SFT) | 高质量指令-回答对 | 让模型学会遵循指令 |
| 3 | 人类反馈强化学习(RLHF) | 人类偏好标注 | 对齐人类价值观9) |
预训练是 LLM 最耗资源的阶段。以 LLaMA 65B 为例,在 2048 张 A100 GPU 上训练了 21 天10)。训练数据通常涵盖网页、书籍、学术论文、代码等,经过过滤、去重、分词等处理。
预训练目标函数是 自回归语言建模——给定前文预测下一个词。这个简单的目标在足够的数据和参数规模下,能产生强大的语言理解和生成能力。
RLHF 分为三步13):
RLHF 的替代方案包括 DPO(Direct Preference Optimization)15),直接使用偏好对优化模型,不需要单独训练奖励模型。
LLM 生成文本时使用自回归解码——逐个 token 生成,每次将已生成的内容作为输入预测下一个 token。常用的解码策略:
Scaling Laws18) 揭示了模型性能与三个因素之间的幂律关系:参数量、数据量、计算量。增加任意一个都能提升性能。但 Chinchilla 定律19) 进一步指出,大多数模型的数据量不足——对给定的计算预算,最优的模型和数据配比是模型增大同时按比例增加数据。
当模型规模超过某个阈值时,会涌现出小模型不具备的能力20):
| 模型 | 组织 | 参数规模 | 开源 | 特点 |
|---|---|---|---|---|
| GPT-423) | OpenAI | 未公开 | 否 | 多模态、强大的推理能力 |
| Claude 3/4 | Anthropic | 未公开 | 否 | 长上下文、安全对齐 |
| LLaMA 324) | Meta | 8B/70B/405B | 是 | 开源标杆,社区生态丰富 |
| Qwen 2.525) | 阿里巴巴 | 0.5B~72B | 是 | 中文优化,多语言 |
| DeepSeek R126) | 深度求索 | 671B MoE | 是 | MoE 架构、推理强 |
| Mistral27) | Mistral AI | 7B~123B | 是 | 高效、多语言 |
| Gemma28) | 2B~27B | 是 | 轻量级,移动端友好 | |
| Command R+29) | Cohere | 104B | 是 | 企业级 RAG 优化 |