目录

Large Language Model

大语言模型(Large Language Model,LLM)是一类基于海量文本数据训练的深度学习模型,核心架构是 Transformer1)

核心架构:Transformer

2017 年 Google 发表的 Attention Is All You Need2) 提出了 Transformer 架构,核心创新是 Self-Attention 机制——让模型在处理每个词时能「关注」输入序列中的所有其他词,而不是像 RNN 那样逐步传递。

Transformer 的组成:

原始 Transformer 是 Encoder-Decoder 结构,但当今的 LLM 主要分为三类架构:

当前大多数主流 LLM(GPT-4、Claude、LLaMA、Qwen、DeepSeek 等)采用 Decoder-only 架构。

训练流程

LLM 的训练通常分三个阶段8):

阶段 名称 数据 目标
1 预训练(Pre-training) 海量无标注文本(TB 级) 预测下一个 token
2 有监督微调(SFT) 高质量指令-回答对 让模型学会遵循指令
3 人类反馈强化学习(RLHF) 人类偏好标注 对齐人类价值观9)

预训练

预训练是 LLM 最耗资源的阶段。以 LLaMA 65B 为例,在 2048 张 A100 GPU 上训练了 21 天10)。训练数据通常涵盖网页、书籍、学术论文、代码等,经过过滤、去重、分词等处理。

预训练目标函数是 自回归语言建模——给定前文预测下一个词。这个简单的目标在足够的数据和参数规模下,能产生强大的语言理解和生成能力。

有监督微调(SFT)

预训练模型只会「续写文本」,不会「回答问题」。SFT 用人工标注的指令-回答数据让模型学会遵循指令。典型数据集包括 OpenAssistant11)、ShareGPT、Dolly12) 等。

人类反馈强化学习(RLHF)

RLHF 分为三步13):

  1. 收集人类对模型输出的偏好比较数据
  2. 训练一个奖励模型(Reward Model)来预测人类偏好14)
  3. 用 PPO 算法微调 LLM,使其输出获得更高的奖励分数

RLHF 的替代方案包括 DPO(Direct Preference Optimization)15),直接使用偏好对优化模型,不需要单独训练奖励模型。

推理与解码

LLM 生成文本时使用自回归解码——逐个 token 生成,每次将已生成的内容作为输入预测下一个 token。常用的解码策略:

扩展定律

Scaling Laws18) 揭示了模型性能与三个因素之间的幂律关系:参数量、数据量、计算量。增加任意一个都能提升性能。但 Chinchilla 定律19) 进一步指出,大多数模型的数据量不足——对给定的计算预算,最优的模型和数据配比是模型增大同时按比例增加数据。

涌现能力

当模型规模超过某个阈值时,会涌现出小模型不具备的能力20):

主流模型与开源生态

模型 组织 参数规模 开源 特点
GPT-423) OpenAI 未公开 否 多模态、强大的推理能力
Claude 3/4 Anthropic 未公开 否 长上下文、安全对齐
LLaMA 324) Meta 8B/70B/405B 是 开源标杆,社区生态丰富
Qwen 2.525) 阿里巴巴 0.5B~72B 是 中文优化,多语言
DeepSeek R126) 深度求索 671B MoE 是 MoE 架构、推理强
Mistral27) Mistral AI 7B~123B 是 高效、多语言
Gemma28) Google 2B~27B 是 轻量级,移动端友好
Command R+29) Cohere 104B 是 企业级 RAG 优化

关键挑战