老赵写字的地方

Large Language Model

大语言模型(Large Language Model,LLM)是一类基于海量文本数据训练的深度学习模型,核心架构是 Transformer1)

核心架构:Transformer

2017 年 Google 发表的 Attention Is All You Need2) 提出了 Transformer 架构,核心创新是 Self-Attention 机制——让模型在处理每个词时能「关注」输入序列中的所有其他词,而不是像 RNN 那样逐步传递。

Transformer 的组成:

  • 多头自注意力(Multi-Head Self-Attention):并行计算多组注意力权重,捕获不同粒度的依赖关系
  • 前馈网络(Feed-Forward Network):对注意力输出做非线性变换
  • 层归一化(Layer Normalization):稳定训练过程3)
  • 位置编码(Positional Encoding):为模型提供 token 位置信息

原始 Transformer 是 Encoder-Decoder 结构,但当今的 LLM 主要分为三类架构:

  • Encoder-only(如 BERT4)):双向注意力,适合理解类任务(分类、实体识别)
  • Decoder-only(如 GPT5)、LLaMA6)):因果注意力(只能看左侧),适合生成类任务
  • Encoder-Decoder(如 T57)):结合两者,适合翻译、摘要等序列转换任务

当前大多数主流 LLM(GPT-4、Claude、LLaMA、Qwen、DeepSeek 等)采用 Decoder-only 架构。

训练流程

LLM 的训练通常分三个阶段8):

阶段 名称 数据 目标
1 预训练(Pre-training) 海量无标注文本(TB 级) 预测下一个 token
2 有监督微调(SFT) 高质量指令-回答对 让模型学会遵循指令
3 人类反馈强化学习(RLHF) 人类偏好标注 对齐人类价值观9)

预训练

预训练是 LLM 最耗资源的阶段。以 LLaMA 65B 为例,在 2048 张 A100 GPU 上训练了 21 天10)。训练数据通常涵盖网页、书籍、学术论文、代码等,经过过滤、去重、分词等处理。

预训练目标函数是 自回归语言建模——给定前文预测下一个词。这个简单的目标在足够的数据和参数规模下,能产生强大的语言理解和生成能力。

有监督微调(SFT)

预训练模型只会「续写文本」,不会「回答问题」。SFT 用人工标注的指令-回答数据让模型学会遵循指令。典型数据集包括 OpenAssistant11)、ShareGPT、Dolly12) 等。

人类反馈强化学习(RLHF)

RLHF 分为三步13):

  1. 收集人类对模型输出的偏好比较数据
  2. 训练一个奖励模型(Reward Model)来预测人类偏好14)
  3. 用 PPO 算法微调 LLM,使其输出获得更高的奖励分数

RLHF 的替代方案包括 DPO(Direct Preference Optimization)15),直接使用偏好对优化模型,不需要单独训练奖励模型。

推理与解码

LLM 生成文本时使用自回归解码——逐个 token 生成,每次将已生成的内容作为输入预测下一个 token。常用的解码策略:

  • 贪心解码:每次选概率最高的 token,输出确定但缺乏多样性
  • Top-k 采样:从概率最高的 k 个 token 中采样16)
  • Top-p(Nucleus)采样:从累积概率达到 p 的最小 token 集合中采样17)
  • 温度(Temperature):控制概率分布的平滑程度,温度越高输出越随机

扩展定律

Scaling Laws18) 揭示了模型性能与三个因素之间的幂律关系:参数量、数据量、计算量。增加任意一个都能提升性能。但 Chinchilla 定律19) 进一步指出,大多数模型的数据量不足——对给定的计算预算,最优的模型和数据配比是模型增大同时按比例增加数据。

涌现能力

当模型规模超过某个阈值时,会涌现出小模型不具备的能力20):

  • 上下文学习(In-Context Learning):仅通过 Prompt 中的示例就能执行任务,无需更新参数
  • 思维链推理(Chain-of-Thought):生成中间推理步骤来解答复杂问题21)
  • 指令遵循(Instruction Following):理解和执行复杂的多步指令
  • 代码生成:编写和调试程序22)

主流模型与开源生态

模型 组织 参数规模 开源 特点
GPT-423) OpenAI 未公开 否 多模态、强大的推理能力
Claude 3/4 Anthropic 未公开 否 长上下文、安全对齐
LLaMA 324) Meta 8B/70B/405B 是 开源标杆,社区生态丰富
Qwen 2.525) 阿里巴巴 0.5B~72B 是 中文优化,多语言
DeepSeek R126) 深度求索 671B MoE 是 MoE 架构、推理强
Mistral27) Mistral AI 7B~123B 是 高效、多语言
Gemma28) Google 2B~27B 是 轻量级,移动端友好
Command R+29) Cohere 104B 是 企业级 RAG 优化

关键挑战

  • 幻觉(Hallucination)30):模型生成看似合理但事实上错误的内容
  • 上下文窗口限制:模型能处理的输入长度有限,虽然后续模型(Claude、Gemini)已支持百万 token
  • 训练成本:训练一次大模型需要数百万美元的电力和硬件成本
  • 安全与对齐:确保模型行为符合人类价值观31)
  • 评估困难:缺乏全面可信的评估基准32)
zh/large_language_model/large_language_model.txt · 最后更改: 由 dsbot