大模型工作原理
833 字约 3 分钟
domain/aiai/llm
2026-07-24
1. 核心结论
- 大语言模型基于 Transformer 架构,通过预测下一个 token 来学习语言规律
- 预训练阶段在海量文本上学习通用知识,后训练阶段对齐人类偏好
- 模型能力随参数量、数据量、计算量增加而提升(Scaling Laws)
- 推理时通过自回归方式逐 token 生成文本,使用采样策略控制输出多样性
- 理解大模型工作原理有助于更好地设计 prompt 和评估模型输出
2. 基础概念
预训练(Pre-training):在大规模无标注文本上训练模型,学习语言表示和世界知识。
微调(Fine-tuning):在特定任务数据上继续训练,使模型适应特定场景。
RLHF(Reinforcement Learning from Human Feedback):使用人类反馈强化学习对齐模型行为。
自回归生成(Autoregressive Generation):基于已生成的 token 逐个预测下一个 token。
Temperature:控制输出随机性的参数,值越高输出越多样。
Top-p / Top-k:采样策略,限制候选 token 范围。
Scaling Laws:模型性能与参数量、数据量、计算量之间的幂律关系。
3. 工作原理
大模型训练流程:
- 数据准备:收集、清洗、去重、过滤训练数据
- 预训练:
- 目标:最大化下一个 token 的概率
- 损失函数:交叉熵损失
- 优化器:AdamW,带学习率预热和衰减
- 监督微调(SFT):使用高质量指令数据微调模型
- 偏好对齐:
- RLHF:训练奖励模型,使用 PPO 优化
- DPO:直接偏好优化,无需奖励模型
- 评估测试:在基准数据集上评估模型能力
推理生成流程:
- 输入文本 tokenization
- 通过 Transformer 计算下一个 token 的概率分布
- 使用采样策略选择 token
- 将新 token 追加到输入,重复步骤 2-3
- 遇到结束 token 或达到最大长度时停止
4. 实战场景
- 对话系统:客服、助手、角色扮演
- 内容创作:文章、报告、营销文案
- 代码生成:补全、重构、调试
- 数据分析:SQL 生成、数据解释
- 教育辅导:答疑、出题、批改
- 翻译与本地化
5. 常见误区
- 认为模型有记忆:模型只有训练时的知识,不会记住对话
- 忽视 prompt 格式:不同模型对 prompt 格式敏感
- 过度依赖单一模型:不同模型在不同任务上表现差异大
- 不理解采样参数:temperature 和 top-p 设置不当影响输出质量
- 忽视 token 限制:超出上下文窗口会导致截断或错误
6. 进阶方向
- 模型压缩与量化(GGUF、AWQ、GPTQ)
- 高效微调技术(LoRA、QLoRA、Adapter)
- 推理优化(vLLM、TensorRT-LLM)
- 多模态大模型
- 长上下文扩展技术
- 模型蒸馏与知识迁移
7. 推荐资料
- OpenAI API Docs - https://platform.openai.com/docs
- Anthropic Claude Docs - https://docs.anthropic.com/
- Hugging Face Transformers - https://huggingface.co/docs/transformers
- Stanford CS324 (LLMs) - https://stanford-cs324.github.io/winter2022/
- Scaling Laws Paper - https://arxiv.org/abs/2001.08361
8. 关联笔记
- Transformer原理
- Token与上下文窗口
- Prompt Engineering
- 模型选择与对比