深度学习基础
884 字约 3 分钟
domain/aiai/foundations
2026-07-24
1. 核心结论
- 深度学习使用多层神经网络学习数据的层次化表示,层数越深表达能力越强
- 反向传播和梯度下降是神经网络训练的核心机制
- 激活函数引入非线性,使神经网络能够拟合复杂函数
- 卷积神经网络(CNN)擅长处理图像,循环神经网络(RNN)擅长处理序列,Transformer 是当前主流架构
- 深度学习需要大量数据和计算资源,但预训练模型降低了使用门槛
2. 基础概念
神经网络(Neural Network):由多层神经元组成的计算模型,模拟生物神经网络。
层(Layer):神经网络的基本组成单元,包括输入层、隐藏层、输出层。
权重(Weight)和偏置(Bias):神经网络的可训练参数。
激活函数(Activation Function):引入非线性的函数,如 ReLU、Sigmoid、Tanh、GELU。
反向传播(Backpropagation):通过链式法则计算梯度,从输出层向输入层传播误差。
学习率(Learning Rate):控制参数更新步长的超参数。
Batch Size:每次训练使用的样本数量。
Epoch:完整遍历一次训练数据集。
3. 工作原理
深度学习训练流程:
- 前向传播:输入数据通过网络各层,得到预测输出
- 计算损失:比较预测输出与真实标签,计算损失值
- 反向传播:计算损失对每个参数的梯度
- 参数更新:使用优化器(SGD、Adam 等)更新参数
- 迭代训练:重复上述过程直到收敛
主流网络架构:
- CNN(卷积神经网络):通过卷积核提取局部特征,适合图像处理
- RNN/LSTM/GRU:具有记忆能力,适合序列数据
- Transformer:基于自注意力机制,并行计算能力强,适合长序列
- GAN(生成对抗网络):生成器和判别器对抗训练,用于生成任务
- Diffusion Model:通过逐步去噪生成数据,当前图像生成主流
4. 实战场景
- 计算机视觉:图像分类、目标检测、图像分割
- 自然语言处理:机器翻译、文本生成、情感分析
- 语音识别:语音转文字、语音合成
- 推荐系统:深度推荐模型、序列推荐
- 自动驾驶:感知、决策、控制
- 药物发现:分子生成、蛋白质结构预测
5. 常见误区
- 数据量不足就使用深度模型:小数据集上传统 ML 可能更好
- 忽视数据预处理:归一化、标准化对训练稳定性至关重要
- 学习率设置不当:过大导致不收敛,过小导致训练缓慢
- 不处理梯度消失/爆炸:深层网络需要残差连接、梯度裁剪
- 过度依赖调参:理解原理比盲目调参更重要
6. 进阶方向
- 自监督学习与对比学习
- 多模态学习(视觉-语言模型)
- 图神经网络(GNN)
- 神经架构搜索(NAS)
- 模型压缩与量化
- 持续学习与元学习
7. 推荐资料
- Deep Learning Book (Goodfellow) - https://www.deeplearningbook.org/
- PyTorch Documentation - https://pytorch.org/docs/
- TensorFlow Documentation - https://www.tensorflow.org/api_docs
- Stanford CS231n (CNN) - https://cs231n.stanford.edu/
- Stanford CS224n (NLP) - https://web.stanford.edu/class/cs224n/