Wikipedia 深度学习核心概念 (Wikipedia Deep Learning Concepts)¶
来源: Wikipedia (英文维基百科)
编译时间: 2026-06-01
状态: 中英对照编译
基于: Deep learning, Neural network, Backpropagation 等条目
关联: 统计学概念, 决策科学概念
📚 目录 (Table of Contents)¶
1. 深度学习基础 (Deep Learning Basics)¶
英文定义 (English Definition):
Deep learning is part of a broader family of machine learning methods based on artificial neural networks with representation learning. The adjective "deep" in deep learning refers to the use of multiple layers in the network.
中文翻译 (Chinese Translation):
深度学习是机器学习方法的一个更大家族的一部分,基于具有表示学习的人工神经网络。深度学习中的形容词"deep"指的是在网络中使用多个层。
核心特征 (Core Characteristics):
| 特征 | 英文 | 中文 | 说明 |
|---|---|---|---|
| 层次结构 | Hierarchical layers | 层次化层 | 多层非线性变换 |
| 表示学习 | Representation learning | 表示学习 | 自动学习特征表示 |
| 端到端 | End-to-end learning | 端到端学习 | 从原始输入到输出 |
| 大数据 | Big data requirement | 大数据需求 | 需要大量训练数据 |
深度学习 vs 传统机器学习 (Deep Learning vs Traditional ML):
| 方面 | 传统机器学习 | 深度学习 |
|---|---|---|
| 特征工程 | 手工设计特征 | 自动学习特征 |
| 数据需求 | 中小规模数据 | 大规模数据 |
| 计算需求 | CPU 可运行 | 需要 GPU/TPU |
| 可解释性 | 相对较高 | 相对较低 |
| 性能 (大数据) | 趋于平稳 | 持续提升 |
神经网络基本结构 (Basic Neural Network Structure)¶
英文:
A neural network consists of interconnected nodes (neurons) organized in layers. Each connection has a weight that is adjusted during training.
中文:
神经网络由组织成层的互连节点(神经元)组成。每个连接都有一个在训练期间调整的权重。
层的类型 (Types of Layers):
神经网络结构
├── 输入层 (Input Layer)
│ └── 接收原始数据
│
├── 隐藏层 (Hidden Layers)
│ ├── 全连接层 (Fully Connected)
│ ├── 卷积层 (Convolutional)
│ ├── 循环层 (Recurrent)
│ └── 注意力层 (Attention)
│
└── 输出层 (Output Layer)
└── 产生最终预测
前向传播公式 (Forward Propagation Formula):
其中: - \(z^{[l]}\): 第 l 层的加权输入 - \(W^{[l]}\): 第 l 层的权重矩阵 - \(b^{[l]}\): 第 l 层的偏置 - \(a^{[l]}\): 第 l 层的激活输出 - \(g\): 激活函数
2. 神经网络架构 (Neural Network Architectures)¶
全连接网络 (Fully Connected Networks)¶
英文:
In a fully connected network, also known as a dense network or multilayer perceptron (MLP), every neuron in one layer is connected to every neuron in the next layer.
中文:
在全连接网络中(也称为稠密网络或多层感知器 MLP),一层中的每个神经元都连接到下一层中的每个神经元。
结构特点 (Structural Features):
全连接层示例:
输入层 隐藏层 输出层
(3 节点) (4 节点) (2 节点)
○ ────── ○
○ ──╲ ╱ ○ ────── ○
○ ──╱ ╲ ○ ────── ○
○ ────── ○
每个节点连接到下一层的所有节点
参数数量 = 输入维度 × 输出维度 + 偏置
适用场景 (Applicable Scenarios):
| 场景 | 推荐度 | 说明 |
|---|---|---|
| 表格数据 | ⭐⭐⭐⭐ | 结构化数据处理 |
| 小型图像 | ⭐⭐ | 忽略空间结构 |
| 特征组合 | ⭐⭐⭐⭐ | 学习特征交互 |
| 最终分类层 | ⭐⭐⭐⭐⭐ | 所有架构的输出层 |
激活函数 (Activation Functions)¶
英文:
Activation functions introduce non-linearity into the network, allowing it to learn complex patterns. Without activation functions, a neural network would be equivalent to a single-layer linear model.
中文:
激活函数向网络引入非线性,使其能够学习复杂模式。没有激活函数,神经网络将等同于单层线性模型。
常见激活函数 (Common Activation Functions):
| 函数 | 公式 | 图像 | 优点 | 缺点 |
|---|---|---|---|---|
| Sigmoid | \(\frac{1}{1+e^{-x}}\) | S 形曲线 | 输出 0-1,概率解释 | 梯度消失 |
| Tanh | \(\frac{e^x-e^{-x}}{e^x+e^{-x}}\) | S 形过原点 | 零中心化 | 梯度消失 |
| ReLU | \(\max(0, x)\) | 折线 | 计算快,缓解梯度消失 | 死亡 ReLU |
| Leaky ReLU | \(\max(0.01x, x)\) | 折线有斜率 | 解决死亡 ReLU | 需要调参 |
| GELU | \(x \cdot \Phi(x)\) | 平滑曲线 | Transformer 默认 | 计算稍慢 |
| Softmax | \(\frac{e^{x_i}}{\sum e^{x_j}}\) | 多类别概率 | 多分类输出 | 仅限输出层 |
选择指南 (Selection Guide):
隐藏层推荐:
├── 默认选择:ReLU
├── 需要零中心化:Tanh
├── 担心死亡神经元:Leaky ReLU
└── Transformer 架构:GELU
输出层推荐:
├── 二分类:Sigmoid
├── 多分类:Softmax
└── 回归:Linear (无激活)
3. 反向传播与优化 (Backpropagation and Optimization)¶
反向传播算法 (Backpropagation Algorithm)¶
英文:
Backpropagation is a supervised learning algorithm used for training neural networks. It computes the gradient of the loss function with respect to each weight by the chain rule, propagating errors backward from the output layer to the input layer.
中文:
反向传播是用于训练神经网络的监督学习算法。它通过链式法则计算损失函数关于每个权重的梯度,从输出层向输入层反向传播误差。
反向传播步骤 (Backpropagation Steps):
1. 前向传播 (Forward Pass)
输入 → 网络 → 预测 → 计算损失
2. 反向传播 (Backward Pass)
损失 → 计算梯度 → 更新权重
3. 权重更新 (Weight Update)
w_new = w_old - learning_rate × gradient
链式法则示例 (Chain Rule Example):
对于网络 \(L = f(g(h(x)))\):
优化器 (Optimizers)¶
英文:
Optimizers are algorithms or methods used to minimize the loss function by updating the weights of the neural network. Different optimizers have different strategies for this update.
中文:
优化器是通过更新神经网络的权重来最小化损失函数的算法或方法。不同的优化器有不同的更新策略。
常见优化器对比 (Common Optimizers Comparison):
| 优化器 | 全称 | 学习率 | 动量 | 自适应 | 推荐场景 |
|---|---|---|---|---|---|
| SGD | 随机梯度下降 | 手动 | 可选 | ❌ | 理论基础,需要调参 |
| Momentum | 动量 SGD | 手动 | ✓ | ❌ | 加速收敛 |
| AdaGrad | 自适应梯度 | 自适应 | ❌ | ✓ | 稀疏数据 |
| RMSprop | 均方根传播 | 自适应 | ❌ | ✓ | RNN, LSTM |
| Adam | 自适应矩估计 | 自适应 | ✓ | ✓ | 默认推荐 |
| AdamW | Adam + 权重衰减 | 自适应 | ✓ | ✓ | Transformer |
Adam 优化器公式 (Adam Optimizer Formula):
默认参数: - \(\alpha = 0.001\) (学习率) - \(\beta_1 = 0.9\) (一阶矩衰减) - \(\beta_2 = 0.999\) (二阶矩衰减) - \(\epsilon = 10^{-8}\) (数值稳定性)
损失函数 (Loss Functions)¶
英文:
A loss function measures the difference between the predicted output and the actual target. The goal of training is to minimize this loss.
中文:
损失函数测量预测输出与实际目标之间的差异。训练的目标是最小化这个损失。
损失函数选择指南 (Loss Function Selection Guide):
| 任务类型 | 损失函数 | 公式 | 适用场景 |
|---|---|---|---|
| 回归 | |||
| 均方误差 | MSE | \(\frac{1}{n}\sum(y-\hat{y})^2\) | 标准回归 |
| 平均绝对误差 | MAE | $\frac{1}{n}\sum | y-\hat{y} |
| Huber | Huber | 分段 MSE/MAE | 鲁棒回归 |
| 分类 | |||
| 二元交叉熵 | BCE | \(-[y\log\hat{y}+(1-y)\log(1-\hat{y})]\) | 二分类 |
| 交叉熵 | CE | \(-\sum y_i\log\hat{y}_i\) | 多分类 |
| 其他 | |||
| 对比损失 | Contrastive | 距离基于标签 | 度量学习 |
| 三元组损失 | Triplet | 锚点 - 正例 - 负例 | 嵌入学习 |
4. 卷积神经网络 (Convolutional Neural Networks)¶
英文定义:
A convolutional neural network (CNN) is a deep learning algorithm that takes an input image, assigns importance to various aspects/objects in the image, and is able to differentiate one from the other. CNNs are primarily used for image processing and computer vision tasks.
中文翻译:
卷积神经网络 (CNN) 是一种深度学习算法,它接收输入图像,对图像中的各个方面/对象分配重要性,并能够区分它们。CNN 主要用于图像处理和计算机视觉任务。
卷积层 (Convolutional Layer)¶
英文:
The convolutional layer applies a set of learnable filters (kernels) to the input. Each filter detects specific features like edges, textures, or patterns.
中文:
卷积层应用一组可学习的滤波器(核)到输入。每个滤波器检测特定特征,如边缘、纹理或图案。
卷积操作可视化 (Convolution Operation Visualization):
输入图像 (5×5) 卷积核 (3×3) 输出特征图 (3×3)
1 1 1 0 0 1 0 1 4 3 2
0 1 1 1 0 * 0 1 0 = 3 4 3
0 0 1 1 1 1 0 1 2 3 4
(滑动窗口,逐元素相乘后求和)
输出计算示例:
(1×1 + 1×0 + 1×1 + 0×0 + 1×1 + 1×0 + 0×1 + 0×0 + 1×1) = 4
卷积参数 (Convolution Parameters):
| 参数 | 英文 | 中文 | 作用 |
|---|---|---|---|
| Kernel size | Kernel size | 卷积核大小 | 感受野大小 |
| Stride | Stride | 步长 | 滑动步幅 |
| Padding | Padding | 填充 | 保持尺寸 |
| Channels | Channels | 通道数 | 特征图深度 |
输出尺寸计算 (Output Size Calculation):
池化层 (Pooling Layer)¶
英文:
Pooling layers reduce the spatial dimensions of the feature maps, which reduces the number of parameters and computation in the network.
中文:
池化层减少特征图的空间维度,从而减少网络中的参数数量和计算量。
池化类型 (Pooling Types):
最大池化 (Max Pooling) 平均池化 (Average Pooling)
输入 (4×4) 输入 (4×4)
1 2 3 4 1 2 3 4
5 6 7 8 5 6 7 8
9 10 11 12 9 10 11 12
13 14 15 16 13 14 15 16
2×2 池化,步长 2 2×2 池化,步长 2
输出 (2×2) 输出 (2×2)
6 8 3.5 5.5
14 16 9.5 11.5
取每个区域的最大值 取每个区域的平均值
经典 CNN 架构 (Classic CNN Architectures)¶
架构演进 (Architecture Evolution):
| 架构 | 年份 | 深度 | 创新点 | 应用场景 |
|---|---|---|---|---|
| LeNet-5 | 1998 | 7 层 | 首个成功 CNN | 手写数字识别 |
| AlexNet | 2012 | 8 层 | ReLU, Dropout | ImageNet 分类 |
| VGG | 2014 | 16-19 层 | 小卷积核堆叠 | 通用视觉 |
| GoogLeNet | 2014 | 22 层 | Inception 模块 | 高效计算 |
| ResNet | 2015 | 50-152 层 | 残差连接 | 超深网络 |
| EfficientNet | 2019 | 可变 | 复合缩放 | 移动端部署 |
ResNet 残差块 (ResNet Residual Block):
残差连接 (Residual Connection):
输入 x
│
├───────────────────┐
↓ │
[Conv] → [BN] → [ReLU] │
↓ │
[Conv] → [BN] │
↓ ↓
(+) ←─────────────────┘
↓
[ReLU]
↓
输出 F(x) + x
优势:解决梯度消失,允许训练更深网络
5. 循环神经网络 (Recurrent Neural Networks)¶
英文定义:
A recurrent neural network (RNN) is a class of artificial neural networks where connections between nodes form a directed graph along a temporal sequence. This allows it to exhibit temporal dynamic behavior and process sequences of data.
中文翻译:
循环神经网络 (RNN) 是一类人工神经网络,其中节点之间的连接形成沿时间序列的有向图。这使其能够表现出时间动态行为并处理数据序列。
RNN 基本结构 (Basic RNN Structure)¶
英文:
RNNs have a concept of 'memory' that allows them to use information from previous steps in the sequence. The same function is applied at each time step.
中文:
RNN 有一个"记忆"概念,使其能够使用序列中先前步骤的信息。在每个时间步应用相同的函数。
RNN 展开图 (RNN Unrolled Diagram):
RNN 按时间展开:
时间步: t=0 t=1 t=2 t=3
┌───┐ ┌───┐ ┌───┐ ┌───┐
输入: │x₀ │ │x₁ │ │x₂ │ │x₃ │
└─┬─┘ └─┬─┘ └─┬─┘ └─┬─┘
│ │ │ │
┌─▼─┐ ┌─▼─┐ ┌─▼─┐ ┌─▼─┐
隐藏状态: │h₀ │ ──→ │h₁ │ ──→ │h₂ │ ──→ │h₃ │
└─┬─┘ └─┬─┘ └─┬─┘ └─┬─┘
│ │ │ │
┌─▼─┐ ┌─▼─┐ ┌─▼─┐ ┌─▼─┐
输出: │y₀ │ │y₁ │ │y₂ │ │y₃ │
└───┘ └───┘ └───┘ └───┘
每个时间步共享相同的权重矩阵
RNN 前向传播公式 (RNN Forward Propagation):
其中: - \(h_t\): 时间步 t 的隐藏状态 - \(x_t\): 时间步 t 的输入 - \(y_t\): 时间步 t 的输出 - \(W_{xh}, W_{hh}, W_{hy}\): 权重矩阵
LSTM (Long Short-Term Memory)¶
英文:
LSTM is a special kind of RNN capable of learning long-term dependencies. It was introduced by Hochreiter & Schmidhuber (1997) and solves the vanishing gradient problem of standard RNNs.
中文:
LSTM 是一种能够学习长期依赖的特殊 RNN。由 Hochreiter & Schmidhuber (1997) 提出,解决了标准 RNN 的梯度消失问题。
LSTM 细胞结构 (LSTM Cell Structure):
LSTM 细胞:
┌─────────────┐
遗忘门 f_t → │ × │
│ + │ → c_t (细胞状态)
输入门 i_t → │ × │ │
│ tanh │ │
候选状态 → │ │ │
└─────────────┘ ↓
×
┌─────────────┐ │
输出门 o_t → │ σ │ ────┘
└─────────────┘
↓
h_t (隐藏状态)
门控机制:
- 遗忘门:决定丢弃什么信息
- 输入门:决定存储什么信息
- 输出门:决定输出什么信息
LSTM 公式 (LSTM Formulas):
GRU (Gated Recurrent Unit)¶
英文:
GRU is a simplified version of LSTM with fewer parameters. It combines the forget and input gates into a single update gate.
中文:
GRU 是 LSTM 的简化版本,参数更少。它将遗忘门和输入门合并为单个更新门。
LSTM vs GRU 对比:
| 特性 | LSTM | GRU |
|---|---|---|
| 门数量 | 3 (遗忘、输入、输出) | 2 (更新、重置) |
| 细胞状态 | 有 | 无 |
| 参数数量 | 较多 | 较少 |
| 训练速度 | 较慢 | 较快 |
| 性能 | 稍好 (长序列) | 相当 (多数场景) |
| 推荐使用 | 很长序列依赖 | 一般序列任务 |
6. 注意力机制与 Transformer (Attention Mechanism and Transformer)¶
注意力机制 (Attention Mechanism)¶
英文定义:
Attention is a technique that allows neural networks to focus on specific parts of the input when producing output. It was introduced to address the limitation of fixed-length context vectors in sequence-to-sequence models.
中文翻译:
注意力是一种技术,允许神经网络在生成输出时关注输入的特定部分。它被引入以解决序列到序列模型中固定长度上下文向量的局限性。
自注意力 (Self-Attention):
自注意力机制:
输入序列: ["I", "love", "deep", "learning"]
对于每个词,计算它与其他所有词的相关性:
"I" ←→ "love" (强相关)
"I" ←→ "deep" (弱相关)
"I" ←→ "learning" (中等相关)
结果:每个词的表示都包含了上下文中其他词的信息
注意力计算公式 (Attention Formula):
其中: - \(Q\): Query (查询) - \(K\): Key (键) - \(V\): Value (值) - \(d_k\): 键的维度 - \(\sqrt{d_k}\): 缩放因子,防止梯度消失
Transformer 架构 (Transformer Architecture)¶
英文:
The Transformer is a deep learning architecture introduced in "Attention Is All You Need" (Vaswani et al., 2017). It relies entirely on self-attention mechanisms and has become the foundation for modern language models.
中文:
Transformer 是在《Attention Is All You Need》(Vaswani et al., 2017) 中引入的深度学习架构。它完全依赖自注意力机制,已成为现代语言模型的基础。
Transformer 总体结构 (Transformer Overall Structure):
Transformer 架构:
编码器 (Encoder) 解码器 (Decoder)
┌─────────────────┐ ┌─────────────────┐
│ 输出嵌入 │ │ 输出嵌入 │
│ + 位置编码 │ │ + 位置编码 │
└────────┬────────┘ └────────┬────────┘
│ │
┌────────▼────────┐ ┌────────▼────────┐
│ 多头自注意力 │ │ 掩码自注意力 │
│ (Multi-Head) │ │ (Masked) │
└────────┬────────┘ └────────┬────────┘
│ │
┌────────▼────────┐ ┌────────▼────────┐
│ 加法和归一化 │ │ 加法和归一化 │
└────────┬────────┘ └────────┬────────┘
│ │
│ ┌────────▼────────┐
│ │ 交叉注意力 │
│ │ (Cross-Attn) │
│ └────────┬────────┘
│ │
▼ ┌────────▼────────┐
┌─────────────────┐ │ 加法和归一化 │
│ 前馈网络 │ └────────┬────────┘
│ (Feed-Forward)│ │
└────────┬────────┘ ┌────────▼────────┐
│ │ 前馈网络 │
┌────────▼────────┐ │ (Feed-Forward)│
│ 加法和归一化 │ └────────┬────────┘
└────────┬────────┘ │
│ ┌────────▼────────┐
▼ │ 加法和归一化 │
... (N 层) └────────┬────────┘
│
┌───▼───┐
│ Softmax│
└───┬───┘
│
输出概率
多头注意力 (Multi-Head Attention):
多头注意力机制:
单个注意力头:
Q → [Attention] → Output₁
K → [ ↓ ]
V → [ ]
多个头并行:
Q → [Head₁] ──┐
K → [Head₁] │
V → [Head₁] ├→ [Concat] → [Linear] → Final Output
│
Q → [Head₂] ──┤
K → [Head₂] │
V → [Head₂] ──┘
...
优势:允许模型同时关注不同位置的不同信息
Transformer 变体 (Transformer Variants)¶
主要变体 (Main Variants):
| 模型 | 年份 | 参数量 | 架构类型 | 主要贡献 |
|---|---|---|---|---|
| BERT | 2018 | 110M-340M | Encoder-only | 双向编码,掩码语言模型 |
| GPT | 2018-2023 | 117M-175B | Decoder-only | 自回归生成,大规模预训练 |
| T5 | 2019 | 60M-11B | Encoder-Decoder | 统一文本到文本框架 |
| BART | 2020 | 140M-400M | Encoder-Decoder | 去噪自编码器 |
| RoBERTa | 2019 | 125M-355M | Encoder-only | BERT 优化版本 |
架构选择指南 (Architecture Selection Guide):
| 任务类型 | 推荐架构 | 代表模型 |
|---|---|---|
| 文本分类 | Encoder-only | BERT, RoBERTa |
| 命名实体识别 | Encoder-only | BERT, DeBERTa |
| 文本生成 | Decoder-only | GPT, LLaMA |
| 机器翻译 | Encoder-Decoder | T5, BART |
| 文本摘要 | Encoder-Decoder | BART, T5 |
| 问答系统 | Encoder-only | BERT, ALBERT |
7. 深度学习应用 (Deep Learning Applications)¶
计算机视觉 (Computer Vision)¶
主要应用 (Main Applications):
| 任务 | 描述 | 典型模型 |
|---|---|---|
| 图像分类 | 识别图像类别 | ResNet, EfficientNet |
| 目标检测 | 定位并识别多个物体 | YOLO, Faster R-CNN |
| 语义分割 | 像素级分类 | U-Net, DeepLab |
| 实例分割 | 区分同一类的不同实例 | Mask R-CNN |
| 图像生成 | 生成新图像 | GAN, Diffusion |
| 图像超分 | 提高图像分辨率 | SRGAN, ESRGAN |
自然语言处理 (Natural Language Processing)¶
主要应用 (Main Applications):
| 任务 | 描述 | 典型模型 |
|---|---|---|
| 文本分类 | 情感分析、主题分类 | BERT, RoBERTa |
| 命名实体识别 | 识别人名、地名等 | BERT-CRF |
| 机器翻译 | 语言间翻译 | T5, mBART |
| 文本摘要 | 生成摘要 | BART, T5 |
| 问答系统 | 回答问题 | BERT, T5 |
| 文本生成 | 创作、对话 | GPT, LLaMA |
| 语音识别 | 语音转文本 | Whisper, Wav2Vec |
强化学习 (Reinforcement Learning)¶
英文:
Deep reinforcement learning combines deep neural networks with reinforcement learning algorithms to learn optimal policies from high-dimensional inputs.
中文:
深度强化学习将深度神经网络与强化学习算法相结合,从高维输入中学习最优策略。
代表性成果 (Representative Achievements):
| 应用 | 描述 | 模型 | 年份 |
|---|---|---|---|
| AlphaGo | 围棋世界冠军 | CNN + MCTS | 2016 |
| DQN | Atari 游戏 | CNN + Q-Learning | 2015 |
| AlphaZero | 通用棋类游戏 | ResNet + MCTS | 2017 |
| GPT + RLHF | 对齐人类偏好 | Transformer + RL | 2022 |
📊 深度学习知识图谱¶
graph TB
A[深度学习] --> B[神经网络基础]
A --> C[网络架构]
A --> D[训练方法]
A --> E[应用领域]
B --> B1[神经元]
B --> B2[激活函数]
B --> B3[损失函数]
C --> C1[CNN]
C --> C2[RNN]
C --> C3[Transformer]
D --> D1[反向传播]
D --> D2[优化器]
D --> D3[正则化]
E --> E1[计算机视觉]
E --> E2[NLP]
E --> E3[强化学习]
style A fill:#4CAF50
style C3 fill:#2196F3
🔑 关键术语对照表 (Glossary)¶
| English | 中文 | 定义 |
|---|---|---|
| Deep learning | 深度学习 | 基于多层神经网络的机器学习 |
| Neural network | 神经网络 | 模拟生物神经系统的计算模型 |
| Layer | 层 | 神经网络的基本组成单元 |
| Activation function | 激活函数 | 引入非线性的函数 |
| Backpropagation | 反向传播 | 计算梯度的算法 |
| Gradient descent | 梯度下降 | 最小化损失函数的优化方法 |
| Convolution | 卷积 | 提取局部特征的运算 |
| Pooling | 池化 | 降维操作 |
| Recurrent | 循环 | 处理序列的网络 |
| LSTM | LSTM | 长短期记忆网络 |
| Attention | 注意力 | 关注输入特定部分的机制 |
| Transformer | Transformer | 基于注意力的架构 |
| Fine-tuning | 微调 | 在预训练模型上进一步训练 |
| Overfitting | 过拟合 | 训练好测试差 |
| Regularization | 正则化 | 防止过拟合的技术 |
编译完成时间: 2026-06-01
来源: Wikipedia Deep learning, Neural network, Backpropagation 等条目
关联文档: statistics-concepts-zh-en.md, decision-science-concepts-zh-en.md