<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>深度学习 | Liu chen chen CV</title><link>https://liuchenlili.github.io/tags/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/</link><atom:link href="https://liuchenlili.github.io/tags/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml"/><description>深度学习</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 12 Nov 2024 00:00:00 +0000</lastBuildDate><image><url>https://liuchenlili.github.io/media/logo.svg</url><title>深度学习</title><link>https://liuchenlili.github.io/tags/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/</link></image><item><title>深度学习学习笔记</title><link>https://liuchenlili.github.io/blog/deep-learning/</link><pubDate>Tue, 12 Nov 2024 00:00:00 +0000</pubDate><guid>https://liuchenlili.github.io/blog/deep-learning/</guid><description>&lt;h1 id="深度学习学习笔记"&gt;深度学习学习笔记&lt;/h1&gt;
&lt;h2 id="1-深度学习概念概览"&gt;1. 深度学习概念概览&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;深度学习属于机器学习的分支，基于多层神经网络。&lt;/li&gt;
&lt;li&gt;核心目标：通过多层非线性变换自动学习特征表示。&lt;/li&gt;
&lt;li&gt;深层模型相比手工特征更具表达能力，但训练更依赖数据和计算资源.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="2-神经网络基础"&gt;2. 神经网络基础&lt;/h2&gt;
&lt;h3 id="21-神经元与计算"&gt;2.1 神经元与计算&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;神经元计算公式：&lt;br&gt;
\( y = f(Wx + b) \)&lt;br&gt;
其中 \(f\) 为激活函数（ReLU、Sigmoid 等）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="22-激活函数"&gt;2.2 激活函数&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ReLU&lt;/strong&gt;：解决梯度消失问题，训练快。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sigmoid / Tanh&lt;/strong&gt;：用于概率输出或特定场景。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Softmax&lt;/strong&gt;：用于多分类。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="23-损失函数"&gt;2.3 损失函数&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;分类&lt;/strong&gt;：交叉熵（Cross Entropy）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;回归&lt;/strong&gt;：均方误差（MSE）&lt;/li&gt;
&lt;li&gt;损失函数用于衡量模型输出与真实标签之间的差距。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="24-反向传播与优化器"&gt;2.4 反向传播与优化器&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;反向传播利用链式法则计算梯度。&lt;/li&gt;
&lt;li&gt;常见优化器：
&lt;ul&gt;
&lt;li&gt;SGD&lt;/li&gt;
&lt;li&gt;Adam（自适应学习率）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="3-常见网络结构"&gt;3. 常见网络结构&lt;/h2&gt;
&lt;h3 id="31-全连接网络mlp"&gt;3.1 全连接网络（MLP）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;结构简单，多用于结构化数据或作为其它模型的基础单元。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="32-卷积神经网络cnn"&gt;3.2 卷积神经网络（CNN）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;特点：局部感受野、权重共享。&lt;/li&gt;
&lt;li&gt;应用：图像分类、检测、分割。&lt;/li&gt;
&lt;li&gt;经典结构：LeNet、AlexNet、VGG、ResNet。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="33-循环神经网络rnn--lstm--gru"&gt;3.3 循环神经网络（RNN / LSTM / GRU）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;用于处理序列数据（文本、时间序列）。&lt;/li&gt;
&lt;li&gt;LSTM/GRU 解决普通 RNN 的梯度消失问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="34-transformer"&gt;3.4 Transformer&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;使用自注意力机制，捕捉任意位置的依赖关系。&lt;/li&gt;
&lt;li&gt;并行计算效率高，现为 NLP 和 Vision 的主流架构。&lt;/li&gt;
&lt;li&gt;常见模型：BERT、GPT、ViT。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="4-深度学习训练流程"&gt;4. 深度学习训练流程&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;准备数据&lt;/li&gt;
&lt;li&gt;定义模型结构&lt;/li&gt;
&lt;li&gt;定义损失函数&lt;/li&gt;
&lt;li&gt;前向传播计算输出&lt;/li&gt;
&lt;li&gt;反向传播计算梯度&lt;/li&gt;
&lt;li&gt;使用优化器更新参数&lt;/li&gt;
&lt;li&gt;在验证集评估效果&lt;/li&gt;
&lt;li&gt;调整超参数并迭代训练&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id="5-训练常见问题及解决策略"&gt;5. 训练常见问题及解决策略&lt;/h2&gt;
&lt;h3 id="51-过拟合"&gt;5.1 过拟合&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;现象：训练集准确率高，验证集低。&lt;/li&gt;
&lt;li&gt;解决：
&lt;ul&gt;
&lt;li&gt;正则化（L2）&lt;/li&gt;
&lt;li&gt;Dropout&lt;/li&gt;
&lt;li&gt;数据增强&lt;/li&gt;
&lt;li&gt;使用更小的模型&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="52-梯度消失--梯度爆炸"&gt;5.2 梯度消失 / 梯度爆炸&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;解决：
&lt;ul&gt;
&lt;li&gt;使用 ReLU&lt;/li&gt;
&lt;li&gt;残差连接（ResNet）&lt;/li&gt;
&lt;li&gt;梯度裁剪&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="53-学习率问题"&gt;5.3 学习率问题&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;学习率过大：训练震荡&lt;/li&gt;
&lt;li&gt;学习率过小：训练很慢且可能陷入局部最优&lt;/li&gt;
&lt;li&gt;常用策略：学习率衰减、余弦退火、warmup&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="6-参数量计算量与显存"&gt;6. 参数量、计算量与显存&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;参数量影响模型容量与存储需求。&lt;/li&gt;
&lt;li&gt;FLOPs（浮点运算量）影响计算成本。&lt;/li&gt;
&lt;li&gt;显存与 batch size 密切相关。&lt;/li&gt;
&lt;li&gt;混合精度训练（FP16/BF16）可减少显存并加速训练。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="7-深度学习的主要应用领域"&gt;7. 深度学习的主要应用领域&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;NLP（文本分类、机器翻译、对话系统）&lt;/li&gt;
&lt;li&gt;CV（图像分类、目标检测、语义分割）&lt;/li&gt;
&lt;li&gt;多模态（图文、图像生成、视频理解）&lt;/li&gt;
&lt;li&gt;时间序列预测（金融、天气、传感器）&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="8-学习路径建议"&gt;8. 学习路径建议&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;数学：线性代数、概率统计、微积分&lt;/li&gt;
&lt;li&gt;基础编程：Python&lt;/li&gt;
&lt;li&gt;框架：PyTorch&lt;/li&gt;
&lt;li&gt;实践：MNIST → CIFAR → Bert → Transformer&lt;/li&gt;
&lt;li&gt;论文阅读：经典模型结构与优化方法&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>