<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>神经网络 | Liu chen chen CV</title><link>https://liuchenlili.github.io/tags/%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/</link><atom:link href="https://liuchenlili.github.io/tags/%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/index.xml" rel="self" type="application/rss+xml"/><description>神经网络</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 12 Nov 2024 00:00:00 +0000</lastBuildDate><image><url>https://liuchenlili.github.io/media/logo.svg</url><title>神经网络</title><link>https://liuchenlili.github.io/tags/%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/</link></image><item><title>机器学习</title><link>https://liuchenlili.github.io/blog/machine-learning/</link><pubDate>Tue, 12 Nov 2024 00:00:00 +0000</pubDate><guid>https://liuchenlili.github.io/blog/machine-learning/</guid><description>&lt;h1 id="1-机器学习总体概念"&gt;1. 机器学习总体概念&lt;/h1&gt;
&lt;p&gt;机器学习是让机器通过数据自动学习规律的技术。&lt;br&gt;
核心任务是从数据中学习一个函数，用来进行预测或分类。&lt;/p&gt;
&lt;p&gt;基本思想：&lt;strong&gt;数据 → 模型 → 学习规则（损失函数 + 优化） → 预测能力&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;机器学习主要分为三类：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：输入 + 标签（分类、回归）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：只有输入（聚类、降维、密度估计）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：智能体通过与环境交互学习策略&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="2-数学基础"&gt;2. 数学基础&lt;/h1&gt;
&lt;p&gt;机器学习的数学基石包括：&lt;/p&gt;
&lt;h2 id="21-线性代数"&gt;2.1 线性代数&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;向量、矩阵&lt;/li&gt;
&lt;li&gt;矩阵运算（点乘、外积、特征值分解、奇异值分解 SVD）&lt;/li&gt;
&lt;li&gt;距离与相似度（欧氏距离、余弦相似度）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="22-概率论"&gt;2.2 概率论&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;条件概率&lt;/li&gt;
&lt;li&gt;贝叶斯公式&lt;/li&gt;
&lt;li&gt;分布（高斯、多项式）&lt;/li&gt;
&lt;li&gt;最大似然估计（MLE）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="23-微积分与优化"&gt;2.3 微积分与优化&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;导数与梯度&lt;/li&gt;
&lt;li&gt;梯度下降（GD）&lt;/li&gt;
&lt;li&gt;牛顿法、凸优化理论&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="3-监督学习"&gt;3. 监督学习&lt;/h1&gt;
&lt;p&gt;监督学习以“有标注的数据”为基础，目标是学习输入与输出之间的关系。&lt;/p&gt;
&lt;h2 id="31-分类问题"&gt;3.1 分类问题&lt;/h2&gt;
&lt;p&gt;输入特征 → 输出离散类别。&lt;/p&gt;
&lt;p&gt;典型算法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;逻辑回归&lt;/li&gt;
&lt;li&gt;决策树&lt;/li&gt;
&lt;li&gt;随机森林&lt;/li&gt;
&lt;li&gt;支持向量机（SVM）&lt;/li&gt;
&lt;li&gt;KNN&lt;/li&gt;
&lt;li&gt;朴素贝叶斯&lt;/li&gt;
&lt;li&gt;神经网络（深度学习）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="逻辑回归logistic-regression"&gt;逻辑回归（Logistic Regression）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;用于二分类。&lt;/li&gt;
&lt;li&gt;本质是线性模型 + Sigmoid 映射成概率。&lt;/li&gt;
&lt;li&gt;损失函数：交叉熵。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="决策树"&gt;决策树&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;通过特征分裂构建树结构。&lt;/li&gt;
&lt;li&gt;常见分裂指标：信息增益、Gini 指数。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="随机森林"&gt;随机森林&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;多棵决策树投票产生结果。&lt;/li&gt;
&lt;li&gt;有效减少过拟合。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="支持向量机svm"&gt;支持向量机（SVM）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;寻找最大化间隔的分类超平面。&lt;/li&gt;
&lt;li&gt;核技巧可处理非线性数据。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="32-回归问题"&gt;3.2 回归问题&lt;/h2&gt;
&lt;p&gt;输出连续数值。&lt;/p&gt;
&lt;p&gt;典型算法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;线性回归&lt;/li&gt;
&lt;li&gt;岭回归、Lasso&lt;/li&gt;
&lt;li&gt;SVR（支持向量回归）&lt;/li&gt;
&lt;li&gt;GBDT（梯度提升决策树）&lt;/li&gt;
&lt;li&gt;XGBoost / LightGBM&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="线性回归"&gt;线性回归&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;模型：\( y = w^Tx + b \)&lt;/li&gt;
&lt;li&gt;损失：均方误差（MSE）&lt;/li&gt;
&lt;li&gt;解法：正规方程或梯度下降。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="lasso--ridge"&gt;Lasso &amp;amp; Ridge&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;通过 L1 或 L2 正则防止过拟合。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="4-无监督学习"&gt;4. 无监督学习&lt;/h1&gt;
&lt;p&gt;无监督学习处理未标注的数据。&lt;/p&gt;
&lt;h2 id="41-聚类"&gt;4.1 聚类&lt;/h2&gt;
&lt;p&gt;目标：发现数据内在分组结构。&lt;/p&gt;
&lt;p&gt;算法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;K-Means（基于距离）&lt;/li&gt;
&lt;li&gt;层次聚类&lt;/li&gt;
&lt;li&gt;DBSCAN（基于密度）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="k-means-重点"&gt;K-Means 重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;随机初始化 K 个中心&lt;/li&gt;
&lt;li&gt;迭代 “分配 → 更新中心”&lt;/li&gt;
&lt;li&gt;目标：最小化簇内平方距离&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="42-降维"&gt;4.2 降维&lt;/h2&gt;
&lt;p&gt;常用于可视化、加速训练、减少噪声。&lt;/p&gt;
&lt;p&gt;算法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;PCA（主成分分析）&lt;/li&gt;
&lt;li&gt;t-SNE（高维可视化）&lt;/li&gt;
&lt;li&gt;Autoencoder（自编码器）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="pca"&gt;PCA&lt;/h3&gt;
&lt;p&gt;通过奇异值分解找到方差最大的方向。&lt;br&gt;
保留主要成分即可降维。&lt;/p&gt;
&lt;hr&gt;
&lt;h1 id="5-模型评估"&gt;5. 模型评估&lt;/h1&gt;
&lt;p&gt;对训练完的模型需要量化效果。&lt;/p&gt;
&lt;h2 id="51-分类评估指标"&gt;5.1 分类评估指标&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;准确率 Accuracy&lt;/li&gt;
&lt;li&gt;精确率 Precision&lt;/li&gt;
&lt;li&gt;召回率 Recall&lt;/li&gt;
&lt;li&gt;F1-score&lt;/li&gt;
&lt;li&gt;ROC 曲线、AUC&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="52-回归评估指标"&gt;5.2 回归评估指标&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;MSE 均方误差&lt;/li&gt;
&lt;li&gt;MAE 平均绝对误差&lt;/li&gt;
&lt;li&gt;\(R^2\) 决定系数&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="53-训练测试划分"&gt;5.3 训练/测试划分&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;训练集（training）&lt;/li&gt;
&lt;li&gt;验证集（validation）&lt;/li&gt;
&lt;li&gt;测试集（test）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;使用交叉验证（K-fold）提高结果稳定性。&lt;/p&gt;
&lt;hr&gt;
&lt;h1 id="6-训练流程通用机器学习-pipeline"&gt;6. 训练流程（通用机器学习 pipeline）&lt;/h1&gt;
&lt;ol&gt;
&lt;li&gt;数据收集&lt;/li&gt;
&lt;li&gt;数据清洗（缺失值、异常值）&lt;/li&gt;
&lt;li&gt;特征工程&lt;/li&gt;
&lt;li&gt;选择模型&lt;/li&gt;
&lt;li&gt;训练模型&lt;/li&gt;
&lt;li&gt;调参（超参数优化）&lt;/li&gt;
&lt;li&gt;模型评估&lt;/li&gt;
&lt;li&gt;部署或进一步优化&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h1 id="7-特征工程"&gt;7. 特征工程&lt;/h1&gt;
&lt;p&gt;机器学习的性能很大程度取决于特征。&lt;/p&gt;
&lt;h2 id="71-特征处理方法"&gt;7.1 特征处理方法&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;标准化（Standardization）&lt;/li&gt;
&lt;li&gt;归一化（Normalization）&lt;/li&gt;
&lt;li&gt;One-hot 编码&lt;/li&gt;
&lt;li&gt;特征选择（过滤、包裹、嵌入方法）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="72-特征重要性"&gt;7.2 特征重要性&lt;/h2&gt;
&lt;p&gt;在树模型、线性模型中尤为重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h1 id="8-过拟合与欠拟合"&gt;8. 过拟合与欠拟合&lt;/h1&gt;
&lt;h2 id="81-过拟合记住训练集但泛化差"&gt;8.1 过拟合（记住训练集但泛化差）&lt;/h2&gt;
&lt;p&gt;解决方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;正则化（L1/L2）&lt;/li&gt;
&lt;li&gt;数据增强&lt;/li&gt;
&lt;li&gt;交叉验证&lt;/li&gt;
&lt;li&gt;降低模型复杂度&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="82-欠拟合模型太简单"&gt;8.2 欠拟合（模型太简单）&lt;/h2&gt;
&lt;p&gt;解决方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;使用更复杂模型&lt;/li&gt;
&lt;li&gt;增加特征&lt;/li&gt;
&lt;li&gt;减少正则化&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="9-损失函数与优化"&gt;9. 损失函数与优化&lt;/h1&gt;
&lt;p&gt;损失函数用于度量预测与真实标签的差距。&lt;br&gt;
优化器用于最小化损失。&lt;/p&gt;
&lt;h2 id="常见损失"&gt;常见损失&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;回归：MSE、MAE&lt;/li&gt;
&lt;li&gt;分类：交叉熵&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="常见优化器"&gt;常见优化器&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;梯度下降（GD）&lt;/li&gt;
&lt;li&gt;随机梯度下降（SGD）&lt;/li&gt;
&lt;li&gt;Adam（适应性学习率）&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="10-树模型与-boosting-系列"&gt;10. 树模型与 Boosting 系列&lt;/h1&gt;
&lt;p&gt;树模型在工业界广泛使用。&lt;/p&gt;
&lt;h2 id="101-gbdtgradient-boosting-decision-tree"&gt;10.1 GBDT（Gradient Boosting Decision Tree）&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;使用残差逐步提升模型表现&lt;/li&gt;
&lt;li&gt;连续叠加弱学习器（树）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="102-xgboost"&gt;10.2 XGBoost&lt;/h2&gt;
&lt;p&gt;GBDT 的高性能版本：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;特征并行&lt;/li&gt;
&lt;li&gt;剪枝算法&lt;/li&gt;
&lt;li&gt;更快的训练速度&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="103-lightgbm"&gt;10.3 LightGBM&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;基于直方图的高效率算法&lt;/li&gt;
&lt;li&gt;更快、更省内存&lt;/li&gt;
&lt;li&gt;适合大数据训练&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="11-强化学习基础介绍"&gt;11. 强化学习（基础介绍）&lt;/h1&gt;
&lt;p&gt;强化学习由“智能体”与“环境”组成。&lt;/p&gt;
&lt;p&gt;核心概念：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;状态（State）&lt;/li&gt;
&lt;li&gt;动作（Action）&lt;/li&gt;
&lt;li&gt;奖励（Reward）&lt;/li&gt;
&lt;li&gt;策略（Policy）&lt;/li&gt;
&lt;li&gt;价值函数（Value Function）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;经典方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Q-Learning&lt;/li&gt;
&lt;li&gt;Deep Q Networks (DQN)&lt;/li&gt;
&lt;li&gt;Policy Gradient&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h1 id="12-机器学习-vs-深度学习"&gt;12. 机器学习 vs 深度学习&lt;/h1&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比项&lt;/th&gt;
&lt;th&gt;机器学习&lt;/th&gt;
&lt;th&gt;深度学习&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;数据需求&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;很大&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;特征工程&lt;/td&gt;
&lt;td&gt;需要人工设计&lt;/td&gt;
&lt;td&gt;自动学习&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;训练成本&lt;/td&gt;
&lt;td&gt;较低&lt;/td&gt;
&lt;td&gt;高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;模型代表&lt;/td&gt;
&lt;td&gt;SVM、树模型&lt;/td&gt;
&lt;td&gt;CNN、Transformer&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;适用场景&lt;/td&gt;
&lt;td&gt;小中型数据、结构化数据&lt;/td&gt;
&lt;td&gt;图像、文本、大规模数据&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;</description></item><item><title>深度学习学习笔记</title><link>https://liuchenlili.github.io/blog/deep-learning/</link><pubDate>Tue, 12 Nov 2024 00:00:00 +0000</pubDate><guid>https://liuchenlili.github.io/blog/deep-learning/</guid><description>&lt;h1 id="深度学习学习笔记"&gt;深度学习学习笔记&lt;/h1&gt;
&lt;h2 id="1-深度学习概念概览"&gt;1. 深度学习概念概览&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;深度学习属于机器学习的分支，基于多层神经网络。&lt;/li&gt;
&lt;li&gt;核心目标：通过多层非线性变换自动学习特征表示。&lt;/li&gt;
&lt;li&gt;深层模型相比手工特征更具表达能力，但训练更依赖数据和计算资源.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="2-神经网络基础"&gt;2. 神经网络基础&lt;/h2&gt;
&lt;h3 id="21-神经元与计算"&gt;2.1 神经元与计算&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;神经元计算公式：&lt;br&gt;
\( y = f(Wx + b) \)&lt;br&gt;
其中 \(f\) 为激活函数（ReLU、Sigmoid 等）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="22-激活函数"&gt;2.2 激活函数&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ReLU&lt;/strong&gt;：解决梯度消失问题，训练快。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sigmoid / Tanh&lt;/strong&gt;：用于概率输出或特定场景。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Softmax&lt;/strong&gt;：用于多分类。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="23-损失函数"&gt;2.3 损失函数&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;分类&lt;/strong&gt;：交叉熵（Cross Entropy）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;回归&lt;/strong&gt;：均方误差（MSE）&lt;/li&gt;
&lt;li&gt;损失函数用于衡量模型输出与真实标签之间的差距。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="24-反向传播与优化器"&gt;2.4 反向传播与优化器&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;反向传播利用链式法则计算梯度。&lt;/li&gt;
&lt;li&gt;常见优化器：
&lt;ul&gt;
&lt;li&gt;SGD&lt;/li&gt;
&lt;li&gt;Adam（自适应学习率）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="3-常见网络结构"&gt;3. 常见网络结构&lt;/h2&gt;
&lt;h3 id="31-全连接网络mlp"&gt;3.1 全连接网络（MLP）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;结构简单，多用于结构化数据或作为其它模型的基础单元。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="32-卷积神经网络cnn"&gt;3.2 卷积神经网络（CNN）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;特点：局部感受野、权重共享。&lt;/li&gt;
&lt;li&gt;应用：图像分类、检测、分割。&lt;/li&gt;
&lt;li&gt;经典结构：LeNet、AlexNet、VGG、ResNet。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="33-循环神经网络rnn--lstm--gru"&gt;3.3 循环神经网络（RNN / LSTM / GRU）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;用于处理序列数据（文本、时间序列）。&lt;/li&gt;
&lt;li&gt;LSTM/GRU 解决普通 RNN 的梯度消失问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="34-transformer"&gt;3.4 Transformer&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;使用自注意力机制，捕捉任意位置的依赖关系。&lt;/li&gt;
&lt;li&gt;并行计算效率高，现为 NLP 和 Vision 的主流架构。&lt;/li&gt;
&lt;li&gt;常见模型：BERT、GPT、ViT。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="4-深度学习训练流程"&gt;4. 深度学习训练流程&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;准备数据&lt;/li&gt;
&lt;li&gt;定义模型结构&lt;/li&gt;
&lt;li&gt;定义损失函数&lt;/li&gt;
&lt;li&gt;前向传播计算输出&lt;/li&gt;
&lt;li&gt;反向传播计算梯度&lt;/li&gt;
&lt;li&gt;使用优化器更新参数&lt;/li&gt;
&lt;li&gt;在验证集评估效果&lt;/li&gt;
&lt;li&gt;调整超参数并迭代训练&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id="5-训练常见问题及解决策略"&gt;5. 训练常见问题及解决策略&lt;/h2&gt;
&lt;h3 id="51-过拟合"&gt;5.1 过拟合&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;现象：训练集准确率高，验证集低。&lt;/li&gt;
&lt;li&gt;解决：
&lt;ul&gt;
&lt;li&gt;正则化（L2）&lt;/li&gt;
&lt;li&gt;Dropout&lt;/li&gt;
&lt;li&gt;数据增强&lt;/li&gt;
&lt;li&gt;使用更小的模型&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="52-梯度消失--梯度爆炸"&gt;5.2 梯度消失 / 梯度爆炸&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;解决：
&lt;ul&gt;
&lt;li&gt;使用 ReLU&lt;/li&gt;
&lt;li&gt;残差连接（ResNet）&lt;/li&gt;
&lt;li&gt;梯度裁剪&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="53-学习率问题"&gt;5.3 学习率问题&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;学习率过大：训练震荡&lt;/li&gt;
&lt;li&gt;学习率过小：训练很慢且可能陷入局部最优&lt;/li&gt;
&lt;li&gt;常用策略：学习率衰减、余弦退火、warmup&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="6-参数量计算量与显存"&gt;6. 参数量、计算量与显存&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;参数量影响模型容量与存储需求。&lt;/li&gt;
&lt;li&gt;FLOPs（浮点运算量）影响计算成本。&lt;/li&gt;
&lt;li&gt;显存与 batch size 密切相关。&lt;/li&gt;
&lt;li&gt;混合精度训练（FP16/BF16）可减少显存并加速训练。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="7-深度学习的主要应用领域"&gt;7. 深度学习的主要应用领域&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;NLP（文本分类、机器翻译、对话系统）&lt;/li&gt;
&lt;li&gt;CV（图像分类、目标检测、语义分割）&lt;/li&gt;
&lt;li&gt;多模态（图文、图像生成、视频理解）&lt;/li&gt;
&lt;li&gt;时间序列预测（金融、天气、传感器）&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="8-学习路径建议"&gt;8. 学习路径建议&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;数学：线性代数、概率统计、微积分&lt;/li&gt;
&lt;li&gt;基础编程：Python&lt;/li&gt;
&lt;li&gt;框架：PyTorch&lt;/li&gt;
&lt;li&gt;实践：MNIST → CIFAR → Bert → Transformer&lt;/li&gt;
&lt;li&gt;论文阅读：经典模型结构与优化方法&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>