<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>可视化 | Liu chen chen CV</title><link>https://liuchenlili.github.io/tags/%E5%8F%AF%E8%A7%86%E5%8C%96/</link><atom:link href="https://liuchenlili.github.io/tags/%E5%8F%AF%E8%A7%86%E5%8C%96/index.xml" rel="self" type="application/rss+xml"/><description>可视化</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 12 Nov 2024 00:00:00 +0000</lastBuildDate><image><url>https://liuchenlili.github.io/media/logo.svg</url><title>可视化</title><link>https://liuchenlili.github.io/tags/%E5%8F%AF%E8%A7%86%E5%8C%96/</link></image><item><title>📉 数据降维方法全解析</title><link>https://liuchenlili.github.io/blog/pca/</link><pubDate>Tue, 12 Nov 2024 00:00:00 +0000</pubDate><guid>https://liuchenlili.github.io/blog/pca/</guid><description>&lt;h1 id="数据降维方法详解"&gt;数据降维方法详解&lt;/h1&gt;
&lt;h2 id="一什么是降维"&gt;一、什么是降维&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;降维（Dimensionality Reduction）&lt;/strong&gt; 是将高维数据映射到低维空间的过程，在尽量保留主要信息的前提下减少特征维度。&lt;br&gt;
主要目标包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;降低计算复杂度&lt;/li&gt;
&lt;li&gt;去除冗余特征与噪声&lt;/li&gt;
&lt;li&gt;便于可视化与理解数据结构&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;降维方法可分为两类：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;线性降维&lt;/strong&gt;：如 PCA（主成分分析）、LDA（线性判别分析）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;非线性降维&lt;/strong&gt;：如 t-SNE、UMAP&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="二pca主成分分析"&gt;二、PCA（主成分分析）&lt;/h2&gt;
&lt;h3 id="1-基本思想"&gt;1. 基本思想&lt;/h3&gt;
&lt;p&gt;PCA 是一种&lt;strong&gt;无监督的线性降维方法&lt;/strong&gt;，通过线性变换将数据投影到新的正交坐标轴上，使得：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;各轴方向互相独立；&lt;/li&gt;
&lt;li&gt;在这些方向上数据方差最大。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;换句话说，PCA 寻找能解释数据方差最大的方向，从而保留“最有信息量”的部分。&lt;/p&gt;
&lt;h3 id="2-数学原理"&gt;2. 数学原理&lt;/h3&gt;
&lt;p&gt;设原始数据矩阵为 \( X \in \mathbb{R}^{n \times d} \)。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中心化数据&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;
\[
X_c = X - \bar{X}
\]&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;计算协方差矩阵&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;
\[
\Sigma = \frac{1}{n} X_c^T X_c
\]&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;特征值分解&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;
\[
\Sigma = V \Lambda V^T
\]&lt;ul&gt;
&lt;li&gt;\( V \)：特征向量矩阵（主成分方向）&lt;/li&gt;
&lt;li&gt;\( \Lambda \)：特征值矩阵（方差解释率）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;选择前 \( k \) 个主成分&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;
\[
Z = X_c V_k
\]&lt;p&gt;
得到降维后的数据 \( Z \)。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="3-方差解释率"&gt;3. 方差解释率&lt;/h3&gt;
\[
\text{解释率}_i = \frac{\lambda_i}{\sum_j \lambda_j}
\]&lt;p&gt;通常选择累计解释率达到 90%~95% 的前几个主成分。&lt;/p&gt;
&lt;h3 id="4-优缺点"&gt;4. 优缺点&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;优点：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;简单高效，常用于特征压缩&lt;/li&gt;
&lt;li&gt;去除特征相关性&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;缺点：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;仅适用于线性结构&lt;/li&gt;
&lt;li&gt;主成分难以直接解释&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="三lda线性判别分析"&gt;三、LDA（线性判别分析）&lt;/h2&gt;
&lt;h3 id="1-基本思想-1"&gt;1. 基本思想&lt;/h3&gt;
&lt;p&gt;LDA 是一种&lt;strong&gt;有监督的线性降维方法&lt;/strong&gt;。&lt;br&gt;
与 PCA 不同，LDA 利用类别标签信息，通过最大化类间方差、最小化类内方差来寻找最优投影方向。&lt;/p&gt;
&lt;p&gt;目标：&lt;br&gt;
&lt;/p&gt;
\[
\text{类间方差最大，类内方差最小}
\]&lt;h3 id="2-数学原理-1"&gt;2. 数学原理&lt;/h3&gt;
&lt;p&gt;设数据共有 \( C \) 个类别。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;类内散度矩阵&lt;/strong&gt;：
\[
S_W = \sum_{i=1}^{C} \sum_{x \in X_i} (x - \mu_i)(x - \mu_i)^T
\]&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;类间散度矩阵&lt;/strong&gt;：
\[
S_B = \sum_{i=1}^{C} n_i (\mu_i - \mu)(\mu_i - \mu)^T
\]&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;优化目标：
&lt;/p&gt;
\[
W^* = \arg\max_W \frac{|W^T S_B W|}{|W^T S_W W|}
\]&lt;p&gt;
通过广义特征值分解求得最优投影矩阵 \( W^* \)。&lt;/p&gt;
&lt;h3 id="3-特点"&gt;3. 特点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;降维后最多为 \( C - 1 \) 维&lt;/li&gt;
&lt;li&gt;常用于分类前特征提取（如人脸识别 Fisherfaces）&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="四t-snet-分布随机邻域嵌入"&gt;四、t-SNE（t-分布随机邻域嵌入）&lt;/h2&gt;
&lt;h3 id="1-基本思想-2"&gt;1. 基本思想&lt;/h3&gt;
&lt;p&gt;t-SNE 是一种&lt;strong&gt;非线性降维与可视化方法&lt;/strong&gt;。&lt;br&gt;
它通过保持高维空间中样本之间的&lt;strong&gt;局部相似性&lt;/strong&gt;，在低维空间中展示高维数据的结构。&lt;/p&gt;
&lt;h3 id="2-核心步骤"&gt;2. 核心步骤&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;在高维空间中，用高斯分布计算相似度 \( p_{j|i} \)。&lt;/li&gt;
&lt;li&gt;在低维空间中，用 t 分布计算相似度 \( q_{ij} \)。&lt;/li&gt;
&lt;li&gt;通过最小化 KL 散度：
\[
KL(P||Q) = \sum_{i \neq j} p_{ij} \log \frac{p_{ij}}{q_{ij}}
\]
使两个分布尽量接近。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="3-特点-1"&gt;3. 特点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;擅长高维数据可视化&lt;/li&gt;
&lt;li&gt;能揭示聚类结构&lt;/li&gt;
&lt;li&gt;对参数（如 perplexity）敏感，计算较慢&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="五umapuniform-manifold-approximation-and-projection"&gt;五、UMAP（Uniform Manifold Approximation and Projection）&lt;/h2&gt;
&lt;h3 id="1-基本思想-3"&gt;1. 基本思想&lt;/h3&gt;
&lt;p&gt;UMAP 也是一种&lt;strong&gt;非线性降维方法&lt;/strong&gt;，基于&lt;strong&gt;流形学习理论&lt;/strong&gt;。&lt;br&gt;
它假设数据分布在一个低维流形上，通过图论建模与优化实现降维。&lt;/p&gt;
&lt;h3 id="2-核心流程"&gt;2. 核心流程&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;在高维空间构建邻接图（保留局部关系）&lt;/li&gt;
&lt;li&gt;在低维空间建立对应图&lt;/li&gt;
&lt;li&gt;通过优化两图的相似性，保持局部与全局结构&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="3-优点"&gt;3. 优点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;比 t-SNE 更快、可扩展性更强&lt;/li&gt;
&lt;li&gt;可保留更多全局结构&lt;/li&gt;
&lt;li&gt;可用于聚类、嵌入或可视化&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="六方法对比"&gt;六、方法对比&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;类型&lt;/th&gt;
&lt;th&gt;是否监督&lt;/th&gt;
&lt;th&gt;保留结构&lt;/th&gt;
&lt;th&gt;应用场景&lt;/th&gt;
&lt;th&gt;优点&lt;/th&gt;
&lt;th&gt;缺点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;PCA&lt;/td&gt;
&lt;td&gt;线性&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;全局&lt;/td&gt;
&lt;td&gt;特征压缩、预处理&lt;/td&gt;
&lt;td&gt;简单高效&lt;/td&gt;
&lt;td&gt;仅限线性结构&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LDA&lt;/td&gt;
&lt;td&gt;线性&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;类间/类内&lt;/td&gt;
&lt;td&gt;分类前降维&lt;/td&gt;
&lt;td&gt;利用标签信息&lt;/td&gt;
&lt;td&gt;类别数限制&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;t-SNE&lt;/td&gt;
&lt;td&gt;非线性&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;局部&lt;/td&gt;
&lt;td&gt;可视化&lt;/td&gt;
&lt;td&gt;展示聚类效果佳&lt;/td&gt;
&lt;td&gt;计算慢&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;UMAP&lt;/td&gt;
&lt;td&gt;非线性&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;局部+全局&lt;/td&gt;
&lt;td&gt;可视化、聚类&lt;/td&gt;
&lt;td&gt;快速可扩展&lt;/td&gt;
&lt;td&gt;参数敏感&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="七实践建议"&gt;七、实践建议&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;PCA&lt;/strong&gt;：用于预处理和特征压缩；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LDA&lt;/strong&gt;：用于有监督分类任务前的降维；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;t-SNE / UMAP&lt;/strong&gt;：用于高维数据的可视化与结构探索。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;常见实践流程：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;数据标准化（StandardScaler）&lt;/li&gt;
&lt;li&gt;先用 PCA 降到中等维度&lt;/li&gt;
&lt;li&gt;再用 t-SNE 或 UMAP 可视化&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;</description></item></channel></rss>