主成分分析（PCA）原理总结

最新推荐文章于 2025-04-09 23:28:36 发布

ASS-ASH

最新推荐文章于 2025-04-09 23:28:36 发布

阅读量3k

点赞数

分类专栏：无监督学习文章标签：机器学习 python 算法

本文链接：https://blog.youkuaiyun.com/qq_38563206/article/details/120707521

版权

PCA（主成分分析）是一种重要的降维技术，常用于数据压缩和噪声消除。其基本思想是找到数据的主要方面来代表原始数据，通过最大化样本点在新维度上的投影差异或最小化到超平面的距离实现。PCA算法简单，仅需特征值分解，但可能丢失小方差特征信息，且新特征的解释性较弱。PCA的变种包括KPCA、IncrementalPCA和SparsePCA等，分别解决了非线性、内存限制和稀疏数据的问题。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

主成分分析（Principal components analysis，以下简称PCA）是最重要的降维方法之一。在数据压缩消除冗余和数据噪音消除等领域都有广泛的应用。一般我们提到降维最容易想到的算法就是PCA，下面我们就对PCA的原理做一个总结。

1. PCA的思想

　　　　PCA顾名思义，就是找出数据里最主要的方面，用数据里最主要的方面来代替原始数据。具体的，假如我们的数据集是n维的，共有m个数据(x(1),x(2),...,x(m))(x(1),x(2),...,x(m))。我们希望将这m个数据的维度从n维降到n'维，希望这m个n'维的数据集尽可能的代表原始数据集。我们知道数据从n维降到n'维肯定会有损失，但是我们希望损失尽可能的小。那么如何让这n'维的数据尽可能表示原来的数据呢？

　　　　我们先看看最简单的情况，也就是n=2，n'=1,也就是将数据从二维降维到一维。数据如下图。我们希望找到某一个维度方向，它可以代表这两个维度的数据。图中列了两个向量方向，u1u1和u2u2，那么哪个向量可以更好的代表原始数据集呢？从直观上也可以看出，u1u1比u2u2好。