稀疏表示是指任意一个信号都可以在一个过完备字典上稀疏线性表出。即,一个信号被分解为有限个信号的线性组合的形式,我们称之为稀疏表示。表达为公式为:y = Dα s.t.||α||0 < σ。
官方定义:
任意一个信号都可以在一个过完备字典上稀疏线性表出。
公式表示为:y = Dα s.t.||α||0 < σ,其中y表示任意信号,D表示过完备字典,α表示系数矩阵,||α||0表示α中非零元素的数量,σ是一个约定的阈值。
通俗解释:
以《红楼梦》和《新华字典》为例,《红楼梦》中的每一个汉字都能从《新华字典》里找到,但《红楼梦》一定没有用完一本《新华字典》中收录的每一个汉字。因此,可以说一套《红楼梦》中所有的汉字都能在《新华字典》中找到,并且《新华字典》中一定有《红楼梦》没用到的汉字。这类似于稀疏表示中的“信号可以在字典中找到表示,但字典中一定有信号没用到的元素”。
再以人脸识别为例,我们只需要记住特定的几个专属于朋友的特征(如下巴的痣、鼻子的形状等)就能认出朋友。这类似于稀疏表示中的“只需要从信号中找到有限个特征就能表示出整个信号”。
过完备性:
在三维坐标系中,任意三个互不相关的向量可以表示出空间中所有的向量。类似地,在信号空间中,至少n个互不相关的信号才能表示这个空间内所有信号。但当n足够大时,很难保证互不相关,因此只能增大信号数量,即m个信号(m>>n)来表示所有信号。这就是过完备性的含义,即字典中信号的个数要远远大于信号的长度。
稀疏表示可以显著减少数据存储和传输所需的空间。例如,一个长度为1024的信号可以表示为一个储存在本地的字典D和一个稀疏向量α。由于α中绝大部分位置上的数值为0,因此只需要记录非零值的位置和数值,从而大大减少存储和传输的数据量。
如图所示,一个1024×1的矩阵信号可以改写成32×32大小的信号矩阵,通过稀疏表示,可以将其表达为一个32×64的字典D和一个64×32的稀疏向量α。由于α中超过90%位置的数值为0,因此只需要传输非零值的位置和数值,从而节省了大量的数据传输流量。


稀疏表示在人脸识别中也有重要应用。由于每个人的面部特征具有特殊性,因此可以采用字典学习的方法从每个人的面部图片学习到特征,并组成字典D。在人脸识别时,将人脸与每个特征字典比对,通过特征的重合程度判断该图片中的人脸属于谁。
这是基于稀疏理论的人脸识别方法,即Sparse Representation Classification (SRC)的基础理论。

稀疏表示作为一种具有较强数学逻辑性的机器学习方法,已经广泛运用于图像处理、人脸识别、信号处理等多个学科门类中。通过稀疏表示,我们可以更有效地存储和传输数据,同时也可以在人脸识别等领域中实现更准确的识别。
