图像熵及各向异性

熵的物理定义

熵,热力学中表征物质状态的参量之一,其物理意义是体系混乱程度的度量。

信息熵
信息熵的定义

信息理论的鼻祖之一Claude E. Shannon把信息(熵)定义为离散随机事件的出现概率。本质上是对我们司空见惯的“不确定性现象”的数学化度量,单位为:比特(bit)。

信息熵的公式定义

信息熵的公式定义如下:
H(x)=−∑x∈χp(x)log⁡2p(x)(1)H(x) = -\sum_{x\in\chi}p(x)\log_2p(x) \tag{1} H(x)=xχp(x)log2p(x)(1)
并且规定0log⁡2(0)=00\log_2(0) = 00log2(0)=0

首次看到这个定义,我们会感到奇怪,为什么熵要定义成这么复杂的形式,并且其中还出现了对数函数这种非常不直观的表述?

首先,我们看下用概率来描述信息量的重要性质:

1:事件发生的概率越低,则信息量越大;

2:事件发生的概率越高,则信息量越小;

3:多个事件同时发生的概率是多个事件概率相乘,总信息量是多个事件信息量相加。

通过前两点,我们知道信息量,信息量和概率之间一定是减函数的关系,第三点要求确定了对数关系

y=log⁡2(x)(2) y = \log_2(x) \tag{2}y=log2(x)(2)

这里的对数关系以及上述第三点其实非常好理解,即两件事情的信息量之和等于两件事情同时发生的信息量:

x1x_1x1x2x_2x2 同时发生的概率:P(x1,x2)=P(x1)×P(x2)P(x_1, x_2) = P(x_1) \times P(x_2)P(x1,x2)=P(x1)×P(x2)

x1x_1x1x2x_2x2 的总信息量: log⁡2(Px1,Px2)=log⁡2(Px1)+log⁡2(Px2)\log_2(P_{x1}, P_{x2}) = \log_2(P_{x1}) + \log_2(P_{x2})log2(Px1,Px2)=log2(Px1)+log2(Px2)

由此确定的信息量描述为:

I(x)=−log⁡2P(x) I(x) = -\log_2P(x) I(x)=log2P(x)

为什么第三点中给出了对数关系,下面进行证明:

f(x)f(x)f(x) 表示事件 AAA 发生时携带的信息量,其中,xxx 为事件 AAA 发生的概率,则有:

lim⁡r→0f(r)=+∞\lim_{r \rightarrow 0}f(r) = +\inftyr0limf(r)=+

f(1)=0f(1) = 0 f(1)=0

f(x1,x2)=f(x1)+f(x2)x1,x2∈(0,1]f(x_1, x_2) = f(x_1) + f(x_2) \quad x_1, x_2 \in (0,1] f(x1,x2)=f(x1)+f(x2)x1,x2(0,1]

然后这就成了一道我们都很熟悉的数学题:

已知f(x)f(x)f(x)定义域 x∈(0,1]x\in(0,1]x(0,1],可导,且满足f(xy)=f(x)+f(y)f(xy)=f(x)+f(y)f(xy)=f(x)+f(y),求f(x)f(x)f(x)

是的,这是一个函数方程,把它解出来就是答案!说到这里,很多人就觉得容易了,我这里仅给出一个推导,实际的解法有太多。

x=y=1x=y=1x=y=1,则有:

f(1)=f(1)+f(1)f(1)=f(1)+f(1)f(1)=f(1)+f(1),所以f(1)=0f(1)=0f(1)=0,显然这是一个可推导出的结论。

根据牛顿-莱布尼茨公式:
f(1)−f(x)=∫x1f′(t)dt(3 - 1)f(1) - f(x) = \int_x^1f'(t)dt \tag{3 - 1}f(1)f(x)=x1f(t)dt(3 - 1)

=∫x1f(t+dt)−f(t)dtdt(3 - 2) = \int_x^1\frac{f(t + dt) - f(t)}{dt} dt \tag{3 - 2}=x1dtf(t+dt)f(t)dt(3 - 2)

乘以ttt 再除以 ttt,则原值保持不变:
=∫x1f(tt+dtt)−f(t)dtdt(3 - 3) = \int_x^1 \frac{f(t\frac{t + dt}t) - f(t)}{dt} dt \tag{3 - 3} =x1dtf(ttt+dt)f(t)dt(3 - 3)

因为,满足 f(xy)=f(x)+f(y)f(xy)=f(x)+f(y)f(xy)=f(x)+f(y),所以得出下式:

=∫x1f(t)+f(1+dtt)−f(t)dtdt(3 - 4) = \int_x^1 \frac {f(t) + f(1 + \frac {dt} t) - f(t)} {dt} dt \tag{3 - 4}=x1dtf(t)+f(1+tdt)f(t)dt(3 - 4)

=∫x1f(1+dtt)dtdt(3 - 5) = \int_x^1 \frac {f(1 + \frac{dt} t)} {dt} dt \tag{3 - 5}=x1dtf(1+tdt)dt(3 - 5)

将式(3−5)(3 - 5)(35)中的分母,同时除以 ttt 再乘以 ttt 得到下式:

=∫x1f(1+dtt)tdttdt(3 - 6) = \int_x^1 \frac{f(1 + \frac {dt}t)} {t \frac{dt}t} dt \tag{3 - 6}=x1ttdtf(1+tdt)dt(3 - 6)

=∫x11tf(1+dtt)dttdt(3 - 7) = \int_x^1 \frac 1t \frac {f(1 + \frac {dt} t)}{\frac{dt}t} dt \tag{3 - 7}=x1t1tdtf(1+tdt)dt(3 - 7)

因为,f(1)=0f(1) = 0f(1)=0,所以,将上式(3−7)(3 - 7)(37)转化为以下形式:

=∫x11tf(1+dtt)−f(1)dttdt(3 - 8) = \int_x^1 \frac 1t \frac {f(1 + \frac {dt} t) - f(1)}{\frac{dt}t} dt \tag{3 - 8}=x1t1tdtf(1+tdt)f(1)dt(3 - 8)

根据基本求导公式:
由于 lim⁡dt→0dtt=0\lim_{dt \rightarrow 0} \frac{dt}t = 0limdt0tdt=0,所以,将式(3−8)(3 - 8)(38)可转化为以下形式:

=∫x11tf′(1)dt(3 - 9) = \int_x^1 \frac 1t f'(1)dt \tag{3 - 9}=x1t1f(1)dt(3 - 9)

所以,

f(1)−f(x)=∫x11tf′(1)dt(3 - 10) f(1) - f(x) = \int_x^1 \frac 1t f'(1)dt \tag{3 - 10}f(1)f(x)=x1t1f(1)dt(3 - 10)

因为, f(1)=0f(1) = 0f(1)=0,所以

0−f(x)=∫x11tf′(1)dt=f′(1)∫x11tdt(3 - 11) 0 - f(x) = \int_x^1 \frac 1t f'(1) dt = f'(1) \int_x^1 \frac 1t dt \tag{3 - 11}0f(x)=x1t1f(1)dt=f(1)x1t1dt(3 - 11)

根据牛顿-莱布尼茨公式,对上述公式进行如下转换:
0−f(x)=f′(1)∫x11tdt=f′(1)(ln(1)−ln(x))=−f′(1)lnx 0 - f(x) = f'(1) \int_x^1 \frac 1t dt = f'(1)(ln(1) - ln(x)) = -f'(1)lnx0f(x)=f(1)x1t1dt=f(1)(ln(1)ln(x))=f(1)lnx

即,

−f(x)=−f′(1)lnx -f(x) = -f'(1)lnx f(x)=f(1)lnx

所以,

f(x)=f′(1)lnxx∈(0,1](3 - 12)f(x) = f'(1)lnx \quad x\in (0,1] \tag{3 - 12}f(x)=f(1)lnxx(0,1](3 - 12)

到此基本推导已经完成,由于底数 eee 不具有一般性,因此,使用换底公式来归一化一下,则上式变换为以下形式:

f(x)=f′(1)log⁡aelog⁡ax(3 - 13)f(x) = \frac {f'(1)} {\log_a e} \log_a x \tag{3 - 13} f(x)=logaef(1)logax(3 - 13)

γ=f′(1)log⁡ae\gamma = \frac{f'(1)}{\log_a e}γ=logaef(1),上式两边同时乘以 γ\gammaγ,有:

F(x)=γf(x)=log⁡ax(3 - 14)F(x) = \gamma f(x) = \log_a x \tag{3 - 14}F(x)=γf(x)=logax(3 - 14)

其中,F(x)F(x)F(x) 叫做信息量,γ\gammaγ 是缩放系数。最后的这个缩放系数可以理解成信息量的单位,不管最终的 log⁡a\log_aloga 中的底数 aaa 是多少,只要 aaa 是确定的,那么以 aaa 为底数度量的信息量的比例都是一致的,也就是说它们是相似的。鉴于不同事件发生的信息量是一个相对值,所以说,这里可以忽略这个缩放系数 γ\gammaγ,最终信息量记为:

f(x)=log⁡ax(3 - 15)f(x)= \log_a x \tag{3 - 15}f(x)=logax(3 - 15)

因为,上述公式中的 xxx 为概率,取值范围为 x∈[0,1]x \in [0, 1]x[0,1],所以,logax≤0log_a x \le 0logax0,但根据信息熵的非负性,所以,上述公式为:

f(x)=−log⁡ax(3 - 16) f(x) = -\log_a x \tag{3 - 16}f(x)=logax(3 - 16)

此时,证明完毕。

由于信息量可描述为:

I(x)=−log⁡2P(x) I(x) = -\log_2P(x) I(x)=log2P(x)

既然有了一件事发生的信息量的数学描述,给出事件确实发生后信息量的数学期望就简单了,它便可以被描述为:

H(x)=E(I(x))=∑in(−P(xi)log⁡2(xi)) H(x) = E(I(x)) = \sum_i^n (-P(x_i)\log_2(x_i))H(x)=E(I(x))=in(P(xi)log2(xi))

这很好理解,事件发生的形式拥有不同的概率,每种可能性发生后的信息量乘以它发生的概率,将其加起来,就是事件发生后总信息量的数学期望。

以上就是关于信息的数学描述,首先我们要明白用对数可以定义一件特定事件发生后的信息量,其次我们要知道一个事件按照不同概率的特定形式发生后的信息量的数学期望。

接下来我来针对这些数学式子做一个现代解释。

信息论的二进制解释

现代计算机科学强调一切都是比特 bitbitbit,那么如果我们想描述一个信息,显而易见的形式当然是bitbitbit。所谓的信息量就是用多少 bitbitbit 可以描述一个事件。这件事不妨反过来理解,我来理一下:

1个 bitbitbit 可以描述 2 个事件;

2个 bitbitbit 可以描述 4 个事件;

3个 bitbitbit 可以描述 8 个事件;

nnnbitbitbit 可以描述 mmm 个事件;

现在我们来看下 nnnmmm 的关系:

m=2n m = 2^nm=2n
n=log⁡2m n = \log_2m n=log2m
我们把式子整理一下,得到下式:
n=−log⁡21m n = -\log_2 \frac 1m n=log2m1

此处,mmm 中可能性提出负号整理之后变成了1m\frac 1mm1 的概率,符合香农的公式形式和含义。从这个二进制的意义上去理解信息论中信息量的式子,是不是更简单呢。

牛顿-莱布尼茨公式

牛顿-莱布尼兹公式(Newton-Leibniz formula),通常也被称为微积分基本定理,揭示了定积分与被积函数的原函数或者不定积分之间的联系。

定义

如果函数 f(x)f(x)f(x) 在区间 [a,b][a, b][a,b] 上连续,且存在原函数 F(x)F(x)F(x), 则

∫abf(x)dx=F(a)−F(b)=F(x)∣ab \int_a^b f(x)dx = F(a) - F(b) = F(x)|_a^b abf(x)dx=F(a)F(b)=F(x)ab

基本求导公式

给出自变增量 Δx≠0\Delta x \ne 0Δx=0;

得出函数增量 Δy=f(x+Δx)−f(x)\Delta y = f(x + \Delta x) - f(x)Δy=f(x+Δx)f(x);

作商 ΔyΔx\frac {\Delta y} {\Delta x}ΔxΔy;

求极限 lim⁡Δx→0ΔyΔx=f′(x)\lim_{\Delta x \rightarrow 0}\frac {\Delta y} {\Delta x} = f'(x)limΔx0ΔxΔy=f(x)

信息熵的性质

1: 对称性, 即 f(p1,p2,p3⋯ ,pn)=f(pk(1),pk(2),pk(3)⋯ ,pk(n))f(p_1,p_2,p_3\cdots,p_n) = f(p_{k(1)},p_{k(2)}, p_{k(3)}\cdots, p_{k(n)})f(p1,p2,p3,pn)=f(pk(1),pk(2),pk(3),pk(n)),信息熵是定义在随机变量的概率分布之上,因此信息熵对具体事件的取值并不关心,即使对随机变量的取值进行交换或者打散,甚至完全替换,只要分布不变,那么信息的度量信息熵就不会发生变化;

2:非负性:即H(x)≥0H(x)\ge 0H(x)0

3:可加性:多随机事件同时发生存在的总不确定性的量度是可以表示为各事件不确定性的量度的和,即H(X,Y)=H(X)+H(X∣Y)H(X,Y) = H(X) + H(X|Y)H(X,Y)=H(X)+H(XY)

4:条件减少熵 H(X∣Y)≤H(X)H(X|Y) \le H(X)H(XY)H(X) ,当人们拥有关于另外一个随机系统的知识的时候,对于人们所关注的随机系统来说,它剩下的不确定性一定不会增加,至少是保持不变,一般情况下不确定性会减少;

5:最大离散熵定理,即

f(p1,p2,p3,⋯ ,pn)≤f(1N,1N,⋯ ,1N)=log⁡(N)=log⁡(∣X∣) f(p_1, p_2, p_3, \cdots, p_n) \le f(\frac 1N, \frac 1N, \cdots, \frac 1N) = \log(N) = \log(|X|) f(p1,p2,p3,,pn)f(N1,N1,,N1)=log(N)=log(X)

信息熵的数学意义

信息论中认为熵是表征对象运动状态有序程度的一种度量,熵越大时,表明无序的程度越高,反之,则认为有序的程度越高。在图像处理中,可以根据图像的各个像素点的灰度分布的有序性,定义图像的局部熵,它反映了图像信息丰富的程度,并以此判定噪声的情况

根据 Shannon 信息论的定义,某件事出现的概率为 ppp,则信息量定义为:I=−log⁡2P(0≤p≤1)I = -\log_2P(0 \le p \le 1)I=log2P(0p1)。描述事物的不确切的量称为“熵”,它代表了平均信息量。“熵”表示一个系统的混乱无序的状态,而信息则正好相反,它量事物有序的度量。

如果 NNN 个事件中的第 iii 个事件发生的概率是 pip_ipi,满足条件 ∑pi=1\sum p_i = 1pi=1,那么信息熵的大小可以表示为每个单独事件信息量的加权和,H=−∑pilog⁡2piH = -\sum p_i\log_2 p_iH=pilog2pi。我们可以从这样的角度来理解,ppp 为事件出现的概率,而 log⁡2p\log_2 plog2p 可以理解为一个“信息因子”,信息因子之所以用 222 为底的对数来表示,是试图将 ppp 量化为以二进制为单位的信息量,表示信道容量所占用的二进制位数宽度。例如一个事件的 p=11024p = \frac 1 {1024}p=10241, 那么其信息量为 101010,也就是需要的信道容量为 101010 位二进制数位。由于ppp 是小于等于 111 的,那么,log⁡2p\log_2plog2p 是负信息因子,因而代表事物在形式特点上的不确定性。所以,事件发生的概率越小,其包含的信息量就越大,其不确定性程度就越高,按照乘法的含义:事件不确定性乘以其发生的概率,代表事物具体表现出来的不确定量,再取绝对值就是:−log⁡2p-\log_2plog2p,这就是形式上的不确定量。事物表现出来的形式上的不确定量,就是信息熵的概念。

图像的熵

定义:

图像的熵,是一种图像特征的统计形式,反映了图像中平均信息量的多少。

图像的一维熵

图像的一维熵表示图像中灰度分布的聚集特征所包含的信息量,令 PiP_iPi 表示图像中灰度值为 iii 的像素所占的比例,则定义一元灰度熵为:

H=∑i=0255Pilog⁡Pi H = \sum_{i=0}^{255} P_i\log P_i H=i=0255PilogPi

其中,H 为一元灰度熵,PiP_iPi 为灰度值 iii 所占的比例。

图像的二维熵
注:图像的二维熵,实际操作中没有用到,只做了解

图像的一维熵可以表示图像灰度分布的聚集特征,却不能反映图像灰度分布的空间特征,为了表征这种空间特征,可以在一维熵的基础上引入能够反映灰度分布空间特征的特征量来组成图像的二维熵。选择图像的邻域灰度均值作为灰度分布的空间特征量,与图像的像素灰度组成特征二元组,记为 (i, j)(i, j)(i, j) ,其中 iii 表示像素的灰度值 (0≤i≤ 255)(0 \le i \le 255)(0i 255)jjj 表示邻域灰度均值(0 ≤ j ≤ 255)(0 \le j \le 255)(0  j  255)

Pi,j=f(i,j)N2 P_{i, j} = \frac{f(i, j)}{N^2} Pi,j=N2f(i,j)

上式能反应某像素位置上的灰度值与其周围像素灰度分布的综合特征,其中f(i,j)f(i, j)f(i,j) 为特征二元组(i,j)(i, j)(i,j) 出现的频数,NNN 为图像的尺度。

图像二维熵的定义:

H=∑i,j255Pi,jlog⁡Pi,j H = \sum_{i, j}^{255}P_{i,j} \log P_{i, j} H=i,j255Pi,jlogPi,j

总结

图像熵反映了图像包含的信息量:

  • 当图像为纯色图时(白或黑),只有一个灰度值,此时熵最小,H=0H=0H=0,图像的信息量为0;因为图像为纯色时,说明图像不包含任何的目标,信息量为 000

  • 当图像包含 NNN 个灰度值时,即图像每个像素的灰度值都不同,此时熵最大,H=log⁡2NH = \log_2 NH=log2N,图像的信息量最大;

此时,图像每个像素灰度都不同,可以认为图像每个单一像素都是一个独立地物目标,信息量为最大 NNN,类似于地图充满了物体;

故:图像的熵H越大,图像包含的像素灰度越丰富,灰度分布越均匀,图像的地物目标越多,图像的信息量越大,反之则反;

一副图像,当每个像素的灰度都不同时,此时的熵最大。

各向异性

各向性的物理定义

各向异性是指物质的全部或部分化学、物理等性质随着方向的改变而有所变化,在不同的方向上呈现出差异的性质。各向异性是材料和介质中常见的性质,在尺度上有很大差异,从晶体到日常生活中各种材料,再到地球介质,都具有各向异性。值得注意的是,各向异性与非均匀性是从两个不同的角度对物质进行的描述,不可等同。

各向同性和各向异性

各向同性和各向异性是指物理性质在不同的方向进行测量得到的结论。如果各个方向的测量结果是相同的,说明其物理性质与取向无关,就称为各向同性。如果物理性质和取向密切相关,不同取向的测量结果迥异,就称为各向异性。

物理性质可以在不同的方向进行测量。如果各个方向的测量结果是相同的,说明其物理性质与取向无关,就称为各向同性。如果物理性质和取向密切相关,不同取向的测量结果迥异,就称为各向异性。造成这种差别的内在因素是材料结构的对称性。在气体、液体或非晶态固体中,原子排列是混乱的,因而就各个方向而言,统计结果是等同的,所以其物理性质必然是各向同性的。而晶体中原子具有规则排列,结构上等同的方向只限于晶体对称性所决定的某些特定方向。所以一般而言,物理性质是各向异性的。

图像的各向异性

对图像来说,各向异性就是在每个像素点周围四个方向上梯度变化都不一样。
在 Halcon 中,该特征用于判断图像灰度的对称性。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐