从本节开始将介绍同为概率生成模型的隐马尔可夫模型(Hidden Markov Model,HMM)。在介绍隐马尔可夫模型之前,对概率模型的整个逻辑进行阶段性介绍。
在极大似然估计与最大后验概率估计中介绍过,频率学派的思想是将概率模型 P ( X ∣ θ ) P(\mathcal X \mid \theta) P(X∣θ)中的参数 θ \theta θ视作一个未知常量,通过求解 θ \theta θ实现求解概率模型 P ( X ∣ θ ) P(\mathcal X \mid \theta) P(X∣θ)。
频率学派针对的核心问题可看作是优化问题。何为优化问题?
它的具体流程可以表示如下:
首先,针对具体任务,将模型(Model)定义出来;
基于模型,结合任务以及样本点的性质,构建出相应的策略(Strategy):它是关于衡量模型参数的工具,即通过构建损失函数(Loss Function)来描述模型参数 θ \theta θ 和任务结果 之间的关联关系。
算法部分,针对构建好的策略,求解最优模型参数
θ
^
\hat \theta
θ^,从而求解概率模型
P
(
X
∣
θ
)
P(\mathcal X \mid \theta)
P(X∣θ)。
常见的模型参数求解方法有:
基于贝叶斯学派延伸的体系被称作概率图模型。它对应的概率模型 P ( X ∣ θ ) P(\mathcal X \mid \theta) P(X∣θ)的求解主要通过两步操作:
针对 P ( Z ∣ X ) P(\mathcal Z \mid \mathcal X) P(Z∣X)的求解被称为推断(Inference)。在之前介绍过的EM算法中就介绍了两种情况:
狭义EM算法:
P
(
Z
∣
X
,
θ
)
P(\mathcal Z \mid \mathcal X,\theta)
P(Z∣X,θ)可直接求解:
Q
(
Z
)
=
P
(
Z
∣
X
,
θ
(
t
)
)
\mathcal Q(\mathcal Z) = P(\mathcal Z \mid \mathcal X,\theta^{(t)})
Q(Z)=P(Z∣X,θ(t))
广义EM算法:由于
P
(
Z
∣
X
,
θ
)
P(\mathcal Z \mid \mathcal X,\theta)
P(Z∣X,θ)在定义过程中就十分复杂,导致其不可直接求解。广义EM就通过 最小化
K
L
\mathcal K\mathcal L
KL散度的方式求解
P
(
Z
∣
X
,
θ
)
P(\mathcal Z \mid \mathcal X,\theta)
P(Z∣X,θ)的近似解:
Q
^
(
t
+
1
)
(
Z
)
=
arg
min
Q
(
Z
)
K
L
[
Q
(
Z
)
∣
∣
P
(
Z
∣
X
,
θ
(
t
)
)
]
=
arg
max
Q
(
Z
)
∫
Z
Q
(
Z
)
log
P
(
X
,
Z
∣
θ
)
Q
(
Z
)
d
Z
ˆQ(t+1)(Z)=argminQ(Z)KL[Q(Z)||P(Z∣X,θ(t))]=argmaxQ(Z)∫ZQ(Z)logP(X,Z∣θ)Q(Z)dZ
Q^(t+1)(Z)=Q(Z)argminKL[Q(Z)∣∣P(Z∣X,θ(t))]=Q(Z)argmax∫ZQ(Z)logQ(Z)P(X,Z∣θ)dZ
实际上,求解 P ( Z ∣ X , θ ) P(\mathcal Z \mid \mathcal X,\theta) P(Z∣X,θ)近似解的方式有很多种,如确定性近似的代表:变分推断(Variational Inference,VI),随机性近似的代表:马尔可夫链蒙特卡洛方法(Markov Chain Monte Karlo,MCMC),在后续的笔记中将会介绍。
概率图,本质上是将数据结构中的图结构(Graph)赋予概率的意义。既然是图模型,自然分有向图和无向图。
如果将概率图模型添加一个其他维度的特征信息。如时间序列信息,可以将静态概率图模型延伸至动态概率图模型。
在高斯混合模型(Gaussain Mixture Model,GMM)中,从生成模型角度观察,概率模型
P
(
X
∣
θ
)
P(\mathcal X \mid \theta)
P(X∣θ)中生成的样本
x
(
i
)
(
i
=
1
,
2
,
⋯
,
N
)
x^{(i)}(i=1,2,\cdots,N)
x(i)(i=1,2,⋯,N),各样本之间独立同分布。即:
可以描述为:各样本
x
(
i
)
(
i
=
1
,
2
,
⋯
,
N
)
x^{(i)}(i=1,2,\cdots,N)
x(i)(i=1,2,⋯,N)之间相互独立并且均服从
P
(
X
∣
θ
)
P(\mathcal X \mid \theta)
P(X∣θ)分布。
x
(
i
)
∼
i.i.d.
P
(
X
∣
θ
)
x^{(i)} \overset{\text{i.i.d.}}{\sim} P(\mathcal X \mid \theta)
x(i)∼i.i.d.P(X∣θ)
并且高斯混合模型中一旦样本
x
(
i
)
x^{(i)}
x(i)从概率模型
P
(
X
∣
θ
)
P(\mathcal X \mid \theta)
P(X∣θ)中生成出来后,就 被固定住,不再发生变化;
相反,什么情况下概率模型
P
(
X
∣
θ
)
P(\mathcal X \mid \theta)
P(X∣θ)生成出的样本
x
(
i
)
x^{(i)}
x(i)会发生变化?
以高斯混合模型为例,介绍不发生变化的情况。
观察高斯混合模型的概率图表示如下(左图):

和上述逻辑相反,以时间特征信息为例,如果 隐变量 Z \mathcal Z Z随着时间的变化而变化,从而影响 X \mathcal X X的变化。那么称满足这种现象的概率图模型为动态概率图模型。
我们称上述右图中有序的隐变量组成的集合称为系统状态(System State),它是由不同状态下的隐变量 Z \mathcal Z Z组成的。
综上,我们观察到动态概率图模型包含两种特性:
后续简称动态模型(Dynamic Model)
如果将动态模型继续向下划分:
下一节将正式介绍隐马尔可夫模型。
相关参考:
机器学习-隐马尔可夫模型1-背景介绍