sklearn库中的gmm模型(高斯混合模型GMM)

本文目录
高斯混合模型GMM
最近在学习语音识别,由于传统的基于HMM-GMM架构的语音识别具有成熟的理论、工具链,且其一直以来神秘感让人十分好奇;所以我打算从传统框架入手学习,并尝试认真地弄懂相关技术;在看了一些语音识别相关简介后,知道虽然GMM模型在很多年前,在”混合模型“(hybrid model)中就被DNN所取代了;甚至在当今深度学习背景下,HMM也有被完全取代的趋势;但是从学习的角度,我觉得GMM仍然是很好的学习材料。
其中:D为数据空间的维数,K为混合分支个数
在 多元正态分布 文中,中我们证实了 的积分为1,在这里由积分的线性性质有:
所以需要 ,且为了保证概率都为正数,这里还要求 都大于0,这时 成为合法的密度函数。
下面关于参数的极大似然估计主要学习PRML书中的相关讨论,这里我只是补充了一些推导过程中的数学细节,这些数学细节书上一般不会写出来,所以这里我决定自己推推看,让心里更加踏实。
为了不至于使得下面ML估计的公式推导太乱,我们在这里提前把部分相关的导数计算好。
1. 设二次型为 ,其中 为D维列向量,而 为D阶方阵,而 为点 处的切空间(tangent space)中的向量,根据下式:
显然 是关于切空间中向量 的线性函数;且 显然是关于 的高阶部分,即当 时, 。
即:
以上便是函数的可微性定义,因而导数(雅可比矩阵)为: 。
进而,若 是对称矩阵,则
2. 同样是上面的二次型,这次我们把参数矩阵看作变量,即 ,有: ,写成矩阵形式就有:
3. 行列式的求导,行列式函数: ,是n阶实方阵空间上的实值函数;事实上我们直接将行列式看作原型是 的函数即可,因为这里我们关心的求导运算跟矩阵的代数运算没有关系,因此可以忽略其结构;从线代课本可知有两种方式定义行列式:
1)组合式定义: ,其中 是n阶方阵, 是n元对称群, 是其中任取的置换,也可以将 看作 的一个全排列,而 是全排列 的符号。
2)递归定义,按第k行展开:
其中: 是矩阵的第k行第j列元素, 是元素 对应的余子式,而记 为元素 的代数余子式。
在这里应该用递归定义比较方便,比如要对元素 求导: 来自第 行、第 列,又因为按照行列式的递归定义(3)式,同样的第 行,但是不同的列 上的元素 的余子式 显然不会包括当前被求导元素 ,因为它不会包含第 行除了 以外的任何元素。因此,我们有:
即行列式关于第 元素的偏导数,就是该元素对应的代数余子式。因此把所有的偏导数整理到矩阵里面,就有:
其中 为 的伴随矩阵的转置。
再次,若 为对称矩阵,且可逆,则根据公式 有: ,即 的伴随矩阵也是对称的。
现在我们用一组数据 来拟合GMM模型,假设数据之间是独立的,则该组数据在模型上的对数似然为:
下面根据微分学计算该似然函数取得极大值的必要条件,由于需要满足约束 ,根据Lagrange乘子法,求下面关于参数 的函数 的极大值点:
先对 求导 ,根据多元复合函数的链式求导法则,有:
,其中 为密度函数指数部分的二次型,即:
令 ,则: ,其中:根据之前的推导,雅可比矩阵 ,而雅可比矩阵 ,所以: 。
按照书中所说将 定义为 关于隐变量的后验概率,则(6)式变为: ,写成梯度形式,就有: ,令其等于 ,并利用 的非奇异性,两边同时左乘 ,将其解出来得:
下面对协方差矩阵求导: 为了保持一致,我们还是用 代替 作为行列式函数;但是这里为了方便,我们不直接对协方差矩阵求导,而是对其逆矩阵求导,我们令 ,重写一遍(0)式:
在上式中,令 ,则根据乘法求导法则有:
其中,根据上面的(4)式有:
因为 是对称矩阵,故而 也是对称矩阵(由 易知),再利用上面证过的(5)式就得到了上式。
令其乘以 ,有:
再利用上面证好的(2)式,有:
其中:
同样,令其乘以 ,有:
最后将(9),(10)两式代入(8)式,整理整理就得到:
令其等于 ,且注意到 ,我们得到:
最后,我们对混合系数 求导:
我们发现其中: 与 只相差一个 ,令 ,并在等式两边同乘以 得:
现在,对一个特定的k,将 代入(11)式,得:
由于无法闭式求解,可以用EM算法来迭代式地拉高数据在模型参数上的似然,抄一抄书本上的算法,加深一下印象:
1. 初始化GMM所有分支的均值向量 、协方差矩阵 ,以及各分支的混合系数 ;
2. E Step : 固定当前模型参数,计算 ,即书上所说的分支 要为解释数据 承担的那部分责任,即后验概率分布:
3. M Step : 利用当前的后验概率分布,重新估计模型的所有参数:
4. 计算对数似然:
检查参数或者对数似然值是否已经达到收敛条件;若否,返回第2步,继续训练。
动态面板gmm模型适合于什么数据
1、面板数据:具有多个时间点和多个个体(或观测单位)的数据集,例如企业、个人、国家等。
2、动态面板数据:变量在时间上具有持续性,并且当前观测值与过去的观测值存在关联。
3、异质面板数据:在不同个体或观测单位之间存在差异,例如不同企业、不同个人、不同国家等。
GMM模型是什么
GMM模型即高斯混合模型。
GMM(Gaussian Mixture Model),高斯混合模型(或者混合高斯模型),也可以简写为MOG(Mixture of Gaussian)。
高斯模型就是用高斯概率密度函数(正态分布曲线)精确地量化事物,将一个事物分解为若干的基于高斯概率密度函数(正态分布曲线)形成的模型。
混合高斯模型使用K(基本为3到5个)个高斯模型来表征图像中各个像素点的特征,在新一帧图像获得后更新混合高斯模型, 用当前图像中的每个像素点与混合高斯模型匹配,如果成功则判定该点为背景点, 否则为前景点。 通观整个高斯模型,主要是有方差和均值两个参数决定,对均值和方差的学习,采取不同的学习机制,将直接影响到模型的稳定性、精确性和收敛性 。由于我们是对运动目标的背景提取建模,因此需要对高斯模型中方差和均值两个参数实时更新。为提高模型的学习能力,改进方法对均值和方差的更新采用不同的学习率;为提高在繁忙的场景下,大而慢的运动目标的检测效果,引入权值均值的概念,建立背景图像并实时更新,然后结合权值、权值均值和背景图像对像素点进行前景和背景的分类。
如何输出gmm模型的回归结果
GMM估计是用于解决内生性问题的一种方法,除此之外还有TSLS两阶段最小二乘回归。
如果存在异方差GMM的效率会优于TSLS,但通常情况下二者结论表现一致,很多时候研究者会认为数据或多或少存在异方差问题,因而可直接使用GMM估计。
内生变量是指与误差项相关的解释变量。对应还有一个术语叫‘外生变量’,其指与误差项不相关的解释变量。产生内生性的原因通常在三类,分别说明如下:
内生性问题的判断上,通常是使用Durbin-Wu-Hausman检验(SPSSAU在两阶段最小二乘回归结果中默认输出),当然很多时候会结合自身理论知识和直观专业性判断是否存在内生性问题。如果假定存在内生性问题时,直接使用两阶段最小二乘回归或者GMM估计即可。一般不建议完全依照检验进行判断是否存在内生性,结合检验和专业理论知识综合判断较为可取。
内生性问题的解决上,通常使用工具变量法,其基本思想在于选取这样一类变量(工具变量),它们的特征为:工具变量与内生变量有着相关(如果相关性很低则称为弱工具变量),但是工具变量与被解释变量基本没有相关关系。寻找适合的工具变量是一件困难的事情,解决内生性问题时,大量的工作用于寻找适合的工具变量。
关于引入工具变量的个数上,有如下说明:
过度识别和恰好识别是可以接受的,但不可识别这种情况无法进行建模,似想用一个工具变量去标识两个内生变量,这是不可以的。
工具变量引入时,有时还需要对工具变量外生性进行检验(过度识别检验),针对工具变量外生性检验上,SPSSAU提供Hansen J检验。特别提示,只有过度识别时才会输出此两个检验指标。
GMM估计类型参数说明如下:
案例说明
1 背景
本案例引入Mincer(1958)关于工资与受教育年限研究的数据。案例数据中包括以下信息,如下表格:
数据共有12项,其中编号为1,5,7,8,12共五项并不在考虑范畴。
本案例研究‘受教育年限’对于‘Ln工资’的影响。明显的,从理论上可能出现‘双向因果关系’即‘受教育年限’很可能是内生变量。那么可考虑使用‘母亲受教育年限’和‘成绩’这两项数据作为工具变量。同时研究时纳入3个外生变量,分别是‘婚姻’,‘是否大城市‘和’当前单位工作年限’。使用两阶段最小二乘TSLS回归进行解决内生性问题。
本案例研究时,工具变量为2个,内生变量为1个,因而为过度识别,可以正常进行TSLS回归。
2 理论
关于内生性的检验Durbin-Wu-Hausman检验(SPSSAU在两阶段最小二乘回归TSLS结果中默认输出),其用于检验是否真的为内生变量;如果说检验不通过(接受原假设),那么说明没有内生变量存在,可直接使用OLS回归即可。当然即使没有内生性,一般也可以使用TSLS回归或GMM估计,没有内生性问题时,OLS回归和TSLS回归,或GMM估计结论通常一致;
关于过度识别检验上,SPSSAU提供Hansen J检验,原理上此过度识别检验仅在‘过度识别’时才会输出,即工具变量个数》内生变量个数时,才会输出。
3 操作
本案例分别将被解释变量,内生变量,工具变量和外生变量纳入对应的模型框中,如下:
4 SPSSAU输出结果
SPSSAU共输出5类表格,分别是研究变量类型表格,GMM估计模型分析结果表格,GMM估计模型分析结果-简化格式表格,模型汇总(中间过程)表格和过度识别检验(overidentifying restrictions)。说明如下:
5 文字分析
上一表格展示本次研究时涉及的各变量属性,包括被解释变量,内生变量,工具变量和外生变量组成情况。
上表格列出GMM估计的最终结果,首先模型通过Wald 卡方检验(Wald χ² =272.418,p=0.000《0.05),意味着模型有效。同时R方值为0.341,意味着内生和外生变量对于工资的解释力度为34.1%。具体查看内生和外生变量对于被解释变量‘工资’的影响情况来看:
受教育年限的回归系数值为0.112(p=0.000《0.01),意味着受教育年限会对工资产生显著的正向影响关系。
婚姻(已婚为1)的回归系数值为0.168(p=0.000《0.01),意味着相对未婚群体来讲,已婚群体的工资水平明显会更高。
是否大城市(1为大城市)的回归系数值为0.145(p=0.000《0.01),意味着相对来讲,大城市样本群体,他们的工资水平明显会更高。
当前单位工作年限的回归系数值为0.036(p=0.000《0.01),意味着当前单位工作年限会对工资产生显著的正向影响关系。
总结分析可知:受教育年限, 婚姻,是否大城市, 当前单位工作年限全部均会对工资产生显著的正向影响关系。

更多文章:
tcp ip四层网络模型(TCP IP参考模型共分为四层:( )、网络层、传输层、应用层)
2026年10月10日 15:20
sql server数据库管理系统是基于(MS-SQL 是甚麼)
2026年10月10日 14:40
oracle11g安装和配置(oracle数据库安装在什么地方)
2026年10月10日 09:10
php安装图文(php页面加入图文编辑框,这是什么技术,请大师指点)
2026年10月10日 08:50






