999精品在线视频,手机成人午夜在线视频,久久不卡国产精品无码,中日无码在线观看,成人av手机在线观看,日韩精品亚洲一区中文字幕,亚洲av无码人妻,四虎国产在线观看 ?

基于EM算法數(shù)據(jù)單變量缺失處理方法研究

2015-03-25 08:20:31
科技傳播 2015年20期
關(guān)鍵詞:數(shù)據(jù)處理方法

黃 鉉

電子科技大學(xué)成都學(xué)院微電子系,四川成都 610097

基于EM算法數(shù)據(jù)單變量缺失處理方法研究

黃 鉉

電子科技大學(xué)成都學(xué)院微電子系,四川成都 610097

數(shù)據(jù)分析方法大都針對完整數(shù)據(jù),而實(shí)際上由于一些原因,觀測數(shù)據(jù)常存在缺失。本文采用EM算法對正態(tài)分布下的隨機(jī)缺失數(shù)據(jù)的參數(shù)進(jìn)行估計(jì)。實(shí)驗(yàn)結(jié)果表明EM算法對正態(tài)分布下的單變量缺失數(shù)據(jù)有效果,但缺失數(shù)據(jù)比例過大時(shí)該方法處理欠佳,對大比例變量缺失的情況有待研究。

EM;缺失數(shù)據(jù);正態(tài)分布

近年來數(shù)據(jù)庫及計(jì)算機(jī)技術(shù)的發(fā)展推動(dòng)了數(shù)據(jù)挖掘技術(shù)廣泛地應(yīng)用于各個(gè)領(lǐng)域。目前,對數(shù)據(jù)進(jìn)行處理的各種數(shù)據(jù)挖掘方法幾乎都是以假設(shè)數(shù)據(jù)完整為前提條件。然而實(shí)際情況是數(shù)據(jù)庫里的數(shù)據(jù)往往不完整,數(shù)據(jù)缺失的情況時(shí)常發(fā)生。引起數(shù)據(jù)缺失的原因很多,比如:傳感器故障、數(shù)據(jù)傳輸中斷、監(jiān)測方式改變又或者人為因素等。如果直接對包含缺失數(shù)據(jù)的數(shù)據(jù)集進(jìn)行分析,結(jié)果會(huì)產(chǎn)生偏差會(huì)直接影響到后續(xù)的決策,因此對數(shù)據(jù)進(jìn)行分析前對缺失數(shù)據(jù)的處理尤為重要。

目前國內(nèi)外學(xué)者針對缺失數(shù)據(jù)的研究很多,也取得了一定的成果。其中,Rubin(1976)將缺失機(jī)制分為三類:完全隨機(jī)缺失(MCAR)是指變量出現(xiàn)缺失值的可能性與模型中其他變量無關(guān),與該變量自身也無關(guān),完全隨機(jī)缺失機(jī)制中缺失數(shù)據(jù)的分布與完整數(shù)據(jù)分布一致。隨機(jī)缺失(MAR)是指變量出現(xiàn)缺失值的可能性與模型中某些觀測變量有關(guān)而與該變量自身無關(guān)。對于隨機(jī)缺失機(jī)制,缺失數(shù)據(jù)可以通過完整數(shù)據(jù)來估計(jì)。非隨機(jī)缺失(MNAR)是指變量的缺失值僅與自身相關(guān)。單變量缺失是指數(shù)據(jù)集中只有某個(gè)變量出現(xiàn)信息不完整的情況,此時(shí)對缺失值處理首要考慮數(shù)據(jù)缺失機(jī)制,不同的缺失機(jī)制有不同的處理方法。比如成列刪除或者成對刪除的方法,如果數(shù)據(jù)為MCAR,減少的樣本其實(shí)是原樣本的一個(gè)隨機(jī)樣本,因此刪除后對剩下的數(shù)據(jù)進(jìn)行處理是無偏差的;但如果數(shù)據(jù)為MAR,那么這種處理方法則會(huì)產(chǎn)生有偏差的估計(jì)值。 本文主要研究數(shù)據(jù)單變量隨機(jī)缺失的情況。

單變量缺失處理方法

假設(shè)從樣本集中隨機(jī)抽取m個(gè)獨(dú)立樣本:(X(1),X(2),…,X(m)),每個(gè)樣本之間獨(dú)立。對于每個(gè)樣本Z(i)為其隱含變量,要估計(jì)P(X,Z)的參數(shù)θ。

EM(Expectation-maximization)算法有兩步E步和M步,其中E步在觀測數(shù)據(jù)和現(xiàn)有條件下求缺失數(shù)據(jù)的期望,假設(shè)迭代的初始值為0θ,第一次迭代E步就是在觀測數(shù)據(jù)和0θ下求完整數(shù)據(jù)的似然函數(shù)的期望,在已知

0θ時(shí)估計(jì)參數(shù)可以通過似然函數(shù)

求得,其中P(θ|Xobs) 表示未知參數(shù)θ的后驗(yàn)分布,P(θ|Xobs, Xmis)表示未知參數(shù)θ在完整數(shù)據(jù)下的后驗(yàn)分布。

M步中將E步中求的缺失數(shù)據(jù)的期望極大化,θ?(1)=argmax L(1)(θ|θ(0));這就是第1次迭代后通過的第2次參數(shù)θ的初始估計(jì)值。上兩步完成一次迭代。經(jīng)過反復(fù)迭代,直到估計(jì)結(jié)果收斂為止。這就得到了θ的ML似然估計(jì)。

假設(shè)觀測數(shù)據(jù)X=(X(1),X(2),…,X(m))服從正態(tài)分布,密度函數(shù)為:,需要估計(jì)正態(tài)分布的參數(shù)(μ,σ)

缺失數(shù)據(jù)Xmis在觀測數(shù)據(jù)Xobs及參數(shù)下的條件概率密度為:,式中iμ,iσ為第i次迭代的參數(shù)值。

因此可通過EM算法的E步計(jì)算得到完整數(shù)據(jù)似然函數(shù)的期望為:

M步將L(i+1)(θ|θi)最大化得到θi+1,對上式分別求μi和σi的偏導(dǎo)數(shù)并令其為0 可得到第i次迭代后參數(shù)的估計(jì)值。重復(fù)E步和M步直到且時(shí)迭代結(jié)束,便可以求得缺失數(shù)據(jù)下未知參數(shù)的最佳估計(jì)值:

用MATLAB隨機(jī)產(chǎn)生兩組服從正態(tài)分布的數(shù)據(jù)各有100個(gè),其中,σ=5。分別模擬變量10%,20%,30%和40%的數(shù)據(jù)缺失的情況。采用EM算法迭代20次和直接忽略缺失數(shù)據(jù)的方法對數(shù)據(jù)的參數(shù)進(jìn)行估計(jì):

缺失比例μ? σ? μ?均方差σ?均方差10% 9.615567665 9.7716977885.1789556875.0789785640.0032853330.00244612820%9.805265135 10.018890355.3107016135.1634236120.0041123250.00284322330%10.19595857 10.021000305.4114748085.3208076280.0134243710.00483612140%10.50903115 10.849680605.6474614935.6275326420.0354124730.021248317

結(jié)論:

實(shí)驗(yàn)結(jié)果表明采用EM算法對不完整的數(shù)據(jù)進(jìn)行處理可以用已知數(shù)據(jù)的條件期望代替缺失數(shù)據(jù)。通過比較可見EM方法對缺失數(shù)據(jù)處理比不考慮缺失數(shù)據(jù)直接進(jìn)行計(jì)算精度高,因而這種方法處理缺失數(shù)據(jù)是有效果的,但通過不同缺失值得情況對比分析,對于正態(tài)分布數(shù)據(jù),當(dāng)缺失數(shù)據(jù)比例低于30%時(shí)EM方法處理效果良好,當(dāng)缺失數(shù)據(jù)比例不斷增大缺失數(shù)據(jù)較多的時(shí)候,對缺失數(shù)據(jù)參數(shù)估計(jì)效果欠佳。EM方法可以達(dá)到收斂到后驗(yàn)密度函數(shù)的穩(wěn)定點(diǎn),但不保證結(jié)果是收斂到極大值點(diǎn);另外初始值的選擇對結(jié)果有一定影響,不同的初始值得到不同的估計(jì)結(jié)果,因此選擇不同的初始值進(jìn)行迭代可以減輕初值對結(jié)果的影響。如果增大數(shù)據(jù)個(gè)數(shù)EM算法估算精度會(huì)提高,同時(shí)也會(huì)造成計(jì)算復(fù)雜度提高,需要更多次迭代才能收斂,因此這種方法對大數(shù)據(jù)處理不適用。

[1]Paul D. Allison 缺失數(shù)據(jù).格致出版社.

[2]龐新生.缺失數(shù)據(jù)處理中相關(guān)問題的探討[J].統(tǒng)計(jì)與信息論壇,2004,19(5):29-32.

[3]胡玄子.數(shù)據(jù)處理中缺失數(shù)據(jù)填充方法的研究[J].湖北工業(yè)大學(xué)學(xué)報(bào),2013,28(5):82-84.

[4]呂王勇.基于EM算法的對數(shù)正態(tài)分布參數(shù)估計(jì)[J].理論新探,2007(6):21-23.

[5]陳曉林,汪四水.一類混合正態(tài)分布參數(shù)估計(jì)的EM算法和數(shù)據(jù)擴(kuò)張[J].蘇州大學(xué)學(xué)報(bào),2007,23(3).

TP39

A

1674-6708(2015)149-0153-02

猜你喜歡
數(shù)據(jù)處理方法
認(rèn)知診斷缺失數(shù)據(jù)處理方法的比較:零替換、多重插補(bǔ)與極大似然估計(jì)法*
ILWT-EEMD數(shù)據(jù)處理的ELM滾動(dòng)軸承故障診斷
學(xué)習(xí)方法
可能是方法不對
用對方法才能瘦
Coco薇(2016年2期)2016-03-22 02:42:52
MATLAB在化學(xué)工程與工藝實(shí)驗(yàn)數(shù)據(jù)處理中的應(yīng)用
四大方法 教你不再“坐以待病”!
Coco薇(2015年1期)2015-08-13 02:47:34
賺錢方法
捕魚
Matlab在密立根油滴實(shí)驗(yàn)數(shù)據(jù)處理中的應(yīng)用
主站蜘蛛池模板: 国产成人免费高清AⅤ| 真实国产乱子伦高清| 亚洲精品动漫| 国内老司机精品视频在线播出| 99九九成人免费视频精品| 91年精品国产福利线观看久久| 特级精品毛片免费观看| 亚洲一级无毛片无码在线免费视频| 亚洲av无码人妻| 18黑白丝水手服自慰喷水网站| 日本人又色又爽的视频| 成人亚洲天堂| 日韩高清成人| 国产亚洲男人的天堂在线观看| 日韩成人免费网站| 国产精品香蕉在线| 国产麻豆va精品视频| 99re热精品视频国产免费| 久99久热只有精品国产15| 国模视频一区二区| 国产9191精品免费观看| 黑色丝袜高跟国产在线91| 伊人久久久大香线蕉综合直播| 中文纯内无码H| 一级毛片基地| 老熟妇喷水一区二区三区| 成人第一页| 欧美成人怡春院在线激情| 67194亚洲无码| 色综合a怡红院怡红院首页| 久久国产热| 97国产成人无码精品久久久| 亚洲色大成网站www国产| 国产欧美视频在线| 久久久噜噜噜久久中文字幕色伊伊 | 青青草原国产| 人妻少妇久久久久久97人妻| 国产视频大全| 真人高潮娇喘嗯啊在线观看| 国产福利在线观看精品| 亚洲综合中文字幕国产精品欧美| 99精品免费在线| 日本亚洲欧美在线| 亚洲国产成熟视频在线多多| 美女免费精品高清毛片在线视| 九色综合视频网| 久久青草热| 在线永久免费观看的毛片| 欧日韩在线不卡视频| 国产毛片一区| 国产成人高清亚洲一区久久| 波多野结衣无码AV在线| 国产小视频免费观看| 亚洲中文制服丝袜欧美精品| 伊人久久大香线蕉影院| 国产亚洲欧美在线中文bt天堂| 国产丝袜第一页| 亚洲综合第一页| 欧美专区在线观看| 欧美一级大片在线观看| 久久美女精品| 欧美黑人欧美精品刺激| 久久狠狠色噜噜狠狠狠狠97视色| 99热线精品大全在线观看| 国产又大又粗又猛又爽的视频| 性喷潮久久久久久久久| 国产网友愉拍精品| 天天色综网| 再看日本中文字幕在线观看| 亚洲日本一本dvd高清| 亚洲人人视频| 国产日韩精品欧美一区灰| 青青草国产一区二区三区| 欧美另类一区| 国产精品综合久久久| 2020亚洲精品无码| 72种姿势欧美久久久大黄蕉| 精品福利视频导航| 强奷白丝美女在线观看| 高h视频在线| 国产免费自拍视频| 全部免费毛片免费播放|