999精品在线视频,手机成人午夜在线视频,久久不卡国产精品无码,中日无码在线观看,成人av手机在线观看,日韩精品亚洲一区中文字幕,亚洲av无码人妻,四虎国产在线观看 ?

網(wǎng)絡(luò)熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)的設(shè)計(jì)與實(shí)現(xiàn)

2014-03-08 02:01:45邱海健
自動化與儀表 2014年8期
關(guān)鍵詞:評價檢測信息

邱海健

(南京工業(yè)大學(xué) 電子與信息工程學(xué)院,南京 211816)

隨著計(jì)算機(jī)網(wǎng)絡(luò)技術(shù)的快速發(fā)展,大量網(wǎng)民認(rèn)為互聯(lián)網(wǎng)是獲取信息的最重要的渠道,網(wǎng)絡(luò)信息的爆炸增長和網(wǎng)民參與熱情的空前高漲使得對網(wǎng)絡(luò)內(nèi)容的監(jiān)控和管理變得十分迫切和緊要,而面對海量的互聯(lián)網(wǎng)信息,網(wǎng)絡(luò)輿論信息為其中比較突出的代表,網(wǎng)絡(luò)輿論是在互聯(lián)網(wǎng)上傳播的公眾對某一焦點(diǎn)所表現(xiàn)出的有一定影響力的、帶傾向性的意見,而且網(wǎng)民言論同時具有巨大的信息爆發(fā)力和輿論影響力[1]。

互聯(lián)網(wǎng)上,熱點(diǎn)話題表現(xiàn)為互聯(lián)網(wǎng)用戶閱讀網(wǎng)頁、回帖和跟帖等,隨著網(wǎng)民的關(guān)注和事情的發(fā)展和變化,討論中心也會發(fā)生改變,同時真實(shí)地反映了大多數(shù)網(wǎng)民對該事件的態(tài)度。可見,獲取熱點(diǎn)信息變得更加重要。

根據(jù)某單位的需求,要及時地發(fā)現(xiàn)熱點(diǎn)問題和熱點(diǎn)話題的變化[2],提出熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)。系統(tǒng)主要功能是利用Web技術(shù)[3]采集頁面信息并且根據(jù)Single Pass算法熱點(diǎn)評價算法[4]檢測網(wǎng)絡(luò)熱點(diǎn)信息。

1 方案設(shè)計(jì)

發(fā)現(xiàn)熱點(diǎn)話題是為熱點(diǎn)信息檢測服務(wù)的,首先把測試信息結(jié)合在一起,分析其中有影響力的話題,為熱點(diǎn)挖掘提供可靠的依據(jù)。

按照處理過程,本系統(tǒng)主要可以分為以下幾個步驟:信息采集、信息挖掘、信息熱度評價。系統(tǒng)流程如圖1所示。

系統(tǒng)主要流程是提取出來用戶可能感興趣的頁面信息,再進(jìn)行處理,將大量的信息整合成為有序的熱點(diǎn)話題,來提高熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng)挖掘熱點(diǎn)信息的準(zhǔn)確度和效率。

圖1 系統(tǒng)流程圖Fig.1 Flow chart of system

2 系統(tǒng)總體設(shè)計(jì)

本系統(tǒng)采用B/S三層體系結(jié)構(gòu),由應(yīng)用層、業(yè)務(wù)邏輯層和數(shù)據(jù)服務(wù)層構(gòu)成,三層之間相互交互來實(shí)現(xiàn)系統(tǒng)的整個功能。用戶通過發(fā)送請求到應(yīng)用層查詢需要處理的頁面,通過Web技術(shù)和相關(guān)算法處理得到信息存儲在數(shù)據(jù)庫中。數(shù)據(jù)服務(wù)層主要提供數(shù)據(jù)存儲服務(wù),由數(shù)據(jù)庫的服務(wù)器和文件系統(tǒng)組成。系統(tǒng)總體框架如圖2所示。

圖2 系統(tǒng)總體框架Fig.2 Modules of system

每個子系統(tǒng)都有自己單獨(dú)功能模塊程序,而且需要不斷地和數(shù)據(jù)庫進(jìn)行交互完成各自的功能。整個系統(tǒng)包含信息采集子系統(tǒng)、熱點(diǎn)挖掘子系統(tǒng)、熱點(diǎn)評價子系統(tǒng)。

信息采集子系統(tǒng) 主要是對網(wǎng)頁的內(nèi)容進(jìn)行篩選,選出網(wǎng)頁的主要內(nèi)容。

熱點(diǎn)挖掘子系統(tǒng) 主要是對信息采集子系統(tǒng)處理過的內(nèi)容進(jìn)行聚類分析,把信息進(jìn)行歸類。

熱點(diǎn)評價子系統(tǒng) 主要是對熱點(diǎn)挖掘子系統(tǒng)的歸類信息進(jìn)行熱點(diǎn)評價,評價并且排行出近期活躍度高的熱點(diǎn)話題。

3 系統(tǒng)的關(guān)鍵算法

3.1 網(wǎng)頁信息采集

本論文所構(gòu)建的熱點(diǎn)信息發(fā)現(xiàn)及分析系統(tǒng)是利用網(wǎng)絡(luò)信息采集和挖掘等相關(guān)技術(shù),將互聯(lián)網(wǎng)上可能引起用戶興趣話題和關(guān)注比較大的信息整理出來,以直觀的數(shù)據(jù)表現(xiàn)方式提供給相關(guān)用戶進(jìn)行特定處理。

信息采集子系統(tǒng)中主要工作:首先處理測試網(wǎng)頁中一些沒有用的信息例如廣告信息等,得到一些干凈的網(wǎng)頁之后,找出相關(guān)信息網(wǎng)頁。

3.2 熱點(diǎn)信息檢測相關(guān)算法3.2.1 Single Pass聚類算法

Single Pass算法主要是根據(jù)輸入內(nèi)容,將內(nèi)容處理為內(nèi)容文本,將內(nèi)容文本與已有話題進(jìn)行相似性比較,根據(jù)相似度的值進(jìn)行匹配選取。如果與某個話題相似度高,則把文本歸入該話題,如果相似度度量均小于某一閾值,則將該文本定義為一個新的話題,創(chuàng)建一個新的話題類型。其Single Pass算法的流程圖如圖3所示。

圖3 Single pass算法Fig.3 Single pass algorithm

3.2.2 話題熱度評價

性能評測一般采用漏檢率(Pm)誤檢率(Pf)來判斷算法存在的問題,而檢測代價[5](Cn)是用來衡量話題發(fā)現(xiàn)的質(zhì)量,Cn一般是越小表示效果越好。如話題i中相關(guān)的文檔數(shù)目為H、不相關(guān)的數(shù)目為H1、與話題i不相關(guān)文本C,其中C中有C1篇被誤放入話題i中,則:

平均漏報率Pm,平均誤報率Pf和檢測代價Cn。其計(jì)算公式為

其中:G1、G2是漏報和誤報的代價;Pm、Pf是漏報和誤報的概率;P是文本話題類的先驗(yàn)概率。根據(jù)熱點(diǎn)評價的標(biāo)準(zhǔn),一般設(shè)定 G1=1,G2=0.1,P=0.02。

4 系統(tǒng)測試

為了驗(yàn)證本系統(tǒng)采用2013年4月新浪、網(wǎng)易、搜狐、新華網(wǎng)、人民網(wǎng)等幾個網(wǎng)站的網(wǎng)頁,首先利用信息采集子系統(tǒng)的Web技術(shù)處理網(wǎng)頁內(nèi)容,得到一些關(guān)鍵信息內(nèi)容;再利用熱點(diǎn)挖掘子系統(tǒng)處理歸類;最后利用熱點(diǎn)話題評價子系統(tǒng)進(jìn)行熱度排行。

頁面信息處理得到四川雅安地震(YA)、H7N9亞型禽流感病毒(H7N9)、明星跳水秀(MX)、復(fù)旦投毒案(FD)、鳳凰古城(FH)、海天盛筵(HT)等 6 個話題,驗(yàn)證系統(tǒng)檢測話題的有效性和準(zhǔn)確性。測試各項(xiàng)數(shù)據(jù)如表1所示。

表1 熱點(diǎn)信息表Tab.1 Information hotspots

測試中各項(xiàng)數(shù)據(jù)根據(jù)式(1)~式(5)得出,漏報率 數(shù) 據(jù) 是 0.253、0.229、0.221、0.222、0.257、0.1875,誤報率數(shù)據(jù)是 0.01125、0.01、0.00875、0.005、0.0038、0.0075,而檢測代價數(shù)據(jù)是 0.0062、0.0056、0.0053、0.0049、0.0055、0.0045。在漏報率和誤報率計(jì)算中,檢測代價越小表示信息的集中程度越高。根據(jù)結(jié)果數(shù)據(jù)可以得出,信息熱度排名為海天盛筵(HT)、復(fù)旦投毒案(FD)、明星跳水秀(MX)、鳳凰古城(FH)、四川雅安地震(YA)、H7N9亞型禽流感病毒(H7N9)。

5 結(jié)語

本系統(tǒng)基本達(dá)到了企業(yè)提出的需求,基于.NET和關(guān)鍵算法構(gòu)建出熱點(diǎn)信息發(fā)現(xiàn)系統(tǒng),實(shí)現(xiàn)了網(wǎng)頁信息熱點(diǎn)檢測。系統(tǒng)在網(wǎng)絡(luò)熱點(diǎn)話題發(fā)現(xiàn)上既保證了一定的準(zhǔn)確性、實(shí)時性,又為某單位對某事件的態(tài)度傾向提供數(shù)據(jù)服務(wù)。

網(wǎng)絡(luò)熱點(diǎn)話題檢測作為輿情信息挖掘的關(guān)鍵任務(wù)也是研究重點(diǎn),同時還有許多問題有待進(jìn)一步的探索與研究。如實(shí)時動態(tài)的信息獲取并發(fā)送分析好的信息給領(lǐng)導(dǎo),作為下個版本開發(fā)的新內(nèi)容。

[1] Leskovec J,Huttenlocher D,Kleinberg J.Signed networks in social media[C]//Proceedings of the SIGCHI Conference on Human Factors in Computing Systems.ACM,2010:1361-1370.

[2] Kitsak M,Gallos L K,Havlin S,et al.Identification of influential spreaders in complex networks[J].Nature Physic,2010,6(11):893-898.

[3] 岳國偉,永全,陳玉娥.ASP.NET中數(shù)據(jù)分頁技術(shù)的研究[J].計(jì)算機(jī)應(yīng)用研究,2007,24(9):159-161.

[4] 洪宇,張宇,范基禮,等.基于話題分治匹配的蜥事件檢測[J].計(jì)算機(jī)學(xué)報,2008,31(4):687-695.

[5] Makkonen J,Ahonen-Myka H,Salmenkivi M.Simple semantics in topic detection and tracking[J].Information Retrieval,2004,7(3-4):347-368. ■

猜你喜歡
評價檢測信息
“不等式”檢測題
“一元一次不等式”檢測題
“一元一次不等式組”檢測題
SBR改性瀝青的穩(wěn)定性評價
石油瀝青(2021年4期)2021-10-14 08:50:44
訂閱信息
中華手工(2017年2期)2017-06-06 23:00:31
小波變換在PCB缺陷檢測中的應(yīng)用
基于Moodle的學(xué)習(xí)評價
展會信息
中外會展(2014年4期)2014-11-27 07:46:46
保加利亞轉(zhuǎn)軌20年評價
多維度巧設(shè)聽課評價表 促進(jìn)聽評課的務(wù)實(shí)有效
體育師友(2012年4期)2012-03-20 15:30:10
主站蜘蛛池模板: 精品久久久久久成人AV| 国产91小视频| 国产精品成人第一区| 熟妇人妻无乱码中文字幕真矢织江 | 韩日无码在线不卡| 日韩第九页| 波多野结衣亚洲一区| 天天做天天爱夜夜爽毛片毛片| 秋霞一区二区三区| 一级一级一片免费| 露脸国产精品自产在线播| 在线人成精品免费视频| 国产精品私拍99pans大尺度| 亚洲人成网站在线观看播放不卡| 国产精品久久自在自线观看| 99久久精品国产精品亚洲 | 亚洲娇小与黑人巨大交| 色老头综合网| 欧美a在线看| 亚洲精品亚洲人成在线| 97视频在线观看免费视频| 欧美成人免费午夜全| 久久婷婷人人澡人人爱91| 亚洲国产成人麻豆精品| AV色爱天堂网| 国产亚洲高清视频| 四虎精品免费久久| 青青草国产一区二区三区| 天堂成人在线| 日韩在线中文| 四虎在线观看视频高清无码| 免费人成在线观看成人片| 久久青青草原亚洲av无码| 高清色本在线www| 国产靠逼视频| 成人综合网址| 亚洲 日韩 激情 无码 中出| 1024国产在线| 婷婷综合在线观看丁香| 亚洲综合天堂网| 日本亚洲成高清一区二区三区| 青青国产视频| 夜色爽爽影院18禁妓女影院| 欧美成人午夜影院| 男人天堂伊人网| 99精品在线看| 日韩美女福利视频| 久热99这里只有精品视频6| 国产精品香蕉| 久草性视频| 国产二级毛片| 日韩精品一区二区三区视频免费看| 久久午夜夜伦鲁鲁片无码免费| 国产精品香蕉| 中文毛片无遮挡播放免费| 亚洲综合色婷婷| 91视频国产高清| 久久婷婷人人澡人人爱91| 日韩一级二级三级| 亚洲欧美激情小说另类| 国产xx在线观看| 国产美女一级毛片| 久久久久青草线综合超碰| 午夜国产不卡在线观看视频| 婷婷午夜天| 丝袜美女被出水视频一区| 国产精品va免费视频| 亚洲欧洲天堂色AV| 最近最新中文字幕在线第一页| 国产成人一区| 亚洲国产天堂久久综合| 亚洲AV成人一区二区三区AV| 成人一级免费视频| 亚洲永久色| 夜夜爽免费视频| 国产第一页第二页| 国产欧美日韩一区二区视频在线| 国产精品99久久久| 亚洲永久色| 91黄色在线观看| 日韩国产欧美精品在线| 在线欧美国产|