午夜视频国产在线,九九精品99久久久香蕉,欧美在线视频二区,老司机在线精品视频网站,久久久精品免费,97国产品香蕉在线观看

您的位置:首 頁 > 新聞中心 > 行業(yè)動(dòng)態(tài) > 行業(yè)動(dòng)態(tài)Python進(jìn)行網(wǎng)頁文本處理

行業(yè)動(dòng)態(tài)

行業(yè)動(dòng)態(tài)Python進(jìn)行網(wǎng)頁文本處理

發(fā)布:2020-10-05 12:23:00 瀏覽:3414

       Python進(jìn)行網(wǎng)頁文本處理

       網(wǎng)頁文本中的中英文處理的區(qū)別在于中文需要額外加入分詞處理過程。所謂分詞就是將一段文本文字分成一個(gè)個(gè)詞組的過程。

       具體處理流程為:加載jieba分詞包進(jìn)行中文分詞;將分詞后的詞組去掉停用詞及一個(gè)字符的詞后, 輸出訓(xùn)練文本中的常用分詞和熟悉的詞組;在訓(xùn)練文本的數(shù)據(jù)訓(xùn)練及情感詞典的歸檔中將爬取獲得的網(wǎng)頁數(shù)據(jù)的客觀性文本分詞后放入變量中, 主觀類情感文本放入另一變量中;為自動(dòng)得到網(wǎng)頁文本中重要的關(guān)鍵詞組, 過濾掉對網(wǎng)頁文本意義貢獻(xiàn)不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉(zhuǎn)換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網(wǎng)頁文本情感分析做準(zhǔn)備。

>>> 查看《行業(yè)動(dòng)態(tài)Python進(jìn)行網(wǎng)頁文本處理》更多相關(guān)資訊 <<<

本文地址:http://yunshengqh.cn/news/html/20623.html

趕快點(diǎn)擊我,讓我來幫您!
澳门| 蚌埠市| 上高县| 乡宁县| 江陵县| 宁安市| 嵊泗县| 曲水县| 平乐县| 三亚市| 隆子县| 庆城县| 塘沽区| 河北区| 册亨县| 上林县| 福安市| 涿州市| 若尔盖县| 云阳县| 嘉定区| 山阳县| 霍山县| 辉南县| 大关县| 辽中县| 惠来县| 基隆市| 通辽市| 沭阳县| 平和县| 潜江市| 大邑县| 绥宁县| 汉阴县| 南岸区|