bl双性强迫侵犯h_国产在线观看人成激情视频_蜜芽188_被诱拐的少孩全彩啪啪漫画

行業動態Python進行網頁文本處理

2022-04-30    分類: 網站建設


網頁文本中的中英文處理的區別在于中文需要額外加入分詞處理過程。所謂分詞就是將一段文本文字分成一個個詞組的過程。

具體處理流程為:加載jieba分詞包進行中文分詞;將分詞后的詞組去掉停用詞及一個字符的詞后, 輸出訓練文本中的常用分詞和熟悉的詞組;在訓練文本的數據訓練及情感詞典的歸檔中將爬取獲得的網頁數據的客觀性文本分詞后放入變量中, 主觀類情感文本放入另一變量中;為自動得到網頁文本中重要的關鍵詞組, 過濾掉對網頁文本意義貢獻不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網頁文本情感分析做準備。

名稱欄目:行業動態Python進行網頁文本處理
文章分享:http://vcdvsql.cn/news/147556.html

成都網站建設公司_創新互聯,為您提供電子商務外貿網站建設自適應網站營銷型網站建設網站設計公司靜態網站

廣告

聲明:本網站發布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網站立場,如需處理請聯系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經允許不得轉載,或轉載時需注明來源: 創新互聯

搜索引擎優化