中文向量化

      在〈中文向量化〉中尚無留言

資料下載

停用詞下載 : https://github.com/GoatWang/ithome_ironman/tree/master/day16_NLP_Chinese : 點選 stop.txt,按右上的 Raw 按鈕,將所有的資料全選並複製,然後開啟新的文字文件貼上,最後在專案的目錄下儲存成 stop.txt

訓練資料下載 : https://www.kaggle.com/c/fake-news-pair-classification-challenge ,點選Data, 右邊即有train.csv, test.csv, sample_submission.csv 三個檔案

簡体轉繁体

從 kaggle 下載的訓練資料 train.csv 及 test.csv 為簡体中文,所以請先用底下的代碼轉成繁体中文。再執行之前,請將 langconv.pyzh_wiki.py 下載到專案中,這二個檔為簡轉繁的主要程式。

🔒 底下內容僅限會員閱讀。

立即登入

向量化

底下程式碼中,先將 train_ts.csv 進行斷詞,再開始向量化,最後偵測跟 “美國” 相近的結果

🔒 底下內容僅限會員閱讀。

立即登入

載入向量模型

因為 train_ts.csv 有 320,767 筆資料,向量化模型要一段時間,還好上面程式碼中已儲存成 “w2v_model_chinese” 檔案,所以下次要使用,可以直接載入進行偵測。

🔒 底下內容僅限會員閱讀。

立即登入

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *