資料下載
停用詞下載 : https://github.com/GoatWang/ithome_ironman/tree/master/day16_NLP_Chinese : 點選 stop.txt,按右上的 Raw 按鈕,將所有的資料全選並複製,然後開啟新的文字文件貼上,最後在專案的目錄下儲存成 stop.txt
訓練資料下載 : https://www.kaggle.com/c/fake-news-pair-classification-challenge ,點選Data, 右邊即有train.csv, test.csv, sample_submission.csv 三個檔案
簡体轉繁体
從 kaggle 下載的訓練資料 train.csv 及 test.csv 為簡体中文,所以請先用底下的代碼轉成繁体中文。再執行之前,請將 langconv.py 及 zh_wiki.py 下載到專案中,這二個檔為簡轉繁的主要程式。
向量化
底下程式碼中,先將 train_ts.csv 進行斷詞,再開始向量化,最後偵測跟 “美國” 相近的結果
載入向量模型
因為 train_ts.csv 有 320,767 筆資料,向量化模型要一段時間,還好上面程式碼中已儲存成 “w2v_model_chinese” 檔案,所以下次要使用,可以直接載入進行偵測。
