假新聞識別,從0到95% - 機器學習實戰_機器學習

來源:互聯網
上載者:User

我們使用機器學習和自然語言處理開發了一個假新聞檢測器,其在驗證集上的準確率超過了95%。 在現實世界中,準確率應該會比95%低一些,特別是隨著時間的推移,假新聞的創作方式也會有所改變。

由於自然語言處理和機器學習方面發展迅猛,因此我想也許可以搞一個能夠識別假新聞的模型,從而遏制假新聞泛濫所造成的災難性後果 。

可以說,要製作自己的機器學習模型,最困難的部分就是收集訓練資料。 我花了幾天和幾天的時間來收集2017/2018賽季所有NBA球員的照片, 以期訓練一個Face Service模型 。 我不知道我會潛入一個長達數月之久的痛苦過程,暴露出一些真正黑暗而令人不安的事情,這些事情仍然作為新聞和真實的資訊被傳播。

如果你希望馬上學習機器學習方面的技能和知識,我推薦你使用匯智網的Python機器學習線上運行環境 假新聞的定義

我的第一個障礙是意外的。 在對假新聞做了一些研究之後,我很快發現錯誤資訊有很多不同的類別。 有些文章是公然虛構的,有些文章則提供了真實的事件但進行錯誤的解讀,有些文章屬於偽科學,有些宣揚片面觀點的文章也偽裝成新聞,文章是諷刺的,有些文章主要內容就是一些推特和引用其他人的話。 我搜尋了一下,發現一些人試圖將網站分為“諷刺”,“虛假”,“誤導”等類別。

我認為這是一個很好的開始,因此繼續前進,並開始訪問這些被標記的網站,試圖尋找一些例子。 幾乎是馬上,我發現了一個問題: 一些被標記為“虛假”或“誤導”的網站有時也會有真實的文章。 所以我知道如果不做一個完整的檢查就沒有辦法去刮。

於是我開始問自己,我的模型是否應該考慮到諷刺和意見,如果是的話,他們應該被認為是虛假的、真實的還是屬於自己的類別。 情感分析

在假新聞網站上泡了大約一周后,我開始懷疑自己是否把問題過度複雜化了。 也許我只需要使用現成的機器學習模型來進行情感分析,看看是否存在一種模式。 我決定構建一個快速的小工具,使用網路爬蟲來抓取文章標題、描述、作者和內容,並將抓取結果輸入到情感分析模型。 我使用了Textbox ,這個線上服務很方便,並且很快就可以返回結果。

Textbox會返回一個你可以解釋為正向或負向的情緒分數。 然後,我搞了一個粗糙的小演算法來為不同類型的文本(標題、內容、作者等等)的情緒添加權重,並將它們加在一起,看看能不能得到一個有意義的全域得分。

一開始它表現的很好,但當我試過第七或第八篇文章之後,這個小演算法開始胡言亂語了:它的表現離我想要建立的假新聞檢測系統還差的很遠。

失敗。 自然語言處理

這部分就是我的朋友大衛·埃爾南德斯 ( David Hernandez)所建議的:利用真實的文本訓練出一個模型。 為了做到這一點,我們需要為不同的類別中提供大量樣本執行個體。

為了試圖理解假新聞的模式所投入的精力,讓我已經相當疲憊了,所以我們決定只抓取那些已知屬於虛假、真實或諷刺等分類的網站,看看我們能否快速構建一個資料集。

在運行了幾天的粗糙的抓取工作之後,我們得到了一個自認為足夠大的資料集來訓練一個模型。

結果是廢話。 深入查看訓練資料後,我們意識到,這些網站從未像我們想的那樣,整齊地落入預先規劃的小類別。 其中一些網站把假新聞和真實的新聞混在一起,另一些網站則只有一些來自其他網站的部落格文章,有些網站的文章中90%的文字都是特朗普的推文。 所以我們意識到必須重新開始訓練資料。

這是事情變糟的時候。

這是一個星期六,我開始了漫長的過程,閱讀每篇文章然後才決定將其歸入什麼類別,並且笨拙地將文本複製、粘貼到試算表中。 其中有一些黑暗的、令人噁心的、種族主義的、真正墮落的東西,開始時我試圖忽略它們。 但經過數百篇這樣的文章之後,它們開始接近我。 當我的視覺模糊,我對顏色的解讀變得混亂起來的時候,我開始變得非常沮喪。 人類文明為何降到如此低的水平。 為什麼人們不能批判性地思考。 我們真的有希望嗎。 這個過程持續了幾天,因為我努力為這個模型準備足夠多的資料樣本。

我發現自己在對假新聞的解讀中浮現出來,當看到那些我有不同意見的文章時,就會生氣,只為選出我認為是正確的文章而繼續奮鬥。 但是,什麼是對,什麼是錯。

不過最終,我收集到了足夠多的樣本,然後非常放心地把它們發給大衛。

第二天,當我急切地等待結果時,他再次進行了訓練。

我們達到了約70%的準確率。 起初我覺得這已經很好了,但是當使用開放選擇的文章進行抽查後,我意識到這個模型一無是處。

失敗。 Fakebox

回到繪圖板。 我做錯了什麼。 是David指出來,簡化問題可能是提高準確率的關鍵。 因此我的確思考了,到底什麼才是我要解決的問題。 然後突然一激靈,也許不需要檢測假新聞,只要檢測真實的新聞就夠了。 真實的新聞更容易分類,客觀真實,幾乎不需要解讀。 而且還有很多可信的訊息來源。

於是我回到互連網,開始重新收集訓練資料。 我決定把所有新聞都歸為兩類: 真實的和不真實的。 不真實類將包括挖苦、片面觀點、假新聞,以及其它沒有遵守AP標準的內容。

我花了數周的時間來做這件事,每天都要花幾個小時從The Onion到Reuters的各種網站上獲得最新的內容。 我把成千上萬的真實和非真實內容的樣本放到一個巨大的試算表中,每天我都會增加數百個。 最終,我認為樣本已經足夠來再次嘗試。 於是我給David發了試算表,然後就是焦急地等著結果。

當我看到準確度在95%以上時,我幾乎跳了起來。 這意味著我們發現了一個模式,可以用來區分真實的新聞和那些你應當謹慎對待的新聞。

成功(某種程度)。

如果你喜歡這篇文章,請關注我的頭條號:新缸中之腦。

原文: I trained fake news detection AI with >95% accuracy, and almost went crazy

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.