引言:這篇論文是我最近讀到的將機器學習/資料採礦演算法引入到SNS網路隱私保護領域中的一篇經典論文,感覺模型比較有新意,實現了自動化的使用者隱私權設定分析,使用者只需要對很少朋友根據自己的隱私偏好打上存取控制標籤,分類器就可以對其他大部分朋友的存取權限做自動分類,並且達到了很高的準確率,大大減輕了SNS使用者手動隱私權設定的負擔。該論文發表於WWW10'及CCS10‘,我將全文翻譯並加入了自己的理解性注釋,發布到自己的部落格上與國內網友共用,最近打算將這個項目實現並且深入做下去,目前的進展見博文《資料採礦-基於機器學習的SNS隱私權原則推薦嚮導分類器的C++及WEKA實現與評估》有興趣參與這個項目的朋友可以與我聯絡交流:)。博文是本文目錄及前兩部分,全文PDF版下載連結見點擊開啟連結
基於機器學習的SNS隱私保護原則推薦嚮導的設計與實現
Lujun Fang and Kristen LeFevre
ElectricalEngineering & Computer Science, University of Michigan
CCS10’及WWW10’論文楊柳概述整理核心內容 yang.liu@pku.edu.cn
摘要
設計一個SNS隱私保護原則推薦嚮導,利用機器學習方法自動計算出SNS使用者的隱私保護偏好,只需要使用者進行比現行SNS隱私保護機制下少得多的輸入,就可以構建描述使用者特定隱私偏好的機器學習模型,然後使用這個模型來自動化佈建使用者SNS隱私保護原則。
具體的實現方法是,以使用者SNS資料資料項目為行,以朋友為列構建存取控制矩陣,填入存取控制標籤。對於每一個朋友抽取出若干屬性特徵,例如所屬的“圈子”,性別,生日,城市等資訊,可實現對朋友的向量化表示。基於已有的部分朋友和使用者打上的訪問許可的標籤產生訓練樣本,其他朋友以及使用者新添加的朋友作為測試樣本。對於每一項使用者資料,例如使用者生日資訊,系統讓使用者對少量朋友按照自己的意願打上allow/deny標籤,然後系統基於這些輸入形成的訓練樣本,利用機器學習演算法構建分類器,就可以使用該分類器來自動對剩餘朋友及使用者新添加的朋友設定對該資料的allow/deny存取權限。
現有研究表明[CCS10’ WWW10’],真實的SNS使用者會更多基於不同的“圈子”來考慮他們的隱私偏好,而“圈子”資訊很容易利用現有技術從社交網路圖譜中抽取出來。使用朋友所屬的“圈子”資訊,可以自動計算出很高準確度的使用者隱私保護推薦策略,而需要的使用者輸入比照當前的SNS隱私保護機制少很多。
全文檢索目錄
摘要...
1
1
介紹... 3
1.1
設計目標... 3
1.2
主要工作... 3
2
隱私權原則推薦嚮導概述... 4
2.1
初步建模... 4
2.2
通用隱私保護原則推薦嚮導設計... 4
3
積極學習式的嚮導... 6
3.1
偏好模型分類器... 7
3.2
特徵抽取... 7
3.2.1
主要抽取的屬性特徵... 7
3.2.2
基於圈子的屬性... 7
3.3
不定抽樣... 8
3.4
朋友增量維護... 9
4
模型可視化與修正... 10
4.1
可視化... 10
4.2
模型修正和增量維護... 11
5
模型評估... 11
5.1
從真實使用者搜集隱私偏好資料... 11
5.2
實驗設計... 12
5.3
比較隱私保護原則... 13
5.3.1
靜態情境... 13
5.3.2
動態情境... 14
5.3.3
類機率分布的影響... 15
5.4
比較朋友特徵... 16
6
相關研究... 16
7
結論和未來工作... 17
致謝...
17
8
參考文獻... 17
1 介紹
當前SNS都允許使用者自主設定自己的隱私權原則。例如,Facebook有“Privacy Settings”頁面,允許使用者佈建每一項資料對朋友是否可見。Facebook還允許使用者建立朋友名單,然後設定某一部分設定檔是否對該名單的中朋友可見。然而有研究表明,由於比較複雜並不友好的使用者介面,大多數使用者會跳過或者維持預設隱私保護原則。例如,在Facebook上,要實現使用者粒度的存取控制,使用者必須手動將朋友填入一個名單,由於Facebook使用者平均擁有130個朋友,這個過程非常耗費時間。更糟糕的是,這個隱私保護機制需要很多不同的朋友名單,因為對於不同的個人資訊,例如家庭地址和宗教信仰,使用者會有不同的隱私保護偏好。
很明顯,需要更好的SNS隱私保護機制。本文設計了基於機器學習的SNS隱私保護原則推薦嚮導,可以使得SNS使用者以最小的輸入代價自動化佈建個人隱私保護原則。
1.1設計目標
SNS隱私權原則推薦嚮導的設計目標是以最小的使用者輸入代價自動化佈建使用者個人隱私保護原則。主要挑戰如下:
低代價,高準確度。使用者輸入應該形式簡單,數量較少,同時該嚮導自動計算出的隱私權原則要準確反映使用者真實隱私偏好。一個原始的方式就是讓使用者對所有朋友手動設定隱私權原則。儘管這種方式如果被完整執行,可以達到完美的隱私偏好準確度,但是也給使用者帶來了巨大的輸入負擔,實際並不可行。
良好的魯棒性。很難估計使用者為了進行隱私權設定願意提供的輸入量,隱私權原則推薦嚮導的準確率會隨著使用者提供輸入的增加而增加,但是,嚮導應該假定使用者可以在任何時候停止輸入。
資料視覺效果。除了使用者輸入,嚮導還可以使用從SNS上自動抓取和處理的資訊,但是這些資訊只包括當前對該使用者可見的資訊,具體包含使用者的朋友關係,使用者可見的朋友資料以及使用者朋友的朋友關係。
1.2 主要工作
為了應對這些挑戰,我們為隱私權原則嚮導的設計開發了一個架構,這個架構將在第2部分描述。這個架構是基於真實的SNS使用者會根據一個特定的暗含規則集來考慮其隱私保護偏好,因此可以使用機器學習演算法和少量使用者輸入來構建使用者隱私偏好模型,通過這個模型,可以實現使用者隱私保護原則自動化設定。
作為這個架構的一個執行個體,我們實現了一個使用者隱私保護原則推薦嚮導。這個嚮導通過學習一個分類器實現了使用者隱私偏好模型。在這個分類器中,描述每個朋友的特徵,包括所屬“圈子”資訊,可以從使用者可見的資訊中自動抽取。嚮導提供了非常簡便的使用者互動介面,利用機器學習中的積極學習範式,讓使用者對少量挑選的朋友打上隱私標籤,例如allow/deny。使用者提供的輸入越多,分類器的效能越好,但是允許使用者在任何時候停止輸入。更進一步,嚮導可以適應使用者不斷添加新朋友的情況。基本的嚮導使用簡單,對於進階使用者,嚮導會提供可以可視化和修改隱私保護原則的工具,這將在第4部分描述。
為了評估這個方案,我們對45個真實的Facebook使用者進行了詳盡的實驗。實驗表明,第一,我們的嚮導達到了更好的使用者使用代價和隱私偏好準確率的tradeoff,一般而言,如果一個使用者在200個以上的朋友中標註了25個朋友,嚮導將以高於90%的準確率自動化佈建使用者隱私保護原則。第二,從使用者鄰居結點中抽取的“圈子”資訊對於預測使用者隱私偏好極其重要。
2 隱私權原則推薦嚮導概述
2.1 初步建模
使用者隱私偏好表現了使用者與每個朋友分享隱私的意願。對於特定的使用者,我們定義使用者所有朋友構成集合F,定義使用者資料中的資料項目構成集合I,那麼,使用者隱私偏好可以用函數pref來定義,,如果,這就意味著使用者的意願是允許朋友f看到資料項目i.
主要術語如下:
使用者隱私偏好:指使用者理想的隱私保護原則,定義為
使用者隱私權設定:SNS實際執行的使用者隱私保護原則,定義為
隱私權設定準確率:對於特定的朋友集合F和特定的資料項目集合I,隱私權設定準確率計算公式是
2.2 通用隱私保護原則推薦嚮導設計
設計隱私保護原則推薦嚮導的動機是基於這樣一個事實,SNS使用者實際會根據特定的暗含規則集來考慮其隱私偏好。可以用執行個體1來說明。
執行個體1.1中所示,在使用者K的鄰近社交網路中,有幾組結點聚集在了一起。圖1是使用Fruchterman-Reingold
force-based 布局來描述的,把拓撲上鄰近(楊柳註:可以理解為朋友親密值更大)的結點放置的更近,反之則放置的更遠。在社交網路研究中,這些聚集的組稱為“圈子”。我們已經在圖中手動標明了一些明顯的圈子,G0,G1等。觀察發現使用者K的隱私偏好傾向於在圈子邊界處表現出差異。使用者願意同大部分朋友共用其生日資訊,但是,有兩個圈子,即圖中的G20和G22,他不想向其公開自己的生日資訊。(楊柳註:比如女生的年齡、身高、體重資訊,一般不願意對異性公布),這就表明了使用者K已經根據一組暗含的規則集構建了他的隱私偏好,這些規則與他的朋友網路的基本圈子結構有關。
基於這樣一個觀察結果,為了應對介紹部分指出的需求,我們提出設計隱私保護原則推薦嚮導的通用架構,2中所示。這個架構由三個部分組成:
使用者輸入:嚮導會向使用者請求關於隱私偏好的輸入,通常是一些問答互動,使用者可以在任何時候放棄回答問題。
特徵抽取:使用使用者可見資訊,嚮導選取一個特徵向量空間,使用者的每一個朋友就可以用該空間中的一個向量來描述。
隱私偏好模型:使用抽取的特徵和使用者輸入,嚮導構建一個隱私偏好模型,包含了推測出的使用者考慮隱私偏好時使用的規則特徵。這個模型可以被用來自動設定使用者的隱私權設定。當使用者提供更多的輸入或者添加新朋友的時候,這個隱私偏好模型和配置的隱私權設定應該自動更新。
博文是本文目錄及前兩部分,全文PDF版下載連結見點擊開啟連結