繼今年6月《廣州日報》起訴「今日頭條」並達成和解協定之後,近日又傳出「今日頭條」被圍剿的消息。 6月24日搜狐高調起訴「今日頭條」侵犯著作權和HTTP://www.aliyun.com/zixun/aggregation/2559.html">不正當競爭。 同時,國家版權局宣佈對「今日頭條」立案調查。 至此,作為新聞資料的聚集者與加工者的「今日頭條」,命運堪憂!然而,該事件對筆者的思考不僅于此,「大資料」模式的法律風險才是更值得關注的問題!
「大資料」模式
所謂「大資料」模式,其實是將巨量的資料資料通過擷取、分析,從而提取有價值的規律性資訊,以供政府、企業、個人等決策使用。 換句話說,「大資料」模式本質上是巨量資料的「二次加工」。 這種「二次加工」不僅存在於資訊空間,也存在於傳統世界。
在資訊空間,「大資料」模式的加工物件是各種各樣的「電子資料」。 筆者認為,「今日頭條」就是一種典型的「大資料」模式。 「今日頭條」並不生產新聞資料,而是將各個新聞媒體發佈的巨量新聞資料進行擷取、分析,進而根據新聞資料的重要性和關注程度推送給使用者閱讀。 這其實是「大資料」模式在新聞行業的應用。
傳統領域也有「大資料」模式。 曾經有人與筆者討論一個商業案例,某零售企業對商業圈內的社區垃圾進行收集和資料分析,並以此判斷社區居民的消費需求。 這種「大資料」商業模式無疑是成功的。 然而,筆者更關心這種「大資料」模式是否侵犯社區居民的隱私權。
實際上,近日的「今日頭條」事件,已經凸顯了「大資料」模式的法律風險。
「大資料」模式的法律問題
「大資料」模式的首要法律問題是資料本身的法律屬性。 比如說,「今日頭條」所擷取的新聞資料可能是不受著作權保護的時事新聞,也可能是享受著作權保護的文字作品。 那麼文字作品的著作權或者傳播者權如何保護?如果「今日頭條」以商業目的對文字作品進行使用,恐怕需要取得著作權人或傳播者權人的「使用許可」。 具體取得方式可以是「徵求著作權人或傳播者權人的同意」或者「支付著作權或傳播者權的對價」。 再如,前述商業案例中,社區垃圾的資料資訊是否屬於公民的個人資訊,是否屬於隱私權的保護範疇?這也是值得討論的。
大資料的取得方式也關係到「大資料」模式的合法性問題。 就互聯網資料而言,目前主要的取得方式是利用「編目程式」(也叫「網路爬蟲」)自動搜索並抓取資料。 這種技術有一個專門的協定,即「robots協定」(也叫「爬蟲協定」、「 機器人協定」)。 該協定要求所有網站在其網站的根目錄下放置一個「robots.txt」檔。 該檔告訴搜索者本網站哪些資料可以被「抓取」。 如果網站根目錄下沒有這個檔,則被視為「本網站內所有沒有口令保護的資料都可以被抓取」。 這就意味著如果有人突破「robots協定」範圍抓取網站資料就要承擔 「侵犯資料」的法律責任。 同理,丟棄的社區垃圾是否意味著公民放棄社區垃圾的資料資訊呢?
當然,「大資料」模式的使用目的不同,法律規制的要求也自然不同。 企業以商業目的利用「大資料」模式進行生產、經營的,應當嚴格保護資料權利人的合法利益,不得隨意侵犯資料所附有的著作權、隱私權等權利。 而對於非商業目的利用「大資料」的行為,則應區別對待。 比如,個人或科研部門以學習、研究為目的對「大資料」進行擷取、分析的,政府或司法機關以行政決策或打擊犯罪為目的對「大資料」進行擷取、分析的,則需要對資料權利進行必要的限制。 當然,這種限制是相對的,絕不是說相關部門和人員可以隨意侵犯資料權利人的合法權益。
此外,像大資料的處理、分析這些「加工行為」如何定性,也是一個值得思考的法律問題。 在「今日頭條」事件中,「今日頭條」只是對文字作品進行擷取、分析並重新整理,這像是文字作品的「彙編」行為。 而前述商業案件中,零售企業在社區垃圾的資料資訊基礎上,提取出消費需求資訊及使用者消費規律,這更像是「大資料」的「創作」行為。