集體智慧編程--勘誤表(1-4章)

來源:互聯網
上載者:User

標籤:style   blog   http   使用   io   檔案   資料   ar   2014   

最近在工作之餘的時間在閱讀集體智慧編程這本書,在隨書碼字的過程中遇到的一些問題,就在這裡記錄一下:

(註:下面的頁碼針對於英文的非影印版)

chapter1 標題:

沒什麼說的,瀏覽下就好。

chapter2 提供推薦:

1.書上的源碼是基於python 2.x,而在3.x中print是被當作一個函數處理,所以要自己加上括弧;

2.在P42利用del.icio.us提供的rss訂閱源構建資料集時,這本書發布時間較長的原因,python api pydelicious的

很多介面已經發生了改變,這個實驗我最後跳過了,作了後面的MovieLens,書中資料的為:

http://grouplens.org/datasets/movielens/;

chapter3 發現群組:

仍然是資料集構建的問題,我們學習的主要重心在於資料的處理部分,而非資料的採集,所以可以採用將資料檔案直接下載的方法,

我們將http://kiwitobes.com/clusters/feedlist變更為http://segaran.com/clusters/feelist,之後只要出現kiwitobes直接

替換為segaran就可以了;關於PIL的安裝,不要採用python的easy_install或者pip install,直接下載對應

平台的可執行檔即可,在這裡我下載的是PIL-1.1.7.win32-py2.7.exe,直接安裝即可;

chpter4 搜尋與排名:

1.關於資料庫sqlite的安裝在python2.x的版本中,是有包含sqlite的,所以大部分情況下自己也無需安裝,具體可以可以在python

的安裝路徑python/Lib/下,如果找到sqlite3就表示可以直接使用,相應的匯入包的語句變更為import sqlite3 as sqlite即可

2.在P85的部分是沒有介紹函數addlinkref,有需要的同學需要自己到隨書源碼包中去查看

3.在calculatepagerank(self,iterations)函數中,初始化pagerank表時,書中的源碼和隨書源碼是不同的,但書中源碼的效率

較高

4.代碼輸出結果不同:

   a.建立的searchindex.db,書中是27mb左右,自己產生的是22mb左右,這個原因主要是一些連結的失效

   b.P103未訓練之前getresult函數產生的結果應該是0.076,後面經過多次訓練,以及本身資料集不同的原因,輸出結果不同

   是正常的現象。

   c.需要注意一點,一般在建立好資料庫和表時,第一次必須執行一次產生隱藏層節點的函數,generatehiddennode(wordids,urlids)

   在nn.py中

   在searchengine.py中

   

 

集體智慧編程--勘誤表(1-4章)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.