搜尋引擎排名和Page Rank 關聯分析 最近 google 黑板報 的一篇關於 談 Page Rank – Google 的民主表決式網頁排名技術 又掀起了大家對 PR 的關注,加上最近 google 對一些網站的PR 做了調整,因此很多朋友都談到這這個話題。 見:Google PageRank 又更新了 Google PR值更新了吧? 有關 Pagerank 民主的民科研究 現在對PR最關心的大概就是 SEO
如何判斷一個網頁是不是一個Blog的首頁? 最近碰到一個問題,如何從一組連結中,判斷連結是不是Blog的首頁連結? 先從 Blog 存放的地點說起:1、由BSP託管的Blog,一般採用開源或者BSP獨立開發的Blog系統;2、由個人空間存放的Blog,一般採用開源的Blog系統。而個人空間存放的Blog大都是 比較職業的 價值比較高的Blogger。 對於第一類,BSP的Blog連結地址都是固定的,加上成規模的BSP數量較少,其Blog的首頁連結可以列舉出來。
有趣的數列失真縮放 最近想做一個對Lucene中Term出現頻率的統計Applet圖。(類似股票K線圖)碰到了一個有趣的問題,寫出來和大家分享。
這是我研究網頁切片演算法的一個匯總想法。 之前我寫過:一種面向搜尋引擎的網頁分塊、切片的原理,實現和示範 ,隨著工作的深入,逐漸碰到以下問題: 網頁切片的粒度問題: 網頁切片演算法的目的不是精確找到所需要的內容,而是識別劃分網頁的各種功能區域,導航區,連結區,內容,頁尾區和廣告區等。 網頁切片的網頁對象: 互連網紗功能的網頁大概有2種類型,目錄型和內容型;隨著搜尋引擎的發展,網站結構逐漸向扁平化的方向發展,車東
想起了王安的一個故事: 當機立斷 精粹28
半年以後說SouYo從我第一天知道SouYo後,就一直再觀察它。Technorati
提供:抓蝦 熱點文章 rss 訂閱服務無心插柳 --- 題記 和身邊的一些朋友聊天,發現都很喜歡抓蝦。抓蝦專註於”讓每個人都可以輕鬆閱讀部落格和新聞” ,服務很到位,的確讓人嘖嘖稱道。抓蝦是如此的成功以至於成為了這類產品的標準,後來者無不模仿、甚至全盤抄襲抓蝦的裡裡外外。很多人喜歡抓蝦,和我一樣,經常看抓下的熱文推薦欄目,而其他的則參與不深。但很多人苦於抓蝦不提供熱文的rss訂閱服務,只要不厭其煩的翻頁 click , click
在 計算所漢語詞法分析系統ICTCLAS 字典格式解析 一文中簡單介紹了一下 ICTCLAS 。本來是要把字典格式一併寫上去,無奈不知道怎麼描述這個格式,現在終於寫出了第一個Java版本的代碼,也理清了思路。這個檔案格式可以這樣來描述: 先用文字描述一下: ictclas的字典檔案由結構相同的Segment組成(比如:英文字典可以按照詞語的首字母分為26個Segment。)。 在一個Segment中由結構相同的Section組成。Section是描述詞語的最小單位。
[資料統計] 搜尋引擎索引庫:百度大於雅虎中國 之一互連網滲透的越深、世界就會越平;資訊越透明,誠信越重要---題記 關心搜尋引擎的朋友們都知道,搜全率和搜准率是衡量搜尋引擎系統的兩項基礎指標,在很多關於搜尋引擎技術評比的文章中搜全率和搜准率被頻頻提及。
網站網域名稱搜尋引擎 這是一個 網站網域名稱搜尋引擎。 http://www.search-analysis.com/sem/website-reverse-link-reporter.html 一直以來我都在考慮如何用最快的方法獲得一個網站的所有子網域名稱! 百度服務列表就是用這個方法獲得的,順便告訴 老熊 吧。 這或許不是什麼演算法問題,但有些技巧。 現在的速度還很慢,使用的時候請注意以下幾點
通過分析html格式確定網頁主體內容的想法 做Web編程有時候需要瞭解html檔案的大小,組成等資訊,為以後的各種處理做準備。比如通過crawler抓取網頁對網頁內容自動分類的時候,最好能提取網頁中的主要資訊,過濾掉頁頭,頁角的非主體資訊;還有比較2個網頁內容相關性的時候也需要類似的技術。最簡單的還有:分析一個網頁中使用IFrame的個數,內外連結個數比例等都需要對Html檔案格式做分析。
介紹 Nutch 第一部分:抓取過程詳解(2) 通過上文現在我們有了一些基本的概念了,現在應該接觸實際的操作了,因為懂得原理和實踐還是有很大差距的。 抓取是一個迴圈的過程:抓取蜘蛛從WebDB中產生了一個 fetchlist
google 和 unixlite 的設計理念 昨天 feng.you 給我這條資訊:the google legacy。 http://www.cincomsmalltalk.com/userblogs/runarj/blogView?showComments=true&entry=3308017355 google的使命是“整合全球資訊”,這也決定了在設計google基礎軟體架構的哲學。1、不使用大型關聯式資料庫系統 oracle 或者 sqlserver 儲存資料。2
實現文本自動分類的基礎----Term頻率計算方法
給站長們的一把瑞士軍刀題記: 磨刀不誤砍柴工 互連網站長是一支正在逐漸壯大的群體。265.com 已經連續2次在廈門舉辦了站長大會,在業界影響廣泛。 站長們又是一群吃苦耐勞,創意非凡的活躍群體。網站的創意、策劃、網域名稱註冊、空間維護乃至代碼,內容,幾乎無所不包。 在搜尋引擎時代來臨後,站長們又把目光投向了搜尋引擎最佳化。 搜尋引擎最佳化seo,是站長的最愛,也是站長的一塊心病。畢竟站長和搜尋引擎是茅與盾的兩方,互相鬥智鬥勇。
多麼樂 搜尋引擎索引量報告--實現了自動發送周報功能 自從 多麼樂 搜尋引擎 索引量 統計報告發布一來已經有100多位站長登陸使用;為了把這部分資料主動送到各位站長手中,我特地製作了 這個周報功能,他將會在沒周六下午3點10分,給您提供貴站在google,baidu,yisou,msn等主流搜尋引擎上的索引量資料。 如果您想也使用這項功能,您可以在: 搜尋引擎統計 上登陸您的網址,(注意按照要求填寫。) 並提供您的Email地址。
Web2.0 的冬天快要來臨了? 敏思部落格的倒閉和中搜即將發生大裁員似乎給了我們一些暗示......,不過這並不妨礙搜尋引擎如雨後春筍般的湧現,下面是我收集的世界上最著名的220最著名的搜尋引擎大全,與大家分享. 您也可以在這裡閱讀每日搜尋引擎新聞.
據說垂直搜尋現在很熱,那麼什麼是垂直搜尋呢,下面是我的幾點認識,歡迎大家討論。 1、垂直搜尋引擎不是什嗎? 垂直搜尋不只是類google的行業通用搜尋。以房產行業為例,如果我們按照google抓取網頁的方式,來建造一個房產行業google的做法,是行不通的。技術壁壘不用解釋,就算我們藉助nutch,lucene等搜尋技術來做,我們也無法提供差異化的服務,而沒有差異化的產品在互連網贏家通吃的規則下是無法生存的,就是不要簡單地模仿,而要想辦法形成互補。
nutch 0.7 plug-ins 詳解最近桂林在關注nutch的進展狀況,這裡有幾個重要的訊息要和大家分享:1、nutch 0.7 發布了;2、nutch 的java原始碼包路徑改變成了org.apache...3、yahoo也使用了nutch,並做了很多的工作。1 2clustering-carrot2 : 一個搜尋結果類聚的代碼架構,目前和Egothor等搜 索引擎結合的很好;
給站長們的第二封信:Page Rank 吸血鬼我想站長們在交換鏈結接的時候,被問的最多的一句話應該是:你的Page Rank 是多少啊?Page Rank 儼然成為了衡量網站品質最重要的標誌,很多站長為提高網站的Page Rank 也樂此不疲,高Page Rank 的站長更是對此津津樂道。目前很多站長在追求提高首頁Page Rank的時候,同時也把目光放到了提高主要次層網域,子目錄上面。很顯然瞭解網站總體的Page Rank ,比簡單的比拼首頁的Page Rank