注意: QQ273939617,文章可轉載,但請勿修改,包括錯別字。 *轉載請註明該論壇直接連結 http://blog.sina.com.cn/chengg0769 文章內文字請勿隨意添加任何形式的連結。 *請註明發帖人在本論壇的名字(sina
//這是向一線勘探諮詢的信,歡迎您給我意見,不甚感激。//我的意圖和想法,思路,幾乎在我收集的文章裡//一句話描述我的思路:建立簡單得像計算機一樣好用,易用的網站,提供給採購,業務,商貿人員查詢公司資訊,供求資訊,提交供求資訊。技術基於linux,lucene,mysql,php,網路蜘蛛等。硬體基於低檔pc(線下30-50台pc,分布式抓取分析,集中儲存。線上部分基於約20000-30000/台的super mainboard+Xeon組裝伺服器.
社會化搜尋:一個關鍵的等式開篇明義,先把等式列出來: 社會化搜尋=社區≠社區搜尋 然後學一下“劉韌體”,談結論,不展開闡述了: 1. Google的成功,代表的是“機器搜尋”的成功;由此創造出一個巨大的“機器搜尋”市場 2. 目前還有一個機會將類似google的“機器搜尋”改變人們的生活--“社會化搜尋”(或稱:人肉搜尋);這個市場,目前還沒什麼人做;甚至很多人壓根還沒看到。google和百度都看到了這個市場,但是如何往下做,他們自己都還在嘗試 3. 很多vc對google臨淵羨魚,但現在有一個
http://www.mysoo.com.cn/news/2006/200611849.shtml 對於搜尋引擎, 在索引量和搜尋量大到一定程度的時候, 索引更新的效率會逐漸降低, 伺服器的壓力逐漸升高, 因此基本上整個搜尋引擎的利用率可以說是越來越低了, 並且隨著海量資料存放區帶來的困難, 設計一個良好的分布式搜尋引擎將是一個搜尋引擎能否面相未來發展的關鍵因素了. 那麼分布式搜尋引擎的最主要的核心問題是哪些呢? 1.
今晚,繼續對所謂產品垂直搜尋進行一個摸底分析。//chengg0769 blog.csdn.net/chengg0769 轉載請勿修改和插入連結。決不可用於平面媒體。1. xyz獵商:極其壞的結果,居然連USB這樣的關鍵字也出不來一個結果,那還掛在這裡幹什麼呐。還白白佔用一個“商”字。2.xyz品通:把網頁過濾掉,出來的都是帶企業的網站,沒什麼新鮮,如果點某個企業進去看,出現"您好,正在為您開啟該網站,請稍候",蹩足,技術差,多餘。醜陋。3.
//chengg0769 blog.csdn.net/chengg0769 此行需保留Google無法回答這個問題。百度,雅虎也無法回答這個問題。因為這是他們的資本。多,搜遍各個角落。你不能以這個問題革了他們的命。1. 地毯式是發現資訊的必然手段。誠然。類似的平面技術是可以發現每個角落的知識,我們假設所有資訊都是非DB儲存方式。但這個發現的意義在於此類平面搜尋都為它找到的每一個頁面作了索引,這是沒問題的。在發現資訊這個技術上。平面搜尋是作到了。2.
發布時間: 2007-5-28 17:08 作者: sunny對於搜尋引擎, 在索引量和搜尋量大到一定程度的時候, 索引更新的效率會逐漸降低, 伺服器的壓力逐漸升高, 因此基本上整個搜尋引擎的利用率可以說是越來越低了, 並且隨著海量資料存放區帶來的困難, 設計一個良好的分布式搜尋引擎將是一個搜尋引擎能否面相未來發展的關鍵因素了.那麼分布式搜尋引擎的最主要的核心問題是哪些呢?1. 分布的資訊擷取和計算以及對此進行的資料統一這裡麵包括爬蟲/或者相應的資料擷取機制的分布, 對資訊進行加工的統一管理2.
Google在搜尋領域的成功無疑離不開其先進的搜尋演算法,然而在背後卻存在著一些鮮為人知的秘密:其實Google在運行資料中心方面的經驗比其搜尋演算法更寶貴。 Google並沒有耗資能夠數千萬甚至上億美元的資金來購買昂貴的裝置,而是僅有數百萬美元購置的廉價電腦來構築其基礎設施。通過研究硬體成本,Google的技術人員發現,購買一些高端伺服器的成本要遠高於數十台更簡單的"福士化"伺服器。
Google搜尋引擎技術實現探究 Google搜尋引擎技術實現探究 化柏林 (中國科學技術資訊研究所 北京 100038)【摘要】 本文從技術的角度剖析了Google搜尋引擎的體繫結構與工作過程,詳細介紹了基於Robot的網頁搜尋、標引入庫和檢索引擎三大模組,統計了Google的技術資料,並分析了Google的技術實現特點,解
背景:單線程為30萬條資料建索引花了10分鐘,為了提高效率採用多線程起初我採用多個線程共用一個indexwriter執行個體(也意味著往同一個目錄寫索引),這是luceneinaction和lucenewiki的推薦做法,不知道到為什麼總是報FileNotFoundException,很讓人困惑。偶爾會成功一次。這個錯誤讓我想起另外一個問題,就是在建索引的時候搜尋也會報這個錯誤,luceneinaction明明也說了建索引讀的時候沒問題。言歸正傳,我第二次嘗試使用每個線程單獨擁有自己的index
最近在研究產品搜尋內的成熟網站,至於CPbay等類似的網站是否能稱得上所謂第三代,我覺得所謂IT媒體記者的話倒不太權威,依我看法,現在還無所謂第三代。因為這個模式還是固有傳統平面搜尋結果加上些許過濾而已。IT記者也不過是人云亦云的采編報道工具。不足以有權威定論。據我所知,至少現在的所謂專家還沒對第三代做出一個概念性描述。昨天我有篇文章暴露出cpbay不太垂直,是什麼原因呢?因為我用自己的網名來搜尋,結果類似平面搜尋的結果。今天不太死心,用另外一個關鍵字來搜尋:Flickr,大家都知道,這個是一個
一、緣起 Lucene在索引檔案上G之後的搜尋效能下降很嚴重,隨便跑個搜尋就要上0.x秒。如果是單線程搜尋那麼效能尚可,總可以在0.x秒返回結果,如果是Web式的多線程訪問,由於Lucene的內部機制導致資料被大量載入記憶體,用完後立即丟棄,隨之引起JVM頻繁GC,效能極其低下,1-10秒的長串連比比皆是。這也是世人為之詬病的Lucene應用瓶頸問題,那麼是否有解決方案呢? 二、思路 我們來觀察Google,
Lucene簡介:第一節 全文檢索索引系統與Lucene簡介··· 3一、 什麼是全文檢索索引與全文檢索索引系統?··· 3二、 什麼是Lucene?··· 4三、 Lucene的應用、特點及優勢··· 4四、 本文的重點問題與cLucene項目··· 5第二節 Lucene系統結構分析··· 5一、 系統結構組織··· 5二、 資料流分析··· 6三、 基於Lucene的應用開發··· 8第三節
//chengg0769 此行保留最近看到所謂的圈地,人肉搜尋。一句話,yahoo靠那樣的人工分類法都無法在現在的海量資料下生存,何況圈地呢。1. 組織問題無人能在不給資金的前提下運作一個萬人的團體,除非騙人2. 成本問題就算1000元/人的費用來整理搜集資料,誰來出這1000W??3. 時間成本問題機器一秒鐘可以作多少事情,資料庫1個小時能處理1000w筆資料,靠人,靠怕100年也處理不完4.
開源已不再受困於如何盈利,其商業化現正愈發充滿生機。開源商業協會的召集人Matt Asay這樣認為,在他看來,開源已經跨越了眾所周知的那道障礙。 在最近一次關於開源商業化趨勢的會議上,Matt Asay說,“現在的問題並非如何讓開源盈利,而是你接受開源後,如何最大化地挖掘開源的商業價值。” 調查資料顯示,從1997至今已在開源投資20億美元,而高品質的開源軟體卻值160億美元。 使用者正在逐漸意識到,他們可以投入開源較少的錢而擷取非常大的收益。Matt
未來的電視是什麼樣子? 假設現在是2030年,那麼此時的電視是什麼樣子呢?電視的外觀: 1.兩級分化 未來的電視外觀將走向兩個極端:一個極端是越來越大。這個是很容易看到的趨勢,現有電視也是遵循這這個思路在發展。一個極端是越來越小。未來電視的另外一種外表可能是一副眼鏡,你帶上它就可以收看了;就像周星星在國產007裡面示範的一樣:周星星同學從容不迫的脫下鋥亮的皮鞋對著畫面說:你以為它是一雙皮鞋嗎?不,實際上它是一隻吹風機。 2
//chengg0769 轉載需保留我分析原因有幾個:1. 在垂直搜尋行業,沒有通用的所謂方案定製化,專業化,細膩度很高的垂直搜尋行業,基本細化到抓什麼網站的哪些網頁,要向資料庫提交什麼樣的查詢語句,資訊的分類,特性值等高度定製化的東西,可以說,沒人能提供一個方案給你建立一個垂直搜尋。作為企業內部使用方可,如果要商用,要運營,是可笑的事情。2. 如果具有核心的構件,沒有公司會出售。像google公司,百度公司一樣,架構和實現都是高度保密的東西,怎麼可能輕易售於人使用。破解了怎麼辦?3.
//chengg769 blog.csdn.net/chengg0769 此行需保留很奇怪的是,哪個行業賺到錢,齊刷刷,目光就會對準它。學習搜尋技術和關注搜尋技術的原因很簡單:1.
機器搜尋引擎 vs 人肉搜尋引擎胡寶介 發表於 2006-9-5
http://blog.sina.com.cn/chengg0769 轉載請註明出處和具名 公司資訊通路在哪裡?模型思考,或改良模型,或過渡模型================================================================KeyWord: