今天在做rss解析的時候碰到一個奇怪的難題

經過一周的研究,終於可以解析rss2.0,1.0,0.92,Atom0.3格式,今天在繼續測試的時候讓我又遭受一次挫折,在碰到GBK編碼的rss檔案會拋出異常!  比如 :http://club.sohu.com/rss.shtml這個頁的rss. 

這兩天一直在搗騰lucene

    開始看了下java的,弄不太明白,沒學過java,後來找了了.net的,主要是研究下dotlucene,由於剛剛接觸c#,對這樣一個開源的項目研究還是有點困難,不過我比較喜歡搜尋類的,所以還是看了起來,看了大量的資料,英文的和中文的,現在終於是調試成功了,而且加了一個基於詞表的中文分詞。   現在還有Highlighter高亮顯示的沒弄出來,正在研究中!     還有就是自己寫的html2text,感覺效率不是很好,老是程式一運行程式就卡死!不知道什麼原因 1public string 

Tokyo Tyrant (ttserver)的master-slave複製協議分析

                                        Tokyo Tyrant (ttserver)的master-slave複製協議分析                                        The  replication protocol  of  Tokyo Tyrant (ttserver)                              [文章作者:孫立 連結:http://www.cnblogs.com/sunli/

基於memcached協議構建自訂協議

[文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-09-19]  

基於視覺的系統效能最佳化

        [文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-10-27]    起因        最近公司一個專題,結合了電視台的直播,在直播的時候流量猛增。這個專題的尾部頁面帶有自動重新整理某系統的動態資料的功能 ,在直播當晚,給某系統帶了非常大的頻寬壓力。但是根據頁面的結構,使用者基本都停留在首屏,也就是說使用者根本就沒有看自動重新整理的資料。頁面結構如:      

InfoQ百度技術沙龍”APP Engine技術應用”主題的總結記錄

       [文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-12-18]           今天去參加了InfoQ舉辦的百度技術沙龍活動,這次的主題是“APP Engine技術應用”。最近兩年“雲端運算”,“虛擬化”聽得很多,但是真正拿出來應用的,技術分享的非常好。這次的主題非常有吸引力,由於現場的wifi有點問題,所以沒有做微博的直播,所以就準備寫篇部落格來總結下。    

一個簡單的中文分詞

CLucene - a C++ search engine  http://sourceforge.net/projects/clucene/    傳統的全文檢索索引都是基於資料庫的,Sql Server  Oracle mysql 都提供全文檢索索引,但這些比較大,不適合單機或小應用程式(Mysql4.0以上可以作為整合開發),Mysql也不支援中文。   

一次論壇的負載最佳化經曆

                                      一次論壇的負載最佳化經曆現象     論壇系統在最近負載經常達到10幾,訪問論壇頁面速度也還挺快的,執行時間一般在20ms內。經過svn的版本回顧,發現時有個頁面把以前的<script src>的js 請求改成了file_get_contents,然後寫到頁面,可能是為了seo而做的。    定位這點,給file_get_contents加了1分鐘的緩衝,負載果然下來了。  

Tokyo Tyrant(TTServer)系列-備份恢複和增加從庫

                          Tokyo Tyrant(TTServer)系列-備份恢複和增加從庫                             [文章作者:孫立連結:http://www.cnblogs.com/sunli/  更新時間:2009-08-25]                                  上篇:Tokyo Tyrant(TTServer)系列-高可用性和高可靠性+nginx     

利用FUSE把memcached當磁碟使用

     [文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-12-27]       web2.0的盛行,Memcached 用得越來越廣泛。所以也越來越多的產品提供了相容memcached協議的資料存取方式,我們自己開發的NOSQL也提供了memcached協議的支援。一直在想,是否可以把這個NOSQL直接掛載到磁碟上,這樣在某些場合,使用起來就更加方便了。比如cat,vi 都可以直接查看和編輯。     google了一下

天氣突然就冷起來了

   看天氣預報最低溫度已經6度了,今天出去吃飯感覺到有點冷了,坐在電腦前也忍不住關掉窗戶,不然手都被凍僵了!    今天一個朋友跟我說她把毛衣都穿長上了,這種天氣也適合穿了,我還在打算冬天偷偷的弄個什麼取暖的東西來呢!   以前在寢室買了個火鍋大家一起晚上聚在一起吃火鍋,真的是蠻舒服的,感覺很溫馨,現在那個鍋很久沒用了,好像大家現在也懶得去弄東西來煮著吃了,食堂開著呢,多麻煩啊!呵呵,雖然食堂東西也不好吃!  

Tokyo Tyrant(TTServer)系列-介紹和安裝

Tokyo Tyrant(TTServer)系列-介紹和安裝[文章作者:孫立  連結:http://www.cnblogs.com/sunli/ ]       Tokyo Cabinet 是日本人 Mikio Hirabayashi(平林幹雄)のページ  開發的一款DBM資料庫(註:大名鼎鼎的DBM資料庫qdbm就是他開發的),該資料庫讀寫非常快。insert:0.4sec/1000000 recordes(2500000qps),寫入100萬資料只需要0.4秒。search:0.33sec/

當心ttserver(tokyo tyrant)在系統崩潰或斷電的時候遺失資料

                                     [文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-09-03]      

Tokyo Tyrant(TTServer)系列-資料壓縮

                                               Tokyo Tyrant(TTServer)系列-資料壓縮[文章作者:孫立 連結:http://www.cnblogs.com/sunli/  更新時間:2010-02-05]    

WEB緩衝深入介紹

文章目錄                                                            出自PHP Group memcache的使用 memcache的分布式緩衝 memcached的Replication memcached的監控 memcached的遍曆 Tokyo Tyrant的使用 Tokyo Tyrant的Replication Tokyo Tyrant的狀態 Tokyo Tyrant的管理

Tokyo Tyrant(TTServer)系列-啟動參數和配置

Tokyo Tyrant(TTServer)系列-啟動參數和配置 [文章作者:孫立  連結:http://www.cnblogs.com/sunli/  更新時間:2009-03-18]啟動參數介紹    繼續上一篇Tokyo Tyrant(TTServer)系列-介紹和安 我們繼續來看啟動參數和配置。    ttserver命令可以啟動一個資料庫執行個體。因為資料庫已經實現了Tokyo

搜尋引擎核心初步研究成功!

        已經弄了幾天了,今天測試了一下,在伺服器上下載了我的一個歌詞資料庫,有90M左右,17萬資料.下午我把把他索引了10多萬一點記錄,索引檔案46M.在winforms下做搜尋測試一般需要100MS,不過在程式第一次載入需要20S左右!主要是載入中文分詞的分詞資料庫!    

高效能Nosql資料庫Tokyo Cabinet的兄弟Kyoto Cabinet介紹

      話說高效能的Tokyo Cabinet的兄弟,那效能肯定是不錯。官方網站:http://1978th.net/kyotocabinet/Kyoto Cabinet是一個key-value資料庫管理程式的library ,key和value都可以使二進位或者字串格式。資料存放區存分hash和b+ tree模式。   Kyoto Cabinet非常快,在hash模式下,插入100萬資料只要0.9秒,在b+ tree模式下只要1.1秒。查詢200萬條資料也只需要1秒。並且Kyoto

注意cache同時到期問題

[文章作者:孫立

基於逆向最大化詞表中文分詞法。

以前做知識管理系統的時候,由於需要建立全文檢索索引和統計詞頻,需要對中文文本進行分詞。對於中文分詞,國內做到好的應該是中科院自然研究所,但是相對比較複雜,我看了幾次沒有看明白. :)  ,由於平常我們的知識系統對分詞的要求沒有這麼高,所以 就選擇了最大化的詞表分詞法.  詞表選擇的是人民日報97版的詞表.實際效果可以達到90%以上,基本可以滿足需要。支援 Lucene.net分詞,詞表是啟動時一次性載入;   具體代碼如下:  public sealed class

總頁數: 61357 1 .... 4702 4703 4704 4705 4706 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.