NoSQL架構實踐(一)——以NoSQL為輔

[文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2011-2-21]        前面《為什麼要使用NoSQL》和《關聯式資料庫還是NoSQL資料庫》兩篇從大體上介紹了為什麼要用NoSQL,何時該用NoSQL。經常有朋友遇到困惑,看到NoSQL的介紹,覺得很好,但是卻不知道如何正式用到自己的項目中。很大的原因就是思維固定在MySQL中了,他們問得最多的問題就是用了NoSQL,我如何做關係查詢。那麼接下來,我們看下怎麼樣在我們的系統中使用NoSQL。

NoSQL架構實踐(三)——以NoSQL為緩衝

      在《NoSQL架構實踐》系列的前面兩篇文章中,介紹了《以NoSQL為主》和《以NoSQL為輔》的架構。由於NoSQL資料庫天生具有高效能、易擴充的特點,所以我們常常結合關聯式資料庫,儲存一些高效能的、海量的資料。從另外一個角度看,根據NoSQL的高效能特點,它同樣適合用於快取資料。用NoSQL快取資料可以分為記憶體模式和磁碟持久化模式。記憶體模式  

前門新大街8月7日正式開街亮相

今天(8.7號)晚上吃完飯沒什麼事,就去了今天新開街的前面新大街,那人啊,真是相當的多,總的感覺還可以,就是覺得有點窄,應該再寬點,而且兩邊的房子造型一般,沒什麼特色,好多店都還空著沒開張,就一些老字型大小開張了,包括”大北照相館、慶林春茶莊、億兆百貨、都一處燒麥館、一條龍羊肉館、長春堂藥店、中國書店、南區郵局、月盛齋醬牛羊肉館、張一元茶莊分社、尚珍閣工藝品店。由於奧運期間前門大街將有馬拉松等賽事活動,2條鐺鐺車也沒開。馬路兩邊燈的造型象2個大鳥籠子,垃圾筒的造型挺別緻,一眼看去象是石頭做的,還

KTDictSeg 分片語件1.3版本 部分演算法討論 — 分詞粒度

KTDictSeg 分片語件1.3版本 部分演算法討論 -- 分詞粒度作者:肖波    KTDictSeg 分片語件1.3版本已經接近完成,只剩下最後的一點功能。在KTDictSeg

搜尋引擎中中文片語分詞的實現

      實現方式:通過擴充Lucene.net中標準的分詞器來實現。       Lucene.net標準分詞器原代碼StandardTokenizer       Lucene.net標準分詞器在英文分詞中有非常好的體驗。比喻說:在郵件,IP地址,符號處理方面,它都處理得非常好。只是很遺憾,它不支援中文片語分詞。於是,我就通過修改裡面的核心代碼讓它擴充,支援中文的分詞。目標:使它能夠增加對中文片語的切詞。效果:原句:“我是中國人!I am chiness!Email:youpeizun12

Apsara Distributed File System分詞 – 多元分詞

Apsara Distributed File System分詞 - 多元分詞 作者:eaglet      Apsara Distributed File System分詞開發了多元分詞演算法,其與lucene.net 配合構建全文檢索搜尋,經測試準確度接近google和baidu的水平。現將一些實現方法和測試結果公布出來,供關心分詞和搜尋技術的朋友們參考。       中文分詞按照分詞粒度來分,分成

KTDictSeg 分片語件1.3版本 新增功能列表及下載位置

KTDictSeg 分片語件1.3版本 新增功能列表及下載位置1、 修改字典格式,提高字典載入速度 2、 增加對英文專業名詞的支援 如C++,C#等只要加入字典就可以被分出來 3、 增加詞頻判斷功能,在無法取捨時根據詞頻取捨 4、 增加優先優先詞頻選項,通過這個選項動態決定分詞粒度 需開啟 FreqFirst 5、 增加中文人名前尾碼統計和根據該統計定位人名的功能 6、 增加中文人名和未登入詞出現頻率統計功能 7、 增加自動更新字典功能,對超過閾值的人名和未登入詞自動插入字典 需開啟

微博feed系統的推(push)模式和拉(pull)模式和時間分區拉模式架構探討

微博feed系統的推(push)模式和拉(pull)模式和時間分區拉模式架構探討     [文章作者:孫立 連結:http://www.cnblogs.com/sunli/ 更新時間:2010-08-24]    

KTDictSeg V1.4.01 新增功能說明及下載地址

 KTDictSeg V1.4.01 新增功能說明及KTDictSeg 1.4.01 版本經過一段時間的緊張開發,今天正式發布。感謝這段時間一直關心這個項目的朋友們。希望我的工作能給大家帶來快樂。    1、 增加對Asp.net的支援由於Asp.net 應用的當前路徑並不指向web root 或 web root/bin , 1.4以前版本依靠當前工作路徑來讀取設定檔的方式無法支援Asp.net應用。1.4版本修改了這個錯誤。1.4版本目前已經可以很好的支援ASP.NET應用。 2、

漢語轉拼音(帶音調和多音字識別)

漢語轉拼音-----帶音調和多音字識別1、  背景幾年前就在網上看到過漢字轉拼音的程式,大都就是按漢字的編碼轉換,單字對應的演算法實現的。在網上搜尋“漢字轉拼音”的文章可以搜尋到很多,基本都是同一個演算法,各種語言的移植版本都有,但是都有一個共同的缺點,不能支援多音字。比如“重慶”,“重量”這樣的詞語就不能正確的識別,這在很多應用中會是一個非常大的缺陷,更不用說支援音調。(來自http://sunli.cnblogs.com)2、  解決辦法後來找了很多資料,發現微軟的office word20

部落格園現代化建設—[Entity Framework]在LINQ查詢中指定返回的欄位

解決了Entity Framework跨資料庫查詢問題,部落格園現代化建設又向前邁進了一步。在之前的一篇隨筆“部落格園現代化建設——AutoMapper”中曾談到,我們所遇到的應用情境是資料庫查詢返回的欄位數少於實體類的屬性,而預設情況下Entity Framework根據實體類的屬性進行映射的,所以我們改用了AutoMapper。後來, 真見在評論中指出可以在LINQ通過 select new 指定查詢返回的欄位,Entity

中文分片語件 KTDictSeg 1.2 版本發布及演算法簡介

  KTDictSeg 1.2 版本發布及演算法簡介 作者:肖波個人部落格:http://blog.csdn.net/eaglet2007/6 南京 經過一周的工作,完成了KTDictSeg 1.2 版本的開發,該版本對詞庫進行的初步整理,並增加了如下功能1、 增加了中文人名判斷 2、 增加了正向匹配分詞和反向匹配分詞的選項 3、 增加了停用詞過濾 4、 增加了詞性標註 該版本對演算法進行了改進演算法步驟如下1)      預分詞:預分詞以 KTDictSeg 1.0 版本的演算法為基礎(參見

Apsara Distributed File System分詞–功能簡介

Apsara Distributed File System分詞--功能簡介作者:eaglet     兩年前我開發了一個KTDictSeg 中文分片語件,這個組件推出2年來受到很多朋友的喜愛。不過由於我當初開發KTDictSeg時比較倉促,底子沒有打好,而且當時對分詞的理解也比較膚淺,所以KTDictSeg組件存在很多問題,我一直想重新開放一個更好的開源分片語件,但一直沒有抽出時間。上周我終於下定決心開始做這個事情,經過兩周的開發(業餘時間),今天終於完成了Apsara

部落格園現代化建設——Entity Framework

在部落格園新版部落格背景開發中,為了將園子的現代化建設步伐邁得更大一些,準備裝備最先進的武器。之前已經配備ASP.NET MVC 3,目前正在實驗剛從微軟引進的最新型號新式武器——Entity Framework 4.1 RC。實驗情況分析:1. 資料庫連接字串的迴歸在之前版本的Entity Framework中,微軟另搞了一套連接字串,以至無法直接使用原來的ADO.NET連接字串。害得我們只能改裝它,以重用以前的連接字串,詳見在Entity

夢想成為現實:在Enitity Framework中以理想方式實現指定欄位查詢

在之前的隨筆“部落格園現代化建設—[Entity Framework]在LINQ查詢中指定返回的欄位”中,我們找到了問題的原因,卻沒有找到解決方案。而對於理想中的解決方案,我們依然戀戀不忘,雖然很多次嘗試都失敗了,但我們相信,在代碼世界一切皆有可能。讓我們先回顧一下理想中的LINQ查詢代碼:using (BlogDbContext context = new BlogDbContext()){ var result = (from e in context.BlogEntries

常用分詞演算法的比較與設想

        

Apsara Distributed File System分詞-中文人名識別演算法介紹

Apsara Distributed File System分詞-中文人名識別作者: eaglet     eaglet 曾經在KTDictSeg 中分別嘗試使用規則和統計方式來識別中文(漢族)人名,但效果都不理想。在Apsara Distributed File System分詞中eaglet另闢它徑,採用一種新的演算法來識別中文人名,效果相比規則和統計方式要好很多。下面eaglet就來介紹這種中文人名的識別方法。    

部落格園現代化建設——AutoMapper

上篇隨筆寫的是我們在新版部落格後台開發中用上了新式武器——Entity Framework,該武器火力猛,威力大,但使用中發現在某些情境下顯得不夠靈活,後來不得不引進輕量級常規武器——AutoMapper。我們遇到的情境是一個複雜的實體類,有很多屬性,資料庫操作是一個跨資料庫查詢,查詢的欄位遠遠少於實體類的屬性。對於跨資料庫查詢,我們沒有找到通過LINQ to Entities實現的方法,於是就用DbSet.SqlQuery調用預存程序進行查詢,代碼如下:using

Apsara Distributed File System分詞 V1.2 版本發布

V1.2 增加如下功能1. 未登入詞識別的開關,可以允許關閉未登入詞識別功能在搜尋應用中,開啟未登入詞識別功能將會產生大量的新詞,有些新詞其實不是一個真正的詞,這樣將增加倒排索引的負擔,所以Apsara Distributed File System分詞V1.2版本提供了這個選項,讓使用者可以關閉未登入詞識別,關閉後,未登入詞將轉換為單字輸出。2. 英文忽略大小寫功能這個功能在處理英文時還是很有用的。  3.

修改 highlighter.net-1.4.0 一處Bug

最近在做KTDictSeg 的 1.3 版本,在這個版本中做了一個用Lucene.net 搜尋新聞的例子,其中產生關鍵詞摘要用了highlighter.net-1.4.0版本,發現中文關鍵詞摘要產生結果總是不對,但英文的結果是對的。沒辦法,只得把highlighter.net的源碼拿出來調了一遍,最終發現問題在TokenGroup類的IsDistinct函數上。該函數源碼如下        internal virtual bool IsDistinct(Token token)        

總頁數: 61357 1 .... 4701 4702 4703 4704 4705 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.