資料庫技術發展和大多數領域發展一樣,必將是應用驅動和技術驅動相結合。傳統的關聯式資料庫,由於其自身的局限性,在使用中受到了很多限制,在搜尋、多媒體、企業內容管理、電腦輔助設計等方面,資料庫技術幾乎很少涉足,如能在以下4個方面完善資料庫技術,資料庫將擷取更大市場。
方向1.實現非結構化資料管理
企業在資訊化過程中需要處理大量報表、賬單、影像、電子文檔、圖片、音頻、視頻等非機構化資料,這些資料難以用傳統的關係型資料庫管理。隨著XML技術的出現,資料庫實現對非結構化資料的管理已經成為可能。
“如果誰能控制、支援和儲存所有類型的資料,那麼這樣的廠商也就有能力擴充自己其他產品和服務的市場空間。因此整合XML、對象資料、多媒體資料,將所有資料類型放在一個平台上將是傳統的關聯式資料庫發展的一大趨勢。”
不過,處理結構化資料的關係型資料庫從理論到技術上經曆了30多年發展,已經相當成熟,而非結構化資料的複雜程度遠遠高於結構化資料,所以非結構化資料的儲存還存在很多有待解決的難題,比如,如何很好地解決多種異構資料來源的儲存和查詢就是其中的關鍵問題。雖然有人認為將來XML資料庫將能比較好地解決非結構化資料的管理問題,但將現有文檔映射到XML文檔的工作才剛剛開始,XML查詢語言也遠不如SQL成熟。
方向2.實現對Web資料的挖掘
近年來,隨著Internet技術的快速普及和迅猛發展,使各種資訊可以以非常低的成本在網路上獲得,由於Internet在全球互連互連,可以從中取得的資料量難以計算,而且Internet的發展趨勢繼續看好,特別是電子商務的蓬勃發展為網路應用提供了強大支援,如何在Internet這個全球最大的資料集合中發現有用資訊無疑將成為資料採礦研究的熱點。
資料庫技術應用於Web挖掘主要是為瞭解決Web資訊的管理和查詢問題。這些問題可以分為三類:Web資訊的建模和查詢;資訊抽取與整合;Web網站建構和重構。
從資料庫的觀點進行Web內容挖掘主要是試圖建立Web網站的資料模型並加以整合,以支援複雜查詢,而不止是簡單的基於關鍵詞的搜尋。這要通過找到Web文檔的模式、建立Web資料倉儲或Web知識庫或虛擬資料庫來實現。相關研究主要是基於半結構化資料進行的。
長期以來,由於在資料庫觀點下資料的表示方法比較特殊,其中包含了關係層次和圖形化的資料,所以大部分建立在扁平資料集合之上的資料採礦方法不能直接使用。目前已經有人針對多層資料庫挖掘演算法進行研究。
方向3.對智能搜尋技術的支撐
搜尋技術是現在互連網的熱門 App,不過由於速度慢和並發性差等瓶頸限制,資料庫和搜尋技術長期以來都是“大路朝天,各走一邊”。據陳華介紹,在目前的搜尋技術中,出於速度等方面的考慮,搜尋過程中很少有使用資料庫工具的情況。不過隨著搜尋技術對智能化要求的提高,大量的匹配資訊、描述語句出現在搜尋過程中,資料庫技術如何配合未來的智能搜尋,也逐漸被大家關注。
現代網路系統中存在大量的有用資料,例如,每天有幾千萬個研究。然而,得到這些資料卻非常困難。據瞭解, google目前正在嘗試建立一個體繫結構能夠支援新的關于海量Web資料的研究。為了支援新研究,Google以壓縮的形式儲存了實際所抓到的文檔。Google的目標之一就是要建立一個環境使其他研究者能夠很快進入這個領域,處理海量Web資料,在這樣的情況下,無疑需要資料庫技術來對這種系統進行有效支援。
大型Web搜尋引擎將是個非常複雜的系統,為了提高搜尋效率,需要覆蓋大約1億個網頁。我們必須有一個巧妙的演算法來決定哪些舊網頁需要重新抓取,哪些新網頁需要被抓取。受需求驅動,用代理cache建立搜尋資料庫正在成為目前一個有前途的研究領域。
方向4.輔助軟體工程及製造系統的應用
關聯式資料庫技術是為傳統的交易處理而開發的,如庫存控制、工資、賬目等。但是人們很少將關聯式資料庫技術用於電腦輔助設計、輔助工程、輔助軟體工程及輔助製造(CAD,CAE,CASE和CAM)系統及其應用。
傳統的資料庫系統所支援的事務模型不適合於互動式、協作設計環境下所必須的長事務(Long-duration)。傳統的資料庫系統也不提供表示和管理資料庫的臨時變化,包括如像模式的時間和版本變化以及變化的通報(notification)方面的一些工具。
其實,在電腦輔助設計過程中、製造過程中,會出現大量的結構資訊資料,包括參數、圖形、描述、表格、文檔等。有效構建相應結構資訊的資料庫,對所有的結構資訊、載荷資訊和技術資料進行合理的儲存,並對這些資訊資料設計專用檢索程式,可以極大的最佳化設計工作效果。
資料庫的應用空間將不斷地擴充,未來資料庫將向Web這樣一個廣闊的空間發展。然而另一方面,資料庫技術也將向著更加智能化、更加專業化的方向發展,甚至對其融入自然語言和肢體語言的介面,讓人們應用程式資料庫變得更加容易。