1 查全率與查准率
傳統的資訊檢索評價指標主要是查全率與查准率,
查全率是指返回結果中相關文檔數量與系統中總的相關文檔數量的比率,主要反映檢索系統召回相關結果的完整性。
查准率是指返回結果中相關文檔的數量與結果總數的比值,反映檢索系統查詢結果的準確度。
recall = num(查詢結果集中相關文檔)/num(系統中總的相關文檔)
precision = num(查詢結果中相關文檔)/num(查詢結果總的文檔)
查全率與查准率之間是相關的,總的結果數量越多,查全的可能性就越大,查全率就越高,相反誤檢的數量也越多,查准率也越多。反之亦然。
一個綜合查全與查準的指標:F1(recall,precision) = 2recall*precision/(recall+precision)
查全率的計算(來源於互動百科):
衡量某一情報檢索系統
從特定文獻集合中檢出相關文獻成功度的一項指標。它的數值等於 w/x,式中 w為使用者鑒別檢出的 m篇文獻時,認為實際對口徑的文獻篇數,x 為特定檢索系統中所包括的全部 n篇文獻中實際與某一課題相關的文獻篇數。這一指標最初是由J.W.佩裡
與A.肯特
等人於1956年提出的。F.W.蘭開斯特
於1979年在《情報檢索系統──特性、實驗與評價》
一書(第二版)中將上述n篇文獻表達為a+b+c+d之和,並採用下列2×2表。
查全率
上述m篇文獻應為a+b,w篇文獻應為a,x 篇文獻應為a+c。查全率可表述為a/(a+c),式中a
值經過一次檢索即可判定,c值一般可用下述4種方法確定:①若n
值不大,逐篇鑒別各篇文獻,即可確定c值。②若n值很大,可對未檢出文獻隨機抽樣,如抽樣為1/100,其中有r篇文獻是相關的,則估計c=100r。③
由有經驗的使用者去鑒別檢出的文獻,若他認為這次檢出了2/3
的全部相關文獻,則c=1-2/3=1/3。④通過不同途徑去檢索同一課題的文獻,把各次檢出的文獻加在一起,剔除重複,形成一份較完整的相關文獻清單,
以此對比每次檢出的相關文獻,即可知道相應的c值。有了a值與c 值,代入公式a/
(a+c),即可求出查全率。一般來說,檢索工具的標引深度越大,查全率也就越高。標引過程的網羅性越好,查全率也就越高。C.W.克萊弗登
1963年通過實驗揭示查全率與查准率
一般呈互逆相關關係,即提高查全率往往要降低查准率,反之亦然。1982、1983年中國已有人用機率論與微積分證明了這一經驗定律,並對查全率、查准率相關矩陣邊線與隅角的物理意義作出了進一步的科學解釋。
2
TSAP(TREC-style
average precision)
其中當第i個文檔是相關文檔時ri = 1/i, 否則i = 0. N代表取前N個文檔做為衡量指標。通常來說相關文檔應盡量排在前面,前N篇文檔中相關文檔的數量越多,相關文檔的位置越靠前,TSAP@N 會越大,檢索系統的精確程度越好。
3MAP(Mean average precision)
MAP用來衡量排序結果的精確率。假定文檔只分為相關與不相關兩種,P(n)表示前n項結果的精確率。
P(n) = (number of positive instances within n) / n;
基於P(n)的平均查詢準確率AP為:
其中N表示檢索出文檔的總數量,pos(n)表示第n篇文檔是否為相關文檔,如果是則為1,否則為0。MAP即為對測試集中所有的查詢求AP的平均值。
4 NDCG(Normalized discount cumulative gain)
NDCG用來衡量排序結果的準確率,使用文檔數值化而非二值化的文檔相關性。
R(j) 表示第j篇文檔的相關分值,Zn是關於n的一個標準化因子,NDCG只計算檢出的文檔即可。