Agentic Hybrid RAG
結果反映本次測試設定,表現與模型、檢索方式、資料和評分方法有關。
81.33%
整體正確率
2
拒答
122
正確
同一套 FinanceBench,對照 Agentic Hybrid RAG、Naive RAG 和閉卷 LLM。
結果反映本次測試設定,表現與模型、檢索方式、資料和評分方法有關。
81.33%
整體正確率
2
拒答
122
正確
對照
Naive RAG
基礎檢索增強的測試設定。
整體正確率 21.33%
對照
Closed-book LLM(不查文件)
回答時不提供文件檢索結果。
整體正確率 24%
Naive RAG
21.33%Closed-book LLM(不查文件)
24%Naive RAG
69.33%Closed-book LLM(不查文件)
42%| 系統 | 正確 | 錯誤 | 拒答 | 整體正確率 |
|---|---|---|---|---|
| Agentic Hybrid RAG我們的方案 | 122 | 26 | 2 | 81.33% |
| Naive RAG | 32 | 14 | 104 | 21.33% |
| Closed-book LLM(不查文件) | 36 | 51 | 63 | 24% |
評估集分三類各 50 題:領域題、指標題、新穎題;下表是三種系統在各題型的整體正確率對照。
領域題
指標題
新穎題
全部題目
列出正確、錯誤、拒答、題目數量及兩種正確率,與結果彙總 CSV 一致。
| 系統 | 題型 | 正確 | 錯誤 | 拒答 | 題目數量 | 整體正確率 | 已作答題目的正確率 |
|---|---|---|---|---|---|---|---|
| Agentic Hybrid RAG我們的方案 | 全部題目 | 122 | 26 | 2 | 150 | 81.33% | 82.43% |
| Agentic Hybrid RAG | 領域題 | 41 | 8 | 1 | 50 | 82% | 83.67% |
| Agentic Hybrid RAG | 指標題 | 44 | 6 | 0 | 50 | 88% | 88% |
| Agentic Hybrid RAG | 新穎題 | 37 | 12 | 1 | 50 | 74% | 75.51% |
| Naive RAG | 全部題目 | 32 | 14 | 104 | 150 | 21.33% | 69.57% |
| Naive RAG | 領域題 | 12 | 7 | 31 | 50 | 24% | 63.16% |
| Naive RAG | 指標題 | 1 | 1 | 48 | 50 | 2% | 50% |
| Naive RAG | 新穎題 | 19 | 6 | 25 | 50 | 38% | 76% |
| Closed-book LLM(不查文件) | 全部題目 | 36 | 51 | 63 | 150 | 24% | 41.38% |
| Closed-book LLM(不查文件) | 領域題 | 19 | 15 | 16 | 50 | 38% | 55.88% |
| Closed-book LLM(不查文件) | 指標題 | 10 | 18 | 22 | 50 | 20% | 35.71% |
| Closed-book LLM(不查文件) | 新穎題 | 7 | 18 | 25 | 50 | 14% | 28% |
分別查看三種題型的正確、錯誤和拒答情況。
全部題目
完整評估集。
81.33%
已作答題目的正確率 82.43% · 題目數量 150
領域題
領域知識庫題目。
82%
已作答題目的正確率 83.67% · 題目數量 50
指標題
數字與計算題。
88%
已作答題目的正確率 88% · 題目數量 50
新穎題
非常規題型。
74%
已作答題目的正確率 75.51% · 題目數量 50
整體正確率=正確÷全部題數;已作答題目正確率=正確÷(正確+錯誤)。拒答計入未答對題目。來源:accuracy_summary.csv。