Agentic Hybrid RAG
结果反映本次测试配置,表现与模型、检索方式、资料和评分方法有关。
81.33%
整体正确率
2
拒答
122
正确
同一套 FinanceBench,对照 Agentic Hybrid RAG、Naive RAG 和闭卷 LLM。
结果反映本次测试配置,表现与模型、检索方式、资料和评分方法有关。
81.33%
整体正确率
2
拒答
122
正确
对照
Naive RAG
基础检索增强的测试配置。
整体正确率 21.33%
对照
Closed-book LLM(不查文件)
回答时不提供文档检索结果。
整体正确率 24%
Naive RAG
21.33%Closed-book LLM(不查文件)
24%Naive RAG
69.33%Closed-book LLM(不查文件)
42%| 系统 | 正确 | 错误 | 拒答 | 整体正确率 |
|---|---|---|---|---|
| Agentic Hybrid RAG我们的方案 | 122 | 26 | 2 | 81.33% |
| Naive RAG | 32 | 14 | 104 | 21.33% |
| Closed-book LLM(不查文件) | 36 | 51 | 63 | 24% |
评估集分三类各 50 题:领域题、指标题、新颖题;下表是三种系统在各题型的整体正确率对照。
领域题
指标题
新颖题
全部题目
列出正确、错误、拒答、题目数量及两种正确率,与结果汇总 CSV 一致。
| 系统 | 题型 | 正确 | 错误 | 拒答 | 题目数量 | 整体正确率 | 已作答题目的正确率 |
|---|---|---|---|---|---|---|---|
| Agentic Hybrid RAG我们的方案 | 全部题目 | 122 | 26 | 2 | 150 | 81.33% | 82.43% |
| Agentic Hybrid RAG | 领域题 | 41 | 8 | 1 | 50 | 82% | 83.67% |
| Agentic Hybrid RAG | 指标题 | 44 | 6 | 0 | 50 | 88% | 88% |
| Agentic Hybrid RAG | 新颖题 | 37 | 12 | 1 | 50 | 74% | 75.51% |
| Naive RAG | 全部题目 | 32 | 14 | 104 | 150 | 21.33% | 69.57% |
| Naive RAG | 领域题 | 12 | 7 | 31 | 50 | 24% | 63.16% |
| Naive RAG | 指标题 | 1 | 1 | 48 | 50 | 2% | 50% |
| Naive RAG | 新颖题 | 19 | 6 | 25 | 50 | 38% | 76% |
| Closed-book LLM(不查文件) | 全部题目 | 36 | 51 | 63 | 150 | 24% | 41.38% |
| Closed-book LLM(不查文件) | 领域题 | 19 | 15 | 16 | 50 | 38% | 55.88% |
| Closed-book LLM(不查文件) | 指标题 | 10 | 18 | 22 | 50 | 20% | 35.71% |
| Closed-book LLM(不查文件) | 新颖题 | 7 | 18 | 25 | 50 | 14% | 28% |
分别查看三种题型的正确、错误和拒答情况。
全部题目
完整评估集。
81.33%
已作答题目的正确率 82.43% · 题目数量 150
领域题
领域知识库题目。
82%
已作答题目的正确率 83.67% · 题目数量 50
指标题
数字与计算题。
88%
已作答题目的正确率 88% · 题目数量 50
新颖题
非常规题型。
74%
已作答题目的正确率 75.51% · 题目数量 50
整体正确率=正确÷全部题数;已作答题目正确率=正确÷(正确+错误)。拒答计入未答对题目。来源:accuracy_summary.csv。