評測分析

財報問答評測結果

查看 150 道題的整體結果與題型彙總。測試日期、模型版本、檢索設定、評分說明與逐題輸出尚未披露。

整體結果

同一套 FinanceBench,對照 Agentic Hybrid RAG、Naive RAG 和閉卷 LLM。

我們的方案

Agentic Hybrid RAG

結果反映本次測試設定,表現與模型、檢索方式、資料和評分方法有關。

81.33%

整體正確率

2

拒答

122

正確

對照

Naive RAG

基礎檢索增強的測試設定。

整體正確率 21.33%

對照

Closed-book LLM(不查文件)

回答時不提供文件檢索結果。

整體正確率 24%

  • Agentic Hybrid RAG 的記錄正確率為 81.33%。
  • 本次記錄中,Naive RAG 有 104/150 題拒答。
  • 閉卷模型回答時不提供文件檢索結果,記錄正確率為 24.00%。

整體正確率

Agentic Hybrid RAG我們的方案

81.33%

Naive RAG

21.33%

Closed-book LLM(不查文件)

24%

整體拒答率

Agentic Hybrid RAG2 題拒答

1.33%

Naive RAG

69.33%

Closed-book LLM(不查文件)

42%
系統正確錯誤拒答整體正確率
Agentic Hybrid RAG我們的方案12226281.33%
Naive RAG321410421.33%
Closed-book LLM(不查文件)36516324%

按題型拆解

評估集分三類各 50 題:領域題、指標題、新穎題;下表是三種系統在各題型的整體正確率對照。

我們方案 · 各題型整體正確率

領域題

82%

指標題

88%

新穎題

74%

全部題目我們的方案

81.33%

各題型整體正確率

  • Hybrid
  • Naive
  • Closed

領域題

Hybrid
82%
Naive
24%
Closed
38%

指標題

Hybrid
88%
Naive
2%
Closed
20%

新穎題

Hybrid
74%
Naive
38%
Closed
14%

全部題目

Hybrid
81.33%
Naive
21.33%
Closed
24%

各系統與題型的結果彙總

列出正確、錯誤、拒答、題目數量及兩種正確率,與結果彙總 CSV 一致。

系統題型正確錯誤拒答題目數量整體正確率已作答題目的正確率
Agentic Hybrid RAG我們的方案全部題目12226215081.33%82.43%
Agentic Hybrid RAG領域題41815082%83.67%
Agentic Hybrid RAG指標題44605088%88%
Agentic Hybrid RAG新穎題371215074%75.51%
Naive RAG全部題目321410415021.33%69.57%
Naive RAG領域題127315024%63.16%
Naive RAG指標題1148502%50%
Naive RAG新穎題196255038%76%
Closed-book LLM(不查文件)全部題目36516315024%41.38%
Closed-book LLM(不查文件)領域題1915165038%55.88%
Closed-book LLM(不查文件)指標題1018225020%35.71%
Closed-book LLM(不查文件)新穎題718255014%28%

我們方案 · 各題型摘要

分別查看三種題型的正確、錯誤和拒答情況。

全部題目

完整評估集。

81.33%

已作答題目的正確率 82.43% · 題目數量 150

領域題

領域知識庫題目。

82%

已作答題目的正確率 83.67% · 題目數量 50

指標題

數字與計算題。

88%

已作答題目的正確率 88% · 題目數量 50

新穎題

非常規題型。

74%

已作答題目的正確率 75.51% · 題目數量 50

整體正確率=正確÷全部題數;已作答題目正確率=正確÷(正確+錯誤)。拒答計入未答對題目。來源:accuracy_summary.csv。

從一項業務任務,開始使用 AI Agent

Firmground AI

選擇團隊熟悉的任務,了解 Firmground AI 的處理過程與交付成果。

  • 處理業務文件與數據
  • 連接業務工具,執行具體任務
  • 重用工作流程,關鍵操作經審批後執行

已有帳戶可直接登入。企業系統連接與部署方案可透過示範討論。