TaDELS RAG Beta

TaDELS RAG Benchmark持續擴充中

首版(v1.0)以法實證資料庫中 211 篇 COVID-19 疫情言論相關案件為基礎,評估 RAG 系統的兩大能力:檢索品質(能否找回正確文件,以 nDCG@5 衡量)與生成品質(能否依文件產生正確、無幻覺的答案,以 Entity Matching、Hallucination 等指標衡量)。

訓練集 Train
446
驗證集 Val
101
測試集 Test
101

註:訓練集供模型學習與開發、驗證集用於超參數調整與模型選擇,測試集則保留作為最終評估,不參與開發與調參。

上傳模型預測

上傳測試集(test set)的模型預測結果;需登入後上傳。格式與完整教學請見 GitHub
拖曳檔案到這裡,或點選上傳
JSON 陣列格式即可,檔名不限

Leaderboard

預設顯示依 Total 排序,可點選任一欄位表頭改用其他指標排序。
載入中…
上傳結果詳情
點選上方排行榜任一列,即可在此查看該筆的逐題詳細結果;你自己上傳後的結果也會顯示在這裡。
TaDELS RAG 詳細結果(val / test / train)