首版(v1.0)以法實證資料庫中 211 篇 COVID-19 疫情言論相關案件為基礎,評估 RAG 系統的兩大能力:檢索品質(能否找回正確文件,以 nDCG@5 衡量)與生成品質(能否依文件產生正確、無幻覺的答案,以 Entity Matching、Hallucination 等指標衡量)。
註:訓練集供模型學習與開發、驗證集用於超參數調整與模型選擇,測試集則保留作為最終評估,不參與開發與調參。