🧪 LLM-Eval-Framework 评测平台

RAG 幻觉检测与回答质量评估系统
评测样本数
--
Baseline 平均分
--
Optimized 平均分
--
Cohen's d 效应量
--
正在加载数据...

Baseline vs Optimized 对比

正在加载对比数据...
Baseline 胜
--
Optimized 胜
--
平局
--
p 值
--
Cohen's d
--
检测器 Precision
100%
检测器 Recall
80%
正在加载检测结果...
📊 评测报告总览
本报告由 reports/generate_report.py 自动生成,包含总览指标、检测器性能、按分类幻觉率、Bad Case 清单。
正在加载报告内容...
📈 关键指标总结
总评测样本
20
幻觉率
--
CI 门禁状态
通过 ✅
优化效果
显著提升
任务成功率
--
平均步骤准确率
--
工具选择准确率
--
鲁棒性成功率
--
对内置 Agent 测试集做「工具调用轨迹」评测:验证 Agent 是否选对工具、填对参数、 按正确顺序完成多步任务,并自动归因失败模式。
京ICP备2024087118号-1
🎁 大厂面试真题精选 免费领 · 私信「资料」30 秒到手 去小红书领免费资料 →
×