🧪 LLM-Eval-Framework 评测平台
RAG 幻觉检测与回答质量评估系统
🔒 评测数据集与评测功能为
付费内容
,请输入访问令牌解锁:
解锁
📊 概览
⚡ 快速对比
🔍 幻觉检测
📄 报告生成
🤖 Agent 测试
评测样本数
--
Baseline 平均分
--
Optimized 平均分
--
Cohen's d 效应量
--
正在加载数据...
🚀 启动完整评测(评测20条 + 拉取对比结果)
完整评测报告
ID
类别
查询
候选回答
BLEU
ROUGE-L
Token-F1
忠实度
幻觉?
评分
Baseline vs Optimized 对比
正在加载对比数据...
Baseline 胜
--
Optimized 胜
--
平局
--
p 值
--
Cohen's d
--
检测器 Precision
100%
检测器 Recall
80%
全部
仅幻觉
仅正常
正在加载检测结果...
📊 评测报告总览
本报告由
reports/generate_report.py
自动生成,包含总览指标、检测器性能、按分类幻觉率、Bad Case 清单。
正在加载报告内容...
📈 关键指标总结
总评测样本
20
幻觉率
--
CI 门禁状态
通过 ✅
优化效果
显著提升
任务成功率
--
平均步骤准确率
--
工具选择准确率
--
鲁棒性成功率
--
对内置 Agent 测试集做「工具调用轨迹」评测:验证 Agent 是否选对工具、填对参数、 按正确顺序完成多步任务,并自动归因失败模式。
🚀 运行 Agent 测试(10 条工具调用轨迹)
失败模式分布(聚类归因 → 驱动 Agent 优化)
评测体系自校验(自动判定 vs 人工标注)
逐任务轨迹对比(期望 → 实际)
京ICP备2024087118号-1
🎁 大厂面试真题精选 免费领 · 私信「
资料
」30 秒到手
去小红书领免费资料 →
×
📕 扫码关注小红书
@兔老板工作室
打开小红书 App 扫码关注
私信「
资料
」30 秒到手,免费领大厂面试真题精选 PDF
打开小红书主页 →
关闭