Audit Agent Evaluation
从“能回答”升级到“可交付、可复核、可回归”
评测不只是跑分:这里会检查 Agent 是否能做意图理解、查询改写、多源检索、推理证据化、工具调用、失败降级、人工复核和审计整改闭环。
Calibrated agent evaluation
等待评测
结果、轨迹、工具与证据的多层评测
服务端基于真实任务轨迹分别评测任务结果、执行轨迹、工具调用、证据溯源、安全权限、上下文与鲁棒性。聚合分经过小样本校准,并同时报告置信下界;关键安全失败仍会直接阻断发布。
评测对象:真实任务与完整轨迹
评分方式:校准得分 + 置信下界
发布原则:多次试验 + 关键失败一票否决
运行全链路分层评测后,这里会展示面向交付的质量维度、证据信号和不确定性。
评测场景设计
可用于自定义审计场景、预期答案、关键证据点和指标,用来做发布前回归。
-
真实性
-
Tool / Trace
-
权威性
-
平均耗时
4.0.0
评测版本
评测结果
尚未运行评测。
评测历史与发布门禁
暂无评测记录。