Agent 评估与发布门禁

将审计 Agent 按企业级标准评估:真实性、权威性、工具调用、轨迹质量、人工复核和 badcase 闭环。

加载状态中
Audit Agent Evaluation

从“能回答”升级到“可交付、可复核、可回归”

评测不只是跑分:这里会检查 Agent 是否能做意图理解、查询改写、多源检索、推理证据化、工具调用、失败降级、人工复核和审计整改闭环。

Calibrated agent evaluation

结果、轨迹、工具与证据的多层评测

服务端基于真实任务轨迹分别评测任务结果、执行轨迹、工具调用、证据溯源、安全权限、上下文与鲁棒性。聚合分经过小样本校准,并同时报告置信下界;关键安全失败仍会直接阻断发布。

等待评测
评测对象:真实任务与完整轨迹 评分方式:校准得分 + 置信下界 发布原则:多次试验 + 关键失败一票否决

运行全链路分层评测后,这里会展示面向交付的质量维度、证据信号和不确定性。

评测场景设计

可用于自定义审计场景、预期答案、关键证据点和指标,用来做发布前回归。

-
真实性
-
Tool / Trace
-
权威性
-
平均耗时
4.0.0
评测版本

评测结果

尚未运行评测。

评测历史与发布门禁

暂无评测记录。