产品 / Agent Eval

衡量 Agent 完成了什么,再决定如何优化。

将任务结果、模型与工具调用、人工介入和资源消耗联系起来,识别质量与效率的改进空间。

为企业而设计
01

评估对象

X Worker 数字员工与能够接入运行数据的企业现有 Agent。

02

决策依据

业务标准、运行记录与人工复核共同解释结果。

01 / 评估指标

围绕成功交付,定义共同的衡量标准。

先与业务团队约定成功与质量要求,再比较时间、人工介入和成本。

任务成功率

按约定验收规则通过的任务数 ÷ 纳入评估的任务总数;部分完成和取消任务的处理提前说明。

质量与时间

评估准确性、完整性、来源依据及端到端耗时。

人工介入

记录纠错、复核和补充操作时间,区分必须审批与失败补救。

单次成功任务成本

同一评估任务集的总成本 ÷ 成功任务数,总成本包括失败与重试消耗;人工成本仅在有一致估算依据时另行纳入。

无法计算的情况

成功任务数为零时显示无法计算并解释原因,不显示零成本或无限大盈利指标。

02 / 执行链路分析

找到任务在哪一步反复消耗。

对照任务目标评估交付结果。
概念示意
03 / 评估方法

把自动评分与业务复核放在一起。

用明确样本与规则建立基线,比较版本并持续观察实际运行。

测试集

选择代表性任务,记录难度、输入版本、允许资料与预期结果。

评分方式

业务规则、自动评分与人工抽检结合,说明每项方法的作用和局限。

基线比较

在相同任务与质量条件下比较不同模型或流程版本。

运行后监测

观察实际任务偏差,发现退化时复核并调整评估集。

04 / 优化报告

将问题证据转化为可以验证的建议。

对模型、上下文、工作流和人工协作提出调整方案,并明确如何检查改进效果。

发现

关联具体步骤、失败原因或重复消耗证据。

建议

调整模型规格、减少冗余上下文、优化工具步骤或复核位置。

预期影响

说明可能改善的质量、时间或成本维度,不预设固定比例。

复测

用原任务集和新增边界样本验证,记录变化和副作用。

05 / 闭环与行动区

让每一次调整,都回到任务结果。

与业务和平台团队确认改进方案,更新任务流程或模型策略,再评估实际效果。

X Worker

根据证据优化知识、技能、团队分工与工作流。

Route Engine

在允许模型与质量门槛内调整任务路由。

企业审核

生产变更经过责任人确认,保留版本与回退路径。

申请 Agent 效能诊断