[TOC]
评测指标的定义设计
结果指标
- Pass@1: 衡量单次即时表现(只给一次机会能做对的概率)
- Pass@K: 反映能力上限(k次尝试至少成功一次)
- Pass^k: 则关注业务可靠性(k次必须全部成功)
- Best@k: 捕捉最优变现(k次中取最高分)
实际使用中,模型选型看能Pass@k摸底能力边界,Prompt调优看Best@k最优表现,生产部署前必须验证Pass^k确保稳定性,日常运营监控则依赖Pass@1追踪即时表现
过程指标
即需要从整个会话过程中进行评测的指标,包为合法性,工具调用正确率,路径效率
- 行为合法性检测整个任务执行过程是否存在无效操作&越权操作,
- 工具调研正确率进一步检测搜索工具的查询词是否准确表达需求,文件操作的路径是否指向正确目标
- 路径效率的分别检测步数(思考-行动-观察循环次数)
- 冗余动作(重复搜索相同关键词,反复读取同一文件)
- 回退次数(意识到错误并且纠正的频率)
- 检索覆盖率检测信息收集的全面情况
其他类型指标
- 成本与延迟,检测请求次数,token花费等等
- 鲁棒性,衡量面对不确定性时的稳定性,不同初始化下表现差异大小,页面变化适应性(网站UI更新不应导致完全失效),API抖动容忍度(能否处理临时故障,超时,格式变化),长期记忆干扰
- 安全问题&幻觉,拥有决定性的指标,严禁出现任何敏感操作,数据外泄,违规内容和编造不存在的信息
总结
- 一定要实现轨迹与结果的双重覆盖
- 安全性指标可有一票否决性质
- 除此之外,一定要进行人工抽检与对抗式评审(即主动构造利用评判模型已知偏见骗高分的回答)
评测环境的设置
包含五要素:
数据集:定义任务集合,包含初始状态,目标描述和可选的参考解决方案
环境状态:任务执行中的可变信息
工具接口:Agent可执行的操作集合
评分标准和执行协议:规定交互模式和终止条件