AGENT TOOL USE
Agent
工具调用评测
在 AI 相机与 Chat 融合场景中,核验模型调用的工具是否符合用户真实任务。
用户意图匹配工具选择与需求对应异常与高风险问题识别
范晨 · AI 训练师阿里巴巴集团任职期间 · 项目经理
每日线上巡检
01 / CONTEXT
项目背景
输入同时覆盖图片和文本,需要结合用户需求与任务目标判断 Agent 的实际工具调用是否匹配用户意图。
EVALUATION FOCUS
从“调用了工具”,回到“完成什么任务”。
结合图片、文本与用户目标判断工具选择是否匹配。对不符合预期的调用记录具体差异,再将异常样本交给算法团队定位与修复。
02 / MY ROLE
我的职责
- 01
评测用户需求与 Agent 工具调用之间的匹配关系。
- 02
核对工具调用结果,检查工具选择是否与需求对应。
- 03
开展每日线上巡检,将异常及高风险问题样本反馈算法团队,协同定位与修复。
03 / PROCESS
从判断到交付
- 01
理解任务
结合图片类、文本类输入以及用户希望完成的任务,确定评测目标。
- 02
核验工具选择
核对模型实际调用的工具及调用结果,判断是否与用户需求对应。
- 03
记录不匹配
对不符合预期的样本记录问题表现和判定理由,形成可复核的评测记录。
- 04
线上巡检与协作
每日识别调用链路中的异常及高风险问题,整理样本并反馈算法团队,协同推进定位与修复。
04 / DELIVERY
交付与成果
形成可用于复核和问题定位的记录,支持工具调用链路优化。
- 工具调用匹配评测记录
- 异常及高风险问题样本
- 面向算法团队的问题反馈