VISUAL QUESTION ANSWERING
VQA
用户意图评测
从用户最终得到的内容出发,完成覆盖 26 类意图的百万级评测任务,标注准确率达到 96%。
信息对象是否正确内容是否符合要求信息是否完整用户意图是否满足
范晨 · AI 训练师阿里巴巴集团任职期间 · 项目经理
26 类用户意图覆盖
百万级数据评测规模
96%标注准确率
01 / CONTEXT
项目背景
项目通过模型识别图片、根据识别结果检索知识库、向用户输出检索内容的流程提供信息,评测重点是最终输出是否满足用户需求。
01
→模型识别图片
02
→检索知识库
03
输出检索内容
评测落点是用户最终收到的信息:对象、内容与完整性是否符合需求。
02 / MY ROLE
我的职责
- 01
负责覆盖 26 类用户意图的百万级数据评测任务。
- 02
核对最终输出的信息对象、内容及完整性是否符合用户问题、图片内容和预期交付物。
- 03
对齐意图边界和判断口径,优化标注文档、组织供应商培训并推进分批交付。
03 / PROCESS
从判断到交付
- 01
确定预期交付物
结合用户问题、图片内容和预期结果,明确最终输出应该提供什么。
- 02
核对最终输出
检查信息对象、内容和完整性,对不满足需求的样本记录具体差异。
- 03
统一意图边界
每日与算法团队对齐规则,持续优化标注文档并组织供应商培训。
- 04
分批推进交付
通过任务拆解和分批推进完成百万级数据评测任务。
04 / DELIVERY
交付与成果
完成覆盖 26 类用户意图的百万级数据评测任务,标注准确率达到 96%。
- 用户意图满足情况评测记录
- 规则对齐与复核记录
- 持续更新的标注文档
- 供应商培训及分批数据交付