字节跳动质量保障团队:测试用例生成 Agent 落地

核心结论(一句话)

测试 Agent 的落地关键不是让 LLM 替代 QA,而是把 QA 的自然语言测试意图可靠地转译为可运行回归资产,并用确定性校验、容错链路和稳定断言把模型不确定性限制在必要范围内。

分类提炼

知识节点(9 个独立概念)

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 切入点要窄且可验收。 团队没有让 Agent 直接设计全部测试,而是选择“自然语言测试场景 → 可运行回归用例”。前端操作描述不是主要瓶颈,识别后端 API 并编写 API 级自动化用例才是高成本环节。
  2. 系统目标是端到端可用。 生成流程每一步都可能失败;如果 QA 需要手动定位和修复,局部准确率带来的收益会被抵消。因此系统通过结构校验、异常丢弃和容错推进,优先保证能得到可运行结果。
  3. LLM 只处理不可确定的部分。 业务步骤到请求的映射、测试意图到预期结果可交给模型;字段查找、请求过滤、参数替换、Schema 和断言校验用程序完成,更容易测试和审计。
  4. 上下文治理是质量控制。 原始测试流量包含静态资源、轮询、重复请求、时间戳、trace id 和临时诊断字段。先过滤、摘要、突出候选字段,再把干净证据交给模型,效果优于全量塞入。
  5. 约束比提示词自觉可靠。 允许的请求标识、字段、变量和断言类型形成白名单;越界输出只有在存在唯一修复时才自动修复,否则丢弃,避免错误进入后续阶段。
  6. 稳定断言维护信任。 断言对象必须和业务结果直接相关、可重复验证;宁可删除不明确或波动字段,也不要为追求数量制造误报,让 QA 失去对自动化的信任。
  7. 落地指标要看采用和沉淀。 原文报告 85.4% 生成用例进入 CI/CD、新增用例平均约 25% 来自 Agent、月活 30.7%、每两周节省约 30 人天,并称论文被 ISSTA 2026 接收;这些均是作者口径,需进一步核验。

我的理解

证据边界

相关链接