大淘宝技术:agent 优化之 GEPA——一种提示词自进化的优化方案

核心结论(一句话)

GEPA 将 Prompt 优化从人工盲调改成可度量的闭环:任务模型执行,评分器量化,Judge 归因错误,反思模型生成候选,再用 Pareto 前沿在多个目标之间选择;真正上线仍需要冻结区、回归集和人类控制面。

分类提炼

知识节点

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 文章将 LLM Judge 与被评测 Agent 的 Prompt 优化问题归纳为盲目性、伪自动化、难复制和无权衡四类痛点,并把人工标注对齐与线上业务对齐视为两个目标。
  2. GEPA 主循环是“种子 Prompt → 批量推理 → 结构化解析与评分 → 错误归因和反思变异 → Pareto 选择”。温度、并发、重试和停止条件属于工程配置,不是算法保证。
  3. 方案以配置层、引擎层、组件层和服务层拆分职责;run_optimizerun_evaluatevalidate_config 形成外部 API,Parser、Scorer、Feedback 和 LLM Client 作为可插拔组件。
  4. Inspector 通过字段画像推断任务类型和输入/答案字段;build_config() 让 Schema、答案提取和评分方式按任务类型成套生成,降低手工配置错误。
  5. 评分同时服务两个环节:样本级反馈回答“这一条错在哪”,批次级目标回答“候选整体是否更好”。业务若偏好精确率或召回率,应显式写成约束,而不是只用平均分。
  6. 没有 Ground Truth 时,文章提出把离线评测、线上业务效果和历史策略回溯作为排序/否决信号;这部分是设计设想,必须防止“少做事更容易得分”的保守化偏差。

机制与替代解释

机制上,GEPA 的收益来自把“错误样本”转换为“可操作的规则归因”,再用多目标选择保留候选多样性;因此它比静态 Prompt 扫描多了一条由数据驱动的反馈路径。替代解释是:若数据集代表性不足、评分器本身偏移,或线上目标与离线目标不一致,候选分数上升可能只是过拟合、奖励黑客或指标转移,并不代表业务效果改善。

证据与限制

本文是大淘宝技术团队对 GEPA 论文和内部方案的工程整理。原文没有提供可独立复现的数据集、基线、完整代码或统计检验;调用时长、切分比例、重试参数、效果提升和论文收录信息均为原文/作者口径。冻结区、长度目标和无 Ground Truth 双通道属于合理的工程设计方向,不应当视为已经验证的通用结论。

相关链接