Agent 与自动化 4.0 · 优秀 2025-07-25 · 论文

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

GEPA(Genetic-Pareto,UC Berkeley/Sky 团队等,ICLR 2026 Oral)不碰权重只做 prompt 优化:采样含推理工具调用与输出的轨迹,用自然语言反思诊断问题提出并测试 prompt 更新,再从自身 Pareto 前沿组合互补经验六个任务上平均超 GRPO 6%最高 20%,rollout 用量最多省 35 倍;对比领先 prompt 优化器 MIPROv2 高出 10% 以上(AIME-2025 +12%)社区精读的补充信号:在 Qwen3-8B 的 IFBench 上 678 个 rollout 到 38.61%,GRPO 需 24000 个 rollout 才到 35.88%验证器提供的信号形态(轨迹文本 vs 稀疏标量)决定了样本效率的上限代码已开源

打开原文回到归档
Source: GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning · platform: arxiv · authors: Lakshya A Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J Ryan, Meng Jiang, Christopher Potts, Koushik Sen, Alexandros G. Dimakis, Ion Stoica, Dan Klein, Matei Zaharia, Omar Khattab · date: 2025-07-25

TL;DR(中文摘要)

GEPA(Genetic-Pareto,UC Berkeley/Sky 团队等,ICLR 2026 Oral)不碰权重只做 prompt 优化:采样含推理、工具调用与输出的轨迹,用自然语言反思诊断问题、提出并测试 prompt 更新,再从自身 Pareto 前沿组合互补经验。六个任务上平均超 GRPO 6%、最高 20%,rollout 用量最多省 35 倍;对比领先 prompt 优化器 MIPROv2 高出 10% 以上(AIME-2025 +12%)。社区精读的补充信号:在 Qwen3-8B 的 IFBench 上 678 个 rollout 到 38.61%,GRPO 需 24000 个 rollout 才到 35.88%——验证器提供的信号形态(轨迹文本 vs 稀疏标量)决定了样本效率的上限。代码已开源。

Summary (English)

GEPA is a genetic-Pareto prompt optimizer that samples trajectories, reflects on them in natural language, and merges lessons from its own Pareto frontier. Across six tasks it beats GRPO by 6% on average (up to 20%) using up to 35x fewer rollouts, and outperforms MIPROv2 by over 10% (e.g., +12% on AIME-2025). Code is released at github.com/gepa-ai/gepa.

入库依据

opencli arxiv paper 2507.19457 拉取摘要与作者;6%/20%/35x/MIPROv2 +10% 出自摘要;IFBench 678 vs 24000 rollout 对比来自本地精读笔记 Agent实践探索/2026-09-17 对论文实验的引用。

补充

GEPA (Genetic-Pareto), Lakshya Agrawal et al. (UC Berkeley, Stanford, MIT, Notre Dame, Databricks), arXiv:2507.19457, first posted 2025-07-25, revised 2026-02-14, cs.CL/cs.AI/cs.LG/cs.SE. ICLR 2026 oral per community notes.