AI 编程 4.0 · 优秀 2026-07-22 · 论文

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

论文研究两个 coding agents 组合使用时 reviewer/writer 顺序是否重要作者在 116 个 recent hard/medium LCB tasks 上比较 Claude 与 Codex 的 solo跨模型 review 和同模型 review结果显示 Claude review Codex drafts 可把通过率从 71.6% 提到 89.7%,Codex self-review 到 84.5%;反向 Codex review Claude drafts 反而从 91.4% 降到 82.8%结论是跨模型协作有明显方向性:Claude 审 Codex 有收益,反向不成立

打开原文回到归档

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

  • ID: d72269ec
  • 原文链接: https://arxiv.org/abs/2607.21656
  • 作者 / 日期: Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu | 2026-07-22
  • 分类: coding
  • 来源类型: paper
  • 标签: code-review, coding-agents, codex, claude, evaluation
  • 质量评分: 4/5
  • 抓取时间: 2026-08-05T15:45:26.663004+00:00

中文导读

论文研究两个 coding agents 组合使用时 reviewer/writer 顺序是否重要作者在 116 个 recent hard/medium LCB tasks 上比较 Claude 与 Codex 的 solo跨模型 review 和同模型 review结果显示 Claude review Codex drafts 可把通过率从 71.6% 提到 89.7%,Codex self-review 到 84.5%;反向 Codex review Claude drafts 反而从 91.4% 降到 82.8%结论是跨模型协作有明显方向性:Claude 审 Codex 有收益,反向不成立

为什么值得关注

多 Agent 编码协作不是随便互审,writer/reviewer 方向会直接改变通过率

English Summary

The paper evaluates Claude/Codex writer-reviewer pairings on 116 coding tasks and finds a strong asymmetry: Claude reviewing Codex drafts raises pass rate from 71.6% to 89.7%, while Codex reviewing Claude drafts hurts performance.

Obsidian Evidence

候选来自 Hermes 定时任务/last30days/2026-08-05-ai-coding-agents-brief.md 与晚间调研材料。OpenCLI arXiv metadata fetched for id 2607.21656.

Source Extract / Metadata

arXiv metadata URL: https://arxiv.org/abs/2607.21656

Title: Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

Authors: Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

Abstract-backed summaries above were generated from OpenCLI arXiv metadata fetched during intake.