Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?
- ID: d72269ec
- 原文链接: https://arxiv.org/abs/2607.21656
- 作者 / 日期: Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu | 2026-07-22
- 分类: coding
- 来源类型: paper
- 标签: code-review, coding-agents, codex, claude, evaluation
- 质量评分: 4/5
- 抓取时间: 2026-08-05T15:45:26.663004+00:00
中文导读
论文研究两个 coding agents 组合使用时 reviewer/writer 顺序是否重要作者在 116 个 recent hard/medium LCB tasks 上比较 Claude 与 Codex 的 solo跨模型 review 和同模型 review结果显示 Claude review Codex drafts 可把通过率从 71.6% 提到 89.7%,Codex self-review 到 84.5%;反向 Codex review Claude drafts 反而从 91.4% 降到 82.8%结论是跨模型协作有明显方向性:Claude 审 Codex 有收益,反向不成立
为什么值得关注
多 Agent 编码协作不是随便互审,writer/reviewer 方向会直接改变通过率
English Summary
The paper evaluates Claude/Codex writer-reviewer pairings on 116 coding tasks and finds a strong asymmetry: Claude reviewing Codex drafts raises pass rate from 71.6% to 89.7%, while Codex reviewing Claude drafts hurts performance.
Obsidian Evidence
候选来自 Hermes 定时任务/last30days/2026-08-05-ai-coding-agents-brief.md 与晚间调研材料。OpenCLI arXiv metadata fetched for id 2607.21656.
Source Extract / Metadata
arXiv metadata URL: https://arxiv.org/abs/2607.21656
Title: Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?
Authors: Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu
Abstract-backed summaries above were generated from OpenCLI arXiv metadata fetched during intake.