Learning to Solve Hard Problems in RL for LLMs by Never Giving Up
- arXiv: https://mnoukhov.github.io/posts/ngu
- PDF: pdf
- Score: 4
中文摘要
本文仅提供 arXiv 元数据,摘要未可用。
Noukhovitch(Ai2)博客解读论文:发现 LLM-RL 中的Matthew EffectRL 增益与模型初始能力成正比,简单题大幅提升初始 pass@32=0 的难题几乎不动在 Qwen 2.5 0.5B + GSM8k Platinum 上,k=4 反而比 k=32 更擅长难题,因为大 k 把算力浪费在简单题的稀有错误上提出 Never Give Up(NGU):用小 k 起步,解出即训练;全部答错的 prompt 以概率 p 放回再采 k 次,构成几何分布采样 NGU k=4 + p=0.9 在 GSM8k 上超越所有标准 GRPO k 值...
本文仅提供 arXiv 元数据,摘要未可用。