

Techub News 消息,Meta AI FAIR 团队于 7 月 29 日发布论文指出,强化学习在代码速度优化中面临时序测量噪声大、奖励稀疏等挑战,导致标准算法不稳定。研究团队构建的 DMC-Optim 基准测试显示,模型通过率最高提升 64%,在噪声放大条件下性能提升可达 100% 至 200%。 该研究通过重建 AI 模型训练反馈系统,在离线模拟器中结合正确性与执行速度奖励,创建了可控制时序噪声的校准沙盒环境。测试表明,Qwen 2.5 7B 模型通过率从 18.0% 升至 31.3%,CWM 32B 从 30.7% 升至 50.4%,后者在 LCB 基准上 83% 的时间优于传统强化学习方法。(CryptoBriefing)