logo
登录/注册
快讯

Meta 论文揭示强化学习代码优化难题并提出新基准

Techub News 消息,Meta AI FAIR 团队于 7 月 29 日发布论文指出,强化学习在代码速度优化中面临时序测量噪声大、奖励稀疏等挑战,导致标准算法不稳定。研究团队构建的 DMC-Optim 基准测试显示,模型通过率最高提升 64%,在噪声放大条件下性能提升可达 100% 至 200%。 该研究通过重建 AI 模型训练反馈系统,在离线模拟器中结合正确性与执行速度奖励,创建了可控制时序噪声的校准沙盒环境。测试表明,Qwen 2.5 7B 模型通过率从 18.0% 升至 31.3%,CWM 32B 从 30.7% 升至 50.4%,后者在 LCB 基准上 83% 的时间优于传统强化学习方法。(CryptoBriefing)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Optim
AI
Meta
Qwen
政策
今日快讯
2026-08-02
更多
暂无数据~
更多消息
喜欢
收藏
分享
123