微信扫码
添加专属顾问
我要投稿
Google DeepMind高级研究科学家Rishabh Agarwal的一篇非常有深度的演讲稿,主要探讨了如何通过自生成数据来改进LLM的推理能力。
当前 LLM 训练面临的一个关键挑战: 高质量训练数据的稀缺,传统方法依赖从网络抓取或人工收集高质量数据,这种方式既耗时又昂贵,难以扩展,特别是对于复杂任务而言。
为解决这一问题,演讲者提出了一个创新性的想法: 让模型自己生成训练数据。但这里存在一个潜在的问题: 如果简单地让模型生成数据并用于训练,可能会导致 "模型崩溃"。
介绍了一种称为 ReST_EM (Reinforcement Self-Training via Expectation-Maximization) 的算法来解决这个问题:
这个过程本质上对应于基于期望最大化的强化学习。
ReST_EM 在数学和编程等问题解决任务上取得了显著效果,甚至超过了人类数据训练的模型。这表明自生成数据可能比人类数据更加 "in-distribution" (即更符合模型的分布)。
进一步探讨了如何利用错误解答来训练验证器。验证器可以帮助模型在测试时更好地利用计算资源,提高性能。
通过计算匹配采样,可以在给定计算资源的情况下,让小模型生成更多样本,从而提高大模型的性能。
最后探讨了是否可以通过上下文学习来替代微调过程,提出了强化上下文学习 (Reinforced ICL) 的概念。
Rishabh Agarwal通过这些方法,展示了如何通过自生成数据和验证器来提高 LLMs 在问题解决任务上的性能,尤其是在数学和编程领域。此外,还讨论了如何通过优化计算成本和利用较小模型来进一步提高数据生成的效率和质量。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-02-04
Agent 越用越聪明?AgentScope Java 在线训练插件来了!
2026-02-03
OpenClaw之后,我们离能规模化落地的Agent还差什么?
2026-01-30
Oxygen 9N-LLM生成式推荐训练框架
2026-01-29
自然·通讯:如何挖掘复杂系统中的三元交互
2026-01-29
微调已死?LoRA革新
2026-01-19
1GB 显存即可部署:腾讯 HY-MT1.5 的模型蒸馏与量化策略解析
2026-01-18
【GitHub高星】AI Research Skills:一键赋予AI“博士级”科研能力,74项硬核技能库开源!
2026-01-10
前Mata GenAI研究员田渊栋的年终总结:关于未来AI的思考
2025-11-21
2025-12-04
2026-01-04
2026-01-02
2025-11-22
2025-11-20
2026-01-01
2025-11-19
2025-12-21
2025-11-23
2026-02-03
2026-01-02
2025-11-19
2025-09-25
2025-06-20
2025-06-17
2025-05-21
2025-05-17