微信扫码
添加专属顾问
我要投稿
经典的草莓(strawberry)问题,轻松拿下
在MGSM上Marco-o1准确性得到了提升
将蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)与大型语言模型(LLMs)集成,以增强Marco-o1模型的推理能力:
MCTS框架中的节点和动作:
在MCTS框架中,每个节点代表问题解决过程中的一个推理状态。
从节点可能的动作是由LLM生成的输出,这些输出代表推理链中的潜在步骤或微步骤。
展开和奖励计算:
在展开阶段,LLM继续推理过程直到达到一个终端状态。
通过计算每个状态的值来引导MCTS,这个值是通过计算信心分数得到的。
信心分数的计算:
对于在展开过程中生成的每个标记(token),通过将softmax函数应用于该标记的对数概率以及前5个替代标记的对数概率来计算其信心分数。
信心分数反映了所选标记相对于其他顶部选择的概率,有效地将分数标准化在0和1之间。
整体奖励分数:
在获得展开序列中所有标记的信心分数后,通过计算所有标记的平均信心分数来得出整体奖励分数。
这个平均值作为奖励信号,评估在展开期间采取的推理路径的质量。更高的整体奖励分数表示更有信心且可能更准确的推理路径。
解决方案空间的扩展:
通过这种方法,有效地扩展了解决方案空间,允许模型探索大量的推理路径,并根据计算出的信心分数选择最可能的路径。
实验结果表明,Marco-o1模型在不同语言和配置下提高了推理能力。
由于使用信心分数作为奖励,树搜索结果表现出显著的随机性,目前还无法确定哪种行动策略更优越。
随着奖励信号变得更加准确,MCTS提供的更大解决方案空间将展示出更大的潜力。
数学推理case分析
更细的粒度与微步增强了问题解决能力。在MGSM数据集上,Marco-o1-MCTS(步)(左)与Marco-o1-MCTS(32个标记的微步)(右)的比较。步级动作策略没有得出正确答案,但通过使用更细粒度的32个标记的微步,模型成功地导航了解决方案空间以找到正确答案,展示了增加动作粒度的有效性。
俚语表达“它如此美丽!而且它如此便宜,超级直且不卷曲。买它,买它!”的翻译比较。
https://arxiv.org/pdf/2411.14405Marco-o1: Towards Open Reasoning Models for Open-Ended Solutionshttps://huggingface.co/AIDC-AI/Marco-o1
推荐阅读
• 对齐LLM偏好的直接偏好优化方法:DPO、IPO、KTO
• 2024:ToB、Agent、多模态
• RAG全景图:从RAG启蒙到高级RAG之36技,再到终章Agentic RAG!
• Agent到多模态Agent再到多模态Multi-Agents系统的发展与案例讲解(1.2万字,20+文献,27张图)
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-12-23
我把Claude Code换成GLM-4.7用了6小时,我竟然没发现明显区别
2025-12-23
通义百聆语音交互模型开源,创新架构可节省近50%GPU计算!
2025-12-23
OxyGent 多智能体协作框架新版本发布
2025-12-23
MinIO 停更仅维护!Milvus 对象存储替代方案怎么选
2025-12-23
MiniMax M2.1:多语言编程SOTA,为真实世界复杂任务而生
2025-12-23
OpenAgents:让AI智能体像人类一样联网协作
2025-12-23
智谱GLM-4.7:更强的代码,更好的美学
2025-12-22
Notesnook:一款完全开源、以隐私为核心的笔记应用
2025-11-19
2025-10-20
2025-10-27
2025-10-27
2025-10-03
2025-09-29
2025-11-17
2025-10-29
2025-09-29
2025-11-07
2025-12-22
2025-11-12
2025-11-10
2025-11-03
2025-10-29
2025-10-28
2025-10-13
2025-09-29