微信扫码
添加专属顾问
我要投稿
DeepSeek低调开源金牌级数学推理模型,首次实现可自证的AI数学证明能力,突破传统"答对≠会证"的困境。 核心内容: 1. DeepSeek-Math-V2在IMO、CMO等顶级数学竞赛中达到金牌线 2. 创新的"生成-验证"双向增强飞轮机制详解 3. 模型自我反省与自动扩数据技术突破
刚刚,DeepSeek又悄悄开源了DeepSeek-Math-V2:迈向可自证的数学推理。
model、paper都已开源。
DeepSeekMath-V2 展现出强大的定理证明能力:在 IMO 2025、CMO 2024 上达到金牌线,并在 Putnam 2024 上以扩展测试时计算斩获 118/120 的近满分成绩。虽然前路仍长,但这些结果首次表明——可自证的数学推理不仅可行,更是通往更强数学 AI 的必由之路。
过去一年,大模型靠「最终答案奖励」把 AIME、HMMT 等竞赛刷到饱和,但
DeepSeekMath-V2 的目标:让模型像数学家一样,自己写证明、自己挑毛病、自己改到无懈可击。
| 证明生成器 | ||
| 证明验证器 | ||
| 元验证器 |
三者组成一个可扩展的强化学习闭环:
训练时要求一次输出两段:
##Solution
……(证明正文)
##Self Evaluation
Here is my evaluation of the solution: …
\boxed{score}
奖励设计:
当验证器 & 元验证器足够强,用“多数元验证一致”原则自动给新证明打标签;
最近两轮训练完全取消人工标注,专家抽测一致性>96%。
| 118/120 |
https://github.com/deepseek-ai/DeepSeek-Math-V2/blob/main/DeepSeekMath_V2.pdf
https://hf-mirror.com/deepseek-ai/DeepSeek-Math-V2
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
DeepSeek53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-12-16
阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
2025-12-15
智谱手机 Agent 开源一周,iOS 版就来了
2025-12-15
OpenEvals下一代AI模型评估标准
2025-12-15
AutoGLM:推倒那面墙
2025-12-15
狂揽162K Star!n8n 2.0强势来袭,这次改动有点狠。
2025-12-14
ollama v0.13.3 最新发布:新增模型与功能优化详细解读
2025-12-14
OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE
2025-12-14
AutoGLM开源:手机AI Agent的“安卓时刻”来了
2025-10-20
2025-11-19
2025-10-27
2025-10-27
2025-10-03
2025-09-29
2025-10-29
2025-11-17
2025-09-29
2025-11-07
2025-11-12
2025-11-10
2025-11-03
2025-10-29
2025-10-28
2025-10-13
2025-09-29
2025-09-17