刚刚,DeepSeek又悄悄开源了DeepSeek-Math-V2:迈向可自证的数学推理。
model、paper都已开源。
DeepSeekMath-V2 展现出强大的定理证明能力:在 IMO 2025、CMO 2024 上达到金牌线,并在 Putnam 2024 上以扩展测试时计算斩获 118/120 的近满分成绩。虽然前路仍长,但这些结果首次表明——可自证的数学推理不仅可行,更是通往更强数学 AI 的必由之路。
过去一年,大模型靠「最终答案奖励」把 AIME、HMMT 等竞赛刷到饱和,但
DeepSeekMath-V2 的目标:让模型像数学家一样,自己写证明、自己挑毛病、自己改到无懈可击。
| 证明生成器 | ||
| 证明验证器 | ||
| 元验证器 |
三者组成一个可扩展的强化学习闭环:
训练时要求一次输出两段:
##Solution
……(证明正文)
##SelfEvaluation
Here is my evaluation of the solution: …
\boxed{score}
奖励设计:
当验证器 & 元验证器足够强,用“多数元验证一致”原则自动给新证明打标签;
最近两轮训练完全取消人工标注,专家抽测一致性>96%。
| 118/120 |
https://github.com/deepseek-ai/DeepSeek-Math-V2/blob/main/DeepSeekMath_V2.pdf
https://hf-mirror.com/deepseek-ai/DeepSeek-Math-V2
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
DeepSeek| 欢迎光临 链载Ai (https://www.lianzai.com/) | Powered by Discuz! X3.5 |