微信扫码
添加专属顾问
我要投稿
数学:在高中AIME数学竞赛中,o1-mini的得分为70.0%,与o1的74.4%具有竞争力,且成本明显更低,同时也优于o1-preview的44.6%。o1-mini的得分(约答对11/15道题)使其位列全美约前500名高中生。
编程:在Codeforces竞赛网站上,o1-mini的Elo评分为1650,接近o1的1673,并且高于o1-preview的1258。这个Elo评分将该模型排在Codeforces平台上约86%的程序员之上。o1-mini还在HumanEval编程基准测试以及高中级别的网络安全夺旗挑战赛(CTF)中表现出色。
STEM:在一些需要推理的学术基准测试中,如GPQA(科学)和MATH-500,o1-mini的表现优于GPT-4o。然而,在诸如MMLU的任务上,o1-mini表现不如GPT-4o,并且由于缺乏广泛的世界知识,o1-mini在GPQA上的表现也落后于o1-preview。
人类偏好评估:我们让人工评估员在多个领域的复杂、开放式提示下对o1-mini和GPT-4o进行比较,采用与o1-preview对比GPT-4o相同的方法。与o1-preview相似,o1-mini在需要大量推理的领域中更受青睐,但在语言集中的领域中,GPT-4o更受偏好。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-02-04
Agent 越用越聪明?AgentScope Java 在线训练插件来了!
2026-02-03
OpenClaw之后,我们离能规模化落地的Agent还差什么?
2026-01-30
Oxygen 9N-LLM生成式推荐训练框架
2026-01-29
自然·通讯:如何挖掘复杂系统中的三元交互
2026-01-29
微调已死?LoRA革新
2026-01-19
1GB 显存即可部署:腾讯 HY-MT1.5 的模型蒸馏与量化策略解析
2026-01-18
【GitHub高星】AI Research Skills:一键赋予AI“博士级”科研能力,74项硬核技能库开源!
2026-01-10
前Mata GenAI研究员田渊栋的年终总结:关于未来AI的思考
2025-11-21
2025-12-04
2026-01-04
2026-01-02
2025-11-22
2025-11-20
2026-01-01
2025-11-19
2025-12-21
2025-11-23
2026-02-03
2026-01-02
2025-11-19
2025-09-25
2025-06-20
2025-06-17
2025-05-21
2025-05-17