微信扫码
添加专属顾问
我要投稿
OpenAI 12 天活动的最后一期,主要介绍了新一代推理模型 o3 和 o3-mini。主讲人包括 Sam Altman、Mark Chen、Hongyu Ren 以及特邀嘉宾 ARC Prize Foundation 主席 Greg Kamradt。
主要亮点
1. 新模型发布
发布两个新模型:o3 和 o3-mini
o3 是高性能推理模型,o3-mini 则在保持智能的同时优化了性能和成本
目前仅开放用于公共安全测试,预计一月底推出 o3-mini,随后推出 o3
2. o3 模型性能突破
在软件测试基准 SWE-bench Verified 上准确率达 71.7%,比 o1 提升 20%
在 CodeForce 竞赛编程上达到 2727 ELO 分数
AIME 数学竞赛准确率达 96.7%(o1 为 83.3%)
在博士级科学问题基准 GPQA Diamond 上达到 87.7%
3. o3-mini 特点与优势
4. 安全策略创新
推出"审慎对齐"(Prudent Alignment)新技术
利用模型推理能力提升安全边界判断
显著改善了拒绝基准和过度拒绝指标
开放外部安全测试申请(截止至 1 月 10 日)
重要时间节点
安全测试申请截止:2025 年 1 月 10 日
o3-mini 预计发布:2025 年 1 月底
o3 完整版:将在 o3-mini 之后推出
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-23
Harness Monitor:当多个 Agent 同时写代码时,如何看住质量
2026-05-23
从 Appshots 到 Goal Mode:Codex 正在变成工作流 Agent
2026-05-23
2小时烧掉9亿token后,我发现了OpenAI和Anthropic在/goal上的本质区别
2026-05-23
我在一天内完成10场用户访谈,领导大受震撼
2026-05-23
Codex 的 computer use 功能,为什么这么好用?
2026-05-22
我让3个AI吵了一整天架,它们把PRD写完了
2026-05-22
Cursor 把内部代码审查工具放出来了,AI 写代码之后,质量风险变了
2026-05-22
Codex 又又又更新了,这次能拍图带上下文,/goal 也正式上线了
2026-04-15
2026-04-07
2026-03-31
2026-03-13
2026-03-17
2026-04-07
2026-03-17
2026-03-21
2026-04-24
2026-03-06
2026-05-23
2026-05-21
2026-05-19
2026-05-09
2026-05-09
2026-05-09
2026-05-08
2026-05-07