收藏

疯狂24h后，openai o1有哪些新的秘密？

发布日期：2024-09-14 14:34:10 浏览次数： 3380

作者：NLP前沿

微信搜一搜，关注“NLP前沿”

在openai o1发布24h后，有哪些值得关注的消息呢？

o1-preview 在 ARC-AGI 测试中的得分为 21%（目前的最佳水平是 46%）：总的来说，o1 代表了一种从“记住答案”到“记住推理过程”的模式转变，但并没有脱离目前更广泛的一种模式 -> 通过调整曲线以适应分布来提升性能，使所有内容都符合分布。

o1-preview 在 aider 代码编辑测试中的得分约为 80%（目前的最佳水平 Claude 3.5 Sonnet 是 77%）：o1-preview 模型在适应 aider 的差异编辑格式时遇到了问题。o1-mini 模型在适应整个和差异编辑格式时都有困难。aider 对格式的要求非常宽松，尽力接受任何接近正确格式的输入。令人惊讶的是，这些强大的模型在处理简单文本输出格式的语法要求时遇到了困难。看来 aider 可能需要优化其提示和编辑格式，以更好地发挥 o1 模型的能力。

o1-preview 在 Cognition-Golden 测试中的得分约为 52%（提供建议）：对于以前的模型，Chain-of-thought 和让模型“think out loud”是常见的 prompt 技巧。相反，我们发现让 o1 仅给出最终答案往往表现更好，因为它会在回答之前进行思考。o1 需要更紧凑的上下文，并且对杂乱和不必要的 token 更敏感。传统的提示方法通常会包含多余的指令，这对 o1 的表现有负面影响。

Andrew Mayne 的使用建议: https://x.com/andrewmayne/status/1834408991839158422
我已经使用了 @OpenAI 的 o1 几个星期。关于使用它的建议：

不要把它当作传统的聊天模型。把 o1 想象成一个非常聪明的朋友，你要给她发私信来解决问题。她会回复你一个经过深思熟虑的解释，逐步引导你解决问题。
在记事本中写你的提示。提前规划好你想要什么。详细解释所有步骤，提供比平时更多的细节。
对于那些不需要太多世界知识但需要逐步跟进的任务，使用 o1-mini。
o1 通常会给我部分答案和完整回应，而 o1-mini 会给我步骤。
根据我的经验，当你进行修正或调整时，要耐心地解释你需要改变的内容。那些具备推理能力的模型对经过推理的回应会有很好的反应。

@btibor91 分享在 OAI 研究团队 AMA 的总结 https://x.com/btibor91/status/1834686946846597281

模型名称和推理模式

OpenAI o1 这个名字代表了 AI 能力的新水平，因此编号重置为 1
"Preview" 表示这是完整模型的早期版本
"Mini" 意味着这是 o1 模型的较小版本，优化了速度
o - 表示 OpenAI
o1 不是一个“系统”；它是一个经过训练的模型，用于在返回最终答案之前生成长链的思考
o1 的图标隐喻为一位具有非凡能力的外星人

o1 模型的大小和性能

o1-mini 比 o1-preview 小得多且速度更快，因此未来会提供给免费用户
o1-preview 是 o1 模型的早期检查点，既不大也不小
o1-mini 在 STEM 任务中的表现优于 o1-preview，但世界知识有限
与 o1-preview 相比，o1-mini 在一些任务中表现更好，尤其是在代码相关任务中
o1 的输入 tokens 计算方式与 GPT-4o 相同，使用相同的分词器
o1-mini 能够探索更多的思考链条，相较于 o1-preview

输入 Token 上下文和模型能力

o1 模型将很快支持更大的输入上下文
o1 模型能够处理更长、更开放的任务，较少需要将输入分块，与 GPT-4o 相比
o1 能够在提供答案之前生成长链的思考，与之前的模型不同
当前无法在 CoT 推理过程中暂停以添加更多上下文，但正在为未来模型探索这一功能

工具、功能和即将推出的特性

o1-preview 尚未使用工具，但计划支持函数调用、代码解释器和浏览功能
未来更新将加入工具支持、结构化输出和系统提示
用户可能最终可以控制思考时间和 token 限制
计划启用流式处理，并在 API 中考虑推理进度
o1 内置了多模态能力，旨在在 MMMU 等任务中达到最先进的性能

CoT（思维链）推理

o1 在推理过程中生成隐藏的思考链
没有计划向 API 用户或 ChatGPT 透露 CoT tokens
CoT tokens 会被总结，但不能保证与实际推理完全一致
提示中的指令可以影响模型如何思考问题
o1 使用强化学习（RL）来改进 CoT，而 GPT-4o 仅通过提示无法匹配 o1 的 CoT 性能
思考阶段看起来较慢，因为它总结了思维过程，尽管答案生成通常更快

API 和使用限制

o1-mini 对于 ChatGPT Plus 用户每周有 50 个提示的限制
在 ChatGPT 中所有提示的计数相同
未来会推出更多的 API 访问层级和更高的速率限制
API 中的提示缓存是一个热门请求，但尚无时间表

定价、微调和扩展

o1 模型的定价预计将遵循每 1-2 年降价的趋势
一旦速率限制增加，将支持批量 API 定价
微调在计划中，但尚无时间表
扩展 o1 受到研究和工程人才的瓶颈
新的推理计算扩展范式可能在未来模型中带来显著提升
逆向扩展尚不显著，但个人写作提示显示 o1-preview 相比 GPT-4o 仅表现稍微更好（或稍微差）

模型开发和研究洞察

o1 通过强化学习进行训练，以实现推理性能
该模型展示了创造性思维和在诗歌等侧向任务中的强大表现
o1 的哲学推理和通用能力，比如解码密码，令人印象深刻
研究人员使用 o1 创建了一个 GitHub 机器人，自动联系合适的 CODEOWNERS 进行审查
在内部测试中，o1 自我测验难题以评估其能力
正在增加广泛的世界知识，并将在未来版本中改进
计划为 o1-mini 提供更新的数据（目前为 2023 年 10 月）

提示技术和最佳实践

o1 受益于提供边缘案例或推理风格的提示
o1 模型比早期模型更能接受提示中的推理线索
在检索增强生成（RAG）中提供相关上下文可以提高性能；不相关的内容可能会恶化推理效果

一般反馈和未来改进

由于处于早期测试阶段，o1-preview 的速率限制较低，但会逐步增加
正在积极改进延迟和推理时间

卓越的模型能力

o1 能够思考哲学性问题，如“生命是什么？”
研究人员发现 o1 在处理复杂任务和从有限指令中进行泛化方面表现出色
o1 的创造性推理能力，如自我测验以评估其能力，展示了其高水平的问题解决能力

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-07-03

Ornith-1.0 发布：新一代 Agentic Coding 之王，MIT 开源

2026-07-02

Meta把内部设计系统开源了，支撑内部13000+应用，专为Agent调优

2026-07-02

别再把 AI 当搜索引擎了，这 20 个操作让它替你干活

2026-07-02

ollama v0.31.1发布：Apple Silicon上Gemma 4提速近90%，默认开启无感升级

2026-07-01

在 OpenCode 中接入本地模型：Ollama 部署与配置完全指南

2026-07-01

实测腾讯开源的 BrowserSkill：让 AI 直接用你登录好的浏览器

2026-07-01

阶跃开源JetSpec，大模型推测解码提速近10倍

2026-06-30

花叔的这个神器直接让你的AI Agent出高保真原型、PPT和动画，20k stars不是盖的

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

很多人突然不玩小龙虾而用Hermes Agent了。我替你试了，跟小龙虾到底有啥不同？

2026-04-09

Ollama 本地部署 Gemma 4 完全指南

2026-04-18

Google Gemini CLI 完整使用指南

2026-04-18

Agent终于有了自己的邮箱！腾讯Agently Mail详解

2026-06-22

Claude 的金融 Skills 开源了

2026-05-10

Ollama 换引擎，苹果 M5 封神了

2026-05-06

Qwen3.7来了，全球排名第13，国内第一

2026-05-20

亲测有效！Codex桌面版免费接入DeepSeek V4

2026-05-31

Kimi K2.6 开源了！还附送了 300 个 Agent 员工？

2026-04-21

Kimi K2.6 发布并开源，全面精进代码和 Agent 集群能力

2026-04-21

大家都在问

26.1%的AI编程技能有漏洞：NVIDIA开源 SkillSpector 能扫出什么？

2026-06-16

企业级 AI Agent 为什么集体转向“基座 + Skills”？

2026-05-30

Hermes Agent 深度解析：为什么它能“越用越懂你”？

2026-05-16

百度把Nano Banana塞进4090，疯了？

2026-04-22

Kimi K2.6 开源了！还附送了 300 个 Agent 员工？

2026-04-21

Hermes 凭什么两个月接棒 OpenClaw？

2026-04-15

很多人突然不玩小龙虾而用Hermes Agent了。我替你试了，跟小龙虾到底有啥不同？

2026-04-09

震惊！刚刚，Anthropic掀了桌子：OpenClaude横空出世，大模型闭源时代彻底终结？

2026-04-01

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部

扫码登录

登录即表示您同意《53AI网站服务协议》

服务协议

欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。

一、定义

本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。

会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、账号注册与登录

登录方式：本网站支持以下登录方式，您可根据实际情况选择：

微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。

手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。

账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。

实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。

未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。

三、服务内容与规范

知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。

服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。

禁止行为：您在使用服务时不得实施以下行为：

利用技术手段批量爬取、下载、转存知识库内容；

将知识库内容用于商业目的或未经授权地向第三方传播；

干扰本网站正常运行或侵犯其他用户合法权益；

发布违法违规信息或从事违反公序良俗的活动。

四、知识产权声明

权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。

有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。

五、个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、免责声明

内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。

不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。

第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。

七、违约责任

如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。

八、法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、其他

本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。

我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。

已查阅