我要投稿

o3来了！编程跻身人类全球前200，破解陶哲轩说难的数学测试，北大校友任泓宇现身直播间

发布日期：2024-12-21 05:16:22 浏览次数： 1961

作者：量子位

微信搜一搜，关注“量子位”

OpenAI公布下一代模型，o1之后直接o3！

“双12”直播活动最后一天，终于来了个大的，奥特曼本人也再次现身直播间。

o3相比o1最突出的成绩，一是顶尖程序员竞赛CodeForces分数超过2700，人类超过这个分数的目前只有不到200个。

二是在为AGI准备的测试ARC-AGI上分数从32%跃升到了75.7%、87.5%。

为什么有两个成绩呢？

因为o3支持低思考程度和高思考程度两种设置，高思考程度花费的算力（横轴）也直接拉满。

ARC-AGI是Keras之父François Chollet发起的测试基准，典型题目为图形逻辑推理。

另一项测试是号称最难数学测试的EpochAI Frontier Math，包含最新未公开前沿题目。

此前陶哲轩对这项测试的第一印象是“可能难住AI好几年”。

o3在测试中比之前SOTA从2分提升到25分。

人类专业数学家解决其中一道题目也要花费数小时到数天，现在o3只需要思考几分钟了。

这次直播还公布了o3-mini，支持低中高三种思考程度设置。

主要展示了代码能力，低设置下o3-mini和o1-mini差不多，中高设置已经超过了o1正式版。

【重磅】一键接入扣子、Dify，FastGPT等开发平台

企业内部AI 先行者已通过扣子、Dify 等智能体开发平台积极探索 "人 + AI" 的效率革新。这些应用大多局限于小范围应用，基于此，我们打造一款开箱即用的 AI 门户-53AI Hub，让企业实现从 "场景级效率优化" 到 "企业级生产力重构" 的跨越....

参与研究的北大校友任泓宇，现场展示了o3-mini的编程能力。

他使用了特殊版本的ChatGPT，称为ChatGPT α。

任务如下：

写一个Python脚本，在本地为一个带有大文本框的HTML文件启动服务器。当我在该框中输入文本并按下提交时，它应该将该代码请求发送到OpenAl o3-mini API ，使用medium reasoning_effort ，获取生成的代码，将其保存到桌面上的临时文件中，然后在新的Python终端中执行该文件。还有一些细节：

可以在~/api_key中找到我的API密钥

请在向API的请求中添加一些额外的提示，指定它只应返回没有任何格式或Markdown的原始代码

你将在Mac笔记本电脑环境运行

o3-mini的思考过程用了38秒，然后代码秒出，一次运行成功。

这个演示可能不太直观，但是看得没去现场的另一位OpenAI研究员Aidan Clark直出汗。

总结一下，就是o3-mini用38秒给自己写了一个UI，通过API调用“自己”。

后续演示中，任泓宇要求o3-mini在这个UI中编写并执行一个脚本，来评估“它自己”在低思考程度下、在GPQA数据集上的表现。

脚本正确运行了评估，返回结果数值61.62%，与正式评估结果基本一致。

是不是有一点科幻的感觉了。

可惜呐～ o3和o3-mini目前都是早期预览状态，只给看不给玩。

安全研究者可以在OpenAI官网申请早期访问权限。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-05-27

盘点 Azure AI Foundry 的10大重要更新

2025-05-27

50个AI基础常识问答（看完理解整个AI行业）

2025-05-27

AI时代下的软件升级：大模型如何让考勤系统听懂人话？

2025-05-26

万字长文！AI智能体全面爆发前夜：一文讲透技术架构与行业机会

2025-05-26

国产顶级 DeepResearch 类产品，把咨询专家请回家

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

大家都在问

AI时代下的软件升级：大模型如何让考勤系统听懂人话？

2025-05-27

AI搜索+DeepResearch=？

2025-05-26

大模型 Agent 就是文字艺术吗？

2025-05-23

今天的Agent，就是十年前的小程序？

2025-05-23

从Agent到Agentic AI：大语言模型真的在向"智能体"进化吗？

2025-05-23

震惊，大模型推理的两个阶段，速度竟然相差140倍！一个实验告诉你为什么大模型推理时需要PD分离？

2025-05-18

推理大模型与普通大模型的区别是什么？

2025-05-18

2025AI 圈的 “新物种”：MCP、Fellou、Manus、Browser等都是啥？和纯AI大模型有何区别？如何选？

2025-05-17

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部