微信扫码
添加专属顾问
我要投稿
数学:在高中AIME数学竞赛中,o1-mini的得分为70.0%,与o1的74.4%具有竞争力,且成本明显更低,同时也优于o1-preview的44.6%。o1-mini的得分(约答对11/15道题)使其位列全美约前500名高中生。
编程:在Codeforces竞赛网站上,o1-mini的Elo评分为1650,接近o1的1673,并且高于o1-preview的1258。这个Elo评分将该模型排在Codeforces平台上约86%的程序员之上。o1-mini还在HumanEval编程基准测试以及高中级别的网络安全夺旗挑战赛(CTF)中表现出色。
STEM:在一些需要推理的学术基准测试中,如GPQA(科学)和MATH-500,o1-mini的表现优于GPT-4o。然而,在诸如MMLU的任务上,o1-mini表现不如GPT-4o,并且由于缺乏广泛的世界知识,o1-mini在GPQA上的表现也落后于o1-preview。
人类偏好评估:我们让人工评估员在多个领域的复杂、开放式提示下对o1-mini和GPT-4o进行比较,采用与o1-preview对比GPT-4o相同的方法。与o1-preview相似,o1-mini在需要大量推理的领域中更受青睐,但在语言集中的领域中,GPT-4o更受偏好。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-05-26
DeepSeek V3 0526更新?实测代码能力已经提升,附实测案例。
2025-05-26
从MCP实践到开发简单的MCP服务
2025-05-26
MCP Server的五种主流架构与Nacos的选择
2025-05-26
聊聊Cherry Studio如何接入vLLM部署的本地大模型
2025-05-25
一文搞懂大模型的预训练(Pre-training)
2025-05-24
颠覆认知!大模型自检自改新范式,彻底告别人工标注
2025-05-23
Reasoning模型蒸馏实践:用大模型提升小模型能力
2025-05-23
OpenAI 重磅推出!核心API新增MCP功能,智能体开发迎来翻天覆地的变化
2025-02-04
2025-02-04
2024-09-18
2024-07-11
2024-07-09
2024-07-11
2024-07-26
2025-02-05
2025-01-27
2025-02-01