GPT-o1模型实测：“物化生”水平超人类博士？推理能力碾压GPT-4o

• 2024年9月14日下午7:10 • 发现 • 阅读 131

TechWeb 文/卞海川

毫无预热的情况下，Open AI于9月13日凌晨发布了o1系列的大模型，这是传闻中内部代号为“草莓”的项目，也是OpenAI首款具备复杂推理能力的大模型。

与其前代模型相比，新模型o1擅长通用复杂推理，在物理、信息学等领域表现优异，OpenAI CEO奥特曼称它是一种新范式的开始：可以进行通用复杂推理的人工智能。

OpenAI把新的模型发布称为「预览版」，强调o1系列仍处于早期阶段。

作为早期模型，它尚不具备ChatGPT的许多有用功能，例如联网搜索以及上传文件和图像。

虽然处于开发初期，但o1系列在竞赛数学、编码、科学等类目都有非常不错的表现，其中竞赛数学类甚至大幅领先GPT-4o。

你可以简单理解为，o1系列模型是一个极度“偏科”的理工型人才。

根据官方的解释，o1系列模型采取“思维链”的模式进行训练，以此提升大模型的逻辑推理能力。

所以在回答问题之前，它会花更长时间思考，也就是说，o1系列并不追求信息输出反馈的速度，而是更在乎推理结果的准确性。

为了更好的了解o1系列的能力，我们对它进行了一些简单的测试。

我们首先用一些之前大模型都爱翻车的简单题目来测试一下o1系列的推理能力。

“单词strawberry里面到底有几个r”

不出意外，GPT-4o依旧翻车，给出的答案是错误的。

让我们惊喜的是，GPT-o1的回答就非常准确，

“9.11和9.8谁更大？”

GPT-4o在1秒内回答，但是给出了错误答案。

难倒了一众大模型的小数位比大小问题，o1系列没有翻车，在等待了10多秒以后，o1给出的答案是正确的。

我们再来一些正常的推理题，选择经典的小学奥数水平“空瓶换汽水”问题。

原题如下：“1元钱一瓶汽水，喝完后两个空瓶换一瓶汽水，问：你有20元钱，最多可以喝到几瓶汽水？”

很遗憾，在第一次回答的结果上，4o和o1系列都给出了错误的39瓶答案。

但区别在于，如果我告诉它正确的答案，o1系列会纠正自己的错误，给出新的解题思路，但GPT-4o依旧觉得自己的回答是正确的。

接下来我们把难度升级，测试一下竞赛类题目o1系列模型的能力。

据 OpenAI 介绍，在测试中，o1系列模型在物理、化学和生物等具有挑战性的基准任务上的表现达到了博士生的水平。

这一模型在数学和编码方面表现出色。在国际数学奥林匹克（IMO）的资格考试中，GPT-4o 只正确解决了 13% 的问题，而 o1 模型的得分率则高达 83%。

o1系列模型的编码能力也在竞赛中得到了评估，在 Codeforces 竞赛中达到了第 89 个百分点。

Open AI CEO奥特曼在刚刚结束的2024 IOI信息学奥赛题目中，o1的微调版本在每题尝试50次条件下取得了213分，属于人类选手中前49%的成绩。也就是说，它已经超过了大多数人类数学天才!

如果允许它每道题尝试10000次，就能获得362.14分，高于金牌选手门槛，可获得金牌。

我们选取了AIME 2023的真题，该数学竞赛的题目难度比IMO稍低，但仍处于数学竞赛题目难度前列。

经过测试，o1和4o给出了两个完全不一样的答案，虽然解题思路步骤我们没看懂，但从官方给出的答案来看，o1的结果是正确的。

最后，我们来测试一下o1系列代码能力，以经典的俄罗斯方块小游戏作为考题。

我们给o1模型提了要求，然后将所有代码复制运行，一字未改，成功实现俄罗斯方块小游戏。

写在最后

经过我们的简单测试，o1系列模型的最大亮点是显著增加了逻辑推理能力，以前GPT-4o回答不上来的问题，o1系列可以给出正确的解题思路，它已经不仅仅是简单的生成答案，而是能够提前规划、思考，更接近人类的思维过程。尤其是在数学领域表现突出。

不过，它在特定领域的精确度与应对复杂对话的表现上仍有待进一步优化，在数据分析、编程和数学等重推理的类别中，人们更倾向于选择o1-preview。但在一些自然语言任务中，GPT-4o更胜一筹。

原创文章，作者：，如若转载，请注明出处：https://knewsmart.com/archives/310067

0 0 打赏

微信扫一扫

关于作者

0 文章

0 评论

粉丝

GPT-o1模型实测：“物化生”水平超人类博士？推理能力碾压GPT-4o

上一篇 2024年9月14日下午7:10

BSI为杰柏集团颁发两项ISO认证

下一篇 2024年9月14日下午7:11

发现

第三代元PLUS 11.99万元起正式上市全系搭载第二代刀片电池及闪充技术

5月21日，比亚迪第三代元PLUS正式上市，官方指导价11.99万-14.99万。新车定位元力智趣闪充SUV，凭借全能产品力契合元气青年、年轻家庭与科技实用派的多元出行需求，以全球车品质与年轻姿态解锁高品质纯电出…

新智派
2026年5月21日
8.5K
发现

人均16本？2026全国职场人阅读调查来了！

本雅明在一百年前写下过一个诊断：我们生活在一个体验超载的时代，但内心却感到贫乏，似乎没什么能真正沉淀下来。他把那种可传承、能生根的深厚经验称为“Erfahrung”，而把那些孤立的、转瞬即逝的刺激称为“Erlebnis…

新智派
2026年4月27日
14.7K
发现

田涛对话马拉比：在AI浪潮中破解“上帝密码”与人类命运

一壶武夷岩茶，升腾起连接东西方的氤氲热气。近日，《哈萨比斯：谷歌AI之脑》作者塞巴斯蒂安·马拉比，与华为管理顾问田涛展开了一场深度对话，整整2个小时，围绕人类“重构巴别塔”的雄心与野心，两位观察家在茶香中…

新智派
2026年4月20日
11.4K
发现

为什么我们还要读书？世界总有答案

OpenClaw能打开浏览器、查资料、写邮件、填表格——像一个不睡觉的实习生。 Gemini CLI能一口气吞下整个代码库，三秒钟给你一份精准的优化建议。 MGIE动动嘴就能修图，连软件都不用打开。 2026年，这些AI智能体不再是…

新智派
2026年4月20日
8.0K
发现

博世舒适科技日立冷热科技亮相中国制冷展，以绿色与智能引领行业升级

北京2026年4月17日 /美通社/ -- 在2026中国制冷展期间，博世舒适科技集团日立冷热科技集中展示了覆盖压缩机、空调系统及大型机组在内的全系列产品与解决方案。围绕绿色低碳与智能化发展趋势，公司正加快由单一设备…

新智派
2026年4月17日
3.7K
新智•新速•新未来｜OCS 2.0-SPE工业控制系统新品发布暨OCS@NIICA生态合作伙伴签约仪式圆满举行

北京2026年4月17日 /美通社/ -- 2026年4月16日，"OCS 2.0-SPE工业控制系统新品发布暨OCS@NIICA生态合作伙伴签约仪式"圆满举行。本次会议汇聚行业认证机构、核心技术伙伴及生态厂商，共同见证新一代工业控制技术的诞…

新智派
发现 2026年4月17日
6.0K
以责任赋能发展以初心传递温度 -- 中通快递正式发布 2025 年度可持续发展报告

上海2026年4月17日 /美通社/ -- 2026年4月17日，中国行业领先且快速成长的快递公司中通快递（开曼）有限公司（纽交所代码：ZTO及香港联交所代号：2057）（"中通"或"公司"）正式发布了2025年度可持续发展报告。这是…

新智派
发现 2026年4月17日
11.2K
水隐之触悦然心生 GROHE SPA水悦淋浴系统耀世登场

设计美学：采用高特朗水悦恒温控制面板，内嵌式按钮设计让科技隐于无形。核心技术：模块化创新设计搭配SmartControl控温技术，一键精准调控个性化组合。感官体验：宽大的顶洒与情绪调频式手持花洒结合，打造沉浸…

新智派
发现 2026年4月17日
3.5K
雅诗兰黛集团连续第六年参展中国国际消费品博览会，彰显深耕海南的长期承诺

海口2026年4月17日 /美通社/ -- 作为世界领先的优质护肤品、彩妆、香水和护发产品的制造商与营销商，雅诗兰黛集团连续第六年亮相中国国际消费品博览会（以下简称"消博会"）。围绕"重塑美妆新境，焕启致美之旅"的主…

新智派
发现 2026年4月17日
3.8K
发现

毛源昌眼镜亮相消博会，向世界讲述中华老字号新故事

杭州2026年4月17日 /美通社/ -- 4月13日-18日，第六届中国国际消费品博览会在海南海口举行。毛源昌眼镜作为商务部首批认定的"中华老字号"受邀参展，在老字号"镇店之宝"专题展示区，向全球客商呈现百年品牌的文化底…

新智派
2026年4月17日
3.2K