作者: 财联社 史正丞|
发布时间:2025-12-12 03:44:35
GPT-5.2 重磅来袭:OpenAI 称其为“最强专业知识工作大模型”
摘要: OpenAI 发布最新前沿模型 GPT-5.2 系列,号称在专业知识工作方面表现最佳,多项指标超越前代产品,并在多项推理测试中略胜于 Gemini 3 和 Claude Opus 4.5。新模型将向 ChatGPT 付费用户和 API 用户推送。
正文:
被谷歌逼到拉响“红色警报”后,OpenAI 于 2025 年 12 月 12 日(周四)发布了最新前沿模型 GPT-5.2 系列。
(来源:OpenAI 官网)
OpenAI 介绍称,GPT-5.2 是迄今为止在“专业知识工作方面”表现最好的模型系列,在 制作电子表格、制作演示文稿、图像感知、编写代码以及理解长上下文等方面都优于前代产品。
GPT-5.2 有三种不同的版本:
- Instant: 针对常规查询(如互联网检索、翻译和写作)进行速度优化的模型。
- Thinking: 擅长编程、数学、长文档分析等复杂结构化工作。
- Pro: 旨在为棘手问题提供最大程度的准确性和可靠性。
OpenAI 特别强调,GPT-5.2 Thinking 是迄今为止最适合现实世界专业用途的模型。在评估涵盖 44 个职业的知识型工作任务的 GDPval 测试中,有 70.9% 的对比结果优于或持平于顶尖行业专业人士,这些任务包括制作销售演示文稿、会计电子表格、制造流程图或短视频等。
另外在金融 AI 领域,GPT-5.2 Thinking 的产出成果也明显好于 GPT-5.1。 OpenAI 给出的示例显示,GPT-5.2 Thinking 在制作人力资源规划模型、股权结构表和项目管理表格的任务中,产出成果较 GPT-5.1 Thinking 有肉眼可见的进步。
(来源:OpenAI)
除了做 PPT 和 Excel 表格外,OpenAI 也表示,GPT-5.2 在 编码、数学、科学、视觉、长文本推理以及工具使用等方面均刷新了基准成绩。公司称,这些能力的提升将有望带来“更可靠的代理式工作流程、可用于生产环境的代码,以及能够在大规模上下文和真实世界数据中运行的复杂系统”。
横向比较方面,GPT-5.2 Thinking 在几乎所有列出的推理测试中都略胜于 Gemini 3 和 Anthropic 的 Claude Opus 4.5,涵盖现实世界的软件工程任务(SWE-Bench Pro)和博士级别的科学知识(GPQA Diamond),到抽象推理和模式发现(ARC-AGI 套件)。
(来源:OpenAI)
OpenAI 产品负责人 Max Schwarzer 也在周四通报称,GPT-5.2 Thinking 的回复较前代减少了 38% 的错误,使该模型在日常决策、研究和写作中更为可靠。
从周四开始,GPT-5.2 将向所有 ChatGPT 付费用户和 API 用户推送。
OpenAI CEO 奥尔特曼在周四宣布,下周会给用户们带来一些“小小的圣诞礼物”。他还说,Gemini 3 对公司各项指标的影响比原本担心得要小。他还说,预计 OpenAI 将在明年 1 月“以非常强劲的姿态”退出目前的红色警报状态。
OpenAI 首席产品官 Fidji Simo 也在周四透露,现在已经开始在部分地区推出年龄估算系统,此举旨在控制 ChatGPT 对 18 岁以下用户回复的内容。Simo 也表示,公司希望在明年一季度推出“成人模式”前先引入这一功能。
略有遗憾的是,周四的新品发布似乎聚焦于新模型的推理能力,没有推出新的图像生成器。而今年以来,为数不多的几次现象级新品发布都与图像、视频生成产品有关。奥尔特曼的“红色警报”备忘录中,也提及要改善图像生成能力。此前有报道称,OpenAI 计划在明年 1 月再发布一款新模型,具有更好的图像能力和更完善的个性化特点,但公司周四未对这一传言予以确认。
结论:
GPT-5.2 的发布标志着 OpenAI 在通用人工智能领域的又一次重大突破。凭借其在专业知识工作方面的卓越表现,以及在推理能力和错误率上的显著提升,GPT-5.2 有望在各行各业得到广泛应用,助力企业和个人提升效率、创造价值。 ![]()
![]()
![]()
延伸阅读
原文链接