GPT-5.3-Codex:软件开发的新纪元

Avatar
Lisa Ernst · 15.02.2026 · 人工智能 · 7 分钟

GPT-5.3-Codex 的兴起标志着人工智能和软件开发的一个关键时刻。作为一名长期关注人工智能模型从理论概念走向实际工具发展的人,我可以肯定地说,这个版本的推出将彻底改变代码的编写、调试和部署方式。OpenAI 最新的智能体编程模型在速度和范围方面都带来了前所未有的功能。

GPT-5.3-Codex 于 2026 年初推出,是 OpenAI 最新的智能体编程模型。它独特地结合了 GPT-5.2-Codex 的编程能力和 GPT-5.2 的推理及知识能力。该模型也因其首次在自身开发中做出显著贡献而闻名,协助其训练过程的调试和优化,正如 Vibe Check 文章中所强调的那样。OpenAI 设计 GPT-5.3-Codex 来处理涉及研究、工具使用和复杂执行的复杂、长任务。

快速摘要:GPT-5.3-Codex 亮点

性能与速度:GPT-5.3-Codex 背后的引擎

根据 Vibe Check 博客,该模型的速度显著提升,比其前代 GPT-5.2-Codex 快 25%。这种性能的提升得益于其在 NVIDIA GB200 NVL72 系统上的协同设计,该设计实现了四倍快的训练性能。GPT-5.3-Codex 拥有高达 400,000 token 的上下文窗口和 128,000 token 的输出限制,能够在单次交互中生成完整的软件系统。

其准确率指标代表了能力上的显著飞跃。在 SWE-Bench Pro 上,模型的准确率为 56.8%。Terminal-Bench 2.0 达到了令人印象深刻的 77.3% 的准确率,比 GPT-5.2-Codex 的 64.0% 有显著提高。此外,在 OSWorld-Verified 上,它达到了 64.7% 的准确率,比前代模型的 38.2% 大幅提升。这些数字表明该模型执行复杂任务的能力有所提高。GPT-5.3-Codex 的推理能力在 GDPval 上与 GPT-5.2 相当,注册评分为 70.9%。该模型在 Terminal-Bench 2.0 上甚至超越了 Claude Opus 4.6(75.1% 对比 69.9%)。

性能对比图 GPT-5.3-Codex vs GPT-5.2-Codex。4|此图显示了两个条形图……

来源: tech-now.io

一张条形图直观地比较了 GPT-5.3-Codex 与其前代 GPT-5.2-Codex 的准确率指标,突出显示了性能的显著飞跃。

基准测试 GPT-5.2-Codex 准确率 GPT-5.3-Codex 准确率
SWE-Bench Pro N/A 56.8%
Terminal-Bench 2.0 64.0% 77.3%
OSWorld-Verified 38.2% 64.7%
GDPval (Reasoning) 70.9% (GPT-5.2) 70.9%

可访问性和安全措施

GPT-5.3-Codex 现在已广泛提供给 GitHub Copilot 用户,具体细节请参阅 Copilot 文档和 GitHub Copilot 计划页面。它已扩展到 Copilot Pro、Pro+、Business 和 Enterprise 订阅用户。Copilot Enterprise 和 Copilot Business 的管理员必须在其 Copilot 设置中激活 GPT-5.3-Codex 策略才能使用其功能。除了 GitHub,用户还可以通过 macOS 版 Codex 应用、命令行界面(CLI)、IDE 扩展以及付费 ChatGPT 订阅用户的网页界面(可通过 ChatGPT 定价页面访问)来访问该模型。尽管 GPT-5.3-Codex 的 API 访问尚未提供,但 OpenAI 预计很快会发布,API 使用费用仍在最终确定中。

GitHub Copilot 标志。1|此图显示了一个风格化的黑白机器人头像,带有圆形的……

来源: automateandtweak.com

GitHub Copilot 的标志,一个风格化的机器人头像,标志着 GPT-5.3-Codex 向 Copilot 用户和订阅用户拓宽了可访问性。

OpenAI 将安全性放在首位,将其 GPT-5.3-Codex 归类为其准备框架下首个具有“高能力”的网络安全模型。该公司实施了广泛的安全措施,包括“值得信赖的网络安全访问”计划以及拨款 1000 万美元用于网络安全研究。OpenAI 还通过推出 Aardvark 安全代理(Beta 版)并为开源项目提供 1000 万美元的 API 额度,来促进生态系统的发展。

交互式协作和实际应用

GPT-5.3-Codex 可作为交互式“结对编程员”工作,提供即时结果。`--steerable` 标志允许开发人员实时监控和纠正生成过程,从而促进动态协作。该模型在快速原型开发和命令行工具使用方面表现出色,是寻求速度和敏捷性的开发者的理想选择。其交互式协作功能确保用户在任务期间可以指导模型并提供反馈,从而提高效率。

steerable.sh
--steerable

该模型的多功能性已扩展到各种应用,从创建完整的 PowerPoint 演示文稿到开发功能齐全的游戏。它可以编写 SQL 查询、检索数据,并生成 PDF 报告或幻灯片。GPT-5.3-Codex 设计用于在集成开发环境(IDE)之外执行“知识工作”和“编程工作”,支持整个软件生命周期,涵盖工程、运营、产品规划、分析和沟通。它在 DevOps 场景下的调试表现出高超的能力,并且在基础设施的自我修复、遗留系统迁移和网络安全任务方面可能具有极高的价值。

挑战与混合未来

尽管 GPT-5.3-Codex 具有 remarkable 的功能,但它也存在一些细微之处。它牺牲深度以换取速度,相比 Claude Opus 等“更深入”的模型,它在处理复杂的架构问题方面表现不佳。一个显著的特点是它在处理大型数据集时倾向于“上下文漂移”,可能忘记约束。该模型还可能将合法的渗透测试脚本误认为恶意攻击,从而导致执行被拒绝。对该模型的描述称其为“狂躁、技术精湛、用类固醇强化的实习生”:执行速度快,但缺乏细致,在没有持续监督的情况下容易分心,Vibe Check 博客文章对此进行了详细阐述。

一个狂躁、技术精湛、用类固醇强化的实习生
Vibe Check
Vibe Check
every.to blog
Claude Opus AI 标志。8|此图为风格化的白色头像剪影,带有花朵……

来源: anthropic.com

Claude Opus 的标志代表了一个“更深入”的模型,比更快的 GPT-5.3-Codex 更适合处理复杂的架构问题。

软件开发的未来很可能拥抱一种混合方法。这种设想是,Claude Opus 等模型将负责架构规划和“深度工作”,而 GPT-5.3-Codex 将在终端内作为主要的执行引擎。这种结合利用了每个模型的优势,有望实现更高效、更强大的开发工作流程。

关于 GPT-5.3-Codex 的常见问题解答

GPT-5.3-Codex 何时发布的?

GPT-5.3-Codex 于 2026 年初发布。

与前代相比,GPT-5.3-Codex 的主要改进是什么?

它比 GPT-5.2-Codex 快 25%,拥有 400,000 token 的上下文窗口,并在 Terminal-Bench 2.0 和 OSWorld-Verified 等基准测试上显示出显著的准确率提升。它还整合了 GPT-5.2 的推理能力。

GPT-5.3-Codex 对所有用户可用吗?

它普遍适用于 GitHub Copilot Pro、Pro+、Business 和 Enterprise 用户。付费 ChatGPT 订阅用户也可以通过网页界面、macOS 应用、CLI 和 IDE 扩展访问它。API 访问预计“很快”提供。

使用 GPT-5.3-Codex 的潜在缺点是什么?

虽然速度快,但与其他模型相比,它可能缺乏处理复杂架构问题的深度。它还可能在处理大型数据集时出现“上下文漂移”,并且可能将合法代码错误地归类为恶意。

结论

GPT-5.3-Codex 代表了智能体编程的重大飞跃,为开发人员提供了前所未有的快速开发和执行工具。它集成到 GitHub Copilot 中并通过各种平台提供可访问性,都凸显了其即时影响。尽管在管理其“狂躁”的性质和确保上下文准确性方面仍存在挑战,但该模型的速度、效率和交互功能预示着一个新时代,人类开发人员和 AI 代理将无缝协作,构建明日的软件。

来源: YouTube

来源: YouTube

分享我们的文章!
来源