OpenAI 最新发布的 GPT-5.3-Codex 模型以及两款音频模型现已通过 Microsoft Foundry 平台向开发者开放。此次更新不仅带来了性能上的显著提升,也为企业级 AI 应用开发提供了更丰富的选择。

GPT-5.3-Codex:编程能力再突破
GPT-5.3-Codex 是 OpenAI 目前能力最强的智能体编程模型,在 SWE-bench Pro 和 Terminal-Bench 等 AI 基准测试中创下新纪录。相较于旧版本,该模型实现了以下核心改进:
- 执行效率提升:运行速度提高 25%,可支持更长时间的任务执行
- 任务可控性增强:首次支持任务中途转向功能,开发者可在模型运行过程中调整方向而不丢失上下文
- 计算机使用能力优化:在计算机操作相关任务上表现显著优于前代 GPT-Codex 模型
该模型最初仅在 OpenAI 的 Codex AI 编程平台上提供,现已通过 API 平台及 Microsoft Foundry 向更广泛的开发者群体开放。定价方面,GPT-5.3-Codex 维持与 GPT-5.2-Codex 相同的水平:输入 token 每百万 $1.75,输出 token 每百万 $14,缓存输入每百万 $0.175。
音频模型升级:GPT-Realtime-1.5 与 GPT-Audio-1.5
除编程模型外,OpenAI 还同步推出了两款音频模型:
GPT-Realtime-1.5 在实时语音交互方面实现多项突破:
- Big Bench Audio 基准测试推理能力提升 5%
- 字母数字转录准确率提升 10%
- 指令遵循能力在内部评估中提升 7%
- 语音输出更加流畅自然,节奏和韵律表现更佳
- API 支持在实时音频流中进行结构化、工具驱动的交互
定价详情:
- 文本输入:$4.00(缓存 $0.04)/ 百万 token
- 文本输出:$16.00 / 百万 token
- 音频输入:$32.00(缓存 $0.40)/ 百万 token
- 音频输出:$64.00 / 百万 token
- 图像输入:$4.00(缓存 $0.04)/ 百万 token
- 图像输出:$16.00 / 百万 token
GPT-Audio-1.5 定价为:
- 文本输入:$2.50 / 百万 token
- 文本输出:$10.00 / 百万 token
- 音频输入:$32.00 / 百万 token
- 音频输出:$64.00 / 百万 token
- 图像输入:$2.50 / 百万 token
- 图像输出:$10.00 / 百万 token
开发者获取途径
目前,开发者可通过两种渠道访问 GPT-5.3-Codex API:OpenAI 官方 API 平台或 Microsoft Foundry。两款音频模型同样已在 Microsoft Foundry 平台上线。Microsoft Foundry 作为企业级 AI 模型服务平台,为企业客户提供了更多模型选择和更灵活的部署方案。
此次模型更新进一步丰富了 Microsoft Foundry 的 AI 模型生态,为开发者在编程辅助、实时语音交互等场景提供了更强大的技术支撑。