OpenAI 自研推理芯片 Jalapeño 实测:更高吞吐 + 更低延迟,年底部署
"The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency."
对关注推理基础设施的工程师,这是“专用芯片 vs 通用 GPU”路线的重要数据点。Jalapeño 声称同时提升吞吐和延迟,意味着 agent 类交互(多轮、长上下文)的响应体验可能显著改善。Gen 2/Gen 3 已在路上,说明这是一条长期路线,值得跟踪其对 API 定价和 Codex 会话成本的影响。