OpenAI unveils its first custom chip, built by Broadcom
来源:HackerNews
# OpenAI 发布首款自研芯片:Broadcom 代工背后的 AI 算力新战局
> 原文链接:[OpenAI unveils its first custom chip, built by Broadcom](https://techcrunch.com/2026/06/24/openai-unveils-its-first-custom-chip-built-by-broadcom/)
> 来源:HackerNews
---
## 背景与概述
2026年6月,OpenAI 正式揭开了其首款自研 AI 芯片的神秘面纱,这款芯片由全球半导体巨头 Broadcom 负责制造。这一消息标志着 OpenAI 从纯粹的 AI 模型研发公司,向垂直整合的"模型+硬件"双轮驱动模式迈出关键一步。在 GPT-5 系列模型持续刷新性能纪录的同时,算力瓶颈已成为制约大模型发展的核心矛盾——训练成本飙升、推理延迟难降、GPU 供应受制于英伟达单一渠道,这些问题迫使 OpenAI 必须掌握自己的算力命运。
自研芯片并非 OpenAI 的突发奇想。早在 2023 年,市场上就流传其招募 Google TPU 核心团队的消息;2024 年与微软合作扩建数据中心时,定制加速器的计划已初现端倪。选择 Broadcom 而非台积电直接代工,体现了 OpenAI 独特的策略考量:Broadcom 在 AI 芯片定制领域经验丰富,曾为 Google 设计多代 TPU,其"设计+代工整合"模式能帮助 OpenAI 更快实现从架构设计到量产落地的闭环。这一合作也打破了"AI 公司必须绑定英伟达"的行业定式,为后来者提供了新的参考路径。
---
## 核心内容
### 一、芯片定位:推理优先,而非训练全能
据业界分析,OpenAI 首款芯片并非追求训练与推理的"全能选手",而是**聚焦推理场景优化**的专用加速器。这一选择极具战略眼光:当前大模型的商业化落地中,推理成本占总运营支出的 70% 以上,且随着用户规模扩张呈指数级增长。专用推理芯片可在单位瓦特下提供数倍于通用 GPU 的吞吐量,直接改善 OpenAI 的毛利率结构。
### 二、Broadcom 的"交钥匙"合作模式
与苹果采用台积电先进工艺不同,OpenAI-Broadcom 合作更接近 Google TPU 的定制模式。Broadcom 负责芯片架构设计、物理实现及供应链协调,OpenAI 则深度参与**计算单元的数据流设计**和**与 GPT 模型特性的协同优化**。这种分工让 OpenAI 无需组建数百人的完整芯片团队,却能将模型层面的认知快速转化为硬件指令集——例如针对 Transformer 注意力机制的稀疏计算模式,定制专门的矩阵乘法单元。
### 三、软件生态的隐性布局
硬件成功的关键在软件。OpenAI 同步推进了编译器工具链的开发,使 PyTorch/TensorFlow 模型能无缝迁移至新芯片。据推测,其采用了类似 MLIR 的中间表示层,实现从 Python 代码到芯片指令的自动优化:
概念性示例:OpenAI 芯片的自动图优化
import openai_infer as oi
模型自动识别可融合的计算模式
model = oi.compile(
"gpt-5-medium",
target="oai-chip-v1", # 自研芯片后端
optimization_level="aggressive",
# 自动启用:注意力算子融合、KV Cache 压缩、动态批处理
enable_sparsity=True # 利用结构化稀疏加速
)
推理时自动选择最优数据并行/流水线并行策略
outputs = model.generate(prompts, max_batch_size=256)
### 四、供应链多元化的地缘政治考量
在中美科技博弈背景下,OpenAI 的芯片策略也包含**供应链韧性**的深层设计。Broadcom 的制造网络覆盖台积电、三星及 Intel Foundry 等多家代工厂,使 OpenAI 能灵活调整产能布局,降低单一地缘风险。这与微软、Google 近年"多源代工"的趋势一致,反映了头部 AI 公司对算力自主可控的集体焦虑。
### 五、对行业格局的连锁影响
OpenAI 入场自研芯片,将加速 AI 算力市场的分层:英伟达继续主导高端训练市场,但推理份额面临 Google TPU、Amazon Trainium、OpenAI 定制芯片的多方蚕食。对创业公司而言,这既是警示——通用模型的算力壁垒进一步加高;也是机遇——专用推理芯片的成熟可能降低特定场景的部署成本。
---
## 技术分析
从技术架构看,OpenAI 芯片大概率采用**存算一体(Near-Memory Computing)**或**高带宽内存(HBM)紧耦合**设计,以解决 Transformer 推理中的"内存墙"问题。其核心创新可能体现在三个层面:
**1. 动态稀疏性支持**
现代大模型广泛采用 MoE(Mixture of Experts)架构,每次前向传播仅激活部分参数。通用 GPU 处理这种动态稀疏模式效率低下,而定制芯片可设计**可重构的稀疏矩阵单元**,根据模型配置实时调整计算路径,实现理论峰值利用率 80% 以上(A100/H100 通常仅 30-50%)。
**2. KV-Cache 的硬件级优化**
长上下文推理的瓶颈在于 KV-Cache 的存储与访问。OpenAI 芯片可能集成**大容量片上 SRAM**(数十 MB 级)配合智能预取机制,将常见上下文长度的 KV-Cache 完全驻留片上,避免 HBM 的数百纳秒延迟。更激进的设计或采用**计算存储融合**架构,在存储阵列内完成部分注意力计算。
**3. 低精度推理的灵活支持**
从 INT8 到 FP4、甚至自定义的 6bit/3bit 格式,模型量化技术持续演进。定制芯片可设计**可编程精度单元**,根据模型层敏感度动态选择数值格式,在精度损失可控的前提下最大化吞吐。这要求硬件支持非标准位宽的 ALU 和特殊的舍入模式,正是通用 GPU 的软肋。
---
## 实践建议
对于中国开发者,OpenAI 自研芯片的发布带来以下 actionable insights:
**1. 关注推理优化,而非盲目追训练**
多数团队并无训练千亿参数模型的需求,但推理成本控制直接影响产品可行性。建议掌握:
- 模型量化工具:`bitsandbytes`、`auto-gptq`、`llama.cpp` 的 GGUF 格式
- 推理引擎:vLLM(PagedAttention)、TensorRT-LLM、MLC-LLM
使用 vLLM 实现高效推理服务
from vllm import LLM, SamplingParams
自动启用 PagedAttention 和连续批处理
llm = LLM(model="meta-llama/Llama-2-7b",
tensor_parallel_size=2,
quantization="awq") # 4bit 量化
sampling_params = SamplingParams(temperature=0.7, max_tokens=512)
outputs = llm.generate(prompts, sampling_params)
吞吐量可达传统 HuggingFace 管道的 10-20 倍
**2. 评估国产 AI 芯片的替代可行性**
OpenAI-Broadcom 模式证明,**模型-硬件协同设计**是突破英伟达垄断的有效路径。国内华为昇腾、寒武纪、摩尔线程等厂商的芯片,配合 MindSpore、PaddlePaddle 等框架,在特定场景已具竞争力。建议关注:
- 昇腾 CANN 的图优化与算子开发
- 寒武纪 MagicMind 的模型迁移工具
**3. 为"多后端"部署架构做准备**
未来 AI 基础设施将呈现 CPU/GPU/TPU/定制芯片并存的异构格局。应用层应采用抽象接口,避免硬编码特定硬件:
使用 ONNX Runtime 或 Triton 实现硬件无关部署
import onnxruntime as ort
自动选择最优执行提供者
providers = ['CUDAExecutionProvider',
'ROCMExecutionProvider',
'OpenVINOExecutionProvider', # 支持 Intel/NPU
'CPUExecutionProvider']
session = ort.InferenceSession("model.onnx", providers=providers)
**4. 跟踪 OpenAI 芯片的开放程度**
若 OpenAI 效仿 Google 通过 Cloud API 开放 TPU 访问,开发者或能以更低成本调用优化后的推理算力。建议关注其开发者大会的后续公告,评估是否值得将部分工作负载迁移至新平台。
---
## ���结
OpenAI 首款自研芯片的发布,是 AI 产业从"软件定义一切"迈向"软硬协同进化"的里程碑事件。它揭示了一个残酷而清晰的现实:当模型规模突破万亿参数、用户日活数以亿计时,**算力效率即核心竞争力**,通用硬件的"钝刀"终究要让位于定制芯片的"利刃"。Broadcom 的代工选择则证明,AI 公司无需复制苹果式的重资产芯片部门,通过战略合作同样能快速构建差异化优势。
对中国开发者而言,这一事件的双重启示在于:短期内,应深耕现有工具的推理优化,降低对高端训练卡的依赖;长期看,需理解并拥抱"模型-芯片-框架"三位一体的技术生态,在国产替代与全球创新的交汇中寻找自己的位置。OpenAI 的芯片故事刚刚开篇,而属于中国 AI 算力的突围叙事,