# OpenAI unveils its first custom chip, built by Broadcom

> 来源：[HackerNews](https://techcrunch.com/2026/06/24/openai-unveils-its-first-custom-chip-built-by-broadcom/)

```markdown
# OpenAI 发布首款自研芯片：Broadcom 代工背后的 AI 算力新战局

> 原文链接：[OpenAI unveils its first custom chip, built by Broadcom](https://techcrunch.com/2026/06/24/openai-unveils-its-first-custom-chip-built-by-broadcom/)
> 来源：HackerNews

---

## 背景与概述

2026年6月，OpenAI 正式揭开了其首款自研 AI 芯片的神秘面纱，这款芯片由全球半导体巨头 Broadcom 负责制造。这一消息标志着 OpenAI 从纯粹的 AI 模型研发公司，向垂直整合的"模型+硬件"双轮驱动模式迈出关键一步。在 GPT-5 系列模型持续刷新性能纪录的同时，算力瓶颈已成为制约大模型发展的核心矛盾——训练成本飙升、推理延迟难降、GPU 供应受制于英伟达单一渠道，这些问题迫使 OpenAI 必须掌握自己的算力命运。

自研芯片并非 OpenAI 的突发奇想。早在 2023 年，市场上就流传其招募 Google TPU 核心团队的消息；2024 年与微软合作扩建数据中心时，定制加速器的计划已初现端倪。选择 Broadcom 而非台积电直接代工，体现了 OpenAI 独特的策略考量：Broadcom 在 AI 芯片定制领域经验丰富，曾为 Google 设计多代 TPU，其"设计+代工整合"模式能帮助 OpenAI 更快实现从架构设计到量产落地的闭环。这一合作也打破了"AI 公司必须绑定英伟达"的行业定式，为后来者提供了新的参考路径。

---

## 核心内容

### 一、芯片定位：推理优先，而非训练全能

据业界分析，OpenAI 首款芯片并非追求训练与推理的"全能选手"，而是**聚焦推理场景优化**的专用加速器。这一选择极具战略眼光：当前大模型的商业化落地中，推理成本占总运营支出的 70% 以上，且随着用户规模扩张呈指数级增长。专用推理芯片可在单位瓦特下提供数倍于通用 GPU 的吞吐量，直接改善 OpenAI 的毛利率结构。

### 二、Broadcom 的"交钥匙"合作模式

与苹果采用台积电先进工艺不同，OpenAI-Broadcom 合作更接近 Google TPU 的定制模式。Broadcom 负责芯片架构设计、物理实现及供应链协调，OpenAI 则深度参与**计算单元的数据流设计**和**与 GPT 模型特性的协同优化**。这种分工让 OpenAI 无需组建数百人的完整芯片团队，却能将模型层面的认知快速转化为硬件指令集——例如针对 Transformer 注意力机制的稀疏计算模式，定制专门的矩阵乘法单元。

### 三、软件生态的隐性布局

硬件成功的关键在软件。OpenAI 同步推进了编译器工具链的开发，使 PyTorch/TensorFlow 模型能无缝迁移至新芯片。据推测，其采用了类似 MLIR 的中间表示层，实现从 Python 代码到芯片指令的自动优化：

```python
# 概念性示例：OpenAI 芯片的自动图优化
import openai_infer as oi

# 模型自动识别可融合的计算模式
model = oi.compile(
    "gpt-5-medium",
    target="oai-chip-v1",  # 自研芯片后端
    optimization_level="aggressive",
    # 自动启用：注意力算子融合、KV Cache 压缩、动态批处理
    enable_sparsity=True   # 利用结构化稀疏加速
)

# 推理时自动选择最优数据并行/流水线并行策略
outputs = model.generate(prompts, max_batch_size=256)
```

### 四、供应链多元化的地缘政治考量

在中美科技博弈背景下，OpenAI 的芯片策略也包含**供应链韧性**的深层设计。Broadcom 的制造网络覆盖台积电、三星及 Intel Foundry 等多家代工厂，使 OpenAI 能灵活调整产能布局，降低单一地缘风险。这与微软、Google 近年"多源代工"的趋势一致，反映了头部 AI 公司对算力自主可控的集体焦虑。

### 五、对行业格局的连锁影响

OpenAI 入场自研芯片，将加速 AI 算力市场的分层：英伟达继续主导高端训练市场，但推理份额面临 Google TPU、Amazon Trainium、OpenAI 定制芯片的多方蚕食。对创业公司而言，这既是警示——通用模型的算力壁垒进一步加高；也是机遇——专用推理芯片的成熟可能降低特定场景的部署成本。

---

## 技术分析

从技术架构看，OpenAI 芯片大概率采用**存算一体（Near-Memory Computing）**或**高带宽内存（HBM）紧耦合**设计，以解决 Transformer 推理中的"内存墙"问题。其核心创新可能体现在三个层面：

**1. 动态稀疏性支持**

现代大模型广泛采用 MoE（Mixture of Experts）架构，每次前向传播仅激活部分参数。通用 GPU 处理这种动态稀疏模式效率低下，而定制芯片可设计**可重构的稀疏矩阵单元**，根据模型配置实时调整计算路径，实现理论峰值利用率 80% 以上（A100/H100 通常仅 30-50%）。

**2. KV-Cache 的硬件级优化**

长上下文推理的瓶颈在于 KV-Cache 的存储与访问。OpenAI 芯片可能集成**大容量片上 SRAM**（数十 MB 级）配合智能预取机制，将常见上下文长度的 KV-Cache 完全驻留片上，避免 HBM 的数百纳秒延迟。更激进的设计或采用**计算存储融合**架构，在存储阵列内完成部分注意力计算。

**3. 低精度推理的灵活支持**

从 INT8 到 FP4、甚至自定义的 6bit/3bit 格式，模型量化技术持续演进。定制芯片可设计**可编程精度单元**，根据模型层敏感度动态选择数值格式，在精度损失可控的前提下最大化吞吐。这要求硬件支持非标准位宽的 ALU 和特殊的舍入模式，正是通用 GPU 的软肋。

---

## 实践建议

对于中国开发者，OpenAI 自研芯片的发布带来以下 actionable insights：

**1. 关注推理优化，而非盲目追训练**

多数团队并无训练千亿参数模型的需求，但推理成本控制直接影响产品可行性。建议掌握：
- 模型量化工具：`bitsandbytes`、`auto-gptq`、`llama.cpp` 的 GGUF 格式
- 推理引擎：vLLM（PagedAttention）、TensorRT-LLM、MLC-LLM

```python
# 使用 vLLM 实现高效推理服务
from vllm import LLM, SamplingParams

# 自动启用 PagedAttention 和连续批处理
llm = LLM(model="meta-llama/Llama-2-7b", 
          tensor_parallel_size=2,
          quantization="awq")  # 4bit 量化

sampling_params = SamplingParams(temperature=0.7, max_tokens=512)
outputs = llm.generate(prompts, sampling_params)
# 吞吐量可达传统 HuggingFace 管道的 10-20 倍
```

**2. 评估国产 AI 芯片的替代可行性**

OpenAI-Broadcom 模式证明，**模型-硬件协同设计**是突破英伟达垄断的有效路径。国内华为昇腾、寒武纪、摩尔线程等厂商的芯片，配合 MindSpore、PaddlePaddle 等框架，在特定场景已具竞争力。建议关注：
- 昇腾 CANN 的图优化与算子开发
- 寒武纪 MagicMind 的模型迁移工具

**3. 为"多后端"部署架构做准备**

未来 AI 基础设施将呈现 CPU/GPU/TPU/定制芯片并存的异构格局。应用层应采用抽象接口，避免硬编码特定硬件：

```python
# 使用 ONNX Runtime 或 Triton 实现硬件无关部署
import onnxruntime as ort

# 自动选择最优执行提供者
providers = ['CUDAExecutionProvider', 
             'ROCMExecutionProvider',
             'OpenVINOExecutionProvider',  # 支持 Intel/NPU
             'CPUExecutionProvider']
session = ort.InferenceSession("model.onnx", providers=providers)
```

**4. 跟踪 OpenAI 芯片的开放程度**

若 OpenAI 效仿 Google 通过 Cloud API 开放 TPU 访问，开发者或能以更低成本调用优化后的推理算力。建议关注其开发者大会的后续公告，评估是否值得将部分工作负载迁移至新平台。

---

## ���结

OpenAI 首款自研芯片的发布，是 AI 产业从"软件定义一切"迈向"软硬协同进化"的里程碑事件。它揭示了一个残酷而清晰的现实：当模型规模突破万亿参数、用户日活数以亿计时，**算力效率即核心竞争力**，通用硬件的"钝刀"终究要让位于定制芯片的"利刃"。Broadcom 的代工选择则证明，AI 公司无需复制苹果式的重资产芯片部门，通过战略合作同样能快速构建差异化优势。

对中国开发者而言，这一事件的双重启示在于：短期内，应深耕现有工具的推理优化，降低对高端训练卡的依赖；长期看，需理解并拥抱"模型-芯片-框架"三位一体的技术生态，在国产替代与全球创新的交汇中寻找自己的位置。OpenAI 的芯片故事刚刚开篇，而属于中国 AI 算力的突围叙事，