AI 产业链全景
四条并行供应链
一个 AI 集群不是一堆 GPU 插在机柜里。它是四条独立供应链的物理汇聚——计算、存储、互联、集成——每条都有自己的原材料、制造工艺和单点瓶颈。先看清各条线谁在控制、哪里会断,才能理解整条产业链。
产业链全景
A · 计算
B · 存储
C · 互联
D · 集成
从设计到 GPU 成品
这是一颗 AI GPU 的完整制造路径。它有六个阶段,每个阶段高度集中——从三家公司的设计软件,到一个美国小镇的石英矿,到一家荷兰公司的光刻机,到一家台湾公司的晶圆厂,再到一家美国公司的软件生态。
① 设计 —— 在电脑上画出 800 亿晶体管
EDA —— 芯片设计的"编译器"
全球 EDA 由三家控制:Synopsys(~31%,2025 年营收 $70.5 亿)、Cadence(~30%,$53 亿)、Siemens EDA(~13%)。三家合计约 60%。但真正的护城河不是市场份额——是晶圆厂 PDK 耦合。PDK(Process Design Kit)是晶圆厂给设计公司的"工艺说明书"——包含晶体管模型、设计规则、寄生参数。台积电通过 OIP(Open Innovation Platform)生态,把 Synopsys、Cadence、Siemens 的 EDA 工具认证为"跟台积电工艺绑定的唯一合法入口"。你用别家 EDA 工具?对不起,没有台积电 N2 的 PDK——你连晶体管模型都拿不到,设计无从开始。Synopsys 不仅做 EDA,还卖 IP 核库和验证 IP——三合一锁定。从 2006 年 14% 市场份额一路爬到 2024 年 37%,Synopsys 的增长故事本身就是"PDK 护城河越来越深"的量化证明。切换到对手不是"装个新软件",是所有脚本重写、团队重训、6-12 个月周期、10-20% 性能退化。切换成本高到让这个决策实质上从未发生过——30 年来没有一家大芯片公司换了 EDA 工具。
② 基底 —— 芯片的物理载体
高纯石英砂 —— 不是"沙子",是"坩埚"
半导体级石英砂要求 99.998% 纯度。全球能满足坩埚级要求的矿脉,约 70-80% 来自一个地方:美国北卡 Spruce Pine 矿区。Sibelco 和 The Quartz Corp 在这里各经营一个矿场,合计供应全球坩埚级高纯石英的大部分。
Spruce Pine 的独特纯度不是偶然。它的母岩是钠长石花岗岩(alaskite)——在 3.8 亿年前阿巴拉契亚造山运动中,岩浆缓慢冷却,长石和云母优先结晶,像海绵一样"吸走"了熔体中的钛、铁和稀土元素。剩下的残余熔体几乎只有 SiO₂,最终结晶为超高纯石英。2025 年发表在 ScienceDirect 上的地球化学研究量化了这个过程——长石和云母是 Ti、Fe、REE 的主要"汇",自然净化后的石英纯度远超过其他任何矿区。这不是"Spruce Pine 恰好很纯",而是一个极其罕见的地球化学净化机制运行了 3.8 亿年。世界其他地方找不到同等纯度的石英,因为找不到同等净化程度的钠长石花岗岩矿床。
坩埚级石英的关键不只是"纯",更是热稳定性——1420°C 熔融硅中几十小时不能析出气泡。气泡会在生长的单晶硅棒中产生位错缺陷,整根晶棒报废。Sibelco 2024 年宣布投资 $7 亿扩产。
③ 耗材 —— 每一步都要消耗的化学材料
光刻胶 —— 半导体的"胶片"
光刻胶本质是精密高分子化学。核心成分光致产酸剂(PAG)吸收光子释放质子,引发树脂脱保护——整个反应需在几个纳米精度内完成。但到了 3nm 以下,传统化学放大光刻胶(CAR)碰到了物理天花板——PAG 释放的酸会扩散到周围几个纳米,模糊了本该锐利的线边缘。这叫酸扩散模糊,是 CAR 路线最根本的物理限制。
下一代方案是金属氧化物光刻胶(MOR)。JSR 旗下的 Inpria 开发的锡氧化物 MOR 不再依靠化学放大——直接用锡-氧分子簇吸收 EUV 光子,吸收效率比有机 CAR 高约 5 倍。分子构建基块比 CAR 小约 5 倍,刻蚀阻力高 10-100 倍——不需要 PAG、不需要淬灭剂,从根本上消除了酸扩散问题。JSR 正在台湾建厂,计划靠近台积电生产 MOR——从原料输出国变成本地化供应。Inpria 同时跟 SK 海力士合作,将 MOR 用于先进 DRAM 制造。日本企业占据全球约 80% 光刻胶,EUV 级 95%+。JSR、信越化学、TOK、住友化学主导。光刻胶与彩色胶片技术上同源——日本胶片时代的化学基础完美迁移。韩国和中国砸十年补贴,至今 EUV 级为零。
特种气体 —— 每一步的"化学配方"
稀土 —— 不直接进芯片,但进设备
稀土的分离是化学史上最难的工业分离问题之一。原因在于镧系收缩——从镧(La,原子序数 57)到镥(Lu,71),随着 4f 电子壳层逐渐填充,原子半径和离子半径缓慢但持续地缩小。相邻两种稀土元素的离子半径差异通常小于 0.01 纳米,化学性质几乎完全相同——它们在水溶液中都以 +3 价态存在,跟同一种萃取剂的结合常数差异极小。要用溶剂萃取把它们分开,需要几百上千级混合澄清槽串联——每一级只产生微小的浓度偏移,积累几百级后才能获得 >99% 纯度的单一稀土。中国从 1970 年代开始建立这套工业体系——不是"发现了一个矿",是"建造了几千级萃取槽"——这个基础设施门槛决定了没有任何国家能在十年内复制中国的稀土分离能力。
美国唯一稀土矿 Mountain Pass(MP Materials),至今 70% 以上收入靠卖给中国分离加工。美国国防部拨款建本土冶炼厂,但全系分离厂需 5-10 年。2010 年中日争端期间中国限制出口,日本稀土价格暴涨 300%。
④ 设备 —— 人类最精密的制造工具
光刻机 —— ASML,人类最复杂的机器
ASML 靠 5000+ 供应商:蔡司(反射镜,研磨精度以原子计)、通快(CO₂ 激光器)、VDL(机械框架),合作超 20 年。
刻蚀与薄膜沉积 —— 芯片制造的"加减法"
3D NAND 需要在硅上挖深宽比 100:1 的垂直孔道。解决方案是原子层刻蚀(ALE)——拆成"吸附+反应"两步,每步只刻一个原子层。Lam Cryo 3.0 在 10μm 深度能做到 <0.1% 线宽偏差。逻辑芯片 FinFET→GAA 转变中,ALE 同样关键——纳米尺度选择性刻蚀对气体和终点检测的要求达原子级。
| 维度 | 数据 |
|---|---|
| 设备单价 | $500万–$2,000万/台 |
| 毛利率 | 45–48% |
| 核心驱动力 | 3D NAND 层数增加→ALE 需求线性增长 |
检测与量测 —— KLA,半导体业的"质检警察"
检测分两种:光学检测(明场/暗场,DUV 激光,可检 40nm 以下缺陷)和电子束检测(分辨率 1-3nm,但检一片需几小时)。光学在 10-20nm 触及物理天花板——3nm 制程的亚纳米缺陷开始漏检。电子束可补救但极慢。实际做法是"抽样"——3nm 以下良率管理的核心矛盾是检测精度和速度之间的永恒妥协。
KLA 真正的护城河是全球晶圆厂 30 年实际缺陷数据训练的分类算法——设备可模仿,30 年的缺陷-"根因"配对数据库不可复制。在 EUV 领域,KLA 跟日本 Lasertec 分工——Lasertec 做 actinic 检测(13.5nm 真光),KLA 做光学+打印检查。
⑤ 制造 —— 把设计变成物理芯片
台积电 —— 全球只有一个
FinFlex 是理解 N3 为什么能同时服务 iPhone 和 H100 的关键。台积电 N3 提供了三种标准单元配置:3-2 fin(超高驱动,给服务器 CPU/GPU 用)、2-1 fin(最优能效和密度,给手机芯片用)、2-2 fin(性能/功耗均衡)。同一颗芯片的不同功能模块可以混用不同 fin 配置——CPU 核心用 3-2 追求峰值性能,GPU 模块用 2-2 压功耗,NPU 用 2-1 追求密度。这种灵活性让台积电能用同一个 N3 工艺节点覆盖从手机到 HPC 的全谱系客户。三星 GAA 3nm 没有同等的灵活性——这比单纯的"良率数字"更能解释为什么台积电吃掉了几乎所有 3nm 订单。
台积电另一个不可复制的壁垒是"只制造不设计"——服务 534 家客户、12,682 种产品。三星和 Intel 自己做芯片,客户自然会想:我的设计会不会被你们拿去改进自己的产品?台积电 30 年建立的信任资产不是钱能买来的。
⑥ 产品 —— 芯片设计公司的最终输出
训练 GPU —— 英伟达的 CUDA 护城河
CUDA 护城河是网络效应——就像 Windows 在 PC 时代。AI 研究者写一行 model.to('cuda'),背后是 15 年积累的 cuDNN/cuBLAS/NCCL 算子库。但真正让迁移几乎不可能的,不是单 GPU 算子库——是 NCCL(NVIDIA Collective Communications Library)。
大模型训练不是在单 GPU 上跑的——是几千张 GPU 同时工作,每步训练后所有 GPU 的梯度要汇总平均(all-reduce)。NCCL 是控制这个过程的通信库——它决定了 GPU 之间怎么传数据、走 NVLink 还是 InfiniBand、用 Ring 还是 Tree 拓扑。AMD 的 ROCm 有对应的 RCCL——但通信算法、拓扑优化、故障恢复机制全部不同。一个团队花了 6-12 个月把单 GPU 代码从 CUDA 迁移到 ROCm 后,一到分布式训练就卡在 NCCL/RCCL 的兼容性上——混合英伟达和 AMD GPU 集群的通信性能可能暴跌 30-50%。迁移代价不止是重写代码,是整个训练基础设施的重构——从调度器到监控到网络拓扑。加上跟台积电 15 年供应链关系,英伟达构成了"芯片设计+软件生态+制造产能"三重护城河。
| 厂商 | 产品 | 定位 |
|---|---|---|
| 英伟达 | H200→B200→R100 | 训练王者 |
| AMD | MI300X→MI400 | 追赶者 |
| TPU v5p/v6 | 自用+云服务 | |
| Amazon | Trainium2 | 自用+AWS |
| Microsoft | Maia 100 | 自用 |
推理与端侧 —— 两个新战场
推理和训练对芯片要求截然不同。训练追求 FP16 精度下的 TFLOPS,推理追求每瓦处理多少 token——精度可降到 INT8/INT4。推理不需要 CUDA 生态,给了创业公司结构性机会。
Groq 的 LPU 是理解"推理专用芯片 vs GPU"差异的最佳案例。GPU 用 HBM 做缓存——HBM 带宽极高(~4.8 TB/s),但延迟也不低,且功耗巨大。Groq 的方案是完全不用 HBM,改用 SRAM 做片上内存。SRAM 的延迟比 HBM 低 10-20 倍,所以 Groq 在单 token 推理延迟上碾压 GPU——适合实时对话、语音助手等低延迟场景。但代价巨大:SRAM 比 HBM 贵约 10 倍、密度低约 10 倍。Groq 一片卡只有 230MB SRAM,而一张 H200 有 141GB HBM。这意味着 Groq 跑大模型需要几十张卡分布式推理,批处理吞吐量反而不如 GPU 经济。Groq 赌的是"推理的未来是低延迟实时交互,不是高吞吐离线批处理"——这个赌注还没有定论。
端侧 AI 的核心约束是内存带宽——手机 LPDDR5 ~50 GB/s vs H200 HBM ~4,800 GB/s,差近 100 倍。7B 模型量化到 4-bit 后在手机上只能跑十几个 token/s——远低于阅读舒适速度的 30-50 token/s。端侧短期内不可能替代云端,但可能催生全新交互范式:实时翻译、环境感知 AR、屏幕上下文理解。苹果控制"芯片+OS+应用商店"三位一体,是端侧最被低估的玩家。
计算链层层单点瓶颈:Spruce Pine 石英→ASML EUV→台积电 Foundry→英伟达 CUDA,每一环只有 1-2 家供应商。任何一环断裂,整条链停摆。这也是为什么这条链上的公司利润率极高——卖的不是商品,是不可替代性。半导体设备(SEMI 数据)2026 年全球支出 $1,520 亿(+24%),晶圆厂设备三年累计 $3,740 亿——这个资本开支周期不会因为 AI 叙事降温就停下来。
从 DRAM 晶圆到 HBM
大模型训练时,GPU 需要海量数据以极高速度喂进来。存储链跟计算链并行制造——用完全不同的 DRAM 工艺、设备和供应商体系——在 CoWoS 封装中汇合。这条链有三个层次:底层的 NAND 持久存储、中层的 DRAM 工作内存、顶层的 HBM 高带宽堆叠。
① DRAM 基础 —— 存储链的地基
DRAM —— 一个电容 + 一个晶体管
DRAM 的制造是一场密度战争。当前 DRAM 处于"10nm 级"(D1a→D1b→D1c→D1d 代),三代厂商在冲刺 1c DRAM(约 11-12nm 半间距)。DRAM 单元的基本结构是 1T1C——一个晶体管(控制开关)+ 一个电容(储存电荷)。单元布局从 2007 年起一直使用 6F² 设计(F 是光刻最小特征尺寸),即每个单元占用 6 个正方形单位的面积。业界已研发出 4F² 单元(埋入式字线+深沟槽电容),但在量产中至今未实现——因为把电容埋进硅里要蚀刻 100:1 深宽比的深沟槽且不能钻到相邻单元。DRAM 的密度缩放速度已落后逻辑芯片至少两代。
核心挑战是电容——1T1C 单元里,电容要够大才能稳定存储电荷(电荷太少会被热噪声淹没导致数据丢失),但随着单元缩小,电容越来越难塞进去。
业界方案是把电容竖起来做成 3D 柱状结构,在晶体管上方垂直建造。电容介质从单层 SiO₂ 一路进化:SiO₂ → Si₃N₄/SiO₂(ON 叠层)→ Al₂O₃ → HfO₂ → Hf₁₋ₓZrₓO₂(HZO)纳米叠层——用原子层沉积(ALD)在几十纳米直径、深宽比 >50:1 的柱状孔内壁上交替沉积 HfO₂ 和 ZrO₂ 原子层,精确调控 Hf/Zr 比例来平衡介电常数和漏电流。2025 年 ScienceDirect 上的研究验证了 TiN/Al₂O₃/HZO/TiO₂/TiN 柱状电容结构。整个 DRAM 芯片约 60% 面积是存储阵列(电容+晶体管),40% 是外围电路。
Row Hammer:DRAM 缩小的物理代价。当你反复激活 DRAM 的某一行时,相邻行的存储电容会通过电容耦合缓慢漏电——重复几十万次后,相邻行的电荷漏到不足以正确读取,数据翻转。这不是 bug,是 1T1C 结构的物理宿命——单元越近耦合越强。2015 年 Google 的 Project Zero 首次证明了 Row Hammer 可以从用户态发起攻击绕过所有内存保护。此后每一代 DRAM 都加了 TRR(Target Row Refresh)——监测被反复激活的行并主动刷新邻居。但刷新本身就是 DRAM 功耗的主要来源(占总功耗 10-20%),温度越高刷新越频繁(85°C 下每 32ms 就要刷一次 vs 45°C 下 64ms)。Row Hammer 不是安全漏洞——它暴露了 DRAM 架构最底层的物理矛盾:缩小单元→增强串扰→需要更多刷新→增加功耗→又推高温度→需要更频繁刷新。
EUV 正在进入 DRAM。SK 海力士是全球 DRAM EUV 采用最激进的厂商——1c DRAM 使用 5-6 层 EUV 光刻层,并已在 2025 年安装业界首台 High-NA EUV 用于下一代 DRAM 开发。三星和美光也在跟进。DRAM 制程虽比逻辑芯片"粗"(10nm vs 3nm),但 EUV 能减少多次曝光→提高良率→降低成本——这对大宗商品属性的 DRAM 尤其重要。
全球 DRAM 市场由三家寡头垄断:三星 ~40%、SK 海力士 ~30%、美光 ~25%——合计 ~95%。DRAM 是典型的周期性大宗商品:供过于求时全行业亏损,供不应求时价格暴涨。三十年来每 3-4 年循环一次,每次低谷都有厂商被淘汰(日本尔必达、台湾茂德……)。三强寡头格局不是天然形成的,是"大逃杀"的幸存者名单。
HBM 正在打破这个周期。HBM 使用比标准 DRAM 多 2-3 倍的晶圆面积(堆叠层数多、TSV 占用面积大),挤占了标准 DRAM 产能。当 AI 需求把 HBM 产线塞满,标准 DRAM 产能被压缩→标准 DRAM 价格上升→整个行业从"周期性过剩"转为"结构性紧缺"。2025 年下半年以来,DRAM ASP 持续走强,TrendForce 称之为"史上最强存储器超级周期"——不是手机和 PC 需求好,是 HBM 把产能吃掉了。2026 年 DRAM 市场约 $1,260 亿。HBM ASP 预计在 2026 年继续上涨:三星 +8%、SK 海力士 +1%、美光 +22%(美光基数低、追赶效应更明显)。
② HBM —— DRAM 的 AI 特化版
HBM —— GPU 旁边的"快充站"
HBM 制造:多层 DRAM 芯片磨到几十微米厚→垂直堆叠→硅通孔(TSV)垂直打穿→填充金属。TSV 不是简单的"钻孔"——用的是Bosch 深反应离子刻蚀:交替注入 SF₆(蚀刻硅)和 C₄F₈(在侧壁沉积氟碳聚合物保护层),循环数百次。SF₆ 往下啃硅,C₄F₈ 护住侧壁不被横向侵蚀——但每一步蚀刻都会留下微小的扇贝纹(scallop),影响后续铜填充的均匀性和可靠性。SF₆:C₄F₈ 比例约 7:2 是次微米级 TSV 的最优条件。孔钻好后用物理气相沉积(PVD)做阻挡层/种子层,再电镀铜填满——任何空洞在热循环中都会因铜和硅的热膨胀系数不匹配导致开裂。
HBM 最被低估的物理瓶颈是热。DRAM 存储单元的最高工作温度只有 95°C——比外围 CMOS 逻辑电路的 105°C 低了整整 10°C。在 4 层 HBM2 堆叠中,仅是底层芯片上最热点和最冷点的温差就可达 24°C。堆叠 12 层 HBM3E 后,热量从中间层往上和下都传不出去——这意味着 HBM 堆叠的实际可用层数不是由 TSV 工艺决定,是由热管理能力决定。
热管理的差异直接解释了为什么 SK 海力士领先。SK 海力士使用 MR-MUF(Mass Reflow Molded Underfill)——把所有层一次性回流焊接并填充底部填充胶。三星和美光使用 TC-NCF(Thermal Compression with Non-Conductive Film)——一层一层地热压。MR-MUF 的优势是导热性:底部填充胶填满所有间隙后,每层之间的热阻更低。实测数据:相同 DRAM 工作条件下,MR-MUF 的最大结温比 TC-NCF 低 14°C。在 12 层堆叠中,14°C 的温差就是"芯片能工作"和"热失控"之间的距离。这不是良率问题——是物理问题。SK 海力士的 HBM 领先本质上是封装热工程的领先。
三星在 2025 年 9 月拿下了英伟达 HBM3E 认证——这是存储行业年度最重要的事件之一。此前三星在 HBM 赛道上严重落后,HBM3E 良率和客户认证进度不如 SK 海力士和美光。拿到英伟达认证后,三星 2026 年 HBM 产能全部售罄,Q1 2026 DRAM 整体份额 38%(稳居第一)。最新格局:SK 海力士 HBM 份额 ~50-55%(较 2025 年 Q2 的 62% 有所回落——不是需求不好,是三星和美光在追),三星 ~35-40%,美光 ~5-10%。三星拥有全球最大的 DRAM 产能基数——一旦 HBM 良率追上,释放的产能将对 HBM 定价形成实质压力。
HBM4 是下一场战争。2026 年 Q2 三家都在量产——接口宽度从 1024 位翻倍到 2048 位,单堆叠带宽 2 TB/s+(HBM4E 可达 3.3 TB/s)。关键变化:HBM4 的逻辑底座(Base Die)制造方式在分化——SK 海力士选择让台积电代工逻辑底座(用先进逻辑制程做接口芯片),三星则用自家 4nm 工艺自产。这意味着 HBM4 不再是单纯的存储器,而是存储器+逻辑的混合芯片——台积电在新架构中多了一个位置,但不是唯一的。美光 HBM4 ramp 速度是 HBM3E 的两倍,capex 增加到 $200 亿,2026 年 HBM 产能全数预订。
| 维度 | 数据 |
|---|---|
| HBM 市场 2025→2026 | $380 亿 → $580 亿 |
| SK 海力士 HBM 份额 | ~50-55%(Q1 2026) |
| 三星 HBM 份额 | ~35-40%(已获英伟达认证) |
| 美光 HBM 份额 | ~5-10%(HBM4 ramp 2x 速度) |
| HBM4 单堆叠带宽 | 2+ TB/s(HBM4E 3.3 TB/s) |
| HBM 毛利率 | 50%+ |
③ 3D NAND —— AI 训练的"数据仓库"
3D NAND —— 垂直堆叠的"数据摩天楼"
3D NAND 的原理是把存储单元在垂直方向一层层堆叠起来——像盖摩天楼。当前主流是 200-300 层,三星在往 400 层走。每增加一层,单 GB 成本就下降——但制造复杂度上升:需要挖极深极细的垂直孔道(深宽比 100:1),在孔道内壁精确沉积几十层材料(电荷陷阱层、阻挡层、沟道层……)。
3D NAND 不用传统的浮栅晶体管,而用电荷陷阱闪存(CTF)。浮栅是 2D NAND 时代的方案——用一块导电的多晶硅"岛"存储电荷。但在垂直结构中,你没法用自上而下的光刻在孔道侧壁上做一个水平方向的浮栅——光刻是从上方打下来的。CTF 的解决方案是用氮化硅层替代浮栅——氮化硅不是导体,而是含有大量"陷阱态"的绝缘体。电子被注入后不是储存在一块导电岛上,而是被分别困在氮化硅层内的离散陷阱中。不需要水平结构,只需要在垂直孔道侧壁上依次沉积各层材料即可。但 CTF 也有代价——陷阱中的电子会缓慢逃逸("fast-drift"效应),数据保存时间不如浮栅。这是 3D NAND 在物理上做出的根本性取舍:牺牲电荷保持换取垂直堆叠的可行性。
每个 NAND 单元能存储的比特数决定了成本和寿命的尖锐矛盾。SLC(1 bit/单元)可以有 5-10 万次擦写(P/E 循环),但每 GB 成本是 TLC/QLC 的 10-15 倍。MLC(2 bit)降到 3,000-10,000 次。TLC(3 bit)1,000-3,000 次。QLC(4 bit)只有 100-1,000 次——写满一个 QLC SSD 几十次就可能报废。AI 训练数据集动辄几十 TB,如果用 QLC 做训练缓存,一个训练周期下来 SSD 寿命被吃掉一大块。这就是为什么数据中心级 SSD 大量使用 TLC 配大容量预留空间(over-provisioning),牺牲成本换寿命。NAND 市场 2025 年约 $520 亿,三星 30.4%、SK 海力士 16%、铠侠 15.9%、美光 13.3%、YMTC 11.8%。NAND 比 DRAM 更分散,因为技术壁垒相对较低。
中国长江存储(YMTC)是 NAND 领域最值得关注的新玩家,其 Xtacking 架构是业内最激进的技术方案。传统的 3D NAND 把存储阵列和外围 CMOS 电路做在同一片晶圆上——但两者的制造需求截然不同(存储追求层数,CMOS 追求逻辑速度)。Xtacking 的方案是晶圆对晶圆(W2W)混合键合:在一片晶圆上做存储阵列,在另一片晶圆上用独立逻辑制程做 CMOS 外围电路,然后把两片晶圆面对面精确键合——每平方毫米数以百万计的铜触点对准。这样做有三个好处:(1) 存储晶圆可以不受 CMOS 工艺约束全力堆层数,(2) CMOS 晶圆可以用更先进的逻辑制程,(3) 不需要 EUV 光刻机就能实现高层数。YMTC 第五代 3D TLC NAND 已实现 294 层(其中 232 层活跃),位密度超过 20 Gb/mm²,量产中。但受限于美国设备出口管制,YMTC 无法获取最先进的刻蚀和沉积设备,扩产速度被严重压制。铠侠(原东芝)的 CBA(CMOS directly Bonded to Array)采用了类似的 W2W 键合路线——存储行业的"层数竞赛"正在被"键合竞赛"取代。
HBM 是 AI 算力扩张的关键物理约束。SK 海力士的先发优势正在被三星追赶——2025 年 9 月英伟达认证是最重要的转折点,HBM4 的逻辑底座制造方式分化(SK 海力士选台积电、三星自研 4nm)是下一个变量。DRAM 行业正在经历"史上最强超级周期"——不是周期性的需求波动,而是 AI 带来的结构性紧缺。投资者要区分两件事:HBM 是高利润增长引擎(毛利率 50%+,ASP 年涨 1-22%),标准 DRAM 是被 HBM 挤出产能的受益者(价格上涨但非永续)。存储链最有价值的公司不在"谁最大"(三星的 DRAM 总规模),而在"谁最先"——SK 海力士的 HBM 先发优势和英伟达深度绑定仍是当前最强的护城河,但三星的产能底气和美光的执行力正在把差距缩小。
从化合物半导体到光模块
上万颗 GPU 同时工作、不断交换数据。互联链走的是完全不同的材料体系——化合物半导体(InP/GaAs),不经硅基晶圆厂,有独立制造工艺和供应商。这条链上光模块负责"传输"、交换机芯片负责"路由"。互联链是整个产业链中集中度最高的环节之一——仅博通一家就占了交换机芯片 70%,本质上是两个子主题撑起一整条供应链。
① 光模块 —— 三种材料路线决定 1.6T 时代谁会赢
光模块 —— 为什么跟硅基芯片是完全不同的赛道
800G 光模块正在批量部署,2026 年出货量预计翻倍。1.6T 模块从 2025 年 Q2 开始小批量发货,2026 年被普遍视为 1.6T 商业化量产元年——Cignal AI 预测全年出货超 500 万只。光模块占 AI 基础设施成本从 2023 年的 12% 升到 2025 年的 18%,随着集群规模扩大,这个比例还在爬升。
一个 800G 光模块里,最贵的不是激光器——是 DSP 芯片。DSP(数字信号处理器)负责把电信号编码成适合光纤传输的调制格式、在接收端补偿色散和非线性失真。800G 时代主流是 PAM4 直接检测——8 个 100G 通道、用 5nm CMOS DSP、每模块功耗约 20W。到了 1.6T,单通道速率从 100G 跳到 200G,PAM4 的信噪比不够了——新一代相干检测方案(同时调制幅度和相位)开始进入数据中心内部互联(不再只是长距离传输)。相干 DSP 从 5nm 切换到 3nm CMOS,功耗仍约 20-25W。DSP 的制程竞赛本身就是一场隐藏在光模块里的"芯片战争"——谁先拿到台积电 3nm 产能做相干 DSP,谁就在 1.6T 市场领先一个身位。
1.6T 时代的技术路线之争——三种材料在抢同一个位置:
在讨论材料路线之前,先要理解光模块里激光器是怎么工作的。DML(直接调制激光器)最简单——直接改变驱动电流来开关激光。便宜,但高速时产生"啁啾"(chirp)——激光波长随电流波动,通过光纤时不同波长的光传播速度不同(色散),信号模糊。800G 以上,DML 基本出局。EML(电吸收调制激光器)把激光器和调制器集成在同一芯片上——激光常亮,靠外部的电场开关来调制光。信号更干净、啁啾更低,但成本更高。当前 800G 长距离传输全部用 EML。
800G 时代,EML 是主流。但到了 1.6T,单通道速率从 100G 跳到 200G,三条材料路线在同时冲刺:
① InP EML(传统路线):日本住友电工、Lumentum 主攻。技术最成熟,但 200G/lane 时信号质量衰减严重——需要更复杂的 DSP(数字信号处理)补偿,功耗优势丧失。
② 硅光子(SiPh):利用成熟的 CMOS 工艺在硅片上制造光电器件。Intel 和台积电在押注这条路线——如果能用硅做激光器和调制器,成本结构会彻底改变(硅晶圆 $50 vs InP 晶圆 $500+)。但硅是间接带隙材料,发光效率天然低——目前仍需要外接 InP 激光器作为光源,所谓"硅光"严格说是"硅光调制 + InP 光源"的混合方案。Nature Communications 2024 年的一篇路线图文章指出:InP 调制器在调制效率和带宽上仍领先硅光一代。
③ TFLN(薄膜铌酸锂):物理性能最优——铌酸锂的 Pockels 效应让它在超高带宽下功耗极低。问题在量产:铌酸锂是脆性晶体,薄膜化工艺极难大规模制造。2025-2026 年全球仅少数实验室能做到 6 寸晶圆级别。
谁在赢?短期(2025-2027):SiPh + InP 光源的混合方案先抢到 1.6T 市场。长期(2028+):如果 TFLN 制造工艺突破,它会在功耗敏感的超大规模集群中碾压前两种路线。这不是"一家通吃"的故事——三种路线可能在 800G、1.6T、3.2T 三代产品中各领风骚几年。
功耗是这条链上被低估的约束。一个 800G 光模块约 15W,一万个 = 150kW——光互联本身就吃掉了数据中心 10-15% 的电力预算。CPO(共封装光学)试图解决这个问题:把光引擎直接装进交换机芯片的封装里,省掉中间的电光转换和长铜线驱动,功耗预计降低 30-50%。但大规模商用还需 2-3 年。
在 CPO 成熟之前,另一场革命正在发生:LPO(线性驱动可插拔光学)。传统光模块的 DSP 不仅做信号调制,还做"重定时"(retiming)——把接收到的模糊信号完全重新生成一遍。但重定时本身吃掉了 DSP 功耗的一半以上。LPO 的思路极其简单:把 DSP 整个拿掉,让交换机的 SerDes 直接驱动激光器。结果:功耗下降 40-50%(~20W → ~10W),延迟从 8-10ns 降到 3ns 以下。代价是信号完整性——没有 DSP 补偿,光纤色散和连接器反射全部由交换机芯片硬扛,对铜缆长度和光纤质量要求极苛刻。到了 1.6T 的 200G/lane,纯 LPO 扛不住了——德州仪器等厂商在推 LRO(Linear Receive Optics,线性接收光学):保留发射端的 DSP,只拿掉接收端的重定时。功耗从 >30W 降到 <20W——折中方案但更可行。LPO/LRO 不是替代 CPO,而是在 CPO 量产前的过渡方案——但过渡期可能有 3-5 年,足够重塑光模块供应链。
② 交换机芯片 —— 数据包的"空中交通管制"
交换机芯片 —— 博通的隐秘帝国
博通有两套交换机芯片架构,服务完全不同的场景。StrataXGS(Tomahawk、Trident)用浅片上共享缓冲、高辐射低延迟流水线——转发延迟亚微秒级,是数据中心和 AI leaf-spine 的主力。但缓冲只有几十 MB——一旦多台服务器同时向同一目标发包(Incast 拥塞),浅缓冲来不及排队就丢包。StrataDNX(Jericho、Qumran)用深度片外 HBM 缓冲(6-8 GB)配合虚拟输出队列(VOQ)调度——转发延迟毫秒级。Tomahawk 是"越快越好"的短跑选手,Jericho 是"什么都吞得下"的马拉松选手。AI 训练集群用 Tomahawk(低延迟关键),数据中心互联用 Jericho(大缓冲关键)。博通同时拥有两套架构意味着它能覆盖从 GPU 集群到洲际互联的全部网络层级——英伟达 Spectrum-X 和 InfiniBand 都做不到这一点。
英伟达 InfiniBand 还是以太网?博通两边都赢。Dell'Oro Group 2025 年 7 月报告给出明确结论:"Ethernet 在 AI 后端网络中赢了 InfiniBand。"截至 2025 年末,以太网占 AI 后端网络交换机销售的 2/3+,从不到 1/3 翻上来的。英伟达的 Spectrum-X 平台本身就是以太网——它用博通的 Tomahawk 芯片做交换机。博通的策略不是跟英伟达正面竞争 GPU,而是给超大规模客户定制 XPU——Google TPU 的部分设计外包给了博通,Meta、Amazon、Anthropic 也在用博通的定制芯片服务。这条路径让它同时吃到了"AI 训练"和"AI 网络"两块增长。
| 维度 | 数据 |
|---|---|
| 交换机芯片格局 | 博通 ~70%,英伟达 ~15% |
| 博通 FY2025 AI 营收 | $200 亿(+65%),总营收 $640 亿 |
| Q1 FY2026 AI 营收 | $84 亿(+106% YoY),Q2 指引 $100 亿+ |
| AI 订单积压 | $730 亿(18 个月内) |
| Tomahawk 6 交换容量 | 102.4 Tbps(2025年6月发布) |
| 网络占集群成本 | 15–20% |
互联链是 AI 产业链中最被忽视的一条——材料和制造完全独立于硅基芯片,有自己的瓶颈和垄断者。博通的位置类似计算链中的英伟达——不造 GPU,但每卖一颗 GPU、每建一个集群都要给博通付费。$730 亿的 AI 订单积压是其护城河的量化证明。光模块侧,InP 晶圆($221M 市场)支撑着数百亿美元的 AI 网络生态——这种"小材料卡大市场"的格局是整个产业链中最脆弱的环节。Ethernet 已经赢了 InfiniBand 的基础设施之战,博通是最大的受益者。1.6T 光模块的技术路线之争(InP vs SiPh vs TFLN)将在 2026-2027 年见分晓,决定下一个五年谁能在这条链上赚到最多的钱。
封装:把四条链拼在一起
封装曾是芯片产业最"低端"的环节。现在它是 AI 芯片供应的最大瓶颈。英伟达卖多少 GPU,不由 GPU 产能决定,由台积电能封多少 CoWoS 决定。集成链子主题虽少,但两个环节(CoWoS、ABF)的集中度可能超过计算链任何单一环节——台积电 CoWoS 90%、味之素 ABF 99%+,两条命脉各握在一家公司手里。
CoWoS —— "不是造芯片,是拼芯片"
CoWoS 的制造流程:先在一片硅晶圆上做出中介层(TSV 硅通孔 + 多层 RDL 重布线)→ 把 GPU 和 HBM 芯片精确贴到中介层上 → 整个模组贴到封装基板。中介层制造类似于前道晶圆工艺(光刻、刻蚀、沉积),而非传统后道封装——这就是为什么只有台积电(同时拥有前道晶圆厂和后道封装厂)能把 CoWoS 做到这个规模。
CoWoS 内部最关键的连接技术正在换代。当前主流是微凸块(microbump)——GPU 和 HBM 底部有几十微米直径的焊料球,加热熔化后连接芯片和中介层。但微凸块的间距(pitch)极限在 25-40μm——再小焊料桥接短路的风险飙升。下一代是混合键合(hybrid bonding)——不用焊料,直接把芯片上的铜触点跟中介层上的铜触点面对面压在一起,在固态下通过原子扩散形成 Cu-Cu 金属键。间距可以做到 10μm 以下,互连密度比微凸块高一个数量级,寄生电阻和电容也大幅降低。TSMC 的 SoIC(System on Integrated Chips)和 Intel 的 Foveros Direct 都走这条路。HBM4 正在考虑混合键合替代微凸块——但混合键合要求两片晶圆表面平整度在亚纳米级,一粒灰尘就毁掉整片晶圆的键合。这是先进封装从"焊接"进化到"原子级键合"的终极挑战。
芯片和中介层之间还有一个看不见的杀手:热膨胀系数(CTE)不匹配。硅的 CTE 是 ~3 ppm/°C,有机基板是 ~17 ppm/°C。GPU 工作时温度在室温到 100°C+ 之间反复循环——每一次循环,硅和基板以完全不同的速率膨胀收缩,连接点(微凸块或混合键合界面)承受巨大的剪切应力。解决方案是底部填充胶——一种填充在芯片和中介层之间的环氧树脂,CTE 被精确调至介于硅和基板之间,吸收应力。但填胶本身也是瓶颈——胶水必须通过毛细作用渗透到几十微米的间隙里,不能有气泡。一颗 B200 模组的填胶如果有一处空洞,热循环一百次后那附近的微凸块就开裂了。这就是为什么 CoWoS 良率不像逻辑芯片那样靠光刻精度,而是靠材料科学——胶水的配方、流动性、固化收缩率每一个参数都决定良率。
瓶颈在中介层面积。EUV 光刻机单次曝光的物理极限(reticle limit)是 26mm × 33mm = 858mm²——这是光罩能投射的最大面积。一颗 H200 的 CoWoS-S 中介层约 858mm²,恰好卡在物理极限上。GPU 和 HBM 越堆越多,中介层就要越大。超过极限后有两种路:多掩膜拼接(reticle stitching)——用多次曝光把相邻区域"缝"在一起,但拼接处需要预留重叠区,会浪费面积并引入对准误差;CoWoS-L(局部硅桥)——不用一整块大中介层,而是用多块小硅桥仅在有连接需求的位置做高密度互联,其余区域用有机基板的低密度互联。台积电正在研发的下一代方案 CoPoS(Chip-on-Panel-on-Substrate)直接抛弃圆形晶圆,改用矩形面板——一块面板可以容纳 6 倍 reticle 面积的芯片模组,从根本上绕过 reticle limit。
产能扩张速度前所未有:台积电 CoWoS 月产能从 2023 年末的 1.3 万片飙升至 2025 年末约 8 万片,2026 年末目标 12-13 万片——三年 10 倍。即便如此,供需缺口仍有 10-20%。Intel 的 EMIB/Foveros 正在成为替代方案,但规模远不能替代 CoWoS。三星的 I-Cube/H-Cube 在客户采纳上仍落后。
ABF 基板 —— 味精公司的隐秘垄断
这个故事的真实版本比"味精副产物"更精彩。1970 年代,味之素的研发团队在研究氨基酸发酵的副产物流时,积累了深厚的氨基酸化学能力。但真正的转折在 1996 年——一家 CPU 制造商(业界普遍认为是 Intel)主动找到味之素:你们在氨基酸化学上的积累,能不能用来做芯片封装用的薄膜绝缘材料?味之素基于几十年的氨基酸技术,开发出了 ABF——一种热固性树脂薄膜,可以在封装基板上层层堆积,形成微米级精度的绝缘层和导线通道。换句话说,不是"味精副产物直接变成了绝缘层",而是"味精产业的化学能力被 Intel 点了一下,变成了半导体材料"。在 CPU/GPU 封装基板中,ABF 膜是构建多层导线的核心材料——没有它,芯片和电路板之间的电气连接就无法实现。
ABF 的壁垒不在专利——很多公司知道配方。壁垒在两个物理参数的极致控制。第一是CTE 匹配——硅的 CTE 是 ~3 ppm/°C,铜是 ~17 ppm/°C,ABF 需要精确调到介于硅和铜之间(~5-10 ppm/°C)。配方通过调节树脂中二氧化硅填料的体积分数来控制 CTE——填料多了 CTE 接近硅但变脆、难钻孔,填料少了 CTE 失配导致热循环中铜导线拉断。味之素在这个精度上积累了几十年,每代 ABF(GX92→GX-T31→GZ系列)的 CTE 波动控制在 ±0.5 ppm/°C 以内。
第二是激光微孔加工。ABF 基板上的每一层导线通过微孔(microvia)上下连接——孔直径几十微米,用 UV 激光在 ABF 膜上一个一个烧出来。激光烧蚀时,树脂和二氧化硅填料的烧蚀速率不同——树脂烧得快、硅填料烧得慢,孔壁会形成微观粗糙度。烧完后需要"除胶渣"(desmear)——用等离子或化学药水把孔壁残留的熔融树脂清理干净。然后在孔壁上用化学镀沉积一层 0.3-0.8μm 的铜种子层,再电镀填满。味之素在 2026 年发表的等离子除胶渣论文揭示了新一代 ABF 的关键挑战:孔径越小(<20μm),等离子越难深入孔底→除胶渣不均匀→种子层附着力差→微孔失效。每缩小一代微孔直径,制造难度翻倍——而 AI 芯片的 I/O 密度要求微孔越来越小、越来越密。这不是配方问题,是物理极限问题。
AI 浪潮直接把 ABF 变成了印钞机。全球 ABF 市场从 2025 年的 $42 亿预计增长到 2034 年的 $91 亿(CAGR 8.9%)。味之素的 ABF 业务利润率超过 50%——这在一家以调味品为主业的公司里是极其异常的数字。2026 年 5 月,味之素宣布斥资 ¥12 亿(约 $8,000 万)买地建新厂,2032 年投产。"一家年收入约 $100 亿的食品公司,用氨基酸技术卡住了全球 AI 芯片封装的脖子"——这句话现在要加上:它同时是全球利润率最好的半导体材料公司之一。
潜在的颠覆者:玻璃基板。Intel、三星、Absolics 在推动用玻璃替代 ABF/有机基板。玻璃的热膨胀系数更接近硅,可以做更细的线宽,理论上一片玻璃基板能连接更多芯片。但玻璃基板的量产面临通孔加工、金属化附着力和切割三大难题——业界普遍认为至少还需要 5 年以上才能进入主流市场。在此之前,味之素很安全。
先进封装是整个产业链中最紧的瓶颈。它是三条链(计算、存储、互联)的物理汇聚点——CoWoS 产能决定英伟达出货量,ABF 膜决定基板产能。供应商高度集中(台积电、味之素),扩张周期长(2-3 年),是 AI 算力供应最直接的物理约束。
算力的物理容器
GPU 模组造好了,但一万个模组需要空间——服务器机柜、供电、散热、网络。这部分不创造芯片,但定义算力能力的天花板。电力瓶颈从机柜级(ORV3 48V 总线)延伸到电网级(ERCOT 198 GW 并网排队——详见横向板块「电力」),但本章聚焦数据中心内部的物理约束。
服务器集成 —— 把 GPU 装进机柜
服务器集成商毛利 15-20%,但市场年增 50%+——绝对的"薄利多销"型增长。真正的差异化竞争在散热:谁能把越来越烫的 GPU 塞进同一台机柜而不烧掉,谁就拿到了英伟达的配额分配。Supermicro 凭借液冷机柜的早期布局(直接液冷 DLC 出货量全球第一)成为最大受益者,FY2025 营收突破 $300 亿。
更上游的基础设施供应商赚得更稳。Vertiv(电源/UPS/PDU/液冷系统)FY2025 Q4 营收 $26 亿(+29% YoY),数据中心相关业务增速超过 40%。这家公司不挑 GPU 品牌——英伟达还是 AMD,风冷还是液冷,都需要它的供电和散热设备。在 AI 基础设施投资中,Vertiv 是那种"不管谁赢都要用我的东西"的卖铲人。
电力与散热 —— 算力增长碰到物理天花板
数据中心效率的通用衡量是 PUE(Power Usage Effectiveness)= 总输入功率 ÷ IT 设备功率。PUE 1.0 表示 100% 电力用于计算。十年前行业平均 PUE >2.0(一半电力浪费在冷却和配电上)。Google 2024 年达到 1.10,意味着只有 10% 的电力被非 IT 系统吃掉。每降低 0.1 PUE,一个 100MW 数据中心每年省约 $5,000 万电费。
但 AI 机房让 PUE 变难了——不是效率倒退了,是密度暴增。一台 NVL72 机柜 120kW 的功耗需要一个全新的供电架构。传统 12V 供电在 120kW 下需要 10,000A——铜排粗到物理上塞不进机柜。OCP 的 ORV3(Open Rack V3)标准改用 48V 直流母线——同样的功率电流降到 2,500A,但铜排仍然重到需要特殊支撑结构。一台 ORV3 电源架在 1U 空间内提供 15kW(N+1 冗余),一个机柜塞 8 台才能凑够 120kW。供电密度正在成为跟芯片散热同等重要的物理约束——你能把多少 kW 安全地塞进一台机柜,决定了你能塞多少颗 GPU。
比总量更关键的是密度。一台 8×H200 服务器功耗 10-15kW——传统风冷机柜设计上限 20-30kW,根本装不下。B200 一代单机柜可达 40-50kW,NVL72 机柜更是飙到 120kW——超出风冷极限 4-6 倍。唯一的解是液冷。
液冷分两路:冷板液冷——在 GPU/CPU 上贴金属冷板,内部通冷却液直接带走热量,可处理 50-100kW/机柜,是当前主流。浸没式液冷——把整台服务器泡在绝缘冷却液(介电流体)里。其中的两相浸没式尤为激进:冷却液在 49°C 就会沸腾,气泡上升带走热量,遇冷凝器变回液体落下——形成一个不耗电的自循环"沸腾-冷凝"系统。但 3M 在 2025 年宣布退出 Novec 氟化液生产(Novec 是两相浸没式最主流的冷却液),给这个技术路线造成巨大冲击。替代品正在追赶——Solvay 的 Galden、Chemours 的 Opteon、以及中国巨化集团的氟化液——但产能、价格和环保认证都远未达到 Novec 的成熟度。这次退出可能意味着两相浸没式大规模部署要推迟 2-3 年,冷板液冷在这段时间窗口里会更稳固。
核电是数据中心电力的终极答案。美国弗吉尼亚北部(全球最大数据中心集群)电网排队 2 年+。微软于 2024 年签下重启三里岛核电站 1 号机组的协议——2026 年 6 月,NRC 批准豁免加速并网,DOE 提供 $10 亿贷款担保。这台机组更名为 Crane Clean Energy Center,835MW 全容量专供微软数据中心。这不是个案:IEA 数据显示,数据中心与 SMR(小型模块化核反应堆)的购电协议管道从 2024 年末的 25GW 膨胀到 45GW。Google、Amazon 也在签约核电。电力决定了 AI 未来在哪里发生——不是地价便宜的地方,是电网还有剩余容量的地方。
GPU 云 —— 从挖矿到 $230 亿,然后呢?
但 GPU 云的本质是重资产租赁生意,不是技术平台。GPU 跟传统服务器的关键区别在折旧。一颗 H100 采购价约 $25,000-30,000,靠租金回收。CoreWeave 2026 年实际定价:H100 ~$2.70/GPU 小时(裸金属,8 GPU 节点 $21.60/hr),H200 ~$6.16/GPU 小时,B200 ~$8.60/GPU 小时。按 H100 $2.70/hr、70% 利用率算——一颗 H100 一年产生约 $16,500 收入。$25,000 的采购成本需要约 1.5 年回本。但这是建立在"70% 利用率"的前提上——如果 GPU 供应过剩、利用率跌到 40%,回本周期翻倍。
超大规模云厂商另一个优势是折旧弹性。主流做法是按 5-6 年直线折旧——每年账面减记 16-20%。但 GPU 的实际经济寿命比训练用途长得多:训练(第 1-2 年)→ 推理/微调(第 2-4 年)→ 转卖给二线云(第 4-6 年)。这个"价值瀑布"让 GPU 的实际经济回报期比训练报废周期长 2-3 倍。微软/Oracle 愿意签 CoreWeave 上百亿合同的原因很直白——它们今天需要 GPU,但三五年后自有芯片(Maia、Trainium、TPU)就位,不需要 CoreWeave 永远存在。GPU 云公司是被"今天需要你但明天不一定"的客户养活的中间层。NVIDIA 自己的 DGX Cloud 进一步挤压了第三方 GPU 云的生存空间——如果英伟达直接租给你 GPU,为什么还要通过 CoreWeave 加一层差价?
数据中心是算力扩张的物理约束层——供电、散热、空间跟不上,GPU 只是仓库里的芯片。液冷是最确定的结构性增长方向。GPU 云公司赚供需缺口,长期护城河存疑。
从模型能力到商业变现
硬件造出了算力,软件把算力变成价值。这个板块回答两个问题:模型为什么这么强(架构、训练、推理)和钱从哪赚(定价、分发、锁定)。①②③ 是技术基础层,④ 是商业分析层——两层逻辑交叉在一起:技术架构决定成本结构,成本结构决定谁能赚钱。
① 模型能力层 —— 什么让模型真正强大
MoE —— 让推理成本暴跌 10-30 倍的核心技术
MoE 的代价在训练——路由策略需要学习"哪个 token 该发给哪个专家",负载不均衡会导致某些专家过载而其他闲着的"专家坍塌"。DeepSeek 用无辅助损失负载均衡解决了这个问题,这也是为什么 DeepSeek-V3 的训练成本只有 OpenAI 同类模型的大约 1/10。但推理时 MoE 有新的瓶颈——所有专家的参数都要驻留在 GPU 显存里(虽然每次只用几个)。一个 671B MoE 模型显存需求接近 671B Dense 模型。解决方向是专家卸载——把不活跃的专家换出到 CPU 内存甚至 SSD,用时再加载。
从 Pre-training 到 Post-training —— 模型能力的三级火箭
对齐技术本身在快速演进。RLHF(基于人类反馈的强化学习)需要先训练一个"奖励模型"来模拟人类偏好,再用 PPO 算法优化——训练不稳定、需要大量人类标注。DPO(直接偏好优化)2024 年后逐渐取代 RLHF——不需要单独训练奖励模型,直接从"好回答 vs 坏回答"的比较数据中优化。DPO 更快、更稳定,但有一个微妙代价:模型在优化偏好的过程中会轻微牺牲指令遵循能力——实测 SFT 模型指令遵循率达 92.6%,DPO 后反而下降到 ~90%。这是对齐领域当前的核心矛盾:越对齐越安全,但可能越不听话。
为什么推理比训练更难——内存墙与投机解码
绕过内存墙的核心技术是KV-cache——每生成一个新 token,注意力机制需要之前所有 token 的 Key 和 Value。如果每次重新计算,一个 128K 上下文的推理需要 128K × 128K 次注意力运算。KV-cache 把已计算的 K 和 V 缓存起来,只算新 token 的注意力——这是推理效率的基石。但 KV-cache 本身吃显存——长上下文下可能比模型权重还大。投机解码是另一个加速方向:用一个小"草稿模型"一次预测 3-5 个 token,大模型一次验证全部——如果猜对了就全接受,实现了 2-3 倍加速且不影响输出质量。量化(把 FP16 权重压缩到 INT4/INT8)把模型大小砍到 1/4,但在低于 4-bit 时模型质量会出现可感知的退化——这是所有开源模型本地部署的基础技术。
② 模型经济学 —— 为什么最强模型不一定最赚钱
API 定价——从稀缺到商品的 18 个月
价格崩溃有两个驱动力。一是 MoE 架构从根本上降低了单位 token 的计算成本(同一 GPU 跑 MoE 比 Dense 多服务 10-30 倍请求)。二是开源侧的DeepSeek 效应——2025 年 DeepSeek-V3 发布后,所有闭源厂商被迫跟降价格。OpenAI 的反应是推出分层定价:GPT-5.4 Pro($30/百万 token 输出)用于"需要最聪明模型"的场景,GPT-4.1 Nano($0.10/百万 token)用于替代传统 NLP 任务。分层意味着 OpenAI 承认:没有一种定价能覆盖所有场景。模型商品化的速度远超任何人的预期——18 个月内,API 从"稀缺算力"变成了"可按需切换的大宗商品"。
上下文窗口 vs RAG —— 两种根本不同的架构哲学
但长上下文有它自己的问题——"上下文腐化"(context rot)。当 2M token 的上下文里混杂了 40 份法律合同和 3 份财报,模型在回答"请找 2024 年 Q3 的营收数据"时,注意力会分散到无关文档段落上,准确率反而低于先检索再回答的 RAG 方案。2026 年主流实践是混合架构:用轻量级检索先缩窄到相关文档,再用长上下文窗口仔细阅读——结合两者的优势但增加了工程复杂度。上下文窗口的膨胀和 API 价格的崩塌双线并行,决定了应用架构的根本方向:不需要再在 RAG、微调、提示工程之间做痛苦抉择——全都要。
③ 开发者生态 —— 价值捕获的真正战场
AI 编码——$128 亿市场里的三国杀
三种工具的竞争本质是三种产品哲学:Copilot = IDE 内补全(保守、低侵入、企业友好),Cursor = IDE 替代(激进、深层理解、开发者个人选择),Claude Code = 终端 Agent(最激进、直接操作代码库、绕过 IDE 限制)。护城河都很薄——70% 开发者日常用 2-4 个工具,每 3-6 个月试一个新的。但有一个结构性粘性源:一旦开发者习惯了"描述需求→AI 生成完整实现→人工审查微调",回到手写代码的意愿趋近于零。详细的收入数据和市场竞争分析见下方「To B · 赛道一」。
Agent——75% 可靠但 54% 更信任手动搜索
Gartner 预测 2026 年 40% 的 Agent 项目将被取消。不是因为技术不行——是因为不确定性不可接受。一个客服 Agent 回答错 5% 的问题,公司可能面临声誉损失和法律风险。一个交易 Agent 下错 1% 的单,损失是真金白银。Agent 的工程挑战不在"能不能做",在"做错了怎么办"——回滚机制、人工兜底、置信度阈值、权限分级。这些是 2026 年最活跃的工程前沿,也是独立 Agent 创业公司和大平台(Salesforce Agentforce、Microsoft Copilot Studio)的真正分水岭——大平台有客户关系来消化 Agent 的失误成本,独立创业公司没有。
④ 应用层变现 —— 钱最终从哪来
以下将 To B 和 To C 分别拆解为独立赛道。每个赛道的分类、数据和判断基于 a16z、McKinsey、Gartner、JetBrains、Sacra、Thrad AI 等外部研究报告——不是编辑判断,是可追溯的外部数据。
To B —— 七个赛道,投资级颗粒度
AI 编码工具 —— 已跑通的 $10-15B 年化收入,但三强格局在剧变
市场规模 · 数据分歧需注意:不同研究机构对 AI 编码工具市场的估算差异极大:$4.2B(2025)→$40B(2035,CAGR 25.3%)、$7.4B(2025)→$30B(2031,CAGR 26.2%)、$8.5B(2025)→$42.8B(2033,CAGR 22.5%)。差异主要来自市场边界不同——纯代码补全 vs 含 AI 测试/安全/运维。综合取中位:2025 年约 $6-8B,2030 年约 $250-400 亿——这是软件行业历史上最快达到百亿美元级的新品类。
竞争格局 · Copilot 的份额在崩塌:GitHub Copilot 仍以 4,700 万付费用户领先(29% workplace adoption,90% Fortune 100 采用),但 Stack Overflow 的 2025 年版开发者调查显示其份额从 67% 暴跌至 51%——一年内丢了 16 个百分点。Cursor 同期冲到 $2B ARR(2026.2),100 万+付费用户,workplace adoption 18-19%。Claude Code 的速度更惊人:2025 年 4 月仅 3% workplace adoption → 2026 年 1 月 18%——不到一年翻了 6 倍(JetBrains 调查,10,000+ 开发者样本),2026 年 4 月"最爱率"达 46%(行业第一)。三强格局不是稳定的——是 Copilot 在防守、Cursor 和 Claude Code 在猛攻。
价格战正在爆发:Copilot Individual $10/月(标准版),Teams 2026 年 6 月改为两档——Standard $32/seat/月、Premium $96/seat/月。Cursor Pro $20/月,但重度用户实际账单可达 $200-1,400/月(usage-based 定价,Composer Agent 模式下 token 消耗巨大)。Claude Code Max 约 $20+/月。Coding 工具的 ARPU 在急剧分化——轻量补全用户 $10/月,重度 Agent 用户 $1,000+/月。
新势力不容忽视:Cognition(Devin)2025 年 7 月收购 Windsurf,ARR 从 $37M(2025.5)→ $492M(2026.5),12 个月翻 13 倍,最新 $26B 估值、$1B 融资。Replit 从 $300M→$525M ARR 仅用 4 个月。OpenAI Codex 正在入场——PR 接受率 79.9%(任务分层分析中行业最高)。Amazon Q Developer 在企业端靠 AWS 渠道绑定。这不是三强格局——是五到六家同时冲刺,每季度格局都在变。
投资维度:
增长阶段 ▸ 爆发期 | 毛利结构 ▸ 负毛利——Microsoft Copilot 据报每用户月亏 $20+($10/月定价)、Cursor 2025 年负毛利、Claude Code Max 订阅包住前端模型成本但 Agent 模式 token 消耗 10-50x | GTM ▸ PLG | 大厂威胁 ▸ 中高 | 变现时间线 ▸ 现在是现金牛——但整个品类可能无一家盈利。
GitHub Copilot $10/月定价时 Microsoft 在每个用户身上月亏 $20+——现在改 $32-96/seat/月才可能接近盈亏平衡。Cursor 2025 年负毛利。这解释了为什么价格涨这么快:不是贪婪,是生存。
GTM 模式 ▸ PLG(bottoms-up,开发者自己选择工具,零销售团队)——这是品类增长的引擎,也是护城河的弱点(切换成本 = 换工具)
大厂威胁 ▸ 中高(Microsoft 可随时将 Copilot 免费捆绑进 VS Code/GitHub;Amazon Q 靠 AWS 渠道绑企业。但讽刺的是:Copilot 份额正在被独立工具侵蚀——说明大厂捆绑在这个品类并非无敌)
变现时间线 ▸ 现在是现金牛——但被低估的风险是安全:Veracode 2025 年测试 100+ LLM 发现 45% 的 AI 生成代码包含 OWASP 漏洞,AI 代码的漏洞率是人类代码的 2.74 倍,6.4% 的 AI 生成仓库泄露了密钥。这不仅是技术风险——如果一起重大安全事故追溯到 AI 生成代码,整个品类的企业采购可能会冻结
代码接受率 ▸ Copilot 42-46%(仅 30% 被开发者实际接受)、Cursor 42.5%、Codex 79.9%(PR 级别)——代理型 AI(自主完成任务)的接受率反而高于补全型 AI,这对依赖补全模式的 Copilot 是结构性的不利
长期展望 ▸ Gartner 预测 2030 年 100% IT 工作涉及 AI(75% 增强、25% 自主)。McKinsey 估计 57% 美国工时可用现有技术自动化。2026 年关键转折:"长时间自主工作流"正在从实验进入生产——Agent 不是"补一行代码"而是"接需求→读代码库→改多个文件→跑测试→修 bug→提交 PR"
AI 嵌入生产力工具 —— Microsoft 20M 坐席的阴影
投资维度:增长阶段 ▸ 成熟公司 AI 转型期 | 毛利结构 ▸ ~52% 行业平均(ICONIQ 2026),从传统 SaaS 80% 被 AI 推理成本侵蚀 12-17 个百分点——Bessemer:"AI 公司 50-60% vs 传统 SaaS 80-90%"——这是结构性压缩,不是过渡现象。ICONIQ 数据:推理成本占 scaling-stage AI B2B 收入的 ~23%。| GTM ▸ 混合 | 大厂威胁 ▸ 极高 | 变现 ▸ 现在,但独立玩家活在 Microsoft 阴影下。
最关键的结构性问题:当 ChatGPT/Copilot/Claude 都能做 AI 写作时,Grammarly $700M ARR 的增长已经归零——这是整个品类的预警信号:任何靠"AI 功能"差异化的独立工具,最终都会被平台级 AI 吸收为"功能"。
客服 AI —— Agentforce $500M ARR 仅用一年
投资维度:增长阶段 ▸ 早期爆发 | 毛利 ▸ 50-65%(人机协作拖累——Gartner 预测 40% agentic AI 项目 2027 年前取消,可靠性不够)| GTM ▸ 企业销售——存量 SaaS 客户加 AI SKU | 大厂威胁 ▸ 中高(Salesforce 自身就是大厂,但 Agentforce 证明独立 SaaS 可以靠存量客户关系跟大厂竞争)| 变现时间线 ▸ 现在。
核心矛盾:Agentforce 年化 $5 亿看着漂亮,但 Gartner 警告 88% 的 Agent 项目投产前就失败了。客服 AI 的护城河不在模型——在跟 CRM 工作流的深度集成。这也是为什么 Zendesk AI $2 亿→$5 亿可以跟 Salesforce 并行增长——不是零和,是同一个 CRM 里的不同用例。
垂直行业 AI —— Harvey $300M ARR,但监管倒计时
投资维度:增长 ▸ 超增长期(69% adoption 刚触及逃逸速度)| 毛利 ▸ ~65%(AI 推理成本压缩了传统 SaaS 80%→65%,Bessemer 数据)| 竞争壁垒 ▸ 数据飞轮——越多人用→越多判例/合同训练→AI 越好→越多人用 | GTM ▸ 企业销售(12-18 月,CIO+法务总监双重审批)| 大厂威胁 ▸ 低(Thomson Reuters/LexisNexis 有数据但缺 AI 原生体验)| 变现 ▸ 现在/1-2 年。
法律 AI 是所有垂直中最接近"平台型"的类别——Harvey 不只是一个法律研究工具,它在成为律师的"操作系统"。但 43% 律所没有任何 AI 政策——这是最大的风险敞口。
平台捆绑 —— Microsoft 的 $72 亿 Copilot 机器
投资维度:增长 ▸ 早期捆绑期(Copilot 渗透率仅 4.4%,意味着 430M+ 坐席未触达)| 毛利 ▸ 高但未来承压——$30/月坐席费里 AI 推理成本占比在上升 | GTM ▸ 捆绑(续约加 SKU,CAC 趋近零)| 大厂威胁 ▸ 自己就是 | 变现 ▸ 现在——Copilot 年化 $72 亿已是全球最大的 AI 应用收入体。
FTC 调查是关键变量——如果强制 Microsoft 解绑 Copilot,独立生产力 AI 公司将获得巨大机会;如果 FTC 放行,Microsoft 在 4.4% 渗透率上每提升 1% 就增加 ~$16 亿 ARR。
AI 视频/创意工具 —— Sora 关停后的重构
Sora 之后谁在领先:Synthesia $100-150M ARR($4B,net retention ~140%)、HeyGen $200M ARR(70% Fortune 500 L&D,85% net retention)、Runway $300M ARR($5.3B)。活下来的共同点:B2B 企业用例(avatar 视频、培训、营销),不是通用消费级生成。Pika 无实质收入却估值 $470-900M——Sora 的前车之鉴。
投资维度:增长 ▸ 分化——B2B 企业视频已跑通 PMF,消费级未验证 | 毛利 ▸ 45-55%(视频推理成本——每帧 $0.01-0.05 × 30fps × 60秒 = 单视频 $18-90)| 竞争力 ▸ 从"生成质量"转向"场景合规性+品牌一致性" | 变现 ▸ B2B 企业视频现在,消费级生成 3+ 年。
AI 营销/销售 —— Gong $500M+ ARR,AI 安全 —— Wiz $32B 被收购
投资维度:增长阶段 ▸ 早期捆绑期(Copilot 的 seat penetration 在 Office 用户中估计 <5%)| 毛利结构 ▸ 高 70-80%(软件分发,AI 推理成本可转嫁)| GTM 模式 ▸ 捆绑(续约时加 SKU,CAC 趋近于零)| 大厂威胁 ▸ N/A——自己就是大厂 | 变现时间线 ▸ 现在——但定价权受限:底层 API 从 $60→$0.14/百万 token 后,$30/月 Copilot 费的套利空间越来越透明。
平台捆绑的核心矛盾:分发优势无敌(CAC 差距 10 倍),但 AI 附加模块定价弹性有限。当底层模型成本趋零时,平台收取的溢价必须靠"集成价值"而非"模型成本"来辩护——这个叙事切换尚未完成。
AI 营销/销售 + AI 安全 —— 两个被低估的 $100B+ TAM
投资维度:增长 ▸ 早期爆发(两个赛道 CAGR 都在 25-33%)| 毛利 ▸ 60-75%(SaaS 为主,AI 推理是新增 COGS)| GTM ▸ 混合(PLG for SMB + 企业销售 for enterprise)| 大厂威胁 ▸ 中低(安全是合规驱动不适合免费捆绑;营销是数据驱动,大厂缺领域数据)| 变现 ▸ 现在——两个赛道都有 $500M+ ARR 的公司。
这两个赛道未在前六赛道中展开,因为各自 $100B+ TAM 的规模和技术深度足以独立成篇。但对投资者来说关键是:它们的大厂威胁远低于生产力/客服——安全靠合规壁垒、营销靠数据壁垒,都不是 Microsoft 免费捆绑能击穿的。
七个赛道的对比矩阵
| 赛道 | TAM 2030 | 增长阶段 | 毛利 | GTM | 大厂威胁 | 变现 |
|---|---|---|---|---|---|---|
| AI 编码 | $250-400 亿 | 爆发期 | 负毛利 | PLG | 中高 | 现在 |
| 嵌入生产力 | $100-200 亿 | 转型期 | ~52% | 混合 | 极高 | 现在 |
| 客服 AI | $480 亿 | 早期爆发 | 50-65% | 企业销售 | 中高 | 现在 |
| 垂直 AI | $80-110 亿 | 超增长 | ~65% | 企业销售 | 低 | 现在/1-2年 |
| AI 视频/创意 | $20-35 亿 | 分化 | 负毛利/未验证 | 混合 | 极高 | 未验证 |
| 平台捆绑 | $3,000 亿+ | 早期(MS 4.4%) | 高(免CAC) | 捆绑 | N/A | 现在 |
| AI 营销/销售 | $580亿→$2,406亿 | 早期爆发 | 60-75% | 混合 | 中低 | 现在 |
| AI 安全 | $250亿→$940亿 | 早期爆发 | 65-75% | 企业销售 | 中低 | 现在 |
To C —— 五个赛道,投资级颗粒度
通用聊天助手 —— 900M 周活,$250 亿 ARR
投资维度:增长 ▸ 成熟期 | 毛利 ▸ 33% 毛利率(2025 实际,2024 年 40%→持续下滑),运营利润率 -55%(2026 年预计亏损 $140 亿)——免费用户是纯推理成本支出 | 付费转化 ▸ 5-6%(3,500 万/9 亿)| 留存 ▸ 50% 年留存(行业最高但仍低于社交产品)| 变现 ▸ ChatGPT Plus $20/月→向 Agent 平台转型。
ChatGPT 的护城河不在模型本身——是9 亿周活用户的习惯惯性。a16z 的数据揭示了一个关键动态:ChatGPT 和 Gemini 的原生图像/视频生成能力在持续提升,正在系统性挤压独立 AI 工具——Midjourney 从第一版 Top 10 跌到第六版 #46,不是 Midjourney 变差了,是 ChatGPT 变好了。
AI 创作/创意工具 —— Midjourney 的悖论
投资维度:增长阶段 ▸ 成熟期(Midjourney)vs 早期爆发(Runway +147%)| 毛利结构 ▸ 中等 50-70%(Midjourney 自建 GPU 集群控制推理成本,Runway 视频推理更高)| 留存 ▸ 高——重度创作者积累 prompt/风格/审美,迁移成本极高 | 大厂威胁 ▸ 极高(ChatGPT/Gemini 原生图像能力提升→Midjourney 从 Top 10→#46)| 变现 ▸ 现在(两者均有真实收入),但轻度用户正在被平台 AI 吸走。
Midjourney 的悖论:$500-600M ARR、零 VC、完全自筹——是消费 AI 的财务标杆。但 a16z 第六版数据显示它已从第一版的 Top 10 跌到 #46。重度用户(积累了几千条 prompt 的创作者)迁移成本极高,但轻度用户正被 ChatGPT/Gemini 的原生图像能力吸走。
AI 陪伴/角色 —— 日均 120 分钟,年收入仅 $30M
投资维度:增长阶段 ▸ 早期(用户粘性已证明,变现模式未跑通)| 毛利结构 ▸ 中低 40-50%(推理成本高,长对话→高 token 消耗)| ARPU ▸ 极低(年轻用户群可支配收入低,虚拟商品 ARPU 远低于游戏)| 留存 ▸ 极高(60%+ 年留存,情感粘性>功能粘性)| 大厂威胁 ▸ 低(情感连接是个性化体验,平台 AI 的"通用性"反而是劣势)| 变现时间线 ▸ 2-5 年——需要用 ARPU 提升来匹配留存率。
陪伴 AI 是所有消费赛道中"粘性/收入比"最极端的案例。伦理风险巨大但恰恰证明了情感需求的护城河深度。核心问题:是否有办法将日均 120 分钟的注意力转化为 $10/月+ 的 ARPU?游戏行业证明过这条路——但 Character.AI 还没找到公式。
AI 搜索 —— Perplexity 的 $450M 赌注
投资维度:增长阶段 ▸ 爆发期($100M→$450M ARR 仅 12 个月)| 毛利结构 ▸ 中等 40-55%(搜索推理+实时爬虫+RAG 基础设施成本远高于聊天)| 留存 ▸ 中等(品牌搜索习惯可培养但 Google 的反制能力极强)| 大厂威胁 ▸ 极高(Google 在搜索结果中嵌入 AI 摘要+保留广告——"干净搜索"可能永远是高端小众)| 变现时间线 ▸ 现在($450M ARR),但 $200 亿估值建立在"订阅模式能突破 Google 广告护城河"的假设上。
Perplexity 赌的是历史上从未被大规模验证过的命题:消费者愿意为"不掺杂广告的精准答案"付费。如果这个假设成立,搜索的商业模型将从广告(免费+广告)变成订阅(付费+纯净)。如果不成立,Perplexity 的天花板就是 $500M-1B ARR 的小众高端产品。
AI 教育 —— Khanmigo + Duolingo Max
投资维度:增长阶段 ▸ 早期(PMF 在部分市场已验证,全球扩展尚早)| 毛利结构 ▸ 中高 60-70%(推理成本+内容生成,但教育内容一次性生成可复用)| 留存 ▸ 极高——学习路径个性化+累积性+不可移植,切换=丢弃学习记录 | 大厂威胁 ▸ 中(Google/Khan Academy 等非营利、Duolingo 有先发品牌)| 变现时间线 ▸ 现在(Duolingo Max 已有收入贡献),但 To C 教育 ARPU 地区差异巨大(北美 $20-50/月 vs 东南亚 $5/月)。
教育 AI 的数据粘性是所有消费 AI 品类中最强的——但变现受限于地区经济差异。To B 教育市场(企业培训、职业再培训)可能比 To C 更大。
五个赛道的对比矩阵
| 赛道 | TAM 2030 | 增长阶段 | 毛利 | 留存 | 大厂威胁 | 变现 |
|---|---|---|---|---|---|---|
| 通用聊天 | $1,300-4,000 亿 | 成熟期 | 33%(+运营利润率-55%) | 中 50% | 极高 | 现在但巨额亏损 |
| AI 创作 | $50-80 亿 | 成熟+被挤压 | ~50%(Midjourney自建GPU) | 高(重度用户) | 极高 | 现在 |
| AI 陪伴 | $50-100 亿 | 早期 | 10-20%公司盈利 | D30仅13-18% | 低 | 2-5 年 |
| AI 搜索 | $50-100 亿 | 爆发但DAU暴跌65% | 负毛利(推理成本>>订阅收入) | 中 | 极高 | 现在 |
| AI 教育 | $500-1,000 亿 | 早期 | 71%→69%(AI成本上升) | 极高 | 中 | 现在 |
软件生态是 AI 产业链的价值变现层——所有硬件投资最终在这里兑现。技术层面,MoE 架构、投机解码、DPO 对齐是 2025-2026 年最重要的三个技术拐点,它们共同推动了 API 定价的结构性崩塌(18 个月内 $60→$0.14/百万 token)。商业层面,模型商品化是不可逆趋势——没有模型厂商能维持定价权超过 6 个月。真正的护城河不在模型能力,在分发渠道(谁控制了开发者在哪里写代码、企业在用什么工具)和用户关系(谁的 AI 嵌入了用户的创作流、工作流、情感流)。投资逻辑:硬件看壁垒(稀缺资源的控制力),模型看分发(渠道锁定),应用看粘性(切换成本和网络效应)。
贯穿全链的约束条件
电力、地缘政治、安全监管——这三个主题不属于任何一条供应链,但穿透每一层。电力决定了产能上限(晶圆厂和数据中心都需要电网),地缘决定了供应链的地理分布,监管决定了 AI 能否进入特定市场。本章跟 Part E 的「电力与散热」互补——E 聚焦数据中心内部的物理约束(PUE、ORV3、液冷),本章聚焦电网级约束(并网排队、输电扩容)。
电力 —— 从晶圆厂到数据中心的统一约束
但真正被低估的不是总量,是电网接入速度。ERCOT(德州电网)2026 年 Q1 单季就收到 198 GW 的大型负荷并网申请,其中 86 GW 在审核中——相当于 ERCOT 当前峰值负荷的总和。PJM(美国东部电网)和 ERCOT 自 2025 年 10 月以来新增数据中心项目超过 10 GW,约 30% 计划 2027 年前上线——但电网扩容的周期是 5-7 年。EIA 预测 ERCOT 电力需求 2025 年 +7%、2026 年 +14%。电力瓶颈不在总发电量,在输电和配电——GPU 集群可以两年建好,高压输电线路需要十年。台积电的 3nm/2nm 晶圆厂每座耗电相当于一座小型城市——台湾电网能否承受 2nm 扩产是全球 AI 产业链最底层的物理约束。
地缘政治 —— 出口管制的持续升级
制程分布仍是核心风险。计算链在台湾(台积电 90%+ 先进产能,但正加速分散——亚利桑那 N4 2024 Q4 量产,第二座厂 N3 设备 2026 Q3 搬入、2027 年量产,总投资 $1,650 亿;日本熊本厂 2024 年 12 月量产;德国德累斯顿厂在建)。存储链在韩国(SK 海力士 62% HBM 份额)。互联链在美国(博通)+日本(InP 晶圆)+中国(光模块封装)。集成链在台湾(CoWoS)+日本(ABF)。稀土冶炼在中国(85-90%)。每条链各有脆弱点,但计算链集中风险远超其他。
CHIPS Act 的实际落地:已最终确定 20 项拨款,直接资金 $337 亿 + 贷款 $55 亿(截至 2025 年初)。最大四笔:Intel $85 亿直接资金 + $110 亿税收抵免、TSMC Arizona $66 亿、Samsung Texas $64 亿、Micron $55 亿。但实际拨付复杂——截至 2025 年 8 月 Intel 仅收到 $22 亿,TSMC 子公司收到的政府资金也远低于承诺额。地缘风险既是威胁,也是重塑产业链的催化剂——日本 Rapidus 冲刺 2nm(已接收 ASML NXE:3800E High-NA EUV 光刻机)。
安全与监管 —— 全球三套体系并行
美国走的是"没有联邦法但有出口管制"的路径。没有类似 EU AI Act 的横向立法——但通过 BIS 出口管制实质上管控了最先进 AI 技术的全球流动。中国走第三条路:2023 年 8 月《生成式人工智能服务管理暂行办法》生效——要求生成式 AI 服务提供者进行算法备案和安全评估,内容须"体现社会主义核心价值观"。监管的三套体系正在形成事实上的"AI 铁幕"——不是 AI 被禁止,是符合一套标准的产品可能在另一辖区违法。对投资者来说,最大的合规风险不是监管本身,是三套互不兼容的监管体系同时运行——全球化的 AI 产品可能需要对每个市场单独开发和合规。
Sam Altman 一边呼吁监管一边推商业化——不是自限,是用监管建护城河。当合规成本压垮创业公司时,大公司反而少竞争者。