AI 推理股票有哪些?GPU、ASIC、HBM 与数据中心概念股
目录
- 一分钟看懂 AI 推理芯片
- 为什么推理成为 AI 基础设施下一个主战场
- 推理其实分成两段:Prefill 与 Decode
- 五个真正有用的推理指标
- 七种主要 AI 推理平台怎样比较
- NVIDIA:优势不只是 GPU
- Google、Amazon、Microsoft:自研芯片的目的不是对外卖芯片
- Broadcom:把客户架构变成可量产 XPU
- Cerebras:不是 GPU 替代品,而是低延迟专用层
- GPU 会被 ASIC 取代吗
- AI 推理股票如何沿产业链传导到美股与全球半导体
- 第一层:运算平台
- 第二层:晶圆代工、HBM 与先进封装
- 第三层:网络与光互连
- 第四层:电力、冷却与数据中心
- 投资者应追踪的六个领先指标
- Klaro Research 结论
- 常见问题
- AI 推理芯片与训练芯片有什么分别?
- GPU 与 ASIC 有什么分别?
- TPU、Trainium 和 Maia 可以买到吗?
- AI 推理股票/概念股有哪些?
- Cerebras 会取代 NVIDIA 吗?
- 官方资料与方法边界
如果你搜寻「AI 推理股票有哪些」,最直接的答案不是一张把所有 AI 公司放在一起的名单,而是先按收入如何传导分层:NVIDIA(NVDA)和 AMD(AMD)是通用加速器;Broadcom(AVGO)和 Marvell(MRVL)参与定制 ASIC 与高速互连;台积电(TSM)、SK 海力士、三星电子和美光(MU)提供制造与 HBM;Arista(ANET)、Credo(CRDO)、Coherent(COHR)和 Lumentum(LITE)处理网络及光互连;Vertiv(VRT)、Eaton(ETN)和部分 AI 云端公司则承接电力、散热与部署需求。 Google、Amazon、Microsoft 和 Meta 的自研芯片主要服务自身云端或产品,不能直接当成独立芯片收入来估值。
| AI 推理产业链位置 | 代表公司 | 投资者实际要核对什么 |
|---|---|---|
| 通用 GPU/加速器 | NVIDIA、AMD | 推理收入或部署是否增长、软件生态、每 token 成本与客户集中度 |
| 云端自研芯片 | Alphabet、Amazon、Microsoft、Meta | 芯片是否真正部署、云端利用率与毛利是否改善,而不是只看发布会名称 |
| 定制 ASIC/高速互连 | Broadcom、Marvell | 客户数、设计导入、量产节奏、SerDes/交换机与 ASIC 收入能否落到财报 |
| 制造/HBM/先进封装 | 台积电、SK 海力士、三星电子、美光 | 每颗加速器的 HBM 含量、封装产能、资本开支与内存价格循环 |
| 网络/光互连 | Arista、Credo、Coherent、Lumentum、Fabrinet | 800G/1.6T 采用、端口内容量、客户验证与 AI 收入纯度 |
| 电力/散热/AI 云端 | Vertiv、Eaton、Nebius、Bloom Energy | 接电与部署速度、利用率、折旧、订单转收入及自由现金流 |
这张表是产业位置地图,不是推荐清单。AI 推理芯片(AI inference chip)本身,是用来执行已完成训练的人工智能模型,将使用者输入转化为文字、图片、语音、程式码或代理行动的处理器。ChatGPT 回答问题、Copilot 生成程式码、搜寻引擎产生 AI 摘要,背后都在进行推理。
市场常把「AI 芯片」等同 NVIDIA GPU,但推理市场已经分成多条路线:NVIDIA 与 AMD 提供可编程 GPU;Google、Amazon、Microsoft 及 Meta 发展自研或共同开发的 ASIC;Broadcom、Marvell 协助大型客户把自订架构变成芯片;Cerebras 则以晶圆级处理器追求极低延迟。它们不是单纯比较峰值算力,而是在竞争每个 token 的成本、回应速度、吞吐量、功耗、软件相容性和部署弹性。
Klaro Research 核心判断:推理不会由单一芯片架构全面通吃。GPU 会继续承担最广泛、最常变动的模型和工作负载;超大规模云端平台会把稳定、高用量的模型迁移至自研 ASIC,以降低单位成本;Cerebras 等专用系统则争取极低延迟或特定模型的高价值工作。真正扩大的市场不是某一种芯片,而是由运算、HBM、网络、光互连、电力和软件共同组成的推理基础设施。
本文资料截至 2026 年 8 月 1 日。各公司公布的 FLOPS、tokens per second 和成本数据使用不同模型、精度、批次、延迟限制及系统配置,不能直接横向相除;本文以架构与商业模式为主,不把供应商单方面基准测试当成最终胜负。
一分钟看懂 AI 推理芯片
| 问题 | 直接答案 |
|---|---|
| AI 训练是什么 | 用大量数据调整模型参数,建立模型能力 |
| AI 推理是什么 | 让已训练模型根据新输入产生答案或行动 |
| 推理最重要的指标 | 首个 token 延迟、输出速度、整体吞吐量、每 token 成本、功耗及准确度 |
| GPU 的优势 | 通用、可编程、软件成熟,能快速支援新模型与多种工作负载 |
| ASIC 的优势 | 可针对固定工作负载删除不需要的功能,提高性能功耗比和成本效率 |
| ASIC 的限制 | 开发周期长、前期成本高、软件和客户范围较窄,模型变化可能令设计落后 |
| Cerebras 的差异 | 以晶圆级处理器减少跨芯片通讯,主攻极低延迟推理 |
| 产业链真正瓶颈 | 不只算力,还包括 HBM 容量与频宽、封装、网络、光互连、电力和软件利用率 |
为什么推理成为 AI 基础设施下一个主战场
模型训练通常是一次或周期性的大型计算工程;推理则在产品被使用时持续发生。模型每回答一次问题、代理每多执行一步、影片每多生成一秒,都会消耗推理算力。
这使推理的经济模型与训练不同:
- 训练重视能否在合理时间内完成大型模型;
- 推理同时重视使用者是否愿意等待、每次回答成本是否低于收入,以及系统能否承受高峰流量;
- AI agent 会在一次任务内多次呼叫模型、工具和记忆,令 token 使用量可能快于活跃使用者增长;
- 推理成本下降亦可能产生需求反弹:每次使用更便宜,开发者便会加入更多推理步骤和新产品。
NVIDIA 的推理平台资料显示,硬件以外的量化、核心融合、批次调度和 speculative decoding 亦可大幅改变每 token 成本。换言之,芯片出货量不是唯一变数;同一批硬件经软件优化后可以输出更多 token,亦可能降低新增硬件的边际需求。
推理其实分成两段:Prefill 与 Decode
大型语言模型推理可以简化为两个阶段:
- Prefill(提示处理):模型读取整段输入和上下文,建立注意力状态。长文件、程式码库和大上下文会增加这部分负载;它较容易平行处理,通常偏向运算密集。
- Decode(逐 token 生成):模型逐步产生输出,每生成一个 token 都要读取模型权重和先前状态。这部分通常更受内存频宽、KV cache 和通讯延迟限制。
因此「哪一款芯片最快」没有脱离工作负载的统一答案。大量离线文件摘要可以容忍较高延迟,追求整体吞吐量;即时语音、程式码补全和 AI agent 则需要极低首 token 延迟及稳定输出速度。
AWS 与 Cerebras 已展示把 prefill 与 decode 放到不同硬件的异质推理方向:较通用的加速器处理前段,低延迟专用系统处理生成阶段。这类分工若扩大,代表未来竞争单位不再是一颗芯片,而是一个可以调度不同加速器的完整推理平台。
五个真正有用的推理指标
| 指标 | 它回答什么 | 常见误读 |
|---|---|---|
| TTFT(Time to First Token) | 使用者等多久才看到第一个字 | 首 token 快不代表整段回答完成得快 |
| ITL/TPOT | 生成中的 token 间隔 | 单一请求速度不等于系统总吞吐量 |
| Tokens per second | 一段时间输出多少 token | 必须同时看模型、精度、批次及延迟限制 |
| 每百万 token 成本 | 把硬件、电力与利用率转成商业成本 | 供应商报价未必包含网络、折旧和闲置容量 |
| 每瓦/每机架吞吐量 | 电力受限时能部署多少有效算力 | 峰值 FLOPS 不能直接代表真实 token 输出 |
MLCommons 的 MLPerf Inference v6.0加入 GPT-OSS 120B、DeepSeek-R1 互动推理和视觉语言等工作负载,正好说明单一旧模型基准已不足以代表现代推理。比较供应商时,最好使用相同模型、服务情境、准确度要求及延迟上限的公开结果。




图:推理的竞争单位不是孤立芯片。工作负载先决定延迟、吞吐和内存需求,再由运算、HBM、网络与软件共同形成每 token 成本,最后才转化为供应商收入和云端毛利。
七种主要 AI 推理平台怎样比较
| 平台/路线 | 核心定位 | 主要优势 | 主要限制 | 投资者应观察 |
|---|---|---|---|---|
| NVIDIA GPU | 面向广泛模型和客户的通用加速平台 | CUDA、TensorRT-LLM、网络、系统和开发者生态完整 | 价格与功耗高,客户希望降低单一供应商依赖 | 推理收入占比、token 成本改善、软件能否维持锁定效应 |
| AMD Instinct GPU | 通用 GPU 的第二供应来源 | HBM 容量、开放软件方向及大型云端客户验证 | ROCm 生态、供应规模和整体平台成熟度仍要追赶 | 云端可用区、具名部署、软件相容及整机出货 |
| Google TPU/Ironwood | Google 内部与 Google Cloud 的自研加速器 | 模型、编译器、网络与数据中心共同设计 | 主要依附 Google 生态,外部可移植性较低 | Cloud 外部客户使用量及 Gemini 推理成本 |
| AWS Trainium/Inferentia | AWS 自研的训练与推理平台 | 与 EC2、Bedrock、Neuron 软件及云端定价整合 | 工作负载需要适配 AWS Neuron,跨云弹性较低 | Trainium 使用率、Anthropic 以外客户及 AWS 毛利改善 |
| Microsoft Maia 200 | Azure 内部的大规模推理加速器 | 与 Azure、OpenAI 模型、网络和数据中心共同优化 | 部署仍以 Microsoft 自有云为主,独立基准有限 | 部署区域、实际负载、性能成本及对 NVIDIA 采购组合的影响 |
| Broadcom 定制 XPU | 为少数超大型客户共同开发 ASIC | 能按模型和系统要求定制,并结合 Ethernet、SerDes 和光互连 | 客户集中、开发周期长,收入受少数项目节奏影响 | XPU 客户数、每代量产规模、AI 网络与加速器收入 |
| Cerebras WSE | 晶圆级低延迟推理与特定训练工作 | 大量片上运算和 SRAM,减少跨芯片通讯 | 生态较窄、容量建设资本密集、客户集中 | OpenAI 容量上线、利用率、服务毛利和自由现金流 |
NVIDIA:优势不只是 GPU
NVIDIA 的护城河是 GPU、NVLink/NVSwitch、Spectrum-X/InfiniBand、TensorRT-LLM、Dynamo 和大量模型优化共同形成的全栈平台。硬件规格领先很重要,但客户可以在同一套软件上迅速支援新模型,才是 NVIDIA 在工作负载快速变化时最难取代的部分。
MLPerf v6.0 显示 Blackwell 系统在最广泛的新增测试中都有提交,但这不等于所有客户、所有模型下都拥有最低成本。NVIDIA 自身公布的成本改善亦有很大部分来自软件;投资者应把「GPU 销量」和「每台系统能输出多少 token」一起理解。
Google、Amazon、Microsoft:自研芯片的目的不是对外卖芯片
超大规模云端公司的自研芯片首先是一项内部经济工程:降低推理成本、增加供应来源,并把模型、芯片、网络和数据中心绑在同一平台。
- Google 把第七代 Ironwood TPU定位为推理时代的专用加速器,并以大容量 HBM 和自有 ICI 网络扩展至大型 pod;
- AWS 的 Trainium3 UltraServer同时服务训练与推理,透过 Neuron 软件与 EC2、SageMaker 和 Bedrock 整合;
- Microsoft 的 Maia 200专门针对推理,使用 HBM3e、片上 SRAM 和基于 Ethernet 的扩展网络,并用于 OpenAI 模型和 Microsoft 内部工作负载。
这些公司通常会公布「相对上一代」或「相对现有平台」的性能成本改善,但不同公司测试条件不一致。更可靠的商业证据是:自研芯片是否扩展至更多地区和客户、是否令云端 AI 收入快于折旧与营运成本,以及外购 GPU 比例是否真的下降。
Broadcom:把客户架构变成可量产 XPU
Broadcom 的角色不是像 NVIDIA 一样向整个市场销售同一款加速器,而是和少数超大型客户共同定义 ASIC,再提供先进制程实现、SerDes、HBM 介面、交换机和网络连接。
公司在 2026 财年第一季披露 AI 收入为 84 亿美元、按年增长 106%,由定制 AI 加速器与网络需求推动;这是 ASIC 已由概念变成大规模收入的直接证据。Broadcom 官方业绩资料
OpenAI 与 Broadcom 亦在 2026 年公布首款共同开发的 LLM 推理处理器 Jalapeño,计划由 2026 年底开始部署。OpenAI 的官方说明同时指出,合作涵盖芯片架构、核心、内存、网络、调度和部署系统。这说明定制 ASIC 的价值已从「一颗较便宜的芯片」上升至完整的垂直整合平台。
不过,Broadcom 的 AI 增长仍高度依赖少数客户和多年度项目。单一客户延迟量产、改变模型架构或把下一代转交其他设计伙伴,都可能令收入节奏波动。
Cerebras:不是 GPU 替代品,而是低延迟专用层
Cerebras 把接近整片晶圆做成一个处理器,以大量片上 SRAM 和互连降低资料搬运。OpenAI 在 2026 年宣布加入 750MW Cerebras 超低延迟算力,并将其作为推理组合中的专用低延迟方案,而不是取代全部 GPU。OpenAI 合作公告
这个定位非常重要:只要即时编程、语音和 AI agent 愿意为低延迟支付溢价,Cerebras 不需要取得整个推理市场,也可以建立可观业务;但其估值和商业质素仍要由容量上线、利用率、服务毛利与现金流验证。完整公司研究见《Cerebras(CBRS)是什么公司》。
GPU 会被 ASIC 取代吗
较可能的结果是市场分层,而不是单向取代。
GPU 最适合:
- 新模型、新算子和需求仍快速变化;
- 客户需要同一硬件支援训练、微调、推理和其他加速计算;
- 模型规模未大到足以摊薄定制芯片开发成本;
- 软件相容与快速部署比理论单位成本更重要。
定制 ASIC 最适合:
- 工作负载稳定而且规模极大;
- 客户拥有自己的模型、编译器、数据中心和工程团队;
- 每瓦、每机架及每 token 的微小改善都能转化为巨额成本节省;
- 客户愿意承担两至数年的设计和量产周期。
专用架构最适合:
- 即时互动需要非常低的输出延迟;
- 模型和数据流能配合特定硬件;
- 速度改善可以转化为更高使用量或高价服务。
因此,ASIC 市占增加不必然等于 NVIDIA 收入下降。推理总需求若增长得更快,GPU、ASIC 和专用系统可以同时扩张;真正需要观察的是各平台在新增 token 中取得多少份额,以及价格下降是否快于使用量上升。
AI 推理股票如何沿产业链传导到美股与全球半导体
第一层:运算平台
- NVIDIA(NVDA):GPU、机架级系统、网络与推理软件;
- AMD(AMD):Instinct GPU 与 ROCm 软件,作为通用 GPU 第二来源;
- Broadcom(AVGO)、Marvell(MRVL):定制 AI 芯片、SerDes、交换与连接技术;
- Cerebras(CBRS):晶圆级低延迟推理平台。
这些公司同属 AI 运算,但业务纯度、客户结构和毛利模式完全不同,不能只用「AI 芯片股」放在同一估值框架。
第二层:晶圆代工、HBM 与先进封装
推理模型变大、上下文变长,令 HBM 容量与频宽的重要性上升。台积电负责多数先进 AI 加速器制造与封装;SK 海力士、三星电子和美光供应 HBM。自研 ASIC 增长可能分散加速器品牌份额,却未必减少先进制程和 HBM 总需求。
这也是为什么判断内存公司时,不能只问 NVIDIA 出货,而要追踪所有 GPU、TPU、Trainium、Maia 和定制 XPU 的 HBM 含量。延伸阅读:HBM 概念股与产业链。
第三层:网络与光互连
模型跨越愈多加速器,网络便愈接近系统瓶颈。Broadcom、Marvell、Arista、Credo、Coherent、Lumentum 和 Fabrinet 分别参与交换机、SerDes、主动电缆、DSP、光模块、光器件及制造。
推理负载未必像大型训练一样每一步都需要全体同步,但 AI agent、MoE 和长上下文仍会增加跨节点通讯与资料移动。Ethernet 由 800G 向 1.6T 升级,LPO 与 CPO 的导入都与这个瓶颈相关。完整技术和公司分工见《光模块概念股》。
第四层:电力、冷却与数据中心
推理需求是持续营运负载,不是只在训练期间出现。即使每 token 能效改善,只要总 token 使用量增长更快,数据中心电力、散热和机架密度仍会增加。Vertiv、Eaton、数据中心营运商和电力基建因此属于第二层受惠者,但其回报取决于订单、产能、价格和资本成本,不是 AI 使用量的固定倍数。Nebius(NBIS)公司研究展示 GPU 云端如何把电力、集群和利用率转成收入;Bloom Energy(BE)公司研究则拆解现场电力如何缩短数据中心接电时间。延伸阅读:AI 资本开支如何转化为收入与利润。
投资者应追踪的六个领先指标
- 推理使用量:API token、AI agent 任务和企业生产工作负载是否持续增长;
- 价格下降与需求弹性:每 token 售价下降后,总使用量能否以更快速度上升;
- 硬件利用率:已部署加速器是否保持高负载,还是容量先于需求;
- 云端毛利与折旧:AI 收入增长能否超过设备折旧、电力与租约成本;
- 自研芯片部署范围:由内部模型扩展至第三方客户,还是只停留在公告;
- 供应链收入纯度:公司是否披露 AI 相关收入、客户、产品代际和毛利,而不只是被归入概念股。
这六项比单看芯片峰值 FLOPS 更接近股东回报。技术胜出但资本投入过高、售价下降过快或利用率不足,未必能产生理想自由现金流;相反,份额较小的平台若专注高价值工作负载,仍可能建立良好业务。
Klaro Research 结论
AI 推理芯片竞争的核心,已由「谁能提供最大训练算力」转向「谁能以最低总成本,在指定延迟内持续产生有用 token」。这是一场系统竞争:芯片只是起点,HBM、封装、网络、软件、电力和利用率共同决定结果。
NVIDIA 仍拥有最完整的通用平台和软件生态;Google、Amazon、Microsoft、Meta 和 OpenAI 发展定制芯片,是为了掌握成本与供应,而不是证明 GPU 已失去价值;Broadcom 和 Marvell受惠于客户把更多架构自研;Cerebras 则验证极低延迟推理可以成为独立市场。
对投资者而言,最重要的结论不是选出唯一赢家,而是分清三个层次:
- 芯片份额:哪种架构取得新增工作负载;
- 系统价值:HBM、网络和软件如何影响真正性能;
- 财务转化:推理需求能否变成收入、毛利和自由现金流。
只有三层同时成立,技术趋势才会成为可持续的投资基本面。
常见问题
AI 推理芯片与训练芯片有什么分别?
训练芯片用大量数据建立或更新模型参数,通常重视大规模平行运算和集群扩展;推理芯片执行已训练模型,除了吞吐量,也重视回应延迟、每 token 成本、内存频宽和功耗。现代 GPU 和部分 ASIC 可以同时处理训练与推理,只是优化重点不同。
GPU 与 ASIC 有什么分别?
GPU 可编程、用途广、软件成熟,适合快速变化的模型和多种工作负载;ASIC 为特定计算模式设计,可以降低功耗和单位成本,但开发周期长、弹性较低。规模不足的企业通常难以自行承担定制 ASIC 成本。
TPU、Trainium 和 Maia 可以买到吗?
它们主要透过各自云端平台提供,而不是像一般处理器一样零售。Google TPU 在 Google Cloud 使用;Trainium/Inferentia 在 AWS 使用;Maia 主要部署于 Microsoft Azure 和内部服务。客户购买的是云端运算服务,不一定拥有芯片本身。
AI 推理股票/概念股有哪些?
直接运算平台包括 NVIDIA、AMD、Broadcom、Marvell 和 Cerebras;间接受影响的产业链包括台积电、SK 海力士、三星电子、美光,以及 Arista、Credo、Coherent、Lumentum、Fabrinet、Vertiv 和 Eaton 等网络、光互连、电力与冷却公司。被列入同一主题不代表收入纯度、风险或估值相同,应回到公司财报核对实际业务。
Cerebras 会取代 NVIDIA 吗?
现有证据较支持互补,而不是全面取代。OpenAI 把 Cerebras 定位为超低延迟推理层,同时仍使用 GPU 处理广泛工作负载。Cerebras 的机会是取得对延迟敏感的高价值市场,而不是在短期内替代整个 CUDA 与 GPU 生态。
官方资料与方法边界
- MLCommons:MLPerf Inference v6.0(2026 年 4 月)
- NVIDIA:Data Center Deep Learning Performance(资料于 2026 年 8 月 1 日复核)
- Google:Ironwood TPU及 Cloud TPU 推理文件
- AWS:Trainium3 UltraServers及 Trainium 研究工具
- Microsoft:Maia 200
- Broadcom:2026 财年第一季业绩及 AI 基础设施
- OpenAI:Cerebras 合作及 OpenAI/Broadcom 推理芯片
供应商的性能和成本声称会随软件版本、模型和硬件配置改变。本文只在相同测试条件下比较数字,其他资料用于说明产品定位,并明确区分公司披露、第三方基准与 Klaro Research 推论。
本文只用于理解 AI 推理产业结构与公司商业模式,不构成任何证券的买卖建议。
本文仅供参考,不构成投资建议。