AI 推理股票有哪些?GPU、ASIC、HBM 与数据中心概念股

作者 Klaro 编辑部 ·发布于 2026年8月1日 ·最后更新2026年8月5日

AI 推理概念股产业链封面,呈现 GPU、定制 ASIC、HBM、网络与数据中心之间的关系
封面以数据中心加速器与高速互连呈现 AI 推理概念股的产业链位置;真正的投资判断仍要回到公司收入、毛利、部署与现金流。
目录

如果你搜寻「AI 推理股票有哪些」,最直接的答案不是一张把所有 AI 公司放在一起的名单,而是先按收入如何传导分层:NVIDIA(NVDA)和 AMD(AMD)是通用加速器;Broadcom(AVGO)和 Marvell(MRVL)参与定制 ASIC 与高速互连;台积电(TSM)、SK 海力士三星电子美光(MU)提供制造与 HBM;Arista(ANET)、Credo(CRDO)、Coherent(COHR)和 Lumentum(LITE)处理网络及光互连;Vertiv(VRT)、Eaton(ETN)和部分 AI 云端公司则承接电力、散热与部署需求。 Google、Amazon、Microsoft 和 Meta 的自研芯片主要服务自身云端或产品,不能直接当成独立芯片收入来估值。

AI 推理产业链位置 代表公司 投资者实际要核对什么
通用 GPU/加速器 NVIDIA、AMD 推理收入或部署是否增长、软件生态、每 token 成本与客户集中度
云端自研芯片 Alphabet、Amazon、Microsoft、Meta 芯片是否真正部署、云端利用率与毛利是否改善,而不是只看发布会名称
定制 ASIC/高速互连 Broadcom、Marvell 客户数、设计导入、量产节奏、SerDes/交换机与 ASIC 收入能否落到财报
制造/HBM/先进封装 台积电、SK 海力士、三星电子、美光 每颗加速器的 HBM 含量、封装产能、资本开支与内存价格循环
网络/光互连 Arista、Credo、Coherent、Lumentum、Fabrinet 800G/1.6T 采用、端口内容量、客户验证与 AI 收入纯度
电力/散热/AI 云端 Vertiv、Eaton、Nebius、Bloom Energy 接电与部署速度、利用率、折旧、订单转收入及自由现金流

这张表是产业位置地图,不是推荐清单。AI 推理芯片(AI inference chip)本身,是用来执行已完成训练的人工智能模型,将使用者输入转化为文字、图片、语音、程式码或代理行动的处理器。ChatGPT 回答问题、Copilot 生成程式码、搜寻引擎产生 AI 摘要,背后都在进行推理。

市场常把「AI 芯片」等同 NVIDIA GPU,但推理市场已经分成多条路线:NVIDIA 与 AMD 提供可编程 GPU;Google、Amazon、Microsoft 及 Meta 发展自研或共同开发的 ASIC;Broadcom、Marvell 协助大型客户把自订架构变成芯片;Cerebras 则以晶圆级处理器追求极低延迟。它们不是单纯比较峰值算力,而是在竞争每个 token 的成本、回应速度、吞吐量、功耗、软件相容性和部署弹性

Klaro Research 核心判断:推理不会由单一芯片架构全面通吃。GPU 会继续承担最广泛、最常变动的模型和工作负载;超大规模云端平台会把稳定、高用量的模型迁移至自研 ASIC,以降低单位成本;Cerebras 等专用系统则争取极低延迟或特定模型的高价值工作。真正扩大的市场不是某一种芯片,而是由运算、HBM、网络、光互连、电力和软件共同组成的推理基础设施。

本文资料截至 2026 年 8 月 1 日。各公司公布的 FLOPS、tokens per second 和成本数据使用不同模型、精度、批次、延迟限制及系统配置,不能直接横向相除;本文以架构与商业模式为主,不把供应商单方面基准测试当成最终胜负。

一分钟看懂 AI 推理芯片

问题 直接答案
AI 训练是什么 用大量数据调整模型参数,建立模型能力
AI 推理是什么 让已训练模型根据新输入产生答案或行动
推理最重要的指标 首个 token 延迟、输出速度、整体吞吐量、每 token 成本、功耗及准确度
GPU 的优势 通用、可编程、软件成熟,能快速支援新模型与多种工作负载
ASIC 的优势 可针对固定工作负载删除不需要的功能,提高性能功耗比和成本效率
ASIC 的限制 开发周期长、前期成本高、软件和客户范围较窄,模型变化可能令设计落后
Cerebras 的差异 以晶圆级处理器减少跨芯片通讯,主攻极低延迟推理
产业链真正瓶颈 不只算力,还包括 HBM 容量与频宽、封装、网络、光互连、电力和软件利用率

为什么推理成为 AI 基础设施下一个主战场

模型训练通常是一次或周期性的大型计算工程;推理则在产品被使用时持续发生。模型每回答一次问题、代理每多执行一步、影片每多生成一秒,都会消耗推理算力。

这使推理的经济模型与训练不同:

  • 训练重视能否在合理时间内完成大型模型;
  • 推理同时重视使用者是否愿意等待、每次回答成本是否低于收入,以及系统能否承受高峰流量;
  • AI agent 会在一次任务内多次呼叫模型、工具和记忆,令 token 使用量可能快于活跃使用者增长;
  • 推理成本下降亦可能产生需求反弹:每次使用更便宜,开发者便会加入更多推理步骤和新产品。

NVIDIA 的推理平台资料显示,硬件以外的量化、核心融合、批次调度和 speculative decoding 亦可大幅改变每 token 成本。换言之,芯片出货量不是唯一变数;同一批硬件经软件优化后可以输出更多 token,亦可能降低新增硬件的边际需求。

推理其实分成两段:Prefill 与 Decode

大型语言模型推理可以简化为两个阶段:

  1. Prefill(提示处理):模型读取整段输入和上下文,建立注意力状态。长文件、程式码库和大上下文会增加这部分负载;它较容易平行处理,通常偏向运算密集。
  2. Decode(逐 token 生成):模型逐步产生输出,每生成一个 token 都要读取模型权重和先前状态。这部分通常更受内存频宽、KV cache 和通讯延迟限制。

因此「哪一款芯片最快」没有脱离工作负载的统一答案。大量离线文件摘要可以容忍较高延迟,追求整体吞吐量;即时语音、程式码补全和 AI agent 则需要极低首 token 延迟及稳定输出速度。

AWS 与 Cerebras 已展示把 prefill 与 decode 放到不同硬件的异质推理方向:较通用的加速器处理前段,低延迟专用系统处理生成阶段。这类分工若扩大,代表未来竞争单位不再是一颗芯片,而是一个可以调度不同加速器的完整推理平台。

五个真正有用的推理指标

指标 它回答什么 常见误读
TTFT(Time to First Token) 使用者等多久才看到第一个字 首 token 快不代表整段回答完成得快
ITL/TPOT 生成中的 token 间隔 单一请求速度不等于系统总吞吐量
Tokens per second 一段时间输出多少 token 必须同时看模型、精度、批次及延迟限制
每百万 token 成本 把硬件、电力与利用率转成商业成本 供应商报价未必包含网络、折旧和闲置容量
每瓦/每机架吞吐量 电力受限时能部署多少有效算力 峰值 FLOPS 不能直接代表真实 token 输出

MLCommons 的 MLPerf Inference v6.0加入 GPT-OSS 120B、DeepSeek-R1 互动推理和视觉语言等工作负载,正好说明单一旧模型基准已不足以代表现代推理。比较供应商时,最好使用相同模型、服务情境、准确度要求及延迟上限的公开结果。

AI 推理平台由工作负载到运算、内存、网络与商业结果的繁体中文图解

AI 推理平台由工作负载到运算、内存、网络与商业结果的简体中文图解

AI 推理平台由工作负载到运算、内存、网络与商业结果的繁体中文手机图解

AI 推理平台由工作负载到运算、内存、网络与商业结果的简体中文手机图解

图:推理的竞争单位不是孤立芯片。工作负载先决定延迟、吞吐和内存需求,再由运算、HBM、网络与软件共同形成每 token 成本,最后才转化为供应商收入和云端毛利。

七种主要 AI 推理平台怎样比较

平台/路线 核心定位 主要优势 主要限制 投资者应观察
NVIDIA GPU 面向广泛模型和客户的通用加速平台 CUDA、TensorRT-LLM、网络、系统和开发者生态完整 价格与功耗高,客户希望降低单一供应商依赖 推理收入占比、token 成本改善、软件能否维持锁定效应
AMD Instinct GPU 通用 GPU 的第二供应来源 HBM 容量、开放软件方向及大型云端客户验证 ROCm 生态、供应规模和整体平台成熟度仍要追赶 云端可用区、具名部署、软件相容及整机出货
Google TPU/Ironwood Google 内部与 Google Cloud 的自研加速器 模型、编译器、网络与数据中心共同设计 主要依附 Google 生态,外部可移植性较低 Cloud 外部客户使用量及 Gemini 推理成本
AWS Trainium/Inferentia AWS 自研的训练与推理平台 与 EC2、Bedrock、Neuron 软件及云端定价整合 工作负载需要适配 AWS Neuron,跨云弹性较低 Trainium 使用率、Anthropic 以外客户及 AWS 毛利改善
Microsoft Maia 200 Azure 内部的大规模推理加速器 与 Azure、OpenAI 模型、网络和数据中心共同优化 部署仍以 Microsoft 自有云为主,独立基准有限 部署区域、实际负载、性能成本及对 NVIDIA 采购组合的影响
Broadcom 定制 XPU 为少数超大型客户共同开发 ASIC 能按模型和系统要求定制,并结合 Ethernet、SerDes 和光互连 客户集中、开发周期长,收入受少数项目节奏影响 XPU 客户数、每代量产规模、AI 网络与加速器收入
Cerebras WSE 晶圆级低延迟推理与特定训练工作 大量片上运算和 SRAM,减少跨芯片通讯 生态较窄、容量建设资本密集、客户集中 OpenAI 容量上线、利用率、服务毛利和自由现金流

NVIDIA:优势不只是 GPU

NVIDIA 的护城河是 GPU、NVLink/NVSwitch、Spectrum-X/InfiniBand、TensorRT-LLM、Dynamo 和大量模型优化共同形成的全栈平台。硬件规格领先很重要,但客户可以在同一套软件上迅速支援新模型,才是 NVIDIA 在工作负载快速变化时最难取代的部分。

MLPerf v6.0 显示 Blackwell 系统在最广泛的新增测试中都有提交,但这不等于所有客户、所有模型下都拥有最低成本。NVIDIA 自身公布的成本改善亦有很大部分来自软件;投资者应把「GPU 销量」和「每台系统能输出多少 token」一起理解。

Google、Amazon、Microsoft:自研芯片的目的不是对外卖芯片

超大规模云端公司的自研芯片首先是一项内部经济工程:降低推理成本、增加供应来源,并把模型、芯片、网络和数据中心绑在同一平台。

  • Google 把第七代 Ironwood TPU定位为推理时代的专用加速器,并以大容量 HBM 和自有 ICI 网络扩展至大型 pod;
  • AWS 的 Trainium3 UltraServer同时服务训练与推理,透过 Neuron 软件与 EC2、SageMaker 和 Bedrock 整合;
  • Microsoft 的 Maia 200专门针对推理,使用 HBM3e、片上 SRAM 和基于 Ethernet 的扩展网络,并用于 OpenAI 模型和 Microsoft 内部工作负载。

这些公司通常会公布「相对上一代」或「相对现有平台」的性能成本改善,但不同公司测试条件不一致。更可靠的商业证据是:自研芯片是否扩展至更多地区和客户、是否令云端 AI 收入快于折旧与营运成本,以及外购 GPU 比例是否真的下降。

Broadcom:把客户架构变成可量产 XPU

Broadcom 的角色不是像 NVIDIA 一样向整个市场销售同一款加速器,而是和少数超大型客户共同定义 ASIC,再提供先进制程实现、SerDes、HBM 介面、交换机和网络连接。

公司在 2026 财年第一季披露 AI 收入为 84 亿美元、按年增长 106%,由定制 AI 加速器与网络需求推动;这是 ASIC 已由概念变成大规模收入的直接证据。Broadcom 官方业绩资料

OpenAI 与 Broadcom 亦在 2026 年公布首款共同开发的 LLM 推理处理器 Jalapeño,计划由 2026 年底开始部署。OpenAI 的官方说明同时指出,合作涵盖芯片架构、核心、内存、网络、调度和部署系统。这说明定制 ASIC 的价值已从「一颗较便宜的芯片」上升至完整的垂直整合平台。

不过,Broadcom 的 AI 增长仍高度依赖少数客户和多年度项目。单一客户延迟量产、改变模型架构或把下一代转交其他设计伙伴,都可能令收入节奏波动。

Cerebras:不是 GPU 替代品,而是低延迟专用层

Cerebras 把接近整片晶圆做成一个处理器,以大量片上 SRAM 和互连降低资料搬运。OpenAI 在 2026 年宣布加入 750MW Cerebras 超低延迟算力,并将其作为推理组合中的专用低延迟方案,而不是取代全部 GPU。OpenAI 合作公告

这个定位非常重要:只要即时编程、语音和 AI agent 愿意为低延迟支付溢价,Cerebras 不需要取得整个推理市场,也可以建立可观业务;但其估值和商业质素仍要由容量上线、利用率、服务毛利与现金流验证。完整公司研究见《Cerebras(CBRS)是什么公司》

GPU 会被 ASIC 取代吗

较可能的结果是市场分层,而不是单向取代

GPU 最适合:

  • 新模型、新算子和需求仍快速变化;
  • 客户需要同一硬件支援训练、微调、推理和其他加速计算;
  • 模型规模未大到足以摊薄定制芯片开发成本;
  • 软件相容与快速部署比理论单位成本更重要。

定制 ASIC 最适合:

  • 工作负载稳定而且规模极大;
  • 客户拥有自己的模型、编译器、数据中心和工程团队;
  • 每瓦、每机架及每 token 的微小改善都能转化为巨额成本节省;
  • 客户愿意承担两至数年的设计和量产周期。

专用架构最适合:

  • 即时互动需要非常低的输出延迟;
  • 模型和数据流能配合特定硬件;
  • 速度改善可以转化为更高使用量或高价服务。

因此,ASIC 市占增加不必然等于 NVIDIA 收入下降。推理总需求若增长得更快,GPU、ASIC 和专用系统可以同时扩张;真正需要观察的是各平台在新增 token 中取得多少份额,以及价格下降是否快于使用量上升。

AI 推理股票如何沿产业链传导到美股与全球半导体

第一层:运算平台

  • NVIDIA(NVDA):GPU、机架级系统、网络与推理软件;
  • AMD(AMD):Instinct GPU 与 ROCm 软件,作为通用 GPU 第二来源;
  • Broadcom(AVGO)Marvell(MRVL):定制 AI 芯片、SerDes、交换与连接技术;
  • Cerebras(CBRS):晶圆级低延迟推理平台。

这些公司同属 AI 运算,但业务纯度、客户结构和毛利模式完全不同,不能只用「AI 芯片股」放在同一估值框架。

第二层:晶圆代工、HBM 与先进封装

推理模型变大、上下文变长,令 HBM 容量与频宽的重要性上升。台积电负责多数先进 AI 加速器制造与封装;SK 海力士、三星电子和美光供应 HBM。自研 ASIC 增长可能分散加速器品牌份额,却未必减少先进制程和 HBM 总需求。

这也是为什么判断内存公司时,不能只问 NVIDIA 出货,而要追踪所有 GPU、TPU、Trainium、Maia 和定制 XPU 的 HBM 含量。延伸阅读:HBM 概念股与产业链

第三层:网络与光互连

模型跨越愈多加速器,网络便愈接近系统瓶颈。Broadcom、Marvell、Arista、Credo、Coherent、Lumentum 和 Fabrinet 分别参与交换机、SerDes、主动电缆、DSP、光模块、光器件及制造。

推理负载未必像大型训练一样每一步都需要全体同步,但 AI agent、MoE 和长上下文仍会增加跨节点通讯与资料移动。Ethernet 由 800G 向 1.6T 升级,LPO 与 CPO 的导入都与这个瓶颈相关。完整技术和公司分工见《光模块概念股》

第四层:电力、冷却与数据中心

推理需求是持续营运负载,不是只在训练期间出现。即使每 token 能效改善,只要总 token 使用量增长更快,数据中心电力、散热和机架密度仍会增加。Vertiv、Eaton、数据中心营运商和电力基建因此属于第二层受惠者,但其回报取决于订单、产能、价格和资本成本,不是 AI 使用量的固定倍数。Nebius(NBIS)公司研究展示 GPU 云端如何把电力、集群和利用率转成收入;Bloom Energy(BE)公司研究则拆解现场电力如何缩短数据中心接电时间。延伸阅读:AI 资本开支如何转化为收入与利润

投资者应追踪的六个领先指标

  1. 推理使用量:API token、AI agent 任务和企业生产工作负载是否持续增长;
  2. 价格下降与需求弹性:每 token 售价下降后,总使用量能否以更快速度上升;
  3. 硬件利用率:已部署加速器是否保持高负载,还是容量先于需求;
  4. 云端毛利与折旧:AI 收入增长能否超过设备折旧、电力与租约成本;
  5. 自研芯片部署范围:由内部模型扩展至第三方客户,还是只停留在公告;
  6. 供应链收入纯度:公司是否披露 AI 相关收入、客户、产品代际和毛利,而不只是被归入概念股。

这六项比单看芯片峰值 FLOPS 更接近股东回报。技术胜出但资本投入过高、售价下降过快或利用率不足,未必能产生理想自由现金流;相反,份额较小的平台若专注高价值工作负载,仍可能建立良好业务。

Klaro Research 结论

AI 推理芯片竞争的核心,已由「谁能提供最大训练算力」转向「谁能以最低总成本,在指定延迟内持续产生有用 token」。这是一场系统竞争:芯片只是起点,HBM、封装、网络、软件、电力和利用率共同决定结果。

NVIDIA 仍拥有最完整的通用平台和软件生态;Google、Amazon、Microsoft、Meta 和 OpenAI 发展定制芯片,是为了掌握成本与供应,而不是证明 GPU 已失去价值;Broadcom 和 Marvell受惠于客户把更多架构自研;Cerebras 则验证极低延迟推理可以成为独立市场。

对投资者而言,最重要的结论不是选出唯一赢家,而是分清三个层次:

  • 芯片份额:哪种架构取得新增工作负载;
  • 系统价值:HBM、网络和软件如何影响真正性能;
  • 财务转化:推理需求能否变成收入、毛利和自由现金流。

只有三层同时成立,技术趋势才会成为可持续的投资基本面。

常见问题

AI 推理芯片与训练芯片有什么分别?

训练芯片用大量数据建立或更新模型参数,通常重视大规模平行运算和集群扩展;推理芯片执行已训练模型,除了吞吐量,也重视回应延迟、每 token 成本、内存频宽和功耗。现代 GPU 和部分 ASIC 可以同时处理训练与推理,只是优化重点不同。

GPU 与 ASIC 有什么分别?

GPU 可编程、用途广、软件成熟,适合快速变化的模型和多种工作负载;ASIC 为特定计算模式设计,可以降低功耗和单位成本,但开发周期长、弹性较低。规模不足的企业通常难以自行承担定制 ASIC 成本。

TPU、Trainium 和 Maia 可以买到吗?

它们主要透过各自云端平台提供,而不是像一般处理器一样零售。Google TPU 在 Google Cloud 使用;Trainium/Inferentia 在 AWS 使用;Maia 主要部署于 Microsoft Azure 和内部服务。客户购买的是云端运算服务,不一定拥有芯片本身。

AI 推理股票/概念股有哪些?

直接运算平台包括 NVIDIA、AMD、Broadcom、Marvell 和 Cerebras;间接受影响的产业链包括台积电、SK 海力士、三星电子、美光,以及 Arista、Credo、Coherent、Lumentum、Fabrinet、Vertiv 和 Eaton 等网络、光互连、电力与冷却公司。被列入同一主题不代表收入纯度、风险或估值相同,应回到公司财报核对实际业务。

Cerebras 会取代 NVIDIA 吗?

现有证据较支持互补,而不是全面取代。OpenAI 把 Cerebras 定位为超低延迟推理层,同时仍使用 GPU 处理广泛工作负载。Cerebras 的机会是取得对延迟敏感的高价值市场,而不是在短期内替代整个 CUDA 与 GPU 生态。

官方资料与方法边界

供应商的性能和成本声称会随软件版本、模型和硬件配置改变。本文只在相同测试条件下比较数字,其他资料用于说明产品定位,并明确区分公司披露、第三方基准与 Klaro Research 推论。


本文只用于理解 AI 推理产业结构与公司商业模式,不构成任何证券的买卖建议。

本文仅供参考,不构成投资建议。