AMD向英伟达下战书,新版AI芯片速度登顶,算力王座或将易主?
- 体育比分
- 2026-08-24 04:51:03
- 1
在全球人工智能竞赛的硝烟中,算力是唯一的硬通货,长久以来,英伟达凭借其CUDA生态与Tensor Core架构,几乎垄断了AI训练与推理的“军火生意”,这堵看似坚不可摧的城墙,正在被老对手AMD凿出一道裂痕。
AMD高调宣布,其最新一代AI加速芯片在多项关键基准测试中,推理与训练速度全面超越英伟达目前市售的同级别旗舰产品,这一声明,无异于在AI算力市场投下一枚深水炸弹。
数据说话:不止是“接近”,而是“超越”
不同于以往“性价比更高”或“能效比更优”的委婉措辞,AMD这次直接祭出了“速度”这一核心指标,在MLPerf等业界公认的AI负载测试中,AMD的新版芯片在Llama 2、GPT-3等主流大语言模型的推理吞吐量上,比英伟达的H100(或后续同代际产品)高出约20%至30%。
更令市场震动的是训练性能,对于动辄需要数千张GPU集群训练的超大模型,哪怕单卡速度提升10%,意味着数百万美元电力成本与数周时间的节省,AMD宣称,得益于全新的3D堆叠缓存技术与更激进的存储带宽设计,其芯片在数据传输瓶颈上实现了突破——而这正是大模型训练中最致命的痛点。
技术解剖:为什么AMD这次能“快”起来?
AMD的逆袭并非偶然,而是精准打击了英伟达架构的“阿喀琉斯之踵”。

第一,内存带宽的碾压,大模型推理的本质是“拼内存”,英伟达H100虽拥有3.35TB/s的带宽,但AMD通过将HBM3E内存堆叠与更短的数据路径结合,实现了理论峰值超过5TB/s的吞吐,当模型参数动辄数百亿时,谁喂数据喂得快,谁的计算单元就不至于“饿死”。
第二,无限缓存的魔法,AMD将桌面端验证成熟的Infinity Cache技术引入数据中心芯片,将高频访问的张量数据直接锁定在片上缓存中,这一设计大幅减少了对外部显存的读写次数,在自回归解码这类重复性极高的推理场景中,延迟被压缩到了极致。
第三,开放的ROCm生态终于成熟,过去AMD被诟病“硬件强、软件弱”,但经过数年打磨,ROCm 6.0已原生支持PyTorch、TensorFlow等主流框架,无需改写代码即可迁移,当开发者不再被CUDA绑架,纯硬件速度的比拼就变得纯粹而致命。
市场暗流:英伟达的“王座”会晃吗?

短期来看,英伟达的统治地位依然稳固,CUDA的护城河积累十余年,数百万开发者的习惯、数千个优化过的库,不是一朝一夕能颠覆的,更何况,英伟达的Blackwell架构芯片已箭在弦上,黄仁勋绝不会坐视AMD在宣传口径上占优。
但AMD此举的战略意义远大于一城一池的得失,它向整个行业传递了一个信号:AI算力不再是单一供应商的卖方市场,微软、Meta、OpenAI等云计算巨头们苦于英伟达高达70%以上的毛利率,早已暗中扶持替代方案,AMD的军火只要“够快、够用、够便宜”,巨头们没有理由不分散供应链风险。
有消息称,微软Azure已开始大规模部署AMD的MI300系列,用于内部的Copilot推理服务,当最大客户开始“脚踩两只船”,英伟达的定价权将第一次面临真正的挑战。
速度的战争,最终是生态的战争
AMD声称的“速度超越”是否能在真实的大规模集群中复现,仍需第三方机构的长期验证,但这场争夺战本身,已是AI产业走向成熟的标志——当竞争者开始用“每秒处理token数”而不是“PPT上的浮点算力”来对垒时,说明市场终于回归了务实的硬件本质。
英伟达的王朝尚未结束,但它的王座下,已经能感受到AMD递过来的刀锋,对于整个AI世界而言,这或许是比任何单一模型发布都更值得兴奋的消息:更快的芯片,更低的成本,最终会把智能的边界推向更远的地方。
下一篇:马斯克服软低头认错了
发表评论