英伟达在2026年9月10日的GTC大会上正式发布了下一代Blackwell架构GPU旗舰产品B200。该芯片采用台积电最新的4NP工艺制程,集成了2080亿个晶体管,采用双芯片设计通过NVLink-C2C互连,单卡FP32计算性能达到200 TFLOPS,较上一代H100的100 TFLOPS提升100%。
B200不仅在传统FP32/FP16精度上性能翻倍,更首次原生支持FP4精度推理,在保持可接受精度损失的前提下,可将大语言模型的推理吞吐量提升2-4倍,显著降低AIGC应用的算力成本。
Blackwell架构引入了第二代Transformer引擎,通过动态精度调整和稀疏计算技术,在AI训练和推理 workload 上实现更高的效率。新增的引擎还支持原生稀疏注意力机制,进一步优化Transformer模型的计算效率。
B200的发布将进一步加速AI算力的迭代周期。单卡性能翻倍意味着相同算力下可部署更大规模的模型,或者以更少的卡数达到相同性能,这对于中小型AI企业和研究机构尤为重要。
FP4精度的原生支持将显著降低推理成本。以Llama 3 70B模型为例,在H100上使用FP16精度推理需要约140GB显存和较高的算力消耗,而在B200上使用FP4精度可将显存需求降至约70GB,算力消耗降低60%以上,使得单卡B200即可流畅运行当时最大的开源大模型。
此外,B200的高带宽显存和NVLink互连技术,使其在多卡扩展时表现出色,8卡B200系统可提供接近1.6 PFLOPS的FP16稀疏性能,足以训练万亿参数级别的大模型。
英伟达宣布,Blackwell B200将在Q4 2026开始大规模出货,主要云服务提供商包括AWS、Azure、Google Cloud和阿里云均已宣布计划在2027年初大规模采纳。此外,戴尔、惠普、超微等服务器厂商也将推出基于B200的AI服务器产品。
在软件生态方面,CUDA 12.5将同步发布,全面支持Blackwell架构的所有特性,包括新的指令集、内存管理和调度优化。主流AI框架如TensorFlow、PyTorch和JAX也将在发布后不久提供官方支持。
Blackwell B200的发布标志着AI算力进入了一个新的台阶。性能的翻倍不仅带来了绝对算力的提升,更重要的是通过创新的架构和精度技术,大幅提升了算力的效率。随着该芯片的大规模落地,我们可以期待看到更大规模、更高效的AI模型得以训练和部署,同时推理成本的下降也将进一步普及AI应用的边界。
我们将继续关注AI硬件领域的最新进展,并在后续报道中提供更深入的分析和应用指南。