现在大模型训练的算力需求真是爆炸式增长,动不动就上千倍地涨,看得我直呼内行。王华提到的大集群和FP8技术,感觉确实是解决当前算力瓶颈的关键。尤其是FP8,虽然精度低,但通过合理的混合精度训练,不仅能节省资源,还能提升训练效率。摩尔线程提供的万卡集群和全精度算力方案,看起来是真能帮上大忙了。这种技术分享,必须转发一波,让更多人了解AI算力的最新动向
现在大模型训练的算力需求真是爆炸式增长,动不动就上千倍地涨,看得我直呼内行。王华提到的大集群和FP8技术,感觉确实是解决当前算力瓶颈的关键。尤其是FP8,虽然精度低,但通过合理的混合精度训练,不仅能节省资源,还能提升训练效率。摩尔线程提供的万卡集群和全精度算力方案,看起来是真能帮上大忙了。这种技术分享,必须转发一波,让更多人了解AI算力的最新动向

问AI全文概述
摩尔线程副总裁王华在2025中国AI算力大会上指出,大模型训练的算力需求激增近1000倍,主要驱动力来自参数规模与数据量的增长。他强调了大集群和FP8的重要性,并介绍了摩尔线程在混合精度训练和FP8技术上的进展,展示了其产品在性能提升方面的显著效果。
大模型训练算力需求增长
从2020年到2025年,大模型训练的算力需求增长了近1000倍,主要原因是模型参数和训练数据量的大幅增加。例如,Llama 3 70B需要约10^24 FLOPs,而GPT-4则需要10^25 FLOPs。为了满足这些需求,使用万卡级别的集群可以显著缩短训练时间。
混合精度训练缓解算力需求
为应对算力需求激增的问题,摩尔线程采用混合精度训练方法,通过降低部分操作的精度(如FP8),实现算力翻倍并减少显存占用。尽管低精度计算存在数值范围和精度损失问题,但通过优化策略(如Scaling Factor)可以有效解决这些问题。
FP8训练技术及其挑战
FP8训练面临数值范围局限和精度损失等挑战,但在矩阵乘、累加与规约操作以及非线性函数运算中,通过差异化精度策略和Tensor Core技术,能够有效克服这些难题。DeepSeek-V3成功应用FP8混合精度训练,取得了显著成果。
摩尔线程的FP8支持及性能提升
摩尔线程提供全面支持FP8精度的GPU计算卡,并推出了夸娥智算集群系列产品,实现了开箱即用的大规模集群解决方案。基于其软件栈,摩尔线程在多个模型上实现了20%~30%的性能提升,且FP8训练的loss曲线与高精度训练基本一致。
