IT袋

当前位置:主页 > 经验教程 > 硬件教程 >

显卡性能排行榜

显卡性能排行榜 2023年显卡性价比推荐(2)

更新:2023-08-22 16:08:09 来源:IT袋 作者:苏晓敏
导读:显卡性能排行榜,图1:Ampere架构GPU中的稀疏矩阵乘法功能所支持的结构 当你将这个稀疏权重矩阵与一些密集输入相乘时,安培的稀疏矩阵张量核心功能会自动将稀疏矩阵压

显卡性能排行榜

显卡性能排行榜

图1:Ampere架构GPU中的稀疏矩阵乘法功能所支持的结构

当你将这个稀疏权重矩阵与一些密集输入相乘时,安培的稀疏矩阵张量核心功能会自动将稀疏矩阵压缩为密集表示,其大小为图2所示的一半。

在压缩之后,密集压缩的矩阵瓦片被送入张量核心,张量核心计算的矩阵乘法是通常大小的两倍。这有效地产生了2倍的速度,因为在共享内存的矩阵乘法过程中,带宽要求减半。

显卡性能排行榜

图2:在进行矩阵乘法之前,稀疏矩阵被压缩为密集表示。

我在研究中致力于稀疏网络训练,我还写了一篇关于稀疏训练的博文。对我的工作的一个批评是:”你减少了网络所需的FLOPS,但并没有产生速度的提升,因为GPU不能进行快速的稀疏矩阵乘法”。

随着Tensor Cores的稀疏矩阵乘法功能的增加,我的算法或其他稀疏训练算法,现在实际上在训练期间提供了高达2倍的速度。

显卡性能排行榜

开发的稀疏训练算法有三个阶段:(1)确定每层的重要性。(2) 删除最不重要的权重。(3) 提升与每层的重要性成比例的新权重。

虽然这一功能仍处于实验阶段,而且训练稀疏网络还不普遍,但在你的GPU上拥有这一功能意味着你已经为稀疏训练的未来做好了准备。

低精度计算

在我的工作中,我之前已经表明,新的数据类型可以提高低精度反向传播期间的稳定性。

相关阅读