IT袋

当前位置:主页 > 经验教程 > 硬件教程 >

显卡性能排行榜

显卡性能排行榜 2023年显卡性价比推荐(4)

更新:2023-08-22 16:08:09 来源:IT袋 作者:苏晓敏
导读:显卡性能排行榜,图7:在RTX 2080 Ti上,在给定的功率限制下测得的速度下降 我们可以看到,设置功率限制并不严重影响性能。将功率限制在50W,性能仅下降7%。 RTX 4090接头起

显卡性能排行榜

显卡性能排行榜

图7:在RTX 2080 Ti上,在给定的功率限制下测得的速度下降

我们可以看到,设置功率限制并不严重影响性能。将功率限制在50W,性能仅下降7%。

RTX 4090接头起火问题

有一种误解,认为RTX 4090电源线起火是因为被弯折过度了。实际上只有0.1%的用户是这个原因,主要问题是电缆没有正确插入。

因此,如果你遵循以下安装说明,使用RTX 4090是完全安全的。

1. 如果你使用旧的电缆或旧的GPU,确保触点没有碎片/灰尘。

2.使用电源连接器,并将其插入插座,直到你听到咔嚓一声–这是最重要的部分。

3. 通过从左到右扭动电源线来测试是否合适。电缆不应该移动。

4.目视检查与插座的接触情况,电缆和插座之间无间隙。

H100和RTX40中的8位浮点支持

对8位浮点(FP8)的支持是RTX 40系列和H100 GPU的一个巨大优势。

有了8位输入,它允许你以两倍的速度加载矩阵乘法的数据,你可以在缓存中存储两倍的矩阵元素,而在Ada和Hopper架构中,缓存是非常大的,现在有了FP8张量核心,你可以为RTX 4090获得0.66 PFLOPS的计算量。

这比2007年世界上最快的超级计算机的全部算力还要高。4倍于FP8计算的RTX 4090,可与2010年世界上最快的超级计算机相媲美。

显卡性能排行榜

可以看到,最好的8位基线未能提供良好的零点性能。我开发的方法LLM.int8()可以进行Int8矩阵乘法,结果与16位基线相同。

但是Int8已经被RTX 30 / A100 / Ampere这一代GPU所支持,为什么FP8在RTX 40中又是一个大升级呢?FP8数据类型比Int8数据类型要稳定得多,而且很容易在层规范或非线性函数中使用,这在整型数据类型中是很难做到的。

这将使它在训练和推理中的使用变得非常简单明了。我认为这将使FP8的训练和推理在几个月后变得相对普遍。

下面你可以看到这篇论文中关于Float vs Integer数据类型的一个相关主要结果。我们可以看到,逐个比特,FP4数据类型比Int4数据类型保留了更多的信息,从而提高了4个任务的平均LLM零点准确性。

显卡性能排行榜

GPU深度学习性能排行

先上一张图来看GPU的原始性能排行,看看谁最能打。

相关阅读