IT袋

当前位置:主页 > 经验教程 > 硬件教程 >

显卡性能排行榜

显卡性能排行榜 2023年显卡性价比推荐(5)

更新:2023-08-22 16:08:09 来源:IT袋 作者:苏晓敏
导读:显卡性能排行榜,我们可以看到H100 GPU的8位性能与针对16位性能优化的旧卡存在巨大差距。 上图显示的是GPU的原始相对性能,比如对于8位推理,RTX 4090的性能大约是 H100 SM

显卡性能排行榜

显卡性能排行榜

我们可以看到H100 GPU的8位性能与针对16位性能优化的旧卡存在巨大差距。

上图显示的是GPU的原始相对性能,比如对于8位推理,RTX 4090的性能大约是 H100 SMX 的 0.33 倍。

换句话说,与RTX 4090相比,H100 SMX的8位推理速度快三倍。

对于此数据,他没有为旧GPU建模8位计算。

因为8位推理和训练在Ada/Hopper GPU上更有效,而张量内存加速器 (TMA) 节省了大量寄存器,这些寄存器在 8 位矩阵乘法中非常精确。

Ada/Hopper 也有 FP8 支持,这使得特别是 8 位训练更加有效,在Hopper/Ada上,8位训练性能很可能是16位训练性能的3-4倍。

对于旧GPU,旧GPU的Int8推理性能则接近16位推理性能。

每一美元能买到多少算力

那么问题来了,GPU性能强可是我买不起啊……

针对预算不充足的小伙伴,接下来的图表是他根据各个GPU的价格和性能统计的每美元性能排名(Performance per Dollar),侧面反映了GPU性价比。

显卡性能排行榜

选择一个完成深度学习任务并且符合预算的GPU,可分为以下几个步骤:

首先确定你需要多大的显存(至少12GB用于图像生成,至少24GB用于处理Transformer);针对选8位还是16位(8-bit or 16-bit),建议是能上16位就上,8位在处理复杂编码任务时还是会有困难;根据上图中的指标,找到具有最高相对性能/成本的GPU。

我们可以看到,RTX4070Ti 对于8位和16位推理的成本效益最高,而RTX3080对于16位训练的成本效益最高。

虽然这些GPU最具成本效益,但他们的内存也是个短板,10GB和12GB的内存可能无法满足所有需求。

但对于刚入坑深度学习的新手来说可能是理想GPU。

其中一些GPU非常适合Kaggle竞赛,在Kaggle比赛中取得好成绩,工作方法比模型大小更重要,因此许多较小的 GPU非常适合。

Kaggle号称是全球最大的数据科学家汇聚的平台,高手云集,同时对萌新也很友好。

显卡性能排行榜

如果用作学术研究和服务器运营的最佳GPU似乎是 A6000 Ada GPU。

同时H100 SXM的性价比也很高,内存大性能强。

个人经验来说,如果我要为公司/学术实验室构建一个小型集群,我推荐66-80%的A6000 GPU 和20-33%的 H100 SXM GPU。

综合推荐

说了这么多,终于到了GPU安利环节。

Tim Dettmers专门制作了一个「GPU选购流程图」,预算充足就可以上更高配置,预算不足请参考性价比之选。

这里首先强调一点:无论你选哪款 GPU,首先要确保它的内存能满足你的需求。为此,你要问自己几个问题:

我要拿GPU做什么?是拿来参加 Kaggle 比赛、学深度学习、做CV/NLP研究还是玩小项目?

显卡性能排行榜

预算充足的情况下,可以查看上面的基准测试并选择适合自己的最佳GPU。

还可以通过在vast.ai或Lambda Cloud中运行您的问题一段时间来估算所需的GPU内存,以便了解它是否能满足你的需求。

如果只是偶尔需要一个GPU(每隔几天持续几个小时)并且不需要下载和处理大型数据集,那么vast.ai或 Lambda Cloud也能很好地工作。

但是,如果一个月每天都使用GPU且使用频率很高(每天12小时),云GPU通常不是一个好的选择。

以上就是显卡性能排行榜 和 2023年显卡性价比推荐的技术经验小知识,以上内容供大家学习了解!

相关阅读