1到8张老登显卡V100怎样玩转本地运行Qwen3.8-27B(速度测试篇)
前几天发布的Qwen3.8-27B又掀起了本地部署大模型的小浪潮,Qwen3.8-27B确实还不错,普通常见场景确实够用,上一篇文章项目测试部分也进行了相关能力测试,本文主要测试下V100这个8年前发布的老计算显卡速度情况。 初步看下V100配置情况: 显存:16/32GB 带宽:897.0 GB/s 架构:Volta FP16算力:113.0 TFLOPS 支持NVlink2.0(...
前几天发布的Qwen3.8-27B又掀起了本地部署大模型的小浪潮,Qwen3.8-27B确实还不错,普通常见场景确实够用,上一篇文章项目测试部分也进行了相关能力测试,本文主要测试下V100这个8年前发布的老计算显卡速度情况。 初步看下V100配置情况: 显存:16/32GB 带宽:897.0 GB/s 架构:Volta FP16算力:113.0 TFLOPS 支持NVlink2.0(...
Qwen3.8-27b在上周如期开源发布,本文从运行速度和能力两方面进行了测试。同样测试一张2080ti和两张nvlink的效果对比,然后测试了Q4_K_M、Q6_K、Q8_0这几个不同的量化版本的速度:上下文处理速度即预填充prefill速度和输出decoding速度,测试了这个模型能力。
使用两张RTX3080 20g显卡,走Pcie4.0x16互联来运行四个30B参数级别的本地开源大模型,测试了预填充prefill速度和生成decoding速度,其中上下文速度能到1100+tok/s,生成速度能50+tok/s,生成速度能挑战4090,但不如5090。
两张RTX 2080Ti魔改22g显卡加上nvlink,运行本地大模型是否能达到rtx4090显卡的速度?通过测试实验,decoding生成速度还真可以,但预填充prefill速度只有其30%左右。对比一张rtx2080Ti22g的话,上文处理速度提升150tok/s,生成速度提升60%。
当年一代炼丹神卡RTX2080ti跑本地大模型(30B参数级别,如Qwen3.6-27B-Q4_K_M)的运行速度测试(包括预填充prfill速度和生成token速度),然后测试了不同mtp-max值下的提升效果情况,不同上下文长度的运行速度趋势,和对比其他经典显卡的速度。
今年上半年涨价最猛的显卡当属卡皇RTX PRO 6000了,从年初的6万左右涨到6月的10万左右,纸面性能参数特别强,96GB大显存,1.79 TB/s高显存带宽,跑Qwen3.6-27B生成速度能到60+token/s,预填充速度能到2.5k+,MTP能提速一倍,跑其他30B参数左右大模型也是很强
闲人太忙项目汇总
RTX 5090作为现在实力最强的游戏显卡,测试这张卡跑qwen3.6-27b、qwen3.6-35b-a3b、gemma-4-31b、gemma-4-26b-a4b这几款热门本地开源大模型的运行速度,并对比其他主力显卡