部署本地大模型,两张3080的对手是4090还是5090?
使用两张RTX3080 20g显卡,走Pcie4.0x16互联来运行四个30B参数级别的本地开源大模型,测试了预填充prefill速度和生成decoding速度,其中上下文速度能到1100+tok/s,生成速度能50+tok/s,生成速度能挑战4090,但不如5090。
使用两张RTX3080 20g显卡,走Pcie4.0x16互联来运行四个30B参数级别的本地开源大模型,测试了预填充prefill速度和生成decoding速度,其中上下文速度能到1100+tok/s,生成速度能50+tok/s,生成速度能挑战4090,但不如5090。
今年上半年涨价最猛的显卡当属卡皇RTX PRO 6000了,从年初的6万左右涨到6月的10万左右,纸面性能参数特别强,96GB大显存,1.79 TB/s高显存带宽,跑Qwen3.6-27B生成速度能到60+token/s,预填充速度能到2.5k+,MTP能提速一倍,跑其他30B参数左右大模型也是很强
RTX 5090作为现在实力最强的游戏显卡,测试这张卡跑qwen3.6-27b、qwen3.6-35b-a3b、gemma-4-31b、gemma-4-26b-a4b这几款热门本地开源大模型的运行速度,并对比其他主力显卡