部署本地大模型,两张3080的对手是4090还是5090? 闲人太忙 大模型 2026-08-10 06:18 12 阅读 qwen3.6 gemma4 RTX3080 摘要:使用两张RTX3080 20g显卡,走Pcie4.0x16互联来运行四个30B参数级别的本地开源大模型,测试了预填充prefill速度和生成decoding速度,其中上下文速度能到1100+tok/s,生成速度能50+tok/s,生成速度能挑战4090,但不如5090。 闲人太忙 闲人太忙