当年炼丹神卡2080Ti能否驾驭本地大模型之王qwen3.8-27B(1/2卡速度测试及模型能力测试)
Qwen3.8-27b在上周如期开源发布,本文从运行速度和能力两方面进行了测试。同样测试一张2080ti和两张nvlink的效果对比,然后测试了Q4_K_M、Q6_K、Q8_0这几个不同的量化版本的速度:上下文处理速度即预填充prefill速度和输出decoding速度,测试了这个模型能力。
Qwen3.8-27b在上周如期开源发布,本文从运行速度和能力两方面进行了测试。同样测试一张2080ti和两张nvlink的效果对比,然后测试了Q4_K_M、Q6_K、Q8_0这几个不同的量化版本的速度:上下文处理速度即预填充prefill速度和输出decoding速度,测试了这个模型能力。
两张RTX 2080Ti魔改22g显卡加上nvlink,运行本地大模型是否能达到rtx4090显卡的速度?通过测试实验,decoding生成速度还真可以,但预填充prefill速度只有其30%左右。对比一张rtx2080Ti22g的话,上文处理速度提升150tok/s,生成速度提升60%。
当年一代炼丹神卡RTX2080ti跑本地大模型(30B参数级别,如Qwen3.6-27B-Q4_K_M)的运行速度测试(包括预填充prfill速度和生成token速度),然后测试了不同mtp-max值下的提升效果情况,不同上下文长度的运行速度趋势,和对比其他经典显卡的速度。