单卡2080Ti部署Qwen3.6-35B-A3B IQ4_XS量化输出速度实测
关键词: #本地AI大模型 #Qwen3.6 #2080Ti 22G #大模型速度测试
废话(请跳过)
>因为我直到3.8-27B推出后才想起来之前测试的Qwen3.6模型的性能数据,所以来补发一下,这个模型基本已经过时了,就不写些什么长篇大论之类的来和别的模型比较了,仅仅提供配置与测试结果,仅供参考
>本文中的测试内容不包含不同量化的性能对比,仅仅是不同配置下的生成速度对比,关于性能您可以另寻它文
>本站还有一篇Qwen3.8-27B大模型在2080Ti单卡部署的测试结果,感兴趣可以去看看【】
Q1:为什么没用Q4_K_M量化?
A1:当使用Q4_K_M量化时,仅仅模型权重就占用了接近20G的显存,应对长上下文显得力不从心,而使用Q_XS量化时,可以保证在256K满血上下文时保持1G左右的显存余量,避免降速
硬件配置清单
一、上下文对生成速度的影响
单请求生成速度基本随着输入上下文长度而线性下降,当输入长度仅20K的较短上下文时,Qwen3.6-35B-A3B Q4_XS量化模型的直接输出速度达到了惊人的 86.9 token/s,即使是输入长度为196K的超长上下文,其依旧能保持 29.1 token/s 的速度

二、MTP对生成速度的影响
对不同倍率情况下的MTP进行了测试,可见当MTP n-max2时,输出速度达到最大值,并且也保留了相对可观的上下文长度
当MTP取值大于2时,出现了较为明显的降速


测试方法:
固定底座:
-ngl 999 --no-mmap+ KV q4_0 +--spec-draft-p-min 0.05,每次只变 n-max 或 ctx。切换后两步:重启等 health ok,journal 确认
draft acceptance出现(健康≠生效)。预热 2 次 → 校准 tok/char(随机中文实测 ≈1.76,须在 1.2~2.2 区间)。
构造 prompt:随机汉字(勿用重复文本,会被 BPE 压缩),每点换 seed 防缓存;prompt 长度 = ctx×填充率(MTP 组 0.90~0.92,0.97 会 OOM)。
测速:每档 2 次取中位数,速度只认 API
timings.predicted_per_second,同时记录 acceptance(速度=基础×(1+n×acc))。可疑点加测到 6 次——acceptance 是彩票,单次速度差可达 2 倍。
上限两层验证:health ok ≠ 能服务,必须发真实大请求(127K prompt 实测 OOM),过了才算数。
收尾:恢复生产配置,用
ps核对实际启动参数。