0
0

单卡2080Ti部署Qwen3.6-35B-A3B IQ4_XS量化输出速度实测

2026-09-01

关键词: #本地AI大模型 #Qwen3.6 #2080Ti 22G #大模型速度测试

废话(请跳过)

>因为我直到3.8-27B推出后才想起来之前测试的Qwen3.6模型的性能数据,所以来补发一下,这个模型基本已经过时了,就不写些什么长篇大论之类的来和别的模型比较了,仅仅提供配置与测试结果,仅供参考

>本文中的测试内容不包含不同量化的性能对比,仅仅是不同配置下的生成速度对比,关于性能您可以另寻它文

>本站还有一篇Qwen3.8-27B大模型在2080Ti单卡部署的测试结果,感兴趣可以去看看【】

Q1:为什么没用Q4_K_M量化?

A1:当使用Q4_K_M量化时,仅仅模型权重就占用了接近20G的显存,应对长上下文显得力不从心,而使用Q_XS量化时,可以保证在256K满血上下文时保持1G左右的显存余量,避免降速

硬件配置清单

项目

配置

CPU

E3 1260 LV5 @ 3.9GHz,4C8T,TDP 45W

显卡

撼影 魔改2080Ti 22G

内存

DDR4 16G 3400MHz (单条)

一、上下文对生成速度的影响

单请求生成速度基本随着输入上下文长度而线性下降,当输入长度仅20K的较短上下文时,Qwen3.6-35B-A3B Q4_XS量化模型的直接输出速度达到了惊人的 86.9 token/s,即使是输入长度为196K的超长上下文,其依旧能保持 29.1 token/s 的速度

Qwen3.6-35B-A3B IQ4_XS 无MTP生成速度vs上下文长度.webp
Qwen3.6-35B-A3B IQ4_XS 无MTP生成速度vs上下文长度

二、MTP对生成速度的影响

对不同倍率情况下的MTP进行了测试,可见当MTP n-max2时,输出速度达到最大值,并且也保留了相对可观的上下文长度

当MTP取值大于2时,出现了较为明显的降速

Qwen3.6-35B-A3B IQ4_XS 生成速度vs上下文长度.webp
Qwen3.6-35B-A3B IQ4_XS 生成速度vs上下文长度
Qwen3.6-35B-A3B IQ4_XS mtp对生成速度的影响.webp
Qwen3.6-35B-A3B IQ4_XS mtp对生成速度的影响

测试方法:

  1. 固定底座-ngl 999 --no-mmap + KV q4_0 + --spec-draft-p-min 0.05,每次只变 n-max 或 ctx。

  2. 切换后两步:重启等 health ok,journal 确认 draft acceptance 出现(健康≠生效)。

  3. 预热 2 次校准 tok/char(随机中文实测 ≈1.76,须在 1.2~2.2 区间)。

  4. 构造 prompt:随机汉字(勿用重复文本,会被 BPE 压缩),每点换 seed 防缓存;prompt 长度 = ctx×填充率(MTP 组 0.90~0.92,0.97 会 OOM)。

  5. 测速:每档 2 次取中位数,速度只认 API timings.predicted_per_second,同时记录 acceptance(速度=基础×(1+n×acc))。

  6. 可疑点加测到 6 次——acceptance 是彩票,单次速度差可达 2 倍。

  7. 上限两层验证:health ok ≠ 能服务,必须发真实大请求(127K prompt 实测 OOM),过了才算数。

  8. 收尾:恢复生产配置,用 ps 核对实际启动参数。

单卡2080Ti部署Qwen3.6-35B-A3B IQ4_XS量化输出速度实测
/archives/dan-qia-2080tibu-shu-qwen3.6-35b-a3bxing-neng-shi-ce
作者
雨晨_Ethan
发布于
2026-09-01
许可协议
CC BY-NC-SA 4.0

评论