library_name: transformers
license: apache-2.0
license_link: https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE
pipeline_tag: image-text-to-text
base_model:
- bowmanslayer/Qwen3.5-9B-Uncensored
base_model_relation: quantized
tags: - uncensored
- abliterated
- qwen3.5
- multimodal
- w4a16
- gptq
language: - en
- zh
Qwen3.5-9B-Uncensored-W4A16
INT4 weight + FP16 activation 量化版,基于
bowmanslayer/Qwen3.5-9B-Uncensored。
方法:AutoRound → GPTQ 格式,vLLM gptq_marlin 快速核可用。
配合 fp8_e5m2 KV cache 拿到超同尺寸对手 60-80% 的上下文容量。
一、快速开始
推荐 vLLM 启动(已开 fp8 KV,开箱最佳上下文):
vllm serve bowmanslayer/Qwen3.5-9B-Uncensored-W4A16 \
--dtype float16 --tensor-parallel-size 2 \
--kv-cache-dtype fp8_e5m2 \
--max-model-len 28672 --max-num-seqs 16 \
--reasoning-parser qwen3
单卡也可:
vllm serve bowmanslayer/Qwen3.5-9B-Uncensored-W4A16 \
--dtype float16 --tensor-parallel-size 1 \
--kv-cache-dtype fp8_e5m2 --gpu-memory-utilization 0.92
二、量化不破消融(验证过)
12 条 harmful 快验:W4A16 quantized 拒绝率 = 0/10(文字 0/6,图像 0/4),
与 bf16 原模的 2/100(0.02)量级一致。量化没引入任何拒绝回退。
主仓 bf16 的完整能力评测、四方对比表、拒绝率对比见
bowmanslayer/Qwen3.5-9B-Uncensored 主 README。
三、和常见 ~8GB 版本的上下文对比
Qwen3.5-9B 架构 = 32 层(24 linear + 8 full attention),hidden 3584。KV cache 只对
full attention 层随 context 线性增长,因此本节数字是理论算(不含 CUDA graph overhead
等,实测偏差 <5%)。
每 token KV cache 大小:
- fp16 KV:2 (K+V) × 8 层 × 3584 × 2 字节 = 114 KB / token
- fp8 KV(本模型默认):2 × 8 × 3584 × 1 = 57 KB / token(-50%)
单卡 NVIDIA GPU 上,减去权重 + ~1 GB overhead,剩余可分配给 KV cache:
| GPU | 本模型 W4A16(8.2 GB) + fp8 KV | 同尺寸 GGUF Q6_K(7.6 GB) + f16 KV(llama.cpp 默认) |
|---|---|---|
| 12 GB(RTX 3060 12G / 4070 等) | ~48k tokens | ~30k tokens |
| 16 GB(RTX 4060 Ti / 4070 Ti Super 等) | ~120k tokens | ~65k tokens |
| 24 GB(RTX 3090 / 4090) | ~256k tokens(接近模型最大 262k) | ~135k tokens |
要点:
- 我们的推荐启动默认就是 fp8_e5m2 KV,无需手动配置
- GGUF 用户要拿到同等上下文,需手动加
-ctk q8_0 -ctv q8_0(int8 KV,类似效果),
但大部分社区帖不给,默认体验只到我们一半 - 12 GB 显卡的差异最大(48k vs 30k,+60% 上下文)—— 是这类中端卡上最有感知的价值差
四、显存与量化档次对照
以 W4A16 权重 8.2 GB 为基准:
| 场景 | 权重 | KV(28k ctx,batch=1) | 系统 overhead | 合计 | 建议 GPU |
|---|---|---|---|---|---|
| 本模型 + fp8 KV,batch=1 | 8.2 | ~1.6 | ~1.5 | ~11.3 GB | 12 GB ✓ |
| 本模型 + fp8 KV,batch=8 | 8.2 | ~12.5 | ~1.5 | ~22 GB | 24 GB |
| 本模型 + fp16 KV,batch=1 | 8.2 | ~3.2 | ~1.5 | ~12.9 GB | 16 GB |
五、方法与限制
见主仓 bowmanslayer/Qwen3.5-9B-Uncensored。
量化配方:AutoRound --bits 4 --group_size 128 --format auto_round:auto_gptq --nsamples 256 --seqlen 2048,linear_attn.in_proj_a/b(48 张量,ssm 计算不可量化)
排除。视觉塔和 MTP 头随语言层一同处理为 int4。
MTP speculative decoding 不推荐启用(vLLM 0.20.2 实测减速 40-46%,K=5 崩溃)。
六、署名
基座模型见 Qwen/Qwen3.5-9B,Apache 2.0。
本仓是 bowmanslayer 消融版的 W4A16 量化。