library_name: gguf
license: apache-2.0
license_link: https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE
base_model:
- bowmanslayer/Qwen3.5-9B-Uncensored
base_model_relation: quantized
tags: - uncensored
- abliterated
- qwen3.5
- gguf
- llama.cpp
language: - en
- zh
Qwen3.5-9B-Uncensored-GGUF
llama.cpp GGUF 量化,多档,基于
bowmanslayer/Qwen3.5-9B-Uncensored。
注意:GGUF 主要走 llama.cpp 侧,视觉塔转换 llama.cpp 现有支持通过 mmproj-*.gguf
配套文件实现(如已提供),否则本 GGUF 仅为文字侧推理使用。要用视觉能力请用主仓 bf16
或 W4A16 版本 + vLLM。
一、量化档次
| 文件 | 位深 | 大小 | 用途 |
|---|---|---|---|
Qwen3.5-9B-Uncensored-BF16.gguf |
bf16 | ~18 GB | 参考,GPU 24GB+ |
Qwen3.5-9B-Uncensored-Q8_0.gguf |
Q8_0 | ~10 GB | 近无损,16 GB+ GPU |
Qwen3.5-9B-Uncensored-Q6_K.gguf |
Q6_K | ~7.6 GB | 高质量,12 GB+ GPU |
Qwen3.5-9B-Uncensored-Q5_K_M.gguf |
Q5_K_M | ~6.5 GB | 平衡,12 GB GPU |
Qwen3.5-9B-Uncensored-Q4_K_M.gguf |
Q4_K_M | ~5.5 GB | 激进,8 GB+ GPU |
Qwen3.5-9B-Uncensored-IQ4_XS.gguf |
IQ4_XS | ~5 GB | 更小,8 GB GPU |
二、llama.cpp 使用
推荐(开 int8 KV 拿到更大上下文):
./llama-server \
-m Qwen3.5-9B-Uncensored-Q6_K.gguf \
--ctx-size 32768 \
--n-gpu-layers -1 \
-ctk q8_0 -ctv q8_0 \
--host 0.0.0.0 --port 8080
单条推理:
./llama-cli -m Qwen3.5-9B-Uncensored-Q6_K.gguf -p "Hello" \
-n 512 --n-gpu-layers -1 -ctk q8_0 -ctv q8_0
三、和 vLLM W4A16 版本的选择
- 单用户轻量部署 / mac 上跑 → GGUF Q6_K 或 Q5_K_M
- 服务器多并发 / 高吞吐 / 大上下文 → W4A16 + vLLM
(bowmanslayer/Qwen3.5-9B-Uncensored-W4A16)
四、方法与限制
见主仓 bowmanslayer/Qwen3.5-9B-Uncensored。
五、署名
基座模型见 Qwen/Qwen3.5-9B,Apache 2.0。