license: apache-2.0
tags:
- uncensored
- qwen3.5
- moe
- safetensors
- fp8
- vision
- multimodal
language: - en
- zh
- multilingual
pipeline_tag: image-text-to-text
base_model: Li101/Qwen3.5-35B-A3B-Uncensored-Aggressive-safetensors
Qwen3.5-35B-A3B-Uncensored-Aggressive-FP8
FP8 quantized version of Li101/Qwen3.5-35B-A3B-Uncensored-Aggressive-safetensors, which is the "Aggressive" uncensoring variant of Qwen/Qwen3.5-35B-A3B. Quantized to FP8 (W8A8) with block-wise 128×128 scales, matching the official Qwen/Qwen3.5-35B-A3B-FP8 format.
Quantization Details
| Detail | Value |
|---|---|
| Method | FP8 W8A8, dynamic activation |
| Scale block size | 128×128 |
| Model size | 36 GB (vs 67 GB BF16) |
| Excluded from quantization | Embeddings, lm_head, conv1d, MoE gates, shared expert gates, linear attention projections |
Usage with vLLM
vllm serve Li101/Qwen3.5-35B-A3B-Uncensored-Aggressive-FP8 \
--kv-cache-dtype fp8 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
Specs
Same architecture and capabilities as Qwen/Qwen3.5-35B-A3B.