license: apache-2.0
base_model: huihui-ai/Huihui-Qwen3-VL-8B-Instruct-abliterated
base_model_relation: quantized
pipeline_tag: image-text-to-text
tags:
- qwen3_vl
- awq
- int4
- w4a16
- compressed-tensors
- vllm
- abliterated
library_name: transformers
Huihui-Qwen3-VL-8B-Instruct-abliterated-AWQ-int4
Quantização AWQ int4 (W4A16) de huihui-ai/Huihui-Qwen3-VL-8B-Instruct-abliterated,
produzida com llm-compressor.
Configuração (ajustada para máxima precisão)
- Esquema: W4A16 (pesos int4 simétricos por grupo, ativações em 16-bit)
group_size: 32- Amostras de calibração: 512 (lmms-lab/flickr30k)
max_seq_length: 2048duo_scaling: False- Mantidos em bf16 (não quantizados): torre de visão (
visual.*) elm_head
Uso com vLLM
vllm serve quant-mind/Huihui-Qwen3-VL-8B-Instruct-abliterated-AWQ-int4 --quantization compressed-tensors --max-model-len 8192