base_model: huihui-ai/gemma-4-E4B-it-abliterated
language:
- en
- es
license: gemma
tags: - gemma-4
- abliterated
- uncensored
- awq
- quantized
- text-generation
- compressed-tensors
pipeline_tag: text-generation
quantized_by: kamotecito
Huihui-gemma-4-E4B-it-abliterated — AWQ W4A16
Cuantización AWQ W4A16 del modelo huihui-ai/gemma-4-E4B-it-abliterated, generada con llm-compressor usando el algoritmo AWQ (Activation-aware Weight Quantization).
Descripción del Modelo Base
Gemma-4-E4B-it-abliterated es una versión abliterada (sin censura de respuestas) del modelo multimodal Gemma 4 de Google, con 4 mil millones de parámetros efectivos. Está ajustado para instrucciones y mantiene capacidades de visión y audio de la arquitectura Gemma 4.
Cuantización
| Parámetro | Valor |
|---|---|
| Método | AWQ (Activation-aware Weight Quantization) |
| Esquema | W4A16 (pesos INT4, activaciones FP16) |
| Group size | 128 |
| Formato | compressed-tensors (pack-quantized) |
| Herramienta | llm-compressor (vLLM project) |
| Capas cuantizadas | Todas las Linear layers del language_model (0–41), excepto lm_head, embed_tokens, torres de visión/audio |
| Capas NO cuantizadas | embed_tokens, embed_tokens_per_layer, lm_head, audio_tower, vision_tower (BF16) |
| Tiempo de cuantización | ~6.68 horas en 2× Tesla T4 (Kaggle) |
Nota de tamaño: El modelo pesa 9.5 GB en INT4 porque la arquitectura Gemma 4 incluye embeddings muy grandes (
embed_tokens[262144, 2560] +embed_tokens_per_layer[262144, 10752]) que permanecen en BF16, además de las torres de visión y audio sin cuantizar.
Uso con vLLM
from vllm import LLM, SamplingParams
llm = LLM(
model="rangtax43/Huihui-gemma-4-E4B-it-abliterated-AWQ-W4A16",
quantization="compressed-tensors",
dtype="bfloat16",
max_model_len=8192,
gpu_memory_utilization=0.90,
enforce_eager=True,
)
sampling_params = SamplingParams(temperature=0.7, max_tokens=512)
outputs = llm.generate(["Hola, ¿cómo estás?"], sampling_params)
print(outputs[0].outputs[0].text)
Servidor OpenAI-compatible
python -m vllm.entrypoints.openai.api_server \
--model rangtax43/Huihui-gemma-4-E4B-it-abliterated-AWQ-W4A16 \
--quantization compressed-tensors \
--dtype bfloat16 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--enable-prefix-caching \
--port 8000
Archivos
| Archivo | Tamaño | Descripción |
|---|---|---|
model.safetensors |
~9.4 GB | Pesos cuantizados AWQ W4A16 |
config.json |
27 KB | Configuración del modelo Gemma 4 |
tokenizer.json |
31 MB | Tokenizador SentencePiece |
tokenizer_config.json |
2.7 KB | Configuración del tokenizador |
chat_template.jinja |
12 KB | Plantilla de chat |
generation_config.json |
204 B | Configuración de generación por defecto |
recipe.yaml |
982 B | Receta AWQ usada para cuantización |
Licencia
Este modelo hereda la licencia Gemma Terms of Use del modelo base. Úsalo responsablemente.