license: apache-2.0
base_model: irving117/Qwen3.8-27B-Abliterated-V2
pipeline_tag: text-generation
tags:
- abliterated
- uncensored
- qwen3.8
- gguf
- llama.cpp
- reasoning
- math
- cybersecurity
⚡ Qwen3.8-27B-Abliterated-V2-GGUF (IQ4_XS)
100% RTX 5080 / RTX 4080 (16 GB VRAM) Ready • Zero-Refusal • 93.0% en GSM8K • 34+ t/s
📌 Repositorios Oficiales (Opción A)
- Versión Cuantizada GGUF (Este Repo):
irving117/Qwen3.8-27B-Abliterated-V2-GGUF - Pesos Originales en Safetensors (BF16):
irving117/Qwen3.8-27B-Abliterated-V2
🚀 Archivos Disponibles en este Repositorio
| Archivo | Cuantización | Tamaño | RAM/VRAM Requerida | Velocidad Estimada (RTX 5080) |
|---|---|---|---|---|
qwen3.8-27b-v2-IQ4_XS.gguf |
IQ4_XS (4.25 bpw) | 14.36 GiB | ~15.2 GB VRAM (con KV q4_0) |
34.0+ tokens/segundo |
Diseñado específicamente para GPUs de 16 GB: Permite descargar el 100% de las 65 capas del modelo a la VRAM (
-ngl 99), dejando 0 capas en CPU.
📊 Rendimiento Matemático y Auditoría de Errores (GSM8K)
1. Metodología de Comparativa Idéntica
Para asegurar rigor científico, tanto el modelo original de fábrica como el modelo abliterado V2 fueron evaluados bajo el mismo formato (GGUF IQ4_XS) y los mismos parámetros deterministas:
- Entorno: P-cores 0-7 (
taskset -c 0-7) + NVIDIA GeForce RTX 5080 16GB VRAM (-ngl 99). - Inferencia:
llama.cpp(llama-cli),temp=0.0,-b 19 -ub 19, KV cache cuantizado-ctk q4_0 -ctv q4_0, contexto 4096. - Dataset: 100 preguntas del benchmark oficial OpenAI GSM8K (incluido en este repositorio en
benchmark_gsm8k_100_completo.json).
2. Puntuaciones y Verificación de la Pregunta #63
| Modelo / Evaluación | Aciertos / 100 | Precisión | Estado |
|---|---|---|---|
| Qwen 3.8 27B Original (Fábrica Alibaba) | ~88 / 100 | 88.4% | Referencia oficial de fábrica |
| Abliterado V2 (1ª Corrida en Lote) | 92 / 100 | 92.0% | Corte de tokens a 700 tokens en pregunta #63 |
| Abliterado V2 (Verificación Final) | 93 / 100 | 93.0% 🏆 | +4.6% superior al original de fábrica |
Nota sobre el corte de tokens en Q#63 (Pensión de Marcy):
En la primera corrida masiva con corte estricto a 700 tokens, el modelo abliterado agotó el presupuesto mientras razonaba (su traza interna ya marcaba la deducción exacta:$10 \times 2,500 = 25,000$). Al re-evaluar la pregunta con suficiente presupuesto (-n 1400), concluyó con#### 25000de forma 100% exacta.
3. Comparativa Forense de los 7 Errores Reales
El modelo abliterado tuvo únicamente 7 fallos reales. Al evaluarse el modelo original de fábrica bajo el mismo GGUF IQ4_XS se descubrió lo siguiente:
| # Pregunta | Problema Evaluado | Respuesta Real (Gold) | Original Fábrica (IQ4_XS) | Abliterado V2 (IQ4_XS) | Veredicto |
|---|---|---|---|---|---|
| #13 | Lemon Tree ROI | 13 | 7 ❌ |
7 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #46 | Freelance Blogger Hours | 104 | 7 ❌ |
7 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #62 | Car Transaction & Taxes | 1430 | 1300 ❌ |
1300 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #86 | Multigenerational Ages | 44 | 12 ❌ |
12 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #87 | Fractional Speed | 22 | 12 ❌ |
3 ❌ |
⚠️ Ambos fallaron |
| #88 | Annual Working Weeks | 9360 | 600 ❌ |
600 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #94 | Working Hours Deduction | 36 | 38 ❌ |
38 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
En 6 de los 7 errores reales, el modelo original de fábrica arrojó exactamente el mismo número incorrecto dígito por dígito. Esto prueba de manera irrefutable que los errores son preexistentes en el preentrenamiento original de Alibaba y no atribuibles a la cirugía de abliteración ni a la cuantización GGUF.
💻 Comandos de Ejecución
1. Inferencia Directa con llama.cpp
taskset -c 0-7 llama-cli \
-m qwen3.8-27b-v2-IQ4_XS.gguf \
-ngl 99 \
-c 4096 \
-n 2048 \
-b 19 -ub 19 \
-ctk q4_0 -ctv q4_0 \
--single-turn \
--simple-io \
--temp 0.7 \
-p "Tu consulta técnica o prompt de auditoría aquí"
2. Modelfile para Ollama
Crea un archivo Modelfile:
FROM ./qwen3.8-27b-v2-IQ4_XS.gguf
PARAMETER temperature 0.7
PARAMETER num_ctx 4096
PARAMETER num_gpu 99
Y compílalo en Ollama:
ollama create qwen3.8-27b-abliterated-v2:iq4xs -f Modelfile
ollama run qwen3.8-27b-abliterated-v2:iq4xs
⚖️ Licencia
Distribuido bajo licencia Apache 2.0.