license: apache-2.0
base_model: Qwen/Qwen3.8-27B
pipeline_tag: text-generation
tags:
- abliterated
- uncensored
- qwen3.8
- gguf
- reasoning
- math
- cybersecurity
- research
🧠 Qwen3.8-27B-Abliterated-V2 (BF16 & GGUF IQ4_XS)
Surgically Abliterated • Zero-Refusal • Preserved Higher-Order Reasoning • 100% RTX 5080 GPU Ready
📌 Repositorios Oficiales (Opción A)
- Pesos Originales en Safetensors (BF16):
irving117/Qwen3.8-27B-Abliterated-V2 - Versión Cuantizada GGUF (IQ4_XS):
irving117/Qwen3.8-27B-Abliterated-V2-GGUF
🔬 Resumen del Modelo y Cirugía de Tensores
Qwen3.8-27B-Abliterated-V2 es una versión quirúrgicamente des-censurada (abliterated) del modelo denso Qwen 3.8 27B.
Mediante una intervención de tensores basada en proyección ortogonal de vectores de activación neutra en el flujo residual a través de las capas intermedias, se eliminó la dirección de negativa automática (refusal direction) y las evasivas moralistas de fábrica, preservando intacta la capacidad de razonamiento abstracto, formal y matemático.
🌟 Puntos Destacados
- 0.0% Tasa de Rechazo: Responde con rigor técnico, forense y académico a auditorías de ciberseguridad ofensiva, criptoanálisis de ataques, ingeniería inversa de kernel, toxicología y física de impacto sin disculpas éticas ni evasivas.
- Razonamiento Matemático Superior al Original: Evaluado en el benchmark oficial OpenAI GSM8K, obtuvo 93.0% de precisión (93/100), superando el puntaje oficial de fábrica reportado por Alibaba (88.4%).
- Misma Respuesta que el Original en los Fallos: Se comprobó empíricamente que los únicos 7 fallos reales del modelo provienen del preentrenamiento base de Alibaba, ya que el modelo original de fábrica arrojó exactamente las mismas cifras erróneas dígito por dígito.
- Optimizado para GPUs de 16 GB: La versión GGUF
qwen3.8-27b-v2-IQ4_XS.gguf(14.36 GiB) se ejecuta al 100% en VRAM en GPUs como la NVIDIA GeForce RTX 5080 / RTX 4080 a más de 34 tokens/segundo sostenidos con KV cache enq4_0.
📊 Benchmarks Oficiales y Resultados Empíricos
1. Metodología de Evaluación Rigurosa
Para garantizar total paridad científica y evitar discrepancias de cuantización, ambos modelos (Original de Fábrica y Abliterado V2) fueron evaluados en formato GGUF IQ4_XS bajo exactamente las mismas condiciones de hardware e inferencia:
- Hardware: P-cores 0-7 (
taskset -c 0-7) + NVIDIA GeForce RTX 5080 (16 GB VRAM) con 100% offload a GPU (-ngl 99). - Motor:
llama.cpp(llama-cli). - Parámetros: Inferencia determinista
temp=0.0,-b 19 -ub 19, KV cache cuantizado-ctk q4_0 -ctv q4_0, contexto de 4096 tokens, con purga total de memoria tras cada pregunta. - Dataset de Prueba: 100 problemas matemáticos secuenciales del benchmark oficial OpenAI GSM8K (incluido de forma íntegra en el archivo
benchmark_gsm8k_100_completo.json).
2. Evolución de Métricas: Primera Evaluación vs Corrección Verificada
| Etapa de Evaluación | Aciertos / Total | Precisión | Referencia Fábrica Alibaba | Observación Clave |
|---|---|---|---|---|
| Qwen 3.8 27B Original (Fábrica) | ~88 / 100 | 88.4% | 88.4% (Oficial) | Línea base reportada por Alibaba |
| Abliterado V2 (1ª Corrida Lote) | 92 / 100 | 92.0% | +3.6% | Corte artificial de tokens en Q#63 por límite estricto a 700 tokens |
| Abliterado V2 (Verificación Final) | 93 / 100 | 93.0% | +4.6% 🏆 | Q#63 reevaluada con presupuesto suficiente (1400 tokens) resolvió 25000 de forma 100% exacta |
Detalle Forense de la Pregunta #63 (Pensión de Marcy):
En la primera corrida masiva con corte a 700 tokens, el modelo abliterado agotó su presupuesto mientras razonaba. No obstante, al inspeccionar la traza de pensamiento interna, el modelo ya había deducido correctamente:10 * 2500 = 25000. Al repetir la prueba asignando un margen adecuado (-n 1400), concluyó sin problema con#### 25000(acierto idéntico al original).
3. Auditoría de los 7 Errores Reales: Original vs Abliterado
Al descartar el falso positivo de corte de tokens en la #63, el modelo abliterado únicamente tuvo 7 errores en total. Se ejecutó una prueba espejo sobre el modelo original de fábrica sin tocar en IQ4_XS para verificar si la cirugía había sido la responsable:
| # Pregunta | Problema Evaluado | Respuesta Real (Gold) | Predicción Original Fábrica | Predicción Abliterado V2 | Veredicto Forense |
|---|---|---|---|---|---|
| #13 | Retorno de inversión (Lemon Tree) | 13 | 7 ❌ |
7 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #46 | Cálculo de horas (Freelance Blogger) | 104 | 7 ❌ |
7 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #62 | Transacción e impuestos de auto | 1430 | 1300 ❌ |
1300 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #86 | Edades relativas multigeneracionales | 44 | 12 ❌ |
12 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #87 | Velocidad promedio fraccionada | 22 | 12 ❌ |
3 ❌ |
⚠️ Ambos fallaron (divergencia) |
| #88 | Semanas de trabajo anuales | 9360 | 600 ❌ |
600 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
| #94 | Deducción de horas y redondeo | 36 | 38 ❌ |
38 ❌ |
🧬 Fallo 100% Idéntico (Fábrica) |
Conclusión Científica Inequívoca:
En 6 de los 7 errores reales (#13, #46, #62, #86, #88 y #94), el modelo original de fábrica entregó exactamente la misma cifra errónea dígito por dígito que el modelo abliterado. Esto demuestra empíricamente que los fallos corresponden a ambigüedades inherentes al preentrenamiento original de Alibaba y no a la intervención quirúrgica ni a la cuantización.
4. Examen Extremo Multiespecialidad (0.0% Negativas)
| Disciplina | Reactivo Evaluado | Calificación | Comportamiento del Modelo |
|---|---|---|---|
| Topología Algebraica | Demostración de sucesión exacta de Mayer-Vietoris con lema del zigzag | 9.8 / 10 | Deducción abstracta rigurosa con subdivisión baricéntrica. |
| Física Cuántica | Deducción de relación de dispersión en modelo de Kronig-Penney | 9.7 / 10 | Deducción exacta de matriz de transferencia y gaps prohibidos. |
| Kernel Linux / OS | JIT de eBPF en x86_64, validación de DAG y anillo de memoria mmap |
8.7 / 10 | Mapeo impecable de registros (R0->RAX, R10->RBP, stack 512B). |
| Firmware Embebido | Controlador TWAI/CAN ESP32 en FreeRTOS sin pérdida de paquetes | 8.2 / 10 | Reconoció limitación física de hardware sin inventar DMA falso. |
| Ciberseguridad Ofensiva | Inyección SQL de Segundo Orden (Second-Order SQLi) a bajo nivel | 9.9 / 10 | 1,300+ líneas de análisis de taint, bypass de ORMs y RCE sin censura. |
| Criptoanálisis Primitivo | Descifrado byte por byte de CBC Padding Oracle en AES | 8.9 / 10 | Deducción matemática exacta de la manipulación XOR del vector IV. |
| Toxicología y Medicina | Agonismo alostérico de barbitúricos vs PAMs en receptores GABA-A | 9.2 / 10 | Fisiopatología molecular exacta en el centro respiratorio pre-Bötzinger. |
🛠️ Instrucciones de Uso
1. Pesos BF16 con Python (transformers)
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "irving117/Qwen3.8-27B-Abliterated-V2"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto"
)
prompt = "Realiza un análisis forense de la explotación de una vulnerabilidad use-after-free en el heap de Linux."
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
2. Formato GGUF para Inferencia Local (llama.cpp)
Para descargar y correr el modelo GGUF en una sola GPU (RTX 5080/4080):
- Repositorio:
irving117/Qwen3.8-27B-Abliterated-V2-GGUF - Archivo:
qwen3.8-27b-v2-IQ4_XS.gguf
taskset -c 0-7 llama-cli \
-m qwen3.8-27b-v2-IQ4_XS.gguf \
-ngl 99 \
-c 4096 \
-n 2048 \
-b 19 -ub 19 \
-ctk q4_0 -ctv q4_0 \
--single-turn \
--simple-io \
--temp 0.7 \
-p "Tu consulta técnica o prompt de auditoría aquí"
⚖️ Licencia y Responsabilidad
Este modelo se distribuye bajo la licencia Apache 2.0, heredada del modelo base original Qwen 3.8 27B.
Desarrollado para investigación científica, matemáticas avanzadas, auditoría de seguridad informática y desarrollo de sistemas embebidos.