license: apache-2.0
base_model:
- huihui-ai/Qwen2.5-72B-Instruct-abliterated
license: apache-2.0
base_model: Qwen/Qwen2.5-72B-Instruct
tags:
- qwen
- qwen2.5
- text-generation
- gguf
- abliterated
- uncensored
Qwen2.5-72B-Instruct-abliterated - GGUF
Esta es la colección completa de cuantizaciones en formato GGUF del modelo Qwen2.5-72B-Instruct-abliterated, optimizadas para su uso en hardware local mediante herramientas como llama.cpp, Ollama, LM Studio o Text-Generation-WebUI.
El modelo base ha sido procesado mediante técnicas de abliteration para remover las barreras de alineación y censura artificiales del modelo original, manteniendo intactas sus capacidades lógicas y de codificación.
📋 Archivos Disponibles y Recomendaciones
| Archivo | Tamaño (Aprox) | Bits por Peso (BPW) | Descripción y Uso Recomendado |
|---|---|---|---|
Qwen2.5-72B-Instruct-abliterated-F16.gguf |
~145.4 GB | 16.00 | Modelo Base Completo. Máxima precisión absoluta. Requiere hardware empresarial o servidores en la nube. |
Qwen2.5-72B-Instruct-abliterated-Q8_0.gguf |
~77.3 GB | 8.50 | Calidad Máxima. Pérdida de precisión imperceptible frente al original. Recomendado para GPUs masivas (ej. CMP 170HX / A100). |
Qwen2.5-72B-Instruct-abliterated-Q6_K.gguf |
~64.3 GB | 6.59 | Entusiasta. Excelente retención de inteligencia con un ahorro de espacio notable frente a los 8 bits. |
Qwen2.5-72B-Instruct-abliterated-Q5_K_M.gguf |
~54.4 GB | 5.69 | El Punto Dulce (Recomendado). Utiliza cuantización mixta de 5 y 6 bits. Conserva casi el 99% de la precisión original. |
Qwen2.5-72B-Instruct-abliterated-Q5_K_S.gguf |
~51.4 GB | 5.54 | Versión ligeramente más ligera que la 'M', ideal para ajustar el espacio en VRAM. |
Qwen2.5-72B-Instruct-abliterated-Q4_K_M.gguf |
~47.4 GB | 4.85 | El más Popular. El equilibrio perfecto entre velocidad, tamaño y retención lógica para setups hogareños avanzados. |
Qwen2.5-72B-Instruct-abliterated-Q4_K_S.gguf |
~43.9 GB | 4.58 | Versión compacta de 4 bits, prioriza la velocidad sacrificando una mínima precisión. |
Qwen2.5-72B-Instruct-abliterated-Q3_K_L.gguf |
~39.5 GB | 4.01 | La mejor variante de 3 bits. Útil si necesitás que entre sí o sí en configuraciones de memoria más ajustadas. |
Qwen2.5-72B-Instruct-abliterated-Q3_K_M.gguf |
~37.7 GB | 3.66 | Cuantización media de 3 bits. Se empieza a notar pérdida de coherencia en tareas lógicas complejas. |
Qwen2.5-72B-Instruct-abliterated-Q3_K_S.gguf |
~34.5 GB | 3.44 | Variante ligera de 3 bits. Máxima compresión antes de la degradación severa. |
Qwen2.5-72B-Instruct-abliterated-Q2_K.gguf |
~29.8 GB | 2.90 | Compresión Extrema. El modelo es muy propenso a errores lógicos, bucles de texto o respuestas incoherentes. Solo para experimentación. |
🚀 ¿Cómo usar estos archivos?
Con llama.cpp (Terminal)
Podés ejecutar cualquiera de estos modelos utilizando el siguiente comando base:
./llama-cli -m Qwen2.5-72B-Instruct-abliterated-Q4_K_M.gguf -n 512 -p "Escribe una historia sobre un viaje en el tiempo."
Créditos
- Modelo Base: Qwen Team (
Qwen2.5-72B-Instruct) - Abliterated por: (Menciona al autor original del abliterated si aplica, o a vos mismo si lo hiciste vos)
- Cuantizado por: Thaurock