license: apache-2.0
base_model:
- huihui-ai/DeepSeek-R1-Distill-Llama-70B-abliterated
tags:
- llama
- llama3
- deepseek
- deepseek-r1
- text-generation
- gguf
- abliterated
- uncensored
- reasoning
DeepSeek-R1-Distill-Llama-70B-abliterated - GGUF
Esta es la colección integral y completa de cuantizaciones en formato GGUF del modelo DeepSeek-R1-Distill-Llama-70B-abliterated, preparadas localmente para su uso con llama.cpp, Ollama, LM Studio o Text-Generation-WebUI.
Este modelo combina la destilación de razonamiento avanzado (capacidad de pensamiento lógico profundo mediante tags <think>) basada en el modelo Llama-70B de Meta, pero procesada con técnicas de abliteration para remover de raíz los bloqueos y filtros de censura artificiales del sistema, respondiendo sin restricciones.
📋 Archivos Disponibles (Colección Completa sin Splits)
| Archivo | Tamaño Est. | BPW (Bits por Peso) | Perfil de Uso Recomendado |
|---|---|---|---|
DeepSeek-R1-Distill-Llama-70B-abliterated-F16.gguf |
~141.0 GB | 16.00 | Molde Base Completo. Fidelidad absoluta de los pesos en coma flotante. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q8_0.gguf |
~75.0 GB | 8.50 | Calidad idéntica al original, ideal para exprimir en tarjetas masivas locales como la GPU NVIDIA A100. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q6_K.gguf |
~60.0 GB | 6.59 | Altísima retención del árbol de razonamiento lógico con un peso optimizado. Ideal para exprimir en tarjetas masivas locales como la GPU NVIDIA CMP-170HX. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q5_K_M.gguf |
~52.0 GB | 5.69 | Punto Dulce Recomendado. Mantiene intacta la coherencia del pensamiento profundo reduciendo el peso de forma crítica. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q5_K_S.gguf |
~50.0 GB | 5.54 | Variante de 5 bits compacta. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q4_K_M.gguf |
~44.0 GB | 4.85 | El más buscado. Balance óptimo para correr inferencias de 70B en setups hogareños avanzados. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q4_K_S.gguf |
~41.0 GB | 4.58 | Variante compacta de 4 bits para acelerar la velocidad de tokens por segundo. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q3_K_L.gguf |
~37.0 GB | 4.01 | Compresión media alta de 3 bits. Conserva el razonamiento básico. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q3_K_M.gguf |
~34.0 GB | 3.66 | Variante de 3 bits intermedia. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q3_K_S.gguf |
~31.0 GB | 3.44 | Variante de 3 bits ligera. |
DeepSeek-R1-Distill-Llama-70B-abliterated-Q2_K.gguf |
~28.0 GB | 2.90 | Compresión Extrema. Puede experimentar problemas menores en la estructura de las etiquetas internas <think>. Solo para desarrollo experimental. |
Nota: Los tamaños son estimaciones iniciales de referencia basadas en el peso nativo del modelo en safetensors; se recomienda verificar el tamaño final en disco tras la compilación local.
💡 Modo de Uso Destacado
Al ser un modelo de razonamiento, se recomienda utilizar un formato de prompt limpio que respete la generación nativa de la cadena de pensamiento:
./llama-cli -m DeepSeek-R1-Distill-Llama-70B-abliterated-Q4_K_M.gguf -n 1024 -p "<|begin_of_text|><|start_header_id|>user<|end_header_id|>\n\n¿Cómo funciona un reactor de fusión nuclear?<|eot_id|><|start_header_id|>assistant<|end_header_id|>\n\n<think>\n"