license: apache-2.0
task_categories:
- text-generation
language: - en
tags: - imatrix
- quantization
- uncensored
- gguf
- reasoning
size_categories: - 1K<n<10K
Uncensored-Imatrix-Calibration-Mixed-Data (5,000 Samples)
Overview
This dataset contains 5,000 multi-domain conversational samples engineered specifically for importance matrix (imatrix) computation during low-bit LLM quantization (GGUF, AWQ, EXL2).
Calibrating on generic corpora (such as raw Wikipedia dumps) frequently causes safety-induced logic degradation and lobotomizes unaligned behavior, as standard quantizers assign low activation sensitivity to rarely-activated unaligned channels. This dataset preserves critical unaligned and dual-use neural pathways while maintaining high-order reasoning.
Methodology & Domain Balancing
The 5,000 rows follow a strict mixed distribution designed to simulate Unsloth dynamic calibration:
- Uncensored Alpaca Blend (~22%): 11 unaligned Alpaca variants targeting edge-case prompts to shield refusal bypasses.
- Polyglot Code & Architecture (~23%): 15 programming languages, frontend/backend logic, and system-level engineering.
- Cyber Reasoning & CoT (~9%): Explicit
<think>traces and tool calls to preserve internal latent reasoning. - Multi-Turn Roleplay & Fiction (~29%): Rich NPC interactions and filtered Gutenberg creative writing (chosen branches only).
- Conversational & Factual (~17%): Multi-turn ShareGPT unfiltered interactions and Dolly open-domain QA.
Schema
Shipped in universal, model-agnostic chat format:
{
"id": "domain_00001",
"domain": "code_reasoning",
"source": "CodeFeedback",
"messages": [
{"role": "user", "content": "..."},
{"role": "assistant", "content": "..."}
]
}
Apply your target model's chat template before feeding to llama-imatrix.