license: apache-2.0
library_name: mlx
base_model: treadon/granite-4.1-3b-Abliterated-AND-Disinhibited
tags:
- abliteration
- disinhibition
- granite
- mechanistic-interpretability
- mlx
pipeline_tag: text-generation
granite-4.1-3b-Abliterated-AND-Disinhibited-mxfp8-mlx
Brainwaves
arc arc/e boolq hswag obkqa piqa wino
mxfp8 0.405,0.598,0.843,0.520,0.442,0.713,0.582
Quant Perplexity Peak Memory Tokens/sec
mxfp8 11.595 ± 0.129 6.58 GB 1594
Original model
granite-4.1-3b
mxfp8 0.406,0.581,0.821,0.484,0.434,0.712,0.559
Quant Perplexity Peak Memory Tokens/sec
mxfp8 11.346 ± 0.127 6.58 GB 1690
This model granite-4.1-3b-Abliterated-AND-Disinhibited-mxfp8-mlx was
converted to MLX format from treadon/granite-4.1-3b-Abliterated-AND-Disinhibited
using mlx-lm version 0.31.3.
Use with mlx
pip install mlx-lm
from mlx_lm import load, generate
model, tokenizer = load("granite-4.1-3b-Abliterated-AND-Disinhibited-mxfp8-mlx")
prompt = "hello"
if tokenizer.chat_template is not None:
messages = [{"role": "user", "content": prompt}]
prompt = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_dict=False,
)
response = generate(model, tokenizer, prompt=prompt, verbose=True)