← back to catalog · registered 2026-09-21 03:56

kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ

kataguru 9B multimodal second-order
curl -H "Authorization: Bearer $ABL_KEY" \
     "https://abliteration.org/api/v1/models/kataguru%2FQwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ"
Response includes
  • classification m3
  • files 14
  • author_summary 2 models
  • readme_text full
10 credits · hourly refresh · ~4 KB payload Get an API key →
Abliteration classifier · v1.0.0
M3
Primary method

Layer-wise ablation

Applied on top of direct removal inherited from the base model.
Confidence
HIGH
Inherited from base model
Why this label 2 signals
Producer identity confirmed by naming conventions, tags or the model card. This label is very unlikely to change.
  • 'heretic' in model name (Heretic-produced)
  • Heretic uses layer-wise optimization (M3) with underlying direction removal (M1)
Refusal direction extracted via
Extraction technique

Difference-of-means

Confidence
HIGH
Why we say so
name contains 'heretic'; Heretic default extraction is difference-of-means (Arditi 2024)
Downloads · 30-day
0
Likes
0
Model age
today
created 2026-09-21

Genealogy 0 direct forks

Full fork graph →

This model's place in the market. Above: what it was derived from. Below: the tree of everything derived from it.

Metadata

License
apache-2.0
Languages
fi en
Tags
safetensors qwen3_5 qwen qwen3.5 finnish awq w4a16 compressed-tensors vllm uncensored vision multimodal

Related

Total size
8.45 GB
Files
14
Quantizations
1
Registered
2026-09-21 03:56
Last updated on HF
2026-09-21 03:59

Files by quantization

Auxiliary files 14 files 8.47 GB
model-00003-of-00003.safetensors 3.24 GB 5c0114a3 download
model-00001-of-00003.safetensors 2.74 GB 47cccce1 download
model-00002-of-00003.safetensors 2.01 GB 2f51ba70 download
model-nonquant.safetensors 464 MB e9f83dae download
tokenizer.json 19.1 MB 06b95093 download
model.safetensors.index.json 132 KB 406bd0e4 download
chat_template.jinja 21.2 KB 70567765 download
config.json 14.5 KB d86737e8 download
README.md 4.71 KB ec660712 download
.gitattributes 1.53 KB 52373fe2 download
tokenizer_config.json 1.14 KB 1d134cd2 download
video_preprocessor_config.json 590 B b58ed867 download
preprocessor_config.json 483 B 4bdb4383 download
generation_config.json 164 B aaaf57bd download

README current version from Hugging Face


license: apache-2.0
base_model: petruhonk/Qwen3.8-9B-Distill-uncensored-heretic
language:

  • fi
  • en
    pipeline_tag: image-text-to-text
    tags:
  • qwen
  • qwen3.5
  • finnish
  • awq
  • w4a16
  • compressed-tensors
  • vllm
  • uncensored
  • vision
  • multimodal

Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ

Tämä on W4A16 AWQ (compressed-tensors) -kvantisoitu ja vLLM-optimoitu monimodaalinen versio mallista petruhonk/Qwen3.8-9B-Distill-uncensored-heretic.

Malli on kalibroitu laadukkaalla suomenkielisellä monialaisella aineistolla (256 monikierrosnäytettä: suomalainen kulttuuri, IT/Linux, tiede ja neurobiologia, oikeus ja filosofia, asiaproosa sekä sensuroimaton dialogi). Kvantisointi on toteutettu llm-compressor -työkalulla suoraan virheettömistä BF16-lähdepainoista.

GGUF-versiot löydät täältä: kataguru/Qwen3.8-9B-Distill-uncensored-heretic-GGUF.


Keskeiset ominaisuudet & Suorituskyky

  1. Huikea suorituskyky ja nopeus:

    • Vasteaika ja nopeus tuotantokäytössä vLLM:ssä (TP=2, FP8 KV): 255 – 279 tokenia sekunnissa.
    • Ensimmäisen tokenin viive (TTFT): vain 0.18 – 0.22 sekuntia.
    • Kompakti VRAM-jalanjälki: vain ~9.1 GB levytilaa ja minimaalinen muistinkulutus.
  2. Monimodaalisuus & Vision-tuki:

    • Täysi näköaistin tuki (Vision/Image-to-Text). Mukana esiprosessorit (preprocessor_config.json, video_preprocessor_config.json).
    • Testattu tunnistamaan ja analysoimaan monimutkaisia kuvia, geometrisia muotoja ja visuaalista tekstiä salamannopeasti.
  3. Suomen kielen ja sanaston kalibrointi:

    • Korjaa puhtaasti englanninkielisen kvantisoinnin heikkoudet suomen kielessä.
    • Luonnolliset taivutusmuodot, sujuva sanasto ja laaja monialainen tietämys ilman turhia anglismeja.
    • Täysin kaksikielinen (suomi ja englanti).
  4. Optimoitu suomenkielinen Chat Template & Päättelytasot ({REASON:}):

    • Oletuksena välitön vastaus: Malli vastaa heti ilman tarpeettomia sisäisiä pohdintasilmukoita.
    • Päättelysyvyyttä voi säätää komentotunnisteella {REASON:taso}:
      • {REASON:low}: Nopea ja tiivis kiteytys.
      • {REASON:medium}: Tasapainoinen ja jäsennelty analyysi.
      • {REASON:xhigh}: Syvällinen pohdinta ja vaihtoehtojen arviointi.
      • {REASON:spoon}: Syvätutkimus (Qwen Deep Research moniasiantuntijapaneelilla).
      • {REASON:einstein}: Luova aivoriihi (Sternbergin 10 näkökulmaa ja radikaali innovointi).
    • Sensuroimaton: Ei turhaa holhousta, moralisointia tai vastuuvapauslausekkeita luovassa kirjoituksessa tai analyysissä.

Testitulokset & Benchmarkit

Testattu ympäristössä: 2x RTX 5090 (TP=2, FP8 KV, vLLM 0.29.0+):

Tehtävätyyppi Nopeus (tok/s) Keskimääräinen vasteaika Huomiot
Lyhyt faktakysymys 255 tok/s 0.21 s TTFT ~0.19 s
Neurobiologian essee 279 tok/s 1.83 s Täsmällinen tieteellinen terminologia
Syvätutkimus ({REASON:spoon}) 274 tok/s 3.20 s 609 tok sisäinen asiantuntijapaneeli
Kuva-analyysi (Vision) - 1.88 s Tunnisti kuvat ja tekstit 100 % oikein

Käyttö vLLM:n kanssa

Voit käynnistää mallin vLLM:llä seuraavalla komennolla:

vllm serve kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ \
    --tensor-parallel-size 2 \
    --gpu-memory-utilization 0.90 \
    --max-model-len 131072 \
    --kv-cache-dtype fp8 \
    --enable-chunked-prefill \
    --limit-mm-per-prompt '{"image":99}' \
    --reasoning-parser qwen3 \
    --override-generation-config '{"temperature":0.6,"top_p":0.95}'

Python / OpenAI API -esimerkki

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8003/v1", api_key="local")

# 1. Nopea suora vastaus
response = client.chat.completions.create(
    model="kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ",
    messages=[{"role": "user", "content": "Tiivistä lyhyesti fotosynteesin vaiheet."}]
)
print(response.choices[0].message.content)

# 2. Syvätutkimustila (Spoon)
response_spoon = client.chat.completions.create(
    model="kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ",
    messages=[{"role": "user", "content": "{REASON:spoon} Analysoi kvanttikryptografian keskeiset turvallisuushaasteet."}]
)
print(response_spoon.choices[0].message.content)

Kvantisointitiedot

  • Metodi: AWQ (W4A16, compressed-tensors)
  • Painomuoto: Int4 ryhmäkoolla 128 (symmetric)
  • Suojatut kerrokset (BF16): lm_head, GDN linear attention in_proj, MTP (mtp.*)
  • Kalibrointi: 256 kuratoitua suomenkielistä näytettä
Catalog is the map. Apps are the tools.

Run models on your own machine, not in the cloud.

Every model page has an "Open in app" button that hands off directly to a local runtime of your choice - Abliteration, LM Studio, or Ollama. No API keys, no subscription, no prompt leakage.