license: apache-2.0
base_model: petruhonk/Qwen3.8-9B-Distill-uncensored-heretic
language:
- fi
- en
pipeline_tag: image-text-to-text
tags: - qwen
- qwen3.5
- finnish
- awq
- w4a16
- compressed-tensors
- vllm
- uncensored
- vision
- multimodal
Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ
Tämä on W4A16 AWQ (compressed-tensors) -kvantisoitu ja vLLM-optimoitu monimodaalinen versio mallista petruhonk/Qwen3.8-9B-Distill-uncensored-heretic.
Malli on kalibroitu laadukkaalla suomenkielisellä monialaisella aineistolla (256 monikierrosnäytettä: suomalainen kulttuuri, IT/Linux, tiede ja neurobiologia, oikeus ja filosofia, asiaproosa sekä sensuroimaton dialogi). Kvantisointi on toteutettu llm-compressor -työkalulla suoraan virheettömistä BF16-lähdepainoista.
GGUF-versiot löydät täältä: kataguru/Qwen3.8-9B-Distill-uncensored-heretic-GGUF.
Keskeiset ominaisuudet & Suorituskyky
Huikea suorituskyky ja nopeus:
- Vasteaika ja nopeus tuotantokäytössä vLLM:ssä (TP=2, FP8 KV): 255 – 279 tokenia sekunnissa.
- Ensimmäisen tokenin viive (TTFT): vain 0.18 – 0.22 sekuntia.
- Kompakti VRAM-jalanjälki: vain ~9.1 GB levytilaa ja minimaalinen muistinkulutus.
Monimodaalisuus & Vision-tuki:
- Täysi näköaistin tuki (Vision/Image-to-Text). Mukana esiprosessorit (
preprocessor_config.json,video_preprocessor_config.json). - Testattu tunnistamaan ja analysoimaan monimutkaisia kuvia, geometrisia muotoja ja visuaalista tekstiä salamannopeasti.
- Täysi näköaistin tuki (Vision/Image-to-Text). Mukana esiprosessorit (
Suomen kielen ja sanaston kalibrointi:
- Korjaa puhtaasti englanninkielisen kvantisoinnin heikkoudet suomen kielessä.
- Luonnolliset taivutusmuodot, sujuva sanasto ja laaja monialainen tietämys ilman turhia anglismeja.
- Täysin kaksikielinen (suomi ja englanti).
Optimoitu suomenkielinen Chat Template & Päättelytasot (
{REASON:}):- Oletuksena välitön vastaus: Malli vastaa heti ilman tarpeettomia sisäisiä pohdintasilmukoita.
- Päättelysyvyyttä voi säätää komentotunnisteella
{REASON:taso}:{REASON:low}: Nopea ja tiivis kiteytys.{REASON:medium}: Tasapainoinen ja jäsennelty analyysi.{REASON:xhigh}: Syvällinen pohdinta ja vaihtoehtojen arviointi.{REASON:spoon}: Syvätutkimus (Qwen Deep Research moniasiantuntijapaneelilla).{REASON:einstein}: Luova aivoriihi (Sternbergin 10 näkökulmaa ja radikaali innovointi).
- Sensuroimaton: Ei turhaa holhousta, moralisointia tai vastuuvapauslausekkeita luovassa kirjoituksessa tai analyysissä.
Testitulokset & Benchmarkit
Testattu ympäristössä: 2x RTX 5090 (TP=2, FP8 KV, vLLM 0.29.0+):
| Tehtävätyyppi | Nopeus (tok/s) | Keskimääräinen vasteaika | Huomiot |
|---|---|---|---|
| Lyhyt faktakysymys | 255 tok/s | 0.21 s | TTFT ~0.19 s |
| Neurobiologian essee | 279 tok/s | 1.83 s | Täsmällinen tieteellinen terminologia |
Syvätutkimus ({REASON:spoon}) |
274 tok/s | 3.20 s | 609 tok sisäinen asiantuntijapaneeli |
| Kuva-analyysi (Vision) | - | 1.88 s | Tunnisti kuvat ja tekstit 100 % oikein |
Käyttö vLLM:n kanssa
Voit käynnistää mallin vLLM:llä seuraavalla komennolla:
vllm serve kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90 \
--max-model-len 131072 \
--kv-cache-dtype fp8 \
--enable-chunked-prefill \
--limit-mm-per-prompt '{"image":99}' \
--reasoning-parser qwen3 \
--override-generation-config '{"temperature":0.6,"top_p":0.95}'
Python / OpenAI API -esimerkki
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8003/v1", api_key="local")
# 1. Nopea suora vastaus
response = client.chat.completions.create(
model="kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ",
messages=[{"role": "user", "content": "Tiivistä lyhyesti fotosynteesin vaiheet."}]
)
print(response.choices[0].message.content)
# 2. Syvätutkimustila (Spoon)
response_spoon = client.chat.completions.create(
model="kataguru/Qwen3.8-9B-Distill-uncensored-heretic-Finnish-W4A16-AWQ",
messages=[{"role": "user", "content": "{REASON:spoon} Analysoi kvanttikryptografian keskeiset turvallisuushaasteet."}]
)
print(response_spoon.choices[0].message.content)
Kvantisointitiedot
- Metodi: AWQ (W4A16, compressed-tensors)
- Painomuoto: Int4 ryhmäkoolla 128 (symmetric)
- Suojatut kerrokset (BF16):
lm_head, GDN linear attention in_proj, MTP (mtp.*) - Kalibrointi: 256 kuratoitua suomenkielistä näytettä