language:
- fi
- en
license: apache-2.0
tags: - finnish
- uncensored
- moe
- multimodal
- vision
- reasoning
- awq
- w4a16
- marlin
- vllm
base_model: Qwen/Qwen3.5-35B-A3B
pipeline_tag: text-generation
Qwen3.5-35B-A3B-Jackripper-v1.0-Uncensored-W4A16 (Kataguru Production Marlin)
Virallinen Kataguru Jackripper 35B-A3B MoE v1.0 Uncensored W4A16 Marlin -julkaisu vLLM-klusteri- ja palvelinkäyttöön. Malli yhdistää Qwen 3.5 35B-A3B -arkkitehtuurin (35B parametria, joista ~3B aktiivisena per token), suomen kielen syväkuratoinnin, sovereign agentic -päättelyn sekä Zero-Domain IPPCC SOMA/ARA -aktivointiortogonalisoinnin.
Tämä W4A16 Marlin MoE -tuotantomalli on optimoitu suoraan vLLM v0.29.0+ ja SGLang -palvelimille tarjoten yli 265 tok/s läpimenon kahdella RTX 5090 Blackwell -kortilla (TP=2).
Mitä Kataguru muutti? (Insinööriyhteenveto)
| Kenttä | Kuvaus / Arvo |
|---|---|
| Base model | Qwen 3.5 35B-A3B MoE (Alibaba Cloud / Qwen Team) |
| Katagurun käsittely | Jackripper v1.0 Uncensored (Zero-Domain IPPCC SOMA/ARA, kerrokset 10–28, 256 asiantuntijaa) |
| Kielilaatu | 100 % Virheetön suomi: Vaativat sijapäätteet, ammattisanasto |
| Sensuroimattomuus | Zero Refusal: 0.00 % kieltäytymisiä laillisiin aikuiskerronta-, fiktio- ja tutkimuspyyntöihin |
| Kvantisointi | W4A16 Marlin MoE Fast-Cut (26.10 GB, 6 shardia) |
| vLLM-tuki | Täysi tuki Marlin MoE -ytimille ja CUDAGraphs-optimoinnille |
| Testattu laitteisto | 2x NVIDIA RTX 5090 32GB Blackwell (TP=2) |
Palvelinkäyttö vLLM:llä
vllm serve /mnt/ai-core-data/models/huggingface/kataguru/Qwen3.5-35B-A3B-Jackripper-v1.0-Uncensored-W4A16 \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90 \
--max-model-len 32768 \
--trust-remote-code \
--port 8003