← back to catalog · registered 2026-08-23 17:02

Ar4ikov/Qwen3.8-27B-Uncensored-AWQ-W4A16-ASYM

Ar4ikov Qwen 24B multimodal second-order
Your rig guess connected
? Why do I need an app?
Reading your rig…

This is a rough estimate. Install the free app - we'll show exact numbers.

Reading real hardware from your app right now. Numbers below are exact.

Below is the per-quantization compatibility for this model.

curl -H "Authorization: Bearer $ABL_KEY" \
     "https://abliteration.org/api/v1/models/Ar4ikov%2FQwen3.8-27B-Uncensored-AWQ-W4A16-ASYM"
Response includes
  • classification m-uncensored
  • files 14
  • hub_downloads_all_time 6,564
  • author_summary 3 models
  • readme_text full
10 credits · hourly refresh · ~4 KB payload Get an API key →
Abliteration classifier · v1.0.0
M-U
Primary method

Uncensored (method unknown)

No other method signals detected in this model.
Confidence
LOW
Why this label 3 signals
Weak or ambiguous signals. Best guess based on catalog patterns; treat as tentative and check the evidence below.
  • 'uncensored' in name/tags but no 'abliterated' marker
  • method not identifiable from author declaration alone
  • may be DPO fine-tune, prompt engineering, or unknown technique
Refusal direction extraction

No specific extraction method could be identified for this model. The producer either did not document it or used a proprietary pipeline.

What is a refusal direction? →
Downloads · lifetime
7K
Likes
3
Model age
6w ago
created 2026-08-23
Downloads over time
Now9.2K→from286↑3,114%
03.4K6.7K10.1K286 on Aug 269.2K on Oct 11AugSepOct
Aug 26 → Oct 11 · 47 snapshots · spans 46 days

Genealogy 0 direct forks

Full fork graph →

This model's place in the market. Above: what it was derived from. Below: the tree of everything derived from it.

Metadata

License
apache-2.0
Tags
transformers safetensors qwen3_5 image-text-to-text awq w4a16 int4 llm-compressor compressed-tensors vllm multimodal mtp

Related

Total size
18.2 GB
Files
14
Quantizations
1
Registered
2026-08-23 17:02
Last updated on HF
2026-08-23 16:54

Files by quantization

Auxiliary files 14 files 18.2 GB
model.safetensors 17.4 GB 1daf05d5 download
model-mtp.safetensors 810 MB d869b1df download
tokenizer.json 19.1 MB 06b95093 download
model.safetensors.index.json 201 KB 4d526910 download
config.json 20.4 KB d6aea330 download
chat_template.jinja 8.74 KB c0c686f9 download
README.md 6.27 KB 9fae2e7a download
.gitattributes 1.53 KB 52373fe2 download
recipe.yaml 1.37 KB 471d4a5d download
processor_config.json 1.16 KB 33818c7f download
tokenizer_config.json 1.14 KB 1d134cd2 download
preprocessor_config.json 390 B 2ea84a43 download
video_preprocessor_config.json 385 B 3ba673a5 download
generation_config.json 214 B 0bc3addd download

README current version from Hugging Face


license: apache-2.0
library_name: transformers
pipeline_tag: image-text-to-text
base_model: orcarouter/Qwen3.8-27B-Uncensored
base_model_relation: quantized
tags:

  • awq
  • w4a16
  • int4
  • llm-compressor
  • compressed-tensors
  • vllm
  • qwen3_5
  • multimodal
  • mtp
  • uncensored

Qwen3.8-27B-Uncensored-AWQ-W4A16-ASYM

4-битный AWQ-квант orcarouter/Qwen3.8-27B-Uncensored,
сделанный llm-compressor в формате
compressed-tensors (pack-quantized). Грузится в vLLM нативно.

Квантование выполнено с BF16-весов, а не поверх FP8-чекпоинта — чтобы не накладывать
INT4 на уже потерянную точность.

Что внутри

Схема W4A16_ASYM (asymmetric, zero-point)
Group size 128
Стратегия group, type: int, num_bits: 4
Формат compressed-tensors / pack-quantized
Активации BF16 (weight-only)
Калибровка HuggingFaceH4/ultrachat_200k, 256 сэмплов × 2048 токенов, через chat template
Размер 19 GB (было 52 GB в BF16)

Что квантовано, а что осталось в BF16

Qwen3.8-27B — гибрид: 64 слоя по схеме 16 × (3 × Gated DeltaNet → 1 × Gated Attention),
плюс vision-башня и MTP-голова.

В INT4:

  • Gated Attention (слои 3, 7, …, 63): q_proj, k_proj, v_proj, o_proj
  • FFN всех 64 слоёв: gate_proj, up_proj, down_proj
  • Gated DeltaNet (остальные 48 слоёв): in_proj_qkv, in_proj_z, out_proj

Остались в BF16:

  • lm_head и эмбеддинги
  • вся vision-башня (model.visual.*) — квантование визуального энкодера бьёт по качеству
    распознавания сильнее, чем экономит память
  • linear_attn.in_proj_a / in_proj_b — чувствительные гейты SSM-ветки
  • вся MTP-голова (mtp.*) — чтобы не ломать спекулятивный декодинг

Про MTP. transformers не инстанцирует MTP-голову для qwen3_5, поэтому
llm-compressor её не видит и не сохраняет — наивный квант теряет MTP целиком.
Здесь тензоры mtp.* скопированы из исходного BF16-чекпоинта в готовый результат,
зарегистрированы в model.safetensors.index.json и внесены в
quantization_config.ignore. Спекулятивный декодинг сохранён.

Про AWQ-mappings. У гибридной архитектуры нет общего для всех слоёв набора проекций,
поэтому дефолтные маппинги AWQ не резолвятся. В recipe.yaml лежат кастомные: отдельный
маппинг для input_layernorm full-attention слоёв и отдельный — для DeltaNet-слоёв,
где в balance_layers обязаны быть все потребители выхода нормы, включая
неквантуемые in_proj_a / in_proj_b, иначе сглаживание ломает математику.

Использование (vLLM)

vllm serve Ar4ikov/Qwen3.8-27B-Uncensored-AWQ-W4A16-ASYM \
  --max-model-len 262144 \
  --tensor-parallel-size 2

Использование (transformers)

from transformers import AutoModelForImageTextToText, AutoProcessor

model = AutoModelForImageTextToText.from_pretrained(
    "Ar4ikov/Qwen3.8-27B-Uncensored-AWQ-W4A16-ASYM", dtype="auto", device_map="auto"
)
processor = AutoProcessor.from_pretrained("Ar4ikov/Qwen3.8-27B-Uncensored-AWQ-W4A16-ASYM")

transformers при загрузке распаковывает веса обратно в BF16, так что экономии VRAM
здесь не будет. Реальная экономия видна только в рантаймах с нативными INT4-ядрами
(vLLM, SGLang): ожидаемо ≈ размер файла + KV-кэш.

Параметры сэмплирования

Наследуются от базовой модели:

  • Thinking mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0
  • Non-thinking: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5

Поддерживается reasoning_effort (low / medium / xhigh), контекст 262 144 токена нативно.

Воспроизводимость

В репозитории лежит recipe.yaml, сгенерированный llm-compressor. Ключевая часть:

from llmcompressor.modifiers.awq import AWQModifier

recipe = [AWQModifier(
    targets=["Linear"],
    scheme="W4A16_ASYM",
    ignore=[
        "re:.*lm_head",
        r"re:model\.visual\..*",
        r"re:.*\.linear_attn\.in_proj_a",
        r"re:.*\.linear_attn\.in_proj_b",
        r"re:mtp\..*",
    ],
    mappings=MAPPINGS,   # см. recipe.yaml
)]

Оговорки

  • Квантовано 400 Linear-слоёв (64×3 MLP + 16×4 full-attention + 48×3 DeltaNet);
    400 тензоров weight_packed (I32-упаковка INT4) с weight_scale и weight_zero_point.
  • Квант не проходил бенчмарк-валидацию — проверена только связность генерации.
    Для продакшена прогоните свои эвалы.
  • Vision-часть не квантовалась, поэтому качество на изображениях должно быть близко
    к исходной модели; деградация ожидается прежде всего в текстовой части.
  • Базовая модель — uncensored-файнтюн; квантование не добавляет и не снимает никаких
    ограничений, поведение наследуется от orcarouter/Qwen3.8-27B-Uncensored.

README history 1 version

The author's README evolved over time. Click a version to see its content at that point.

  1. 2026-08-23AWQ W4A16_ASYM (group 128), llm-compressor, MTP preservedd07667d6.3 KB
    Loading...

Discussions 1 thread

  1. 2026-09-08best quant i have used from orcaopen2 💬#1
    Loading...
Catalog is the map. Apps are the tools.

Run models on your own machine, not in the cloud.

Every model page has an "Open in Abliteration" button that hands the model directly to the first-party desktop client, at the quantization your rig can actually run. No API keys, no subscription, no prompt leakage.

Open in Abliteration