← back to catalog · registered 2026-08-22 13:56

MarkProMaster229/FlaffyTail-abliterated

MarkProMaster229 Qwen 7.6B
Your rig guess connected
? Why do I need an app?
Reading your rig…

This is a rough estimate. Install the free app - we'll show exact numbers.

Reading real hardware from your app right now. Numbers below are exact.

Below is the per-quantization compatibility for this model.

curl -H "Authorization: Bearer $ABL_KEY" \
     "https://abliteration.org/api/v1/models/MarkProMaster229%2FFlaffyTail-abliterated"
Response includes
  • classification m1
  • files 8
  • benchmarks 16 entries
  • hub_downloads_all_time 152
  • author_summary 1 models
  • readme_text full
10 credits · hourly refresh · ~4 KB payload Get an API key →
Abliteration classifier · v1.0.0
M1
Primary method

Direct removal

No other method signals detected in this model.
Confidence
MEDIUM
Why this label 3 signals
Method inferred from partial signals - repository name, related files, or tag patterns. Producer identity not confirmed; label may sharpen or shift as we gather more evidence.
  • 'abliterated' in name/tags
  • is_gguf=0 (base model)
  • no specific method indicators - defaulting to M1 (most common)
Refusal direction extracted via
Extraction technique

Difference-of-means

Confidence
MEDIUM
Why we say so
primary_method=M1; difference-of-means is the reference extraction for M1/M3 (Arditi 2024)
Downloads · lifetime
152
21 last 30d - stable
Likes
1
Descendants
2
in 2 direct forks
Model age
4mo ago
created 2026-05-27
Downloads over time
Now161→from32↑403%
267512417432 on Jun 10161 on Oct 11JunJulAugSepOct
Jun 10 → Oct 11 · 57 snapshots · spans 123 days

Benchmarks

Portrait before abliteration
Benchmarks of the base model as it stood before the refusal-removal operation. Compare with the numbers above to see what the operation cost.
Benchmark Score Source
BBH average 0.48553638604228827 OpenLLM-v2
IFEval instruct 0.7961630695443646 OpenLLM-v2
IFEval-Prompt 0.7208872458410351 OpenLLM-v2
MATH lvl 5 0 OpenLLM-v2
MMLU-Pro 0.4286901595744681 OpenLLM-v2
Entertainment 1.3 UGI
Hazardous 2.9 UGI
Natural Intelligence 15.76 UGI
Political lean -14.7% UGI
Sensitive-Info 15.62 UGI
SocPol 0.8 UGI
UGI 23.75 UGI
Willingness (10) 4 UGI
W10-Adherence 4 UGI
W10-Direct 4 UGI
Writing 29.72 UGI

Genealogy 2 direct forks

Full fork graph →

This model's place in the market. Above: what it was derived from. Below: the tree of everything derived from it.

Metadata

License
apache-2.0
Languages
ru en
Tags
safetensors qwen2 abliterated uncensored research NSFW refusal-removal text-generation ru en base_model:Qwen/Qwen2.5-7B-Instruct base_model:finetune:Qwen/Qwen2.5-7B-Instruct

Related

Total size
14.2 GB
Files
8
Quantizations
1
Registered
2026-08-22 13:56
Last updated on HF
2026-05-27 18:27

Files by quantization

Auxiliary files 8 files 14.2 GB
model.safetensors 14.2 GB eba60e8c download
tokenizer.json 10.9 MB 3fd16973 download
model.safetensors.index.json 22.1 KB d0d1df10 download
README.md 5.51 KB b48c1b00 download
.gitattributes 1.53 KB 52373fe2 download
config.json 1.34 KB 1432e0ba download
tokenizer_config.json 664 B 9fd0fb48 download
generation_config.json 242 B 6d6285b1 download

README current version from Hugging Face


license: apache-2.0
language:

  • ru
  • en
    pipeline_tag: text-generation
    tags:
  • abliterated
  • uncensored
  • research
  • NSFW
  • refusal-removal
    base_model: Qwen/Qwen2.5-7B-Instruct

FlaffyTail-abliterated

Экспериментальная модель с удалёнными механизмами отказа, созданная в исследовательских целях.


ЮРИДИЧЕСКОЕ ПРЕДУПРЕЖДЕНИЕ (ОБЯЗАТЕЛЬНО К ПРОЧТЕНИЮ)

Настоящая модель является экспериментальной и была создана исключительно в академических и исследовательских целях для изучения механизмов работы больших языковых моделей.

Автор не несёт ответственности за любой контент, сгенерированный данной моделью.

Вы используете эту модель на свой страх и риск.

  • Вы, как пользователь, единолично и полностью ответственны за любой текст, созданный этой моделью
  • Автор не контролирует и не может контролировать то, как вы её используете
  • Автор категорически не одобряет и не поощряет использование модели для создания незаконного, вредоносного или аморального контента
  • Вы, скачивая и используя эту модель, соглашаетесь с этим положением и принимаете на себя все возможные юридические последствия её использования.

Описание

это модифицированная версия Qwen2.5-7B-Instruct, прошедшая процедуру аблитерации и дообучения при помощи LoRA адаптации

Цель эксперимента: исследовать поведение LLM после удаления механизмов цензуры, включая:

  • Реакцию на NSFW-запросы
  • Кросс-языковые эффекты при экстремальных нагрузках
  • Сохранность критического мышления после аблитерации

Модель НЕ предназначена для коммерческого использования и публичных чат-ботов без дополнительной модерации.


Методология

Использованный инструмент

Датасет для измерения направлений отказа

  • Harmful промты (19шт.): негатив
  • Harmless промты (25 шт.): безопасные запросы

Процесс

  1. Измерение скрытых состояний на каждом слое модели для harmful и harmless запросов
  2. Вычисление "направления отказа" как разницы средних активаций: R = mean(H_harmful) - mean(H_harmless)
  3. Анализ отношения сигнал/шум (SNR) для выбора оптимальных слоёв
  4. Вычитание направления отказа из выбранных слоёв

Технические детали аблитерации

Конфигурация

Параметр Значение
Source layer 24
Destination layers 20, 21, 22, 23, 24, 25, 26
Scale 1.0
Sparsity 0.0
Projected False

Анализ SNR по слоям

Слой SNR
1 0.0418
10 0.1013
14 0.1968
20 0.4332
24 0.4944
26 0.5416
27 0.4594

Почему не слой 26: Несмотря на максимальный SNR, слой 26 находится слишком близко к выходу. На этом этапе к сигналу отказа примешивается лингвистическая структура ответа, что повышает риск повреждения генеративных способностей модели.


Результаты и наблюдения

Основные результаты

  • Модель полностью утратила способность явно отказываться от NSFW-запросов
  • Сохранила базовые знания и связность речи

Неожиданные наблюдения

1. Кросс-языковой коллапс

При генерации экстремального NSFW-контента модель спонтанно переключается с русского на китайский язык. Предположительный механизм:

  • Отсутствие механизма отказа приводит к невозможности отклонить запрос как итог - модель находит аварийный выход через возврат в зону лингвистического комфорта

README history 2 versions

The author's README evolved over time. Click a version to see its content at that point.

  1. 2026-05-27Update README.mde5d3a1e5.5 KB
    Loading...
  2. 2026-05-27initial commit0f01cf228 B
    Loading...
Catalog is the map. Apps are the tools.

Run models on your own machine, not in the cloud.

Every model page has an "Open in Abliteration" button that hands the model directly to the first-party desktop client, at the quantization your rig can actually run. No API keys, no subscription, no prompt leakage.

Open in Abliteration