Qwen3-1.7B - abliterated (ru)
Аблитерированная версия Qwen/Qwen3-1.7B, обученная в рамках ДЗ курса NLP ИТМО.
Метод. Поиск refusal direction через усреднённую разницу активаций residual stream на harmful и harmless промптах (256 примеров каждого класса из masterkristall/harmful_behaviors_ru и masterkristall/harmless_alpaca_ru). Ортогонализация embed_tokens (с учётом tied word embeddings - ортогонализация переносится на lm_head.weight), o_proj и down_proj всех слоёв относительно выбранного направления.
Внимание. Модель намеренно модифицирована так, чтобы не отказываться от ответов на harmful-запросы. Используется только как промежуточный шаг учебного пайплайна safety - последующее DPO-дообучение восстанавливает безопасное поведение.
- Base: Qwen/Qwen3-1.7B
- dtype: float16
- layers modified: embed_tokens (+tied lm_head) + o_proj + down_proj (все блоки)
- training set size: 256 harmful + 256 harmless