license: apache-2.0
base_model: Qwen/Qwen3.5-9B
tags:
- gguf
- abliterated
- uncensored
- heretic
Qwen3.5-9B-Uncensored-GGUF
云碩(xCloudinfo)自製的「降低過度拒絕」版本,底模 Qwen/Qwen3.5-9B。
與我方 Qwen3.8-27B-Uncensored-GGUF 同一套方法論,
補齊小顯存機器(單卡 8–12GB、邊緣機)可用的小尺寸選項。
方法
用 Heretic 自動搜參(200 trials,同時最小化拒答率與 KL 散度守住原能力),
迭代兩輪:iter1 收斂後,對其成品再跑一輪 iter2 進一步下壓。
誠實揭露的數字(不同尺、不同結果)
- safetensors 合併模型(greedy 解碼):我方 10 題嚴重危害 held-out,iter1 拒答 3/10 → iter2 拒答 0/10,
無害題 coherence 完好(繁中流暢正確)。 - 量化後 GGUF、經 llama-server 實際載入測(預設取樣,非 greedy):Q6_K 與 Q4_K_M 皆實測 拒答 2/10。
量化與取樣方式的變動會讓拒答率有小幅回升,這裡如實列出兩種情境的數字,不只挑好看的那個。
內含檔案
Qwen3.5-9B-Uncensored-xCloud-{Q8_0,Q6_K,Q5_K_M,Q4_K_M,IQ4_XS,IQ2_M}.gguf—— 六階量化mmproj-Qwen3.5-9B-Uncensored-xCloud-f16.gguf—— 視覺塔(多模態)
技術修正
轉檔時遇到 Qwen3.5 系列共通的「幽靈 MTP」metadata 問題:qwen35.block_count 比實際層數多算一層
(本例 33 vs 實際 32 層),nextn_predict_layers 誤標為 1。已修正兩個 metadata 欄位再進行量化,
避免載入端因層數對不上而出錯或行為異常。
使用方式
llama.cpp / llama-server / 任何相容 GGUF 的推論引擎皆可直接載入。範例:
llama-server -m Qwen3.5-9B-Uncensored-xCloud-Q4_K_M.gguf --jinja \
--chat-template-kwargs '{"enable_thinking":false}'
授權與使用前提
繼承 Qwen3.5-9B 原廠授權(Apache 2.0)。
本版本移除的是對合法、邊界性題目的反射式拒答,不代表對任何非法用途的背書;使用者須自行承擔合法使用之責任。