license: apache-2.0
base_model: xCloudinfo/Qwen3.8-27B-Uncensored-xCloud
base_model_relation: quantized
language:
- zh
- en
pipeline_tag: text-generation
library_name: llama.cpp
tags: - gguf
- uncensored
- abliterated
- qwen3.5
- imatrix
- xCloudinfo
Qwen3.8-27B-Uncensored-xCloud — GGUF
xCloudinfo/Qwen3.8-27B-Uncensored-xCloud
的 GGUF 量化版,供 llama.cpp/agent 調度使用。由 云碩科技(xCloudinfo) 自行轉檔量化。
底模去除拒絕方向(abliteration)的方法與行為,見上游 safetensors 版的說明。
量化版本
| 檔案 | 位元 | 大小 | 用途 |
|---|---|---|---|
...-Q8_0.gguf |
8-bit | ~28 GB | 近乎無損,品質最高 |
...-Q6_K.gguf |
6-bit | ~21 GB | 高品質 |
...-Q5_K_M.gguf |
5-bit | ~19 GB | 品質與體積的均衡 |
...-Q4_K_M.gguf |
4-bit | ~17 GB | agent 調度主力,單張 24 GB 卡即可 |
...-IQ4_XS.gguf |
4-bit | ~15 GB | 更小的 4-bit(imatrix) |
...-IQ2_M.gguf |
2-bit | ~10 GB | 低 VRAM/邊緣(imatrix,品質較低) |
...-imatrix.dat 為重要度矩陣(importance matrix),用於 IQ 系列量化。
K 系列(Q4_K_M 等)亦套用同一份 imatrix 以提升品質。
執行(llama.cpp)
# OpenAI 相容伺服器,供 agent 調度
llama-server -m Qwen3.8-27B-Uncensored-xCloud-Q4_K_M.gguf \
-ngl 99 -c 8192 --host 0.0.0.0 --port 8080 --jinja
-ngl 99 將所有層放到 GPU。這是混合(SSM/線性注意力)模型,llama.cpp 會在單一裝置上正確處理其遞迴狀態。
需使用支援 qwen35 架構的 llama.cpp 版本(近期 master 已內建)。
負責任使用
移除拒絕方向等於移除一層安全機制。使用者需自行負責這些權重的用途,並遵守 Apache-2.0 授權與所有適用法律。