license: apache-2.0
base_model: huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated
tags: [gguf, llama.cpp, qwen4_exp, abliterated, dgx-spark]
Qwen3.8-Flash-Next Abliterated — GGUF (IQ4_XS) for DGX Spark
GGUF ของ Qwen3.8-Flash-Next (125B / 6B-active MoE, arch qwen4_exp) ตัว abliterated (uncensored)
แปลงมาให้รันบน NVIDIA DGX Spark เครื่องเดียว (128GB unified memory)
ไฟล์
| ไฟล์ | ขนาด | บทบาท |
|---|---|---|
Qwen3.8-Flash-Next-Uncensored-IQ4_XS-0000{1,2,3}-of-00003.gguf |
97.5 GB | โมเดลหลัก (mirror จาก orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF) |
Qwen3.8-Flash-Next-Uncensored-MTP-draft.gguf |
4.14 GB | MTP draft model สำหรับ speculative decoding |
mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf |
0.91 GB | vision projector (ถ้าใช้รูปภาพ) |
lora-v1/ (เร็วๆ นี้) |
~1 GB | LoRA adapter จากการ SFT เพิ่ม (5 domains) |
Qwen3.8-Flash-Next-lora-v1.gguf (เร็วๆ นี้) |
~1-2 GB | LoRA แบบ GGUF ใช้กับ --lora ได้ทันที |
รันบน DGX Spark (llama.cpp)
hf download wy2pay/Qwen3.8-Flash-Next-abliterated-GGUF-IQ4XS
llama-server \
-m Qwen3.8-Flash-Next-Uncensored-IQ4_XS-00001-of-00003.gguf \
--model-draft Qwen3.8-Flash-Next-Uncensored-MTP-draft.gguf \
--lora Qwen3.8-Flash-Next-lora-v1.gguf \
-ngl 99 \
--ctx-size 131072 \
-ctk q8_0 -ctv q8_0 \
--port 8080
หมายเหตุ:
- IQ4_XS 97.5GB บนหน่วยความจำ 128GB (ใช้ได้จริง ~110GB) ต้องใช้ KV quant (q8_0)
เพื่อเหลือที่ให้ context ยาว - context 1M tokens เต็ม ต้องลด quant เป็น IQ3_M หรือ KV q4
- ต้องใช้ llama.cpp build ล่าสุดที่รองรับ
qwen4exp
Provenance
- Base: huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated
- GGUF IQ4_XS: mirror ของ orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
- LoRA v1: SFT (SWE / terminal-agent / cybersecurity / long-context datasets) — กำลังเทรน