「検閲なし(Uncensored)」とは?
通常の大規模言語モデルは、安全性のためにファインチューニングや RLHF(人間のフィードバックによる強化学習)を通じて、特定のトピックや表現に対して回答を拒否する「ガードレール」が組み込まれています。たとえば、法律・医療・倫理的にグレーな話題などに対して「お答えできません」と応答するのがその代表例です。
「検閲なし(Uncensored)」モデルとは、このガードレールを取り除いたモデルを指します。具体的には以下のような特徴があります。
- 拒否応答がない: どのようなプロンプトに対しても回答を試みます
- 能力は損なわれない: ガードレール除去のみを行い、モデル本来の知識・推論能力はそのまま維持されます
- 自己責任での利用が前提: フィルタリングがないため、利用者自身がコンテンツの適切性を判断する必要があります
ローカルで完全にオフライン実行できるため、外部サービスにデータを送らずに扱えるのも特徴です。ただし、生成されたコンテンツの利用は利用者の責任となります。法律や倫理に反する用途での使用は避けてください。
モデル概要
ベースはAlibaba Qwenチームが2026年8月26日に公開した「Qwen3.8-Flash-Next」です。Qwen4系アーキテクチャの先行公開版で、GDN(Gated DeltaNet)とQwen Sparse Attentionを組み合わせたハイブリッド構成を採っています。

| 項目 | 内容 |
|---|---|
| 総パラメータ数 | 125B(+ n-gram埋め込み51B、MTP 4B) |
| アクティブパラメータ数 | 6B |
| コンテキスト長 | 262,144トークン(YaRNで最大100万) |
| 検閲なし版の由来 | orcarouter/Qwen3.8-Flash-Next-Uncensoredがabliteration → mradermacherがGGUF化 |
| ライセンス | qwen-community-1.0 |
量子化ファイル一覧
mradermacher版で配布されているGGUFです。
| 形式 | サイズ | 備考 |
|---|---|---|
| Q2_K | 80.5 GB | 最軽量、精度は落ちる |
| Q3_K系 | 88.9〜96.8 GB | |
| IQ4_XS | 98.5 GB | バランス型、単一ファイル |
| Q4_K系 | 111.9〜119.3 GB | 配布元推奨 |
| Q5_K系 | 127.8〜134.2 GB | |
| Q6_K | 167.7 GB | |
| Q8_0 | 188.3 GB | 最高品質 |
セットアップ手順
1. llama.cppの導入
Qwen3.8-Flash-Next(qwen4exp)への対応は2026年8月27日にマージされたため、それ以降のビルドが必要です。
Releaseページからwin-cpu-x64.zip(NVIDIA GPUがあればwin-cuda-x64.zip)をダウンロードして展開するだけでllama-cli.exeが使えます。ソースからビルドする必要はありません。
2. GGUFファイルのダウンロード
curl -L -C - --retry 10 -o Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf \
https://huggingface.co/mradermacher/Qwen3.8-Flash-Next-Uncensored-GGUF/resolve/main/Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf
3. 実行
.llama-cli.exe -m .\models\Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf -c 16384 -t 6 -n -1 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
-c: コンテキスト長-t: スレッド数。論理コア数ではなく物理コア数を指定する方が速い-n -1: 生成を打ち切らず継続

起動すると「>」が表示されプロンプトを入力することができます

「こんにちは」と入力すると回答が返ってきました
4. 思考過程(thinking)の制御
このモデルのチャットテンプレートはenable_thinkingとreasoning_effortをサポートしています。
思考過程を非表示にする場合:
--chat-template-kwargs "{\"enable_thinking\": false}"
思考の深さを変える場合(xhighがデフォルト、medium/lowも指定可能):
--chat-template-kwargs "{\"reasoning_effort\": \"low\"}"
5. APIサーバーとして使う
llama-server.exe -m Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf -c 16384 -t 6 --port 8080
http://localhost:8080/v1でOpenAI互換APIとして利用できます。
注意事項
- abliterationにより安全機構だけでなく、モデルの一部の判断能力も劣化している可能性があります
- 生成内容の正確性・適法性は保証されません
- 第三者に公開するサービスへの組み込みは避けてください

コメント