Qwen3.8-Flash-Next(検閲なし)をllama.cppでローカル実行する

「検閲なし(Uncensored)」とは?

通常の大規模言語モデルは、安全性のためにファインチューニングや RLHF(人間のフィードバックによる強化学習)を通じて、特定のトピックや表現に対して回答を拒否する「ガードレール」が組み込まれています。たとえば、法律・医療・倫理的にグレーな話題などに対して「お答えできません」と応答するのがその代表例です。

「検閲なし(Uncensored)」モデルとは、このガードレールを取り除いたモデルを指します。具体的には以下のような特徴があります。

  • 拒否応答がない: どのようなプロンプトに対しても回答を試みます
  • 能力は損なわれない: ガードレール除去のみを行い、モデル本来の知識・推論能力はそのまま維持されます
  • 自己責任での利用が前提: フィルタリングがないため、利用者自身がコンテンツの適切性を判断する必要があります

ローカルで完全にオフライン実行できるため、外部サービスにデータを送らずに扱えるのも特徴です。ただし、生成されたコンテンツの利用は利用者の責任となります。法律や倫理に反する用途での使用は避けてください。

モデル概要

ベースはAlibaba Qwenチームが2026年8月26日に公開した「Qwen3.8-Flash-Next」です。Qwen4系アーキテクチャの先行公開版で、GDN(Gated DeltaNet)とQwen Sparse Attentionを組み合わせたハイブリッド構成を採っています。

項目内容
総パラメータ数125B(+ n-gram埋め込み51B、MTP 4B)
アクティブパラメータ数6B
コンテキスト長262,144トークン(YaRNで最大100万)
検閲なし版の由来orcarouter/Qwen3.8-Flash-Next-Uncensoredがabliteration → mradermacherがGGUF化
ライセンスqwen-community-1.0

量子化ファイル一覧

mradermacher版で配布されているGGUFです。

形式サイズ備考
Q2_K80.5 GB最軽量、精度は落ちる
Q3_K系88.9〜96.8 GB
IQ4_XS98.5 GBバランス型、単一ファイル
Q4_K系111.9〜119.3 GB配布元推奨
Q5_K系127.8〜134.2 GB
Q6_K167.7 GB
Q8_0188.3 GB最高品質

セットアップ手順

1. llama.cppの導入

Qwen3.8-Flash-Next(qwen4exp)への対応は2026年8月27日にマージされたため、それ以降のビルドが必要です。

Releaseページからwin-cpu-x64.zip(NVIDIA GPUがあればwin-cuda-x64.zip)をダウンロードして展開するだけでllama-cli.exeが使えます。ソースからビルドする必要はありません。

2. GGUFファイルのダウンロード

curl -L -C - --retry 10 -o Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf \
  https://huggingface.co/mradermacher/Qwen3.8-Flash-Next-Uncensored-GGUF/resolve/main/Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf

3. 実行

.llama-cli.exe -m .\models\Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf -c 16384 -t 6 -n -1 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
  • -c: コンテキスト長
  • -t: スレッド数。論理コア数ではなく物理コア数を指定する方が速い
  • -n -1: 生成を打ち切らず継続

起動すると「>」が表示されプロンプトを入力することができます

「こんにちは」と入力すると回答が返ってきました

4. 思考過程(thinking)の制御

このモデルのチャットテンプレートはenable_thinkingreasoning_effortをサポートしています。

思考過程を非表示にする場合:

--chat-template-kwargs "{\"enable_thinking\": false}"

思考の深さを変える場合(xhighがデフォルト、medium/lowも指定可能):

--chat-template-kwargs "{\"reasoning_effort\": \"low\"}"

5. APIサーバーとして使う

llama-server.exe -m Qwen3.8-Flash-Next-Uncensored.IQ4_XS.gguf -c 16384 -t 6 --port 8080

http://localhost:8080/v1でOpenAI互換APIとして利用できます。

注意事項

  • abliterationにより安全機構だけでなく、モデルの一部の判断能力も劣化している可能性があります
  • 生成内容の正確性・適法性は保証されません
  • 第三者に公開するサービスへの組み込みは避けてください

コメント

タイトルとURLをコピーしました