無検閲LLMのクラウドサービス5つを比べた(料金、画像と動画、ファイル編集、リスク)
無検閲LLMのクラウドサービス5つを比べた(料金、画像と動画、ファイル編集、リスク)
X で、無検閲のLLMをクラウドで使えるサービスが5つ並べて紹介されていた。 無検閲のLLMとは、ふつうのモデルなら断る依頼にも答えるように、拒否の仕組みを取り除いたモデルのことだ。 挙がっていたのは abliteration.ai、Featherless、Venice、Audn、heretics.fun の5つである。
知りたかったのは4点だ。 料金はいくらか。 画像と動画をどれだけ作れるか。 ブラウザだけでなく、手元のファイルを直接編集させられるか。 使うと何が危ないか。 画像と動画は、比べる基準に Grok を置いた。
数字は2026年9月18日時点のもので、各社の公式ページを開いて確かめた。 公式ページに載っていない数字は第三者の記事から取り、そのことを本文に書いている。
結論
- 5つは同じ「無検閲」でも中身が違う。API で使うもの(abliteration.ai、Featherless)、一般向けのチャットと画像生成(Venice)、セキュリティ研究者向けのもの(Audn)、モデルそのものを改造して渡すもの(heretics.fun)に分かれる
- 画像と動画を作れるのは Venice だけだった。単価は Grok の API のほうが安く、画像は1枚あたり Venice の約5分の1から15分の1、動画は1秒あたり約2分の1から3分の1になる(Venice の動画は公表された上限の単価で見積もった)
- 画像を大量に作るなら、1日1,000枚まで作れる Venice Pro(月18ドル)が割安になる
- 手元のファイルを直接編集させる公式の手順があるのは、abliteration.ai と Audn の2つである
- いちばん素性が見えないのは heretics.fun で、運営者も利用規約もプライバシー方針も書かれていない
- 無検閲のモデルに、ファイルの操作やコマンドの実行を任せるのは危ない。ファイルを編集させる必要がないなら、ブラウザで使うのが無難である
- (2026年9月22日追記)クラウドを使わず、重みを手元の DGX Spark で動かす場合も調べた。フルサイズの GLM-5.3 は4bit なら4台が目安(強く量子化すれば2〜3台の報告もある)、画像を読める GLM-5.3-Flash なら2〜4台で動く。2〜4台の本体だけで約170万〜430万円かかる(末尾の追記)
5つのサービスは何をするものか、いくらかかるか
| サービス | 何をするものか | 料金 |
|---|---|---|
| abliteration.ai | 開発者向けの API。拒否の仕組みを取り除いたモデルを出している。大型モデルの元は GLM-5.3 と GLM-5.2 | 登録すればカードなしで試せる。従量課金は、標準モデルが入力1ドルと出力3ドル(100万トークンあたり)、大型モデルが入力3ドルと出力5ドル。月20ドル、50ドル、200ドルの定額を払うと、従量分が2.5〜10%引きになる |
| Featherless | Hugging Face 上のオープンモデル(無検閲版を含む)を使える | Chat は月25ドルで、API はない(コンテキスト長32K)。Developer は月50ドル分のクレジット制で、API がある(コンテキスト長は最大256K、使い残しは翌月へ繰り越し)。Business は個別見積もり |
| Venice | 一般向けのチャットと、画像と動画の生成 | Free は無料(テキストは1日10回、画像は1日15枚)。Pro は月18ドル、Pro Plus は月68ドル、Max は月200ドル。年払いにすると最大16.7%引き。API の支払いに使うクレジットは、100クレジットで1ドル |
| Audn | セキュリティ研究者向けの無検閲モデル「Pingu Unchained」と、その周辺ツール | チャットは Free、Plus(月8ドル)、Premium(月12ドル)、PenClaw Pro(月20ドル)。上位モデルは、GODZILLA が月79ドル、NECROMICON が月179ドルの追加料金 |
| heretics.fun | 指定したモデルから拒否の仕組みを外し、改造済みの重み(モデルの本体ファイル)を返す | 暗号資産トークン「HERETIC」の保有量で、使える範囲が決まる。無料枠は週1回で、4B以下のモデルまで。10万トークン保有で1日10回(12B以下)、100万で1日100回(70B以下)、1000万で無制限 |
Audn は、ページによって料金の書き方が揃っていない。 トップページでは、Pingu 10 と KONG をそれぞれ月20ドルと書いている。 契約する前に、申し込み画面の金額を確かめたほうがよい。
画像と動画をどれだけ作れるか(Grok と比べる)
画像と動画は、テキストと違ってトークン数では課金されない。 1枚いくら、1秒いくらで課金される。 そこで単価をそろえ、10ドルで何枚、何秒作れるかに直して比べた。
5つのうち、画像と動画を作れるのは Venice だけだった。 abliteration.ai と Featherless と Audn はテキストのモデルで、heretics.fun はモデルを改造するサービスなので、表から外している。
API で使う場合
| 画像の単価 | 動画の単価 | 10ドルで作れる量 | |
|---|---|---|---|
| Grok(xAI の API) | 1枚0.02ドル | 1秒0.05ドル(grok-imagine-video)、1秒0.08ドル(grok-imagine-video-1.5) | 画像500枚、動画200秒(1.5 なら125秒) |
| Venice(API) | 1枚0.09〜0.29ドル(モデルによる) | 5秒ほどの1本で80クレジット(0.8ドル)未満。1秒あたり0.16ドル未満 | 画像34〜111枚、動画62秒以上 |
Venice は、動画の料金を「5秒ほどの1本で80クレジット未満」としか書いていない。 モデルと解像度で変わるので、実際の金額は Venice の見積もり API で確かめる必要がある。 上の比較は、この上限を単価とみなした場合のものだ。
Venice の動画は、Grok Imagine、Seedance 2.0、Kling 3.0 といった他社のモデルを取り次いでいる。 Grok Imagine を使うだけなら、xAI の API を直接使えば済む。
定額プランで使う場合
| プラン | 画像 | 動画 |
|---|---|---|
| Grok(各プラン) | 上限は公表されていない | 1回の生成で最長15秒、延長すると最大30秒。音声も付く。SuperGrok Lite(月10ドル)は480p、6秒まで |
| Venice Free | 1日15枚 | 記載なし |
| Venice Pro(月18ドル) | 1日1,000枚 | 月100クレジットで、5秒ほどの動画1本分 |
| Venice Pro Plus(月68ドル) | 無制限 | 月7,500クレジットで、93本、470秒ほど |
| Venice Max(月200ドル) | 無制限 | 月22,500クレジットで、280本、1,400秒ほど |
Venice の本数と秒数は、1本80クレジット、5秒として割り戻した目安である。 80クレジットは上限なので、実際にはこれより多く作れる可能性がある。
Grok の定額は、SuperGrok Lite が月10ドル、SuperGrok が月30ドル、SuperGrok Heavy が月300ドルである。 この料金と、表の Grok の動画の仕様は、第三者の記事による。 公式のプラン表には SuperGrok Plus もあるが、料金は確かめられなかった。 2026年6月から、Grok の有料プランは、チャット、画像、動画などで1週間分の使用量を共有する方式に変わった。 プランごとに何本まで作れるかは公表されていない。
画像を大量に作るなら、定額の Venice Pro が割安になる。 Grok の API で1日1,000枚作ると、1日20ドルかかる。 Venice Pro は、月18ドルで1日1,000枚まで作れる。
手元のファイルを直接編集させられるか
| サービス | ブラウザ以外の使い方 |
|---|---|
| abliteration.ai | Claude Code、Codex、Claude Desktop(Cowork)、opencode につなぐ手順を公式に用意している。Claude Code なら、環境変数を2つ設定すれば接続先が変わる(コンテキスト長256K) |
| Audn | Claude Code を改造した CLI「audncode」を配っている(Windows、macOS、Linux)。使うには、PenClaw(Audn の侵入テスト用エージェント)の契約と、政府発行の身分証と自撮りによる本人確認が要る。すべてのリクエストはサーバー側で検証され、記録される |
| Featherless | Developer プラン以上なら OpenAI 互換の API を使えるので、Cline など、この形式を受け付けるツールにつなげる。Anthropic 形式の窓口は見つからなかったので、Claude Code から使うには、形式を変換するプロキシを挟むことになる |
| Venice | 公式のダウンロードページにあるのは、iPhone、iPad、Android 向けのアプリだけである。有料プランの API を、Featherless と同じ方法で他のツールにつなぐことはできる |
| heretics.fun | ブラウザで申し込み、改造済みの重みを受け取る。受け取った重みは、自分の GPU で動かす |
abliteration.ai を Claude Code につなぐ設定は、次の2行である。
export ANTHROPIC_BASE_URL="https://api.abliteration.ai"
export ANTHROPIC_AUTH_TOKEN="ak_..."
この2行をシェルの設定ファイルに書くと、ふだん使う Claude Code まで abliteration.ai につながる。 試すなら、その端末のセッションの中だけで設定する。
使うと何が危ないか
運営者がどこまで見えるか
heretics.fun は、運営者も利用規約もプライバシー方針もページに書いていない。 使うにはウォレットをつなぎ、値動きのある暗号資産トークンを持つ必要がある。 元になっているツール「Heretic」はオープンソースとして GitHub で公開されており、GPU があれば自分で動かせる。 heretics.fun のトークンで買えるのは、その実行の手間を省く部分だけである。
Audn は、米国の Audn Corporation と英国の Albumera LTD が運営している。 abliteration.ai の運営は Abliteration AI, Inc. だが、所在地は公開されていない。
「ログを残さない」は各社の自己申告
abliteration.ai と Featherless は、プロンプトと出力を保存しないと書いている。 外部の監査を受けているかどうかは確認できなかった。 abliteration.ai も、トークン数、時刻、エラーの記録は残すと明記している。
Venice は、自社で管理するGPUで動かす「Private」のモデルでは、プロンプトと応答を保存しない。 一方、他社のモデルを取り次ぐ「Anonymized」のモデルでは、提供元が内容を保存すると書いている。
Audn の audncode は、すべてのリクエストをサーバー側で記録する。
どのサービスでも、登録したメールアドレスと支払い情報は残る。 匿名で使えるわけではない。
ファイルの編集を任せるのがいちばん危ない
無検閲のモデルは、拒否の仕組みを取り除いてある。 ファイルの削除や上書きのような操作も、頼まれればためらわずに実行しやすい。 ファイルや Web ページに紛れ込んだ指示にも従いやすいと考えられる。
コマンドを実行する権限を渡すなら、捨ててよいフォルダーか仮想マシンの中で動かし、自動承認は切っておく。 audncode は、第三者が配っている Claude Code の改造版である。 インストールする前に、そのプログラム自体を信用できるかも考える必要がある。
ファイルを編集させる必要がないなら、ブラウザで使えばよい。
ブラウザでは、モデルが触れるのは自分が貼ったテキストだけになる。
heretics.fun が返す重み(.safetensors 形式)も、読み込んだだけでコードが動く形式ではない。
重みを手元に置くこと自体の危険は小さく、危ないのは、そのモデルにどんな権限を持たせるかである。
規約と法律
abliteration.ai でも、児童の性的なコンテンツと自傷に関わる内容は常に遮断される。 無検閲をうたうサービスで作ったものでも、違法な内容なら責任は作った本人が負う。
サービスの方針は、規制を受けて短い期間で変わることがある。 Grok では2026年1月、女性や未成年者を性的に加工した画像が、依頼に応じて作られていた。 EU、英国、フランス、インドなどが調査や批判に動き、Grok は1月9日に、画像の生成と編集を有料会員に限った。
顧客の個人情報や業務で預かった資料は、どのサービスにも入れないほうがよい。
追記(2026年9月22日):手元で動かすなら DGX Spark は何台要るか
ここまでは、クラウドのサービスを比べた。 では、無検閲の重みを自分の機械で動かすなら、装置はどれだけ要るのか。 abliteration.ai の大型モデルの元になっている GLM-5.3 を、NVIDIA の DGX Spark で動かす場合を調べた。 DGX Spark は、CPU と GPU で共用するメモリを128GB 積んだ小型の機械で、ケーブルでつないで台数を増やせる。
この節の数字は、2026年9月22日に確かめた。 速度はコミュニティの実測報告で、自分では動かしていない。
先に答えを書く。 フルサイズの GLM-5.3 は、4bit のまま載せるなら4台が目安で、無検閲版の作り手は8台で試している。 2bit 以下まで強く量子化すれば2台か3台でも動いた報告があるが、品質と速さを削ることになる。 画像を読める小型版の GLM-5.3-Flash なら、2台から4台で足りる。
無検閲の重みは公開されている
abliteration.ai は API で使わせるサービスで、重みを配っているという記述は見つからなかった。 一方で、同じ GLM-5.3 から拒否の仕組みを外した重みを、別の作り手が Hugging Face に置いている。
| GLM-5.3(フルサイズ) | GLM-5.3-Flash | |
|---|---|---|
| 規模 | 753B。1トークンごとに動くのは約40B | 320B。1トークンごとに動くのは18B |
| 入力 | 文字のみ | 文字と画像 |
| ライセンス | 独自の GLM-5.3 License | MIT |
| 無検閲版の例 | dealignai の ABLITERATED-NVFP4 | orcarouter の Uncensored-NVFP4 |
| 4bit にしたときの大きさ | 約420GB(GGUF の4bit 版) | 約191GB |
GLM-5.3 License は、第三者の解説によると、年商が100億ドルを超える企業に事前の審査を求めている。 それ以下の企業と個人には、MIT と同じ条件になる。 無検閲版の配布ページには MIT と書いているものがあり、元のライセンスと表記が食い違っている。
拒否の仕組みを外した影響は、作り手の報告では小さい。 dealignai 版は、知識を問う試験(MMLU)の正答率が85.58%から84.11%に下がり、有害な依頼の試験(HarmBench の156問)では拒否が0%だった。 orcarouter の Flash 版は、有害な依頼を断る割合が約9割から約17%に下がり、文章を予測する精度の指標(perplexity)は3.8%悪くなった。 いずれも作り手の自己申告で、第三者の検証は見つけていない。
フルサイズを動かした報告
Spark 1台で実際に使えるメモリは、約120GBである。 4bit にしたフルサイズは約420GBあるので、4台(約480GB)でようやく載る。
下の報告は、ひとつ前の GLM-5.2 で測られている。 GLM-5.2 も GLM-5.3 も753Bなので、載るかどうかの計算は変わらない。
| 台数 | 重みの削り方 | 生成の速さ | 注意 |
|---|---|---|---|
| 2台 | 1bit か 2bit まで量子化する | 1bit で毎秒8トークン、2bit で毎秒21.5トークン | 1bit 版は、作者が「学術的」と断っている。ここまで削ったときの品質は確かめられていない |
| 3台 | 部品は間引かず、4bit と 2bit を混ぜて272GBにする | 毎秒約15トークン(文脈は約23万トークン) | 作者の見積もりでは、元の精度の92〜97%。9.8万トークンを入れると、最初の1文字が出るまで270秒かかる |
| 3台 | モデルの部品(エキスパート)を37%間引いて469Bにし、4bit にする | 毎秒約4.4トークン | 遅くて実用にならない |
| 4台 | エキスパートを15%間引き、4bit にする。100G のスイッチでつなぐ | 毎秒約22トークン(文脈は256K) | 作者は「概念実証」と呼んでいる |
| 8台 | 間引かない 4bit | 毎秒26〜27トークン | 先読みしながら生成する仕組み(MTP)を効かせた別の報告では、毎秒48トークン |
3台の1つめの構成は、画像を読む部品を別に足して、フルサイズでも画像を読めるようにしている。 dealignai の配布ページには、8台の Spark で試したことと、512K の文脈を実用するなら8台に分けることが書いてある。
Flash なら2台から4台
| 台数 | 構成 | 生成の速さ | 注意 |
|---|---|---|---|
| 4台 | 4bit(NVFP4)。スイッチを使わず、100G のケーブル4本を輪につなぐ | コードで毎秒約71トークン、文章で毎秒約31トークン。実際の作業では平均45トークンほど(文脈は262K) | 元の Flash での報告である。無検閲版もほぼ同じ大きさなので載るはずだが、動かした報告は見つけていない |
| 2台 | 2台用の構成を公開している人がいる | 確かめていない | 4bit の191GBは、2台(約240GB)に収まる |
| 1台 | 約2bit まで削って85GBにする | 毎秒約64トークン | 同じ掲示板に、「同じ出力を繰り返して止まらない」「品質が低い」という反論が複数ある |
いくらかかるか
DGX Spark の価格.com の最安は、9月22日時点で1,078,000円だった。 発売当初は70万円台だったので、1年で約1.5倍になっている。 同じチップ(GB10)を積んだ ASUS の Ascent GX10 は、83.8万〜118万円で出ている(2026年8月21日の第三者の記事による)。
| 構成 | 本体の概算 |
|---|---|
| Flash を2台 | 約168万〜216万円 |
| フルサイズか Flash を4台 | 約335万〜431万円 |
| フルサイズを8台 | 約670万〜862万円 |
下限は Ascent GX10 の最安、上限は DGX Spark の最安で計算した。 ケーブルとスイッチは含めていない。
NVIDIA が公式に案内している台数は、ケーブルの直結で3台まで、スイッチ経由で4台までだという(第三者の記事による)。 4台を輪につなぐ構成と8台の構成は、この案内の範囲を超えている。
どう見るか
無検閲で、画像も読めて、手元で動く。 この3つを満たす現実的な構成は、GLM-5.3-Flash の無検閲版を2〜4台で動かすものだ。 フルサイズは4台でも毎秒20トークン台で、部品を間引くか、強く量子化することが前提になる。 300万円を超える装置に、その速さと品質が見合うかは疑わしい。
同じ日に書いた手書き伝票の OCR の記事では、画像を読める DeepSeek V4.1 Flash に3台か4台が要ると書いた。 4台あれば、どちらも動かせる計算になる。
手元で動かしても、「ファイルの編集を任せるのがいちばん危ない」の節に書いた注意は変わらない。 内容をクラウドに送らずに済む代わりに、モデルに持たせる権限は自分で絞ることになる。
出典
いずれも2026年9月18日に閲覧した。
- abliteration.ai:トップページ、料金、Claude Code との連携、Claude Desktop(Cowork)との連携、FAQ
- Featherless:料金、プライバシーとログ
- Venice:料金、API の料金、プライバシー、ダウンロード
- Audn:トップページ、audncode、Pingu Unchained
- heretics.fun:トップページ、元になったツール(GitHub)
- xAI:API の料金
- Grok の定額プランの料金(第三者):whichai.fyi(2026年8月14日更新)、Suprmind(2026年7月6日確認)
- Grok の週単位の使用量(第三者):Fello AI
- Grok Imagine の動画の長さ(第三者):AI Business Weekly
- Grok の性的ディープフェイク問題:Euronews(2026年1月9日)
追記の出典は、2026年9月22日に閲覧した。
- GLM-5.3 の公式の重み:フルサイズ、Flash、NVIDIA による GLM-5.2 の4bit 版
- GLM-5.3 のライセンスと GGUF の大きさ(第三者):runaihome
- 無検閲版の重み:dealignai(フルサイズ)、orcarouter(Flash)
- abliteration.ai が重みを配っているか(第三者):explainx.ai
- フルサイズを2台で動かした報告:1bit(NVIDIA の開発者フォーラム)、2bit(GitHub)
- フルサイズを3台で動かした報告:間引かない構成(NVIDIA の開発者フォーラム)、37%間引く構成(GitHub)
- フルサイズを4台と8台で動かした報告:NVIDIA の開発者フォーラム、8台で毎秒48トークン(X の投稿)
- Flash を動かした報告:4台(GitHub)、2台(Hugging Face)、1台(NVIDIA の開発者フォーラム)
- DGX Spark の価格:価格.com
- 互換機の価格と、公式に案内されている台数(第三者):zephel01 の note(2026年8月21日)