Claude APIを使ってアプリやエージェントを作っていると、「危険な内容だとして断られたリクエストには課金されない」という前提でコストを見積もっていた人もいるはずだ。ところが2026年9月24日、Anthropicはその前提の一部を崩した。生物兵器に関わる内容、競合AIモデルの開発を助ける内容、Claudeの内部の考え方をそのまま書き出させる内容。この3種類に限り、出力前に断られたリクエストにも通常どおり料金がかかるようになった。理由は、無料であることを見越した大規模な自動アクセスを防ぐためだという。
「拒否」は何が変わったのか
Claude APIにリクエストを送ると、内容によってはstop_reason: "refusal"という応答が返ってくることがある。エラーではなく、通常のHTTP 200のレスポンスとして届く「拒否」だ。Anthropic公式ドキュメントによれば、この拒否にはstop_details.categoryという分類ラベルが付く。値は"cyber"(サイバー攻撃)、"bio"(生物学的被害)、"frontier_llm"(競合AIモデル開発)、"reasoning_extraction"(内部推論の抽出)、"general_harms"(その他)の5種類ある。
このうち、Claudeが一文字も出力しないまま断った「出力前の拒否」は、2026年6月2日からすべてのカテゴリで無料になっていた。ところが2026年9月24日のリリースノートは、この無料化を一部だけ取り消したと記している。対象は"bio"・"frontier_llm"・"reasoning_extraction"の3つで、実行したモデルの通常料金がそのまま課金される。"cyber"と"general_harms"、それに分類が付かない拒否は引き続き無料のままだ。出力の途中で拒否された場合は、この変更以前からすでに課金対象だったので、扱いは変わっていない。
| カテゴリ | 意味 | 出力前の拒否への課金 |
|---|---|---|
bio | 危険な実験手法など生物学的被害の恐れ | 対象(2026-09-24から) |
frontier_llm | 競合AIモデルの開発支援の恐れ | 対象(2026-09-24から) |
reasoning_extraction | 内部推論をそのまま書き出させる要求 | 対象(2026-09-24から) |
cyber | マルウェア開発など サイバー被害の恐れ | 対象外 |
general_harms | 上記4つに当たらない利用ポリシー違反 | 対象外 |
表からも分かるとおり、対象は5分類中3つだけで、しかも新たに課金されるのは「一文字も出力していない段階」の拒否に限られる。自分のアプリがこの3つのどれかに繰り返し触れているかどうかは、レスポンスのstop_details.categoryを見れば分かる。
自分は対象になるのか
とはいえ、大半の利用者にはそもそも関係がない。Anthropicは公式X投稿で、直近のテストの結果を明かしている。claude.ai・Claude Code・Coworkのアカウントの99.7%は、この新たに課金対象となった拒否に一度も触れていなかったという。対象になるのは、Claude API・Amazon Bedrock・Google Cloud・Microsoft Foundryなどを通じて自分でアプリケーションを組んでいる開発者だ。それも、生物学的に危険な情報、競合モデルの学習データ、Claudeの内部の思考過程そのものを引き出そうとするリクエストを送っている場合に限られる。
普段の対話や、コードを書かせる、資料を要約させるといった一般的な使い方をしている限りは、この3カテゴリに触れる可能性は低い。それでも気になるのは、5つある分類のうち、なぜこの3つだけが選ばれたのかという点だ。
なぜこの3つだけ有料に戻ったのか
"bio"と"frontier_llm"は名前からも内容が想像しやすい。分かりにくいのは"reasoning_extraction"(内部推論の抽出)だ。ドキュメントの説明は「モデルに対し、内部推論をレスポンステキスト内で再現するよう求めている」というだけで、これだけでは何がそんなに問題なのか実感しづらい。
ここでAnthropicが2026年9月10日に公開した脅威インテリジェンスレポートと、それを報じたTechCrunchの記事が手がかりになる。レポートは、Alibabaによる「これまで計測した中で最大の蒸留攻撃」を挙げている。2026年5月から7月の3か月間、Claude Opus 4.6・4.7に対して1億5,100万件を超えるやり取りが送られた。ピーク時は1日あたり約300万件、使われた不正なアカウントは3,500を超えていたという。
手口は、固定のプロンプトをすべてのリクエストに仕込み、Claudeに内部の推論過程をそのままテキストタグの中に書き出させるというものだ。目的は自社のQwenモデル群を訓練するための教材づくりだった。
つまり"reasoning_extraction"というカテゴリ名の裏には、億単位のやり取りで内部推論を引き出そうとした事例があった。自分は当初、危険度の高さでカテゴリが選ばれているのだろうと考えていた。だが課金対象になった3つを見比べると、無料であることを見越して大量に自動化されやすいかどうかが線引きの基準になっている、と自分には読めた。"cyber"のように内容自体は深刻でも、この種の大規模な自動悪用が確認されていないカテゴリは、引き続き無料のまま残されている。
Anthropic自身、今回の変更の理由を「セーフガードの大規模回避を防ぐため」とだけ説明しており、Alibabaの事例を名指ししているわけではない。ただ、カテゴリ名と手口が重なる点に、自分は関連を感じた。
自分のアプリへの影響はどう確かめるか
自分のアプリがこの変更で追加の費用を負担することになるかは、次の2点で確かめられる。
- レスポンスの
stop_details.categoryを確認する。bio・frontier_llm・reasoning_extractionのいずれかが頻出していなければ、今回の変更による請求額への影響はほぼない - 逆に、身に覚えのない拒否課金が続くなら、自分のアプリが意図せずこの3種類のどれかに近い内容を送っている可能性がある、という手がかりになる
拒否そのものを減らしたい場合は、fallbacksパラメータで拒否時に別のモデルへ自動的に処理を引き継がせる仕組みも用意されている。これは今回新しく追加された機能ではなく、2026年7月24日から使える既存の仕組みだが、拒否の課金ルールとセットで理解しておくと役に立つ。拒否されたリクエストをそのまま同じモデルへ再送信しても、多くの場合はまた拒否されるだけだが、別のモデルで再試行すれば通ることがある、という前提に立った機能だ。
なお、誤って拒否と判定される割合(誤検知率)について、Anthropicは0.1%未満に抑えていると説明している。ただしこれはAnthropic自身の測定によるもので、独立した第三者機関による検証は確認できていない。誤って課金された場合の返金や異議申し立ての具体的な手順も、今回確認した公式ドキュメントの範囲には見当たらなかった。
まとめ
2026年9月24日、Anthropicは出力前に拒否されたリクエストのうち、bio・frontier_llm・reasoning_extractionの3カテゴリに限って課金を再開した。それ以外のカテゴリは引き続き無料で、claude.ai・Claude Code・Coworkの利用者の99.7%はそもそも対象に触れていない。危険性の大小よりも、無料であることが大規模な自動悪用に使われやすいかどうかが線引きの基準になっており、reasoning_extractionが指す内部推論の抽出には、億単位のやり取りが送られた蒸留攻撃の実例があった。
自分のアプリへの影響はstop_details.categoryで確認できる。拒否そのものを減らしたい場合は、fallbacksパラメータによる自動フォールバックが既存の対処法として使える。
コメント
気づきや感想をどうぞ記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。
投稿にはGoogleログインが必要です。
Googleでログイン投稿にはGoogleアカウントの表示名が公開されます。メールアドレスは取得・公開しません。
コメントを読み込んでいます…