Litmus — 話題のニュースを、深く読み解く。 RSS
AI

さくらインターネット、専有GPUで定額利用できる生成AIサービスを開始

さくらインターネットが、GPUを専有し月額定額で生成AIを使える「AI Engineプライベートエディション」を開始。従量課金は選ぶモデルで単価が最大6.7倍違い、定額が解くのは見積もりの不確実さだ。

イメージ写真。データセンター内に並ぶ、青いケーブルが配線されたサーバーラックの列。

イメージ写真 記事の内容を撮影したものではありません。Photo by Brett Sayles on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

生成AIの利用料の請求書を開いて、先月と同じような使い方をしたはずなのに金額が増えていて驚いた、という担当者は少なくないはずだ。使った分だけ課金される仕組みでは、どのモデルをどれだけ使うかによって金額の伸び方が変わってしまう。

さくらインターネットは2026年10月8日、この不確実さに応える新サービス「さくらのAI Engine プライベートエディション」の提供を始めた。プレスリリースによると、GPUを自社だけで専有し、トークンの消費量にかかわらず月額定額で使える。ただ、その月額がいくらになるのかは、このニュースを見ただけでは分からない。

専有GPUの定額サービス開始

新サービスは、企業が保有する生成AIモデルを、さくらインターネットのGPU基盤上で専有環境として動かすサービスだ。「専有」とは、他の利用者と共有しない、自社の処理だけに割り当てられたGPUを指す。推論基盤の構築から運用・監視、障害対応までを事業者側が担うため、利用者はサーバーの面倒を見なくてよい。

申し込みは製品ページの問い合わせフォームから行い、構成に応じて個別に見積もる。価格は公開されていない。

プレスリリースでは、国内データセンターで運用し、入力データやモデル資産を外部に出さない運用ができる点が特徴として挙げられている。閉域接続にも対応し、入力データと生成結果をAI学習に使わない点も明記されている。機密情報を扱う社内業務や、自社サービスの提供基盤としての利用を想定しているという。

「GPU単位の月額定額」と言われても、それだけでは何がどれくらい変わるのか実感しにくい。従来の課金方式とどれくらい単価差があるのかを見ると、定額にする意味が見えてくる。

従量課金はどれだけ不確実か

比べる相手になるのが、API経由でトークン単位の従量課金を使う、従来の「さくらのAI Engine」だ。同じ1つのサービスの中でも、選ぶモデルによって単価はどれくらい違うのか。

公式料金ページによると、従来版には無償枠もある。たとえばgpt-oss-120bなら、Chat completionsで月3,000リクエストまでは無料だ。無償枠を超えた分から、トークン単位の課金が始まる。この従量課金の単価が、提供モデルごとに公式ページで公開されている。

012345円/1万トークンgpt-oss-120b: 0.75gemma-4-31B-it: 0.96Qwen3.6-35B-A3B: 1.5Kimi-K2.6: 3Kimi-K2.7-Code: 5.040.750.961.535.04gpt-oss-120bgemma-4-31B-itQwen3.6-35B-A3BKimi-K2.6Kimi-K2.7-Code

同じ「さくらのAI Engine」という1つのサービスの中でも、選ぶモデル次第で出力の単価は最大6.7倍違う。自分はこの表を見るまで、1つのサービスの中でここまで単価が開くとは思っていなかった。

仮に、社内のコーディング支援にKimi-K2.7-Codeを使い、月に1億トークンを出力したとする。単価5.04円/1万トークンで計算すると、出力分だけで月5万400円になる。同じ量をgpt-oss-120bの単価(0.75円/1万トークン)に置き換えれば7,500円で済む。モデルを選び直すだけで、同じ利用量でも請求額は7倍近く動く。これはあくまで出力トークン数を仮定した試算で、実際の利用量とは別物だが、単価の差がそのまま請求額の差になる構造は、公式料金ページの数字から読み取れる。

プライベートエディションが変えたのは、金額の大小ではない。使う前に金額の天井が決まるかどうかだ。GPUを何台専有するかで月額が決まるので、利用量やモデルの組み合わせが変わっても、請求額自体は動かない。

定額で変わったこと

課金の単位が変わるだけでなく、使えるモデルの範囲も変わる。製品ページによると、独自開発モデルやファインチューニング済みモデルに加え、Kimi・Gemmaなどのオープンウェイトモデルを専有環境へ持ち込める。オープンウェイトモデルとは、モデルの重みが公開されていて、自社の環境にそのまま置いて動かせるモデルを指す。

さらに、外部のOpenAIやAnthropicのモデルと組み合わせて使う構成も案内されている。機密情報を扱う処理は持ち込んだ自社モデルに任せ、それ以外の一般的な処理は外部APIを使う、という役割分担を想定しているのではないかと自分は見ている。製品ページにはそこまで踏み込んだ説明はなく、あくまで見立てにとどまる。

項目従来のAI Engine(従量課金)プライベートエディション
課金の単位使ったトークン数専有するGPUの台数(月額)
料金の決まり方公式ページに単価が公開されている問い合わせの上で個別に見積もる
使えるモデルさくらが用意したモデルから選ぶ独自開発・ファインチューニング済み・オープンウェイト(Kimi、Gemmaなど)を持ち込める。外部のOpenAI・Anthropicのモデルとの併用も案内されている

表からも分かるとおり、プライベートエディションは「安く使う」サービスではなく「自分のモデルを、自分専用の環境で、決まった金額で動かす」サービスに近い。公開された従量課金の単価表と比べられる形になっていない時点で、そもそも安さで競う設計になっていないと見てよさそうだ。

向く会社とまだ早い会社

既存のAI Engineを終了するという記載はプレスリリースになく、2つのサービスは当面並行して提供されるとみられる。既存ユーザーが移行を迫られるわけではないとすると、ここまでの条件から向き不向きが見えてくる。

  • 利用量が増えるほど請求額が読めなくなってきた会社には向く。GPU台数という上限がはっきりした単位に置き換えられる
  • 独自モデルやファインチューニング済みモデルを社内で育てていて、外部にデータを出したくない会社にも向く。国内データセンター・閉域接続・学習不使用という3条件が揃っている
  • 利用量がまだ少なく、無償枠と従量課金で足りている会社には、今すぐ切り替える理由がない。月額の金額が公開されておらず、問い合わせない限り損得を比較できない点もハードルになる

まとめ

さくらインターネットは2026年10月8日、GPUを専有し月額定額で生成AIを使える「AI Engineプライベートエディション」の提供を始めた。従来の従量課金は、同じサービス内でもモデルによって出力単価が最大6.7倍違い、使うモデルや量が変わると請求額も大きく動く仕組みだった。

プライベートエディションが提供するのは、安さではなく、GPU台数という上限が事前に決まることだ。独自モデルやオープンウェイトモデルを専有環境に持ち込み、国内データセンターで閉域に運用できる点も、従来のAPI利用にはなかった選択肢になる。価格は問い合わせを通じて個別に決まるため、請求額の読めなさに困っている企業は、まず見積もりを取れば自社の使い方に合う金額かどうかを確かめられる。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →