Litmus — 話題のニュースを、深く読み解く。 RSS
AI

Gemini 3.8 TTS、文章だけで声を設計できるようになった

Googleの新しい音声合成モデルGemini 3.8 TTSは、自然言語の説明文から専用の声をその場で作り、繰り返し呼び出せる。2,000以上という声の数の中身と、日本語対応・料金を確認する。

天井から吊り下げられた3本のコンデンサーマイクを見上げたスタジオの様子

イメージ写真 記事の内容を撮影したものではありません。Photo by Andreu Marquès on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

ポッドキャストや朗読動画にナレーションを入れたいが、既存の音声合成サービスで選べる声は数種類のプリセットだけで、欲しいキャラクター像にしっくりくる声が見つからない。声優を手配する予算も時間もない。そんな経験がある人に向けて、Googleが2026年9月23日(日本時間24日未明)、新しい音声合成モデル「Gemini 3.8 TTS」を発表した。公式ブログによれば、声優も録音も使わず、文章で声の特徴を説明するだけで自分専用の声を作り、その声を何度でも呼び出せるようになった。

Googleが打ち出す数字は「2,000以上の音声」。だが、この数字の中身を公式ドキュメントで追っていくと、単純に録音済みの声が2,000種類並んでいるわけではないことが分かってくる。

何が変わったのか

Gemini 3.8 TTSには「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の2種類がある。Gemini API公式ドキュメントによれば、9月23日からGemini API・Google AI Studio・Gemini Notebook・Google Vidsで使える。Gemini Enterpriseへの提供は近日予定とされている。

これまでのTTSサービスは、Zephyr・Puck・Koreなど、名前付きの声のリストから選ぶ形が主流だった。Gemini 3.8 TTSにも同じ形の「30種類のプリセット音声」が用意されている。しかし公式ブログが強調するのはその先だ。「30種類の元の音声から無限のライブラリへスケールする」と書かれている。

まずはこの数字の跳躍を見てほしい。

0500100015002000種類元のプリセット音声: 30音声ライブラリ全体: 2,000+302,000+元のプリセット音声音声ライブラリ全体

30種類から2,000種類以上へ。声優を70人近く追加で雇ったとしても届かない規模の増え方だ。この数字はどこから来ているのか。

2,000種類はどこから来ているのか

内訳を公式ドキュメントで確かめると、3つの層に分かれている。

30種類のプリセット音声

1つ目の層が、名前と特徴が公開されている30種類のプリセット音声だ。Zephyr(明るい)、Puck(はつらつ)、Charon(説明的)、Kore(しっかり)など、あらかじめ用意された声の一覧から選ぶ、これまでどおりの使い方になる。

数百種類の拡張音声ライブラリ

2つ目の層が「拡張音声ライブラリ」だ。公式ドキュメントによれば、30種類の看板の声を超えて、言語・地域のアクセント・キャラクターの人物像・分野ごとに、数百種類の追加音声を提供するという。Google AI Studioで試聴・絞り込みができ、プログラムからもvoices.list()で一覧を取得できる。

ここまでで足しても、30と数百止まりだ。2,000という数字にはまだ届かない。

言葉で声を作るVoice design

3つ目の層が「Voice design(音声デザイン)」という機能だ。名前も特徴も決まっていない声を、文章で説明するだけでその場で作れる。呼び出し方はGoogle AI Studioから、またはAPIのPOST /v1beta/voicestype="prompted"を指定する2通りがある。呼び出すと、その声固有の「persistent voice_… ID」というIDが発行され、サンプル音声のWAVファイルが返ってくる。一度発行されたIDは保存され(プロジェクトあたり最大200件、保存期間1年)、次の生成でも同じ声を指定できる。

自分は最初、この数字を見て、Googleが2,000人分の声優の収録データを揃えたのだろうと考えた。読み進めると、名前が付いた声は30種類しかなく、拡張ライブラリを足しても「数百」までしか届かない。2,000という数字の大部分を支えていたのは、声を言葉で設計する仕組みそのものだった。プリセットから選ぶ体験に慣れていると、この数字を「録音済みの声の一覧」だと読み違えやすい。

つまり、Googleは声優を2,000人増やしたのではなく、声を作る仕組み自体を広げた、ということだ。決まった声を選ぶ作業ではなく、欲しい声を注文する作業になっている。

なお、この「2,000以上」という言い方は公式ブログの発表文言だ。技術文書である公式ドキュメント側は、拡張ライブラリを「数百種類」とだけ表現しており、正確な内訳の数字は公開されていない。声を言葉で設計できるようになったという中身は同じでも、打ち出し方には差がある。

自分の欲しい声を実際に作るには、どんな指定が必要になるのか。

自分の声はどう作るのか

Voice designで声を作る手順自体は難しくない。プリセットを選ぶときと同じAPI呼び出しの中で、声の指定方法を変えるだけになる。公式ドキュメントのサンプルコードでは、generation_configspeech_configに声を指定する形が示されている。通常はここにプリセット名(例: "voice": "Kore")を書く。その場所に、Voice designで発行されたvoice_...のIDを差し込めば、同じ声を再利用できる。

読み上げさせたい文章はそのままinputに渡す。「明るく元気に」のようなスタイル指定は、speech_metadataという注釈で別に添える。声そのものの設計(Voice design)と、その声にどう演技させるか(スタイル指定)は分かれている。この分担は、既存のプリセット選択の延長として理解しやすい。

似た名前の別機能もある。声を「作る」Voice designに対し、声を「複製する」Voice replicationだ。目的で使い分ける。

  • Voice design(type="prompted"): 架空の声を、文章の説明から作る。今回扱っている機能
  • Voice replication(type="replicated"): 録音した本人の声を再現する。本人の同意を確認できる音声を添えて使う

公式ブログによれば、Voice replicationはイリノイ州・テキサス州・EEA(欧州経済領域)・英国・スイス・インドでは使えない。日本はこの制限対象に含まれていない。

声を作る手段が分かったところで、次に気になるのは、この声が日本語でも通じるのか、そして2つのモデルのどちらを選べばよいのかだ。

日本語対応とモデルの選び方

対応言語は、Flash TTSが130言語、Flash-Lite TTSが101言語で、公式ドキュメントの対応言語表にはどちらにも日本語が含まれている。メキシコスペイン語やケベックフランス語、スコットランド英語のように、同じ言語でも地域ごとのアクセントを区別して対応している点も公式ブログに明記されている。

2つのモデルの使い分けは、用途の重心で決まる。

Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
得意なこと声の忠実度と演技的なニュアンス高スループット・低遅延・低コスト
想定用途オーディオブック、スタジオ収録のナレーション大量生産、リアルタイムの音声エージェント
対応言語数130言語101言語

朗読動画やゲームのキャラクターボイスのように、1本ずつ丁寧に作る用途ならFlash TTSが向く。チャットボットの応答音声のように、リアルタイム性が優先される用途ならFlash-Liteという住み分けになる。

用途が決まったら、次は費用だ。無料で試せるのか、それとも最初から課金されるのか。

いくらかかるのか

Gemini API公式の料金ページを見ると、価格には「無料枠」と「有料枠」の2段階がある。無料枠は入力・出力とも無料だが、代わりに生成した音声がGoogleの製品改善に使われる。有料枠は課金される代わりに、製品改善への利用対象から外れる。

ここで注意したいのは、有料枠は「今は無料」ではないという点だ。有料枠の価格は、2026年12月31日までは割引価格が適用され、2027年1月1日から正規の価格に上がる。

2026年12月31日まで2027年1月1日から
Flash TTS 出力(音声)9.00ドル / 100万トークン18.00ドル / 100万トークン
Flash-Lite TTS 出力(音声)6.00ドル / 100万トークン12.00ドル / 100万トークン

音声トークンは1秒あたり25トークンに相当すると、公式ページに注記がある。Flash TTSの現行の有料枠価格で1時間分の音声を作ると、90,000トークン×9.00ドル÷100万で、約0.81ドルになる計算だ。2027年からはこの単価がそのまま倍になる。今のうちに試しておくほど、割引の恩恵を長く受けられる。

まとめ

Gemini 3.8 TTSが備えた「Voice design」は、声優の収録を挟まず、文章の説明から専用の声をその場で作る機能だ。発行されたIDを指定すれば、同じ声を何度でも呼び出せる。Googleが打ち出す「2,000以上の音声」の大部分は、この仕組みが支えている。名前付きの30種類のプリセットと数百種類の拡張ライブラリだけでは、この数字には届かない。

日本語を含む130言語(Flash-Liteは101言語)に対応し、Gemini API・Google AI Studioなどで今日から使える。有料枠の価格は2026年内は割引が適用され、2027年1月から正規価格に上がる。声優を手配せずに欲しい声を用意したいなら、値上げ前の今が試しどきになる。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →