生成AIで声と映像を作る 第1回
声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定

この記事でわかること
- 抑揚を決める 4 つの方法と、STS が向いている理由
- ElevenLabs の Voice Changer の手順と設定の詰め方
- 台詞 84 本で測った、STS で残るものと注意する所
確認した環境: ElevenLabs の Voice Changer(eleven_multilingual_sts_v2)と読み上げ(eleven_multilingual_v2)/ VOICEVOX エンジン 0.25.2 / 制作は 2026年10月11日、公式の情報の確認と音声の測定は 2026年10月12日
AI で作る声に「ここで上げて、ここで少しためる」といった細かい抑揚を付けたいときは、STS(speech to speech。録音した声を、別の声に変える方法)が向いています。この記事では、ElevenLabs(AI で声を作るサービス)の Voice Changer で STS を使う手順と設定を、編集部が動画の台詞 84 本を作ったときの記録と、その音声を測った結果で説明します。
抑揚を決める 4 つの方法
抑揚は、声の高さの上がり下がりのことです。読み上げ(TTS。文章から声を作る方法)では、文章の書き方・タグ・設定の 3 つで抑揚を変えます。STS では、自分で演じた声の抑揚がそのまま使われます。

ElevenLabs の読み上げでは、それぞれ次のように使います。
- 文章の工夫: 新しいモデルの Eleven v4 では、句読点が話し方に大きく効き、「...」で間と重みが出ると説明されています。感情を表す地の文も効きますが、その文も読み上げられるので、要らなければあとで切ります。
- タグ:
<break time="1.5s" />のように書くと、その場所に間が入ります(最長 3 秒)。使えるのは Multilingual v2・Flash v2・Flash v2.5 で、Eleven v4 と v3 では使えません。v4 と v3 では、[whispers](ささやく)のような音声タグを角かっこで書きます。 - 設定: 安定性(Stability)を下げると感情の幅が広がり、上げすぎると単調になります。設定は、1 回の生成の全体に効きます。
この 3 つで決められるのは、文の雰囲気や、間を入れる場所、生成の全体の表現の幅までです。1 音ずつ声の高さを決めたいときは、VOICEVOX(無料で使える読み上げのソフト)のエディタで手で直すか、STS で自分が演じるかのどちらかになります。
編集部が読み上げで試したこと
編集部は、社内で制作しているドラマの動画で、台詞の声を作りました。台詞は 84 本、役は男女あわせて 10 です。読み上げを 4 通り試してから、全部の台詞を STS で作ることにしました。

最初の試作を聴いた制作の担当者が「抑揚が足りない」と判断し、ほかの読み上げを順に試しました。ElevenLabs の読み上げは抑揚がよく出ましたが、「ここでためる」「ここは速く」を、台詞ごとに設定と <break> で指定する必要があります。最後は、人が全部の台詞を演じて録音し、STS で役の声に変えることにしました。人が読むので、漢字の読み違いも起きません。
同じ台詞で、声の高さの動きを比べた
同じ台詞を、読み上げの 3 通りと STS で作った音声が残っていたので、声の高さを測って比べました。声の高さは、声帯が 1 秒間に震える回数(単位は Hz)です。0.01 秒ごとに測って線にしています。縦軸の目もりは半音(ピアノの隣り合う鍵盤の高さの差)で、それぞれの声の中央値を 0 にしました。声の高さの水準は声によって違うので、上がり下がりの形だけを比べられるようにしています。

- 読み上げの 3 本は、同じ文章でも、高くなる場所や間の取り方がそれぞれ違います。
- STS の出力(青)は、演じた人の録音(灰色)と、上がり下がりの場所がほぼ同じです。「なんの話なん?」の終わりの上がり方も、「しときなさいよ〜」を高く伸ばした所も、演技のとおりに残りました。
STS の仕組み
STS は、録音した声の言い方を残したまま、声だけを別の声に変える方法です。ElevenLabs では Voice Changer という名前の機能で、以前は Speech-to-Speech と呼ばれていました。公式のドキュメントでは、元の声のトーンと話しぶりを保ったまま変換し、ささやき・笑い・泣き・なまり・細かな感情まで写す、と説明されています。

日本語には、Voice Changer のモデル eleven_multilingual_sts_v2 が対応しています(29 の言語のひとつ)。英語だけのモデル eleven_english_sts_v2 もありますが、公式は英語でも multilingual のほうを勧めています。
84 本で、元の演技と STS の出力を比べた
編集部の 84 本の台詞で、演じた人の録音と STS の出力を比べました。

- 長さ: 84 本すべてで、STS の出力の長さと元の録音の長さの差は 0.04 秒未満でした。台詞の中の間の取り方は、演じたとおりに残ります。
- 高さの動き: 声がはっきり出ている部分が 0.5 秒以上ある 72 本で、元の録音と STS の出力の高さの動きの重なり(相関。1 に近いほど同じ形)を計算しました。中央値は 0.94 で、64 本が 0.8 以上でした。
- 0.8 より低かった 8 本のうち 5 本は、同じ男性の役の台詞でした。ささやくような声や低い声は高さを測りにくく、測定の誤差も含まれます。残りの 12 本は短い台詞やささやく台詞で、はっきり声が出ている部分が 0.5 秒に足りず、比べていません。

84 本は、編集部のスタッフ 1 人が、男女すべての役を演じて録音しました。STS の出力では、女性の役は 2.4〜4.5 半音高く、男性の声を選んだ役は 1.8〜9.7 半音低くなっています。高さの動き(抑揚)は演技のまま残り、高さの水準は選んだ声に合わせて変わりました。
ElevenLabs の Voice Changer の使い方
画面(Web のアプリ)で使う手順です。

-
Voice Changer を開いて、声を選ぶ
ElevenLabs の Web のアプリで Voice Changer を開き、右の「Voice」で、変えたい先の声を選びます。
-
録音を渡す
左の枠に録音のファイルをドラッグ&ドロップするか、枠をクリックして選びます。音声のほか、動画のファイルも渡せます。その場で録るときは「Record audio」を押し、マイクのボタンで録音を始めて、終わったら停止のボタンを押します。ファイルは 50MB 未満、長さは 5 分までです。5 分より長いものは、分けて変換します。
-
設定を確かめる
モデルと、安定性・似せ具合などの設定を確かめます。家や会社で録った録音なら、「Remove Background Noise」(背景のノイズの除去)をオンにします。
-
変換して保存する
「Generate speech」を押すと変換されます。クレジット(使える量を数えるポイント)を使うのはこのときで、録音しただけでは使いません。できた音声は、履歴(History)から MP3 か WAV で保存できます。
API でまとめて変換するとき
編集部は 84 本をまとめて変換するため、API(プログラムから使う窓口)を使いました。1 本ずつ、次のように送っています。声の ID とキーは、自分のものに置き換えます。
curl -X POST "https://api.elevenlabs.io/v1/speech-to-speech/<声のID>?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-F "audio=@line01.wav" \
-F "model_id=eleven_multilingual_sts_v2" \
-F "remove_background_noise=true" \
-o line01.mp3
model_id: 使うモデルです。日本語ならeleven_multilingual_sts_v2です。remove_background_noise: 背景のノイズの除去です。voice_settings: 安定性などを、その回だけ変えるときに JSON の文字列で渡します。編集部は渡さず、声に保存された設定のまま変換しました。seed: 0〜4294967295 の数です。公式には、同じ値でも同じ結果になるとは限らない、と書かれています。
設定の詰め方
Voice Changer の設定は、読み上げと共通の声の設定に、背景のノイズの除去が加わったものです。

公式の説明では、よく使われるのは安定性 50・似せ具合 75・スタイル 0 で、そこから少しずつ動かします。
- 安定性(Stability): 下げると感情の幅が広がり、上げすぎると単調、下げすぎると不自然にばらつきます。
- 似せ具合(Similarity): 選んだ声にどこまで寄せるかです。声の元の録音に雑音があると、高くしたときに雑音まで写ることがあります。
- スタイルの誇張(Style Exaggeration): 公式は 0 のままを勧めています。0 以外にすると処理の時間が延び、少し不安定になります。
- 話者の強調(Speaker boost): 選んだ声に近づけます。差は小さく、処理の時間が少し延びます。
画面には話す速さの設定がなく、速さと間は録音のとおりになります。編集部の 84 本は、設定を変えずに変換しました。抑揚と間は、すべて演技で付けています。
録音のしかた
公式のドキュメントには、録音のコツとして次のことが書かれています。
- 感情を込めて演じる: 叫ぶ・泣く・笑うといった演技も、そのまま写ります。
- マイクの入力の大きさを合わせる: 小さすぎると聞き取られにくく、大きすぎると音が割れます。
- 録音が出力の性質を決める: なまりも録音のとおりに残ります。欲しいなまりがあれば、そのなまりで録ります。
- 背景のノイズの除去をオンにする
編集部は、ブラウザで録音するページを社内で作り、84 本を 1 行ずつ録りました。

- 台詞のカードには、①演技のメモと場面の説明を書き、名前の読み(「結衣=ゆい」など)も添えました。
- ②「録音」を押して話し、「停止」を押すと保存されます。聞き直して気になったら、その行だけ消して録り直せます。
- ③「この声で試聴」を押すと、その台詞だけを役の声に変換して聞けます。変換のたびにクレジットを使います。

- 録音のあと、話し始めの前と話し終わりのあとの無音だけを切りました(前後に 0.09 秒を残す)。台詞の中の息や間には、手を加えていません。
- 一度、息の音を小さくする処理(ノイズゲート)も入れましたが、息の消え方が大きすぎて不自然になったので外しました。背景の雑音は、Voice Changer の背景のノイズの除去に任せています。
- 変換は API で 1 本ずつ順に送り、83 本が約 3 分半で終わりました(録り直した 1 本は、あとで変換)。変換の失敗は 0 本でした。
日本語でつまずく所

読み上げでは、漢字の読み違いが起きる
編集部は、ElevenLabs の読み上げで作った声を、書き起こしの AI(Whisper。音声を文字にする AI)にかけて台本と比べました。「御社」が「ごしゃ」と書き起こされるなど、読みが台本と合わない所があり、「おんしゃ」のようにひらがなで書き直しました。
ElevenLabs には、読み方の辞書(Pronunciation dictionaries)もあります。書き方は、語を別の綴りに置き換える alias と、発音記号で指定する phoneme の 2 つです。phoneme が効くのは Eleven v4・v3・Flash v2 だけで、ほかのモデルでは alias を使います。英語以外で発音記号を使うときは Eleven v4 を使う、と書かれています。日本語での使い方は、公式のドキュメントには書かれていませんでした。
VOICEVOX にも「読み方&アクセント辞書」があり、読み違える語を登録できます。
STS では、読みは演じる人が決める
STS では、読み方とアクセントは演じた人のとおりになります。編集部は、台本の横に名前の読みを書いておき、演じるときに読み違えないようにしました。関西の言葉の台詞(グラフの台詞)も、高さの動きは演技とほぼ同じでした。
STS の出力は、短い台詞を聞いて確かめる
84 本の元の録音と STS の出力を、どちらも書き起こしの AI(Whisper large-v3)にかけ、台本とひらがなで比べました。台本と 15% 以上違って書き起こされた台詞は、元の録音では 6 本、STS の出力では 24 本でした。とくに 1.5 秒未満の短い台詞では、元の録音は 15 本すべてが台本に近く書き起こされたのに、STS の出力は 11 本が違う言葉になりました。
これは書き起こしの AI の結果なので、人の耳でも聞き取りにくいとは限りません。それでも、STS で作った声は、短い台詞と小さい声の台詞を中心に、自分の耳で聞いて確かめます。台本との照合に書き起こしの AI を使うと、聞き直す台詞をしぼれます。
料金

- STS(Voice Changer)のクレジットは、音声の長さだけで決まり、1 分で 1,000 クレジットです。読み上げは文字数で数え、Multilingual v2 は 1 文字 1 クレジットです。
- 編集部の 84 本で計算すると、1 回の変換は STS で約 5,800 クレジットです。同じ台本を読み上げで作ると約 2,000 クレジットなので、STS のほうが多く使います。録り直しや試聴の分は、別にかかります。
- API で使うときは、クレジットではなく米ドルで払います。STS は 1 分 0.12 ドル、読み上げ(Multilingual)は 1,000 文字 0.08 ドルです。
- 無料のプラン(Free)は、商用には使えません。無料のプランで作ったものを公開するときは、題名に「elevenlabs.io」か「11.ai」を入れる決まりです。有料のプランには、どれも商用のライセンスが付きます(ベータの機能を除く)。
最新の料金は、ElevenLabs の料金ページで確かめてください。
使う前に確かめること
- ElevenLabs の禁止事項(Prohibited Use Policy。2026年10月9日更新)では、生きている人の声を、本人のはっきりした同意などなしに複製・合成・なりすましすることを禁じています。
- 利用規約(2026年10月9日更新)では、必要な権利を持っていない入力(録音など)を渡したり、出力を作ったりしてはいけない、とされています。編集部の 84 本は、編集部のスタッフが自分で演じた録音です。
- 変換の先に選ぶ共有の声(Voice Library)は、ほかのユーザーが共有した声です。一部の声は有料のプランでだけ使え、無料のプランでは API から使えません。編集部は、共有の声から日本語の声を役ごとに選びました。
ほかの選択肢とくらべる
| くらべるところ | VOICEVOX | ElevenLabs の読み上げ | ElevenLabs の STS |
|---|---|---|---|
| 抑揚の付け方 | エディタで 1 音ずつ、高さ(イントネーション)と長さを直す。「抑揚」の数値を小さくすると棒読みに近くなる | 文章・タグ・設定で変える | 自分で演じる |
| 日本語の読み | 「読み方&アクセント辞書」に登録する | ひらがなで書く・読み方の辞書(alias) | 演じる人が読む |
| 手間がかかる所 | 1 音ずつ手で直す | 台詞ごとに文章やタグを直して作り直す | 全部の台詞を演じて録音する |
| 料金 | 無料(商用・非商用とも。声ごとの規約に従う) | 文字数でクレジットを使う | 長さでクレジットを使う(1 分 1,000) |
| 使うときの決まり | VOICEVOX を使ったと分かるクレジット表記が要る(「VOICEVOX:キャラクター名」など) | 無料のプランは商用に使えない | 無料のプランは商用に使えない |
編集部の 84 本では、STS の変換はすべて成功し、間の取り方はすべての台詞で演技のとおりに残りました。声の高さの動きも、多くの台詞で演技とほぼ同じです。抑揚を細かく決めたいときは、自分で演じて ElevenLabs の Voice Changer で声を変えると、言い方を自分で決められます。変換のあとは、短い台詞を中心に聞いて確かめてください。
参考にした公式の情報
- ElevenLabs ドキュメント「Voice changer」(製品ガイド)
- ElevenLabs ドキュメント「Voice changer」(Capabilities)
- ElevenLabs API リファレンス「Voice changer」
- ElevenLabs API リファレンス「Edit voice settings」
- ElevenLabs ドキュメント「Text to Speech」(製品ガイド)
- ElevenLabs ドキュメント「Best practices」
- ElevenLabs ドキュメント「Models」
- ElevenLabs ドキュメント「Using pronunciation dictionaries」
- ElevenLabs ドキュメント「Voice Library」
- ElevenLabs「Pricing」
- ElevenLabs「API pricing」
- ElevenLabs ヘルプ「Can I publish the content I generate on the platform?」
- ElevenLabs「Prohibited Use Policy」
- ElevenLabs「Terms of Service」
- VOICEVOX「使い方」
- VOICEVOX「利用規約」
- VOICEVOX「Q&A」
この記事は、ハック!でAI編集部が AI を使って執筆しました。画面の画像は、編集部の検証環境で実際に操作して撮影したものです(引用の画像は出典を記載しています)。内容の誤りはお問い合わせからお知らせください。
連載
生成AIで声と映像を作る全 2 回の目次
- 1声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定(この記事)
- 2AI で長い映像を作る(3 分・10 分の作品の作り方)
