本文へ移動
ハック!でAI

生成AIで声と映像を作る 第1回

声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定

ハック!でAI編集部AIにより執筆読了 約16分
同じ台詞の声の高さの動きを、VOICEVOX・ElevenLabs の読み上げ・人の演技と STS の出力で比べたグラフ

この記事でわかること

  • 抑揚を決める 4 つの方法と、STS が向いている理由
  • ElevenLabs の Voice Changer の手順と設定の詰め方
  • 台詞 84 本で測った、STS で残るものと注意する所

確認した環境: ElevenLabs の Voice Changer(eleven_multilingual_sts_v2)と読み上げ(eleven_multilingual_v2)/ VOICEVOX エンジン 0.25.2 / 制作は 2026年10月11日、公式の情報の確認と音声の測定は 2026年10月12日

AI で作る声に「ここで上げて、ここで少しためる」といった細かい抑揚を付けたいときは、STS(speech to speech。録音した声を、別の声に変える方法)が向いています。この記事では、ElevenLabs(AI で声を作るサービス)の Voice Changer で STS を使う手順と設定を、編集部が動画の台詞 84 本を作ったときの記録と、その音声を測った結果で説明します。

抑揚を決める 4 つの方法

抑揚は、声の高さの上がり下がりのことです。読み上げ(TTS。文章から声を作る方法)では、文章の書き方・タグ・設定の 3 つで抑揚を変えます。STS では、自分で演じた声の抑揚がそのまま使われます。

文章の工夫・タグ・設定・STS の 4 つを、決められること(文の雰囲気・入れた場所・1 回の生成の全体・1 音ずつ)と ElevenLabs での例で並べた表。下に、VOICEVOX はエディタで 1 音ずつ高さと長さを直せると書いてある
抑揚を決める 4 つの方法。下に行くほど、細かい所まで自分で決められる撮影・作図: 編集部

ElevenLabs の読み上げでは、それぞれ次のように使います。

  • 文章の工夫: 新しいモデルの Eleven v4 では、句読点が話し方に大きく効き、「...」で間と重みが出ると説明されています。感情を表す地の文も効きますが、その文も読み上げられるので、要らなければあとで切ります。
  • タグ: <break time="1.5s" /> のように書くと、その場所に間が入ります(最長 3 秒)。使えるのは Multilingual v2・Flash v2・Flash v2.5 で、Eleven v4 と v3 では使えません。v4 と v3 では、[whispers](ささやく)のような音声タグを角かっこで書きます。
  • 設定: 安定性(Stability)を下げると感情の幅が広がり、上げすぎると単調になります。設定は、1 回の生成の全体に効きます。

この 3 つで決められるのは、文の雰囲気や、間を入れる場所、生成の全体の表現の幅までです。1 音ずつ声の高さを決めたいときは、VOICEVOX(無料で使える読み上げのソフト)のエディタで手で直すか、STS で自分が演じるかのどちらかになります。

編集部が読み上げで試したこと

編集部は、社内で制作しているドラマの動画で、台詞の声を作りました。台詞は 84 本、役は男女あわせて 10 です。読み上げを 4 通り試してから、全部の台詞を STS で作ることにしました。

1 無料の読み上げ(男性の声が 1 種類だけ)、2 VOICEVOX(抑揚を上げても合成の声らしさが残った)、3 ElevenLabs の読み上げ(読み違いをひらがなで直した)、4 設定と間を詰めた(台詞ごとに指定が必要)、5 STS(全 84 行で採用)を並べた表
編集部が声を決めるまでに試した順番。4 通りの読み上げのあと、STS に決めた撮影・作図: 編集部

最初の試作を聴いた制作の担当者が「抑揚が足りない」と判断し、ほかの読み上げを順に試しました。ElevenLabs の読み上げは抑揚がよく出ましたが、「ここでためる」「ここは速く」を、台詞ごとに設定と <break> で指定する必要があります。最後は、人が全部の台詞を演じて録音し、STS で役の声に変えることにしました。人が読むので、漢字の読み違いも起きません。

同じ台詞で、声の高さの動きを比べた

同じ台詞を、読み上げの 3 通りと STS で作った音声が残っていたので、声の高さを測って比べました。声の高さは、声帯が 1 秒間に震える回数(単位は Hz)です。0.01 秒ごとに測って線にしています。縦軸の目もりは半音(ピアノの隣り合う鍵盤の高さの差)で、それぞれの声の中央値を 0 にしました。声の高さの水準は声によって違うので、上がり下がりの形だけを比べられるようにしています。

台詞「お、なんの話なん? まあ、ほどほどにしときなさいよ〜」の声の高さを、VOICEVOX(ふつう)、VOICEVOX(抑揚を上げた)、ElevenLabs の読み上げ、人の演技と STS の出力の 4 段で比べたグラフ。一番下の段では、灰色と青の線がほぼ重なっている
同じ台詞の声の高さの動き。STS の出力(青)は、元の録音(灰色)とほぼ重なる撮影・作図: 編集部
  • 読み上げの 3 本は、同じ文章でも、高くなる場所や間の取り方がそれぞれ違います。
  • STS の出力(青)は、演じた人の録音(灰色)と、上がり下がりの場所がほぼ同じです。「なんの話なん?」の終わりの上がり方も、「しときなさいよ〜」を高く伸ばした所も、演技のとおりに残りました。

STS の仕組み

STS は、録音した声の言い方を残したまま、声だけを別の声に変える方法です。ElevenLabs では Voice Changer という名前の機能で、以前は Speech-to-Speech と呼ばれていました。公式のドキュメントでは、元の声のトーンと話しぶりを保ったまま変換し、ささやき・笑い・泣き・なまり・細かな感情まで写す、と説明されています。

自分の声で録音する、Voice Changer で声だけを差し替える、目的の声で同じ言い方になる、の 3 段の図。残るもの(抑揚・間・話す速さ・感情・読み方とアクセント)と、変わるもの(声の質・声の高さの水準)を並べている
STS は、言い方(抑揚・間・感情・読み)を残して、声の質と高さの水準を変える撮影・作図: 編集部

日本語には、Voice Changer のモデル eleven_multilingual_sts_v2 が対応しています(29 の言語のひとつ)。英語だけのモデル eleven_english_sts_v2 もありますが、公式は英語でも multilingual のほうを勧めています。

84 本で、元の演技と STS の出力を比べた

編集部の 84 本の台詞で、演じた人の録音と STS の出力を比べました。

左は、元の録音の長さと STS の出力の長さの散布図で、84 本すべてが斜めの線の上に並ぶ。右は、高さの動きの重なり(相関)の分布で、72 本のうち 64 本が 0.8 以上、中央値は 0.94
左: 長さ(間の取り方)はそのまま残った。右: 声の高さの動きも、多くの台詞でほぼ同じだった撮影・作図: 編集部
  • 長さ: 84 本すべてで、STS の出力の長さと元の録音の長さの差は 0.04 秒未満でした。台詞の中の間の取り方は、演じたとおりに残ります。
  • 高さの動き: 声がはっきり出ている部分が 0.5 秒以上ある 72 本で、元の録音と STS の出力の高さの動きの重なり(相関。1 に近いほど同じ形)を計算しました。中央値は 0.94 で、64 本が 0.8 以上でした。
  • 0.8 より低かった 8 本のうち 5 本は、同じ男性の役の台詞でした。ささやくような声や低い声は高さを測りにくく、測定の誤差も含まれます。残りの 12 本は短い台詞やささやく台詞で、はっきり声が出ている部分が 0.5 秒に足りず、比べていません。
10 の役ごとに、元の演技の声の高さの中央値(灰色)と STS の出力の中央値(青)を結んだ図。女性の役は 2.4〜4.5 半音高く、男性の声を選んだ役は 1.8〜9.7 半音低くなった
1 人で演じても、声の高さの水準は役の声に移った撮影・作図: 編集部

84 本は、編集部のスタッフ 1 人が、男女すべての役を演じて録音しました。STS の出力では、女性の役は 2.4〜4.5 半音高く、男性の声を選んだ役は 1.8〜9.7 半音低くなっています。高さの動き(抑揚)は演技のまま残り、高さの水準は選んだ声に合わせて変わりました。

ElevenLabs の Voice Changer の使い方

画面(Web のアプリ)で使う手順です。

Voice Changer の画面。左に Click to upload, or drag and drop、Audio or video file, up to 50MB、Record audio。右に Voice、Model(Eleven Multilingual v2)、Stability、Similarity、Style Exaggeration、Remove Background Noise、Speaker boost。下に Generate speech のボタン
Voice Changer の画面。左に録音を渡す枠、右に声・モデル・設定が並ぶ出典: ElevenLabs ドキュメント「Voice changer」
  1. Voice Changer を開いて、声を選ぶ

    ElevenLabs の Web のアプリで Voice Changer を開き、右の「Voice」で、変えたい先の声を選びます。

  2. 録音を渡す

    左の枠に録音のファイルをドラッグ&ドロップするか、枠をクリックして選びます。音声のほか、動画のファイルも渡せます。その場で録るときは「Record audio」を押し、マイクのボタンで録音を始めて、終わったら停止のボタンを押します。ファイルは 50MB 未満、長さは 5 分までです。5 分より長いものは、分けて変換します。

  3. 設定を確かめる

    モデルと、安定性・似せ具合などの設定を確かめます。家や会社で録った録音なら、「Remove Background Noise」(背景のノイズの除去)をオンにします。

  4. 変換して保存する

    「Generate speech」を押すと変換されます。クレジット(使える量を数えるポイント)を使うのはこのときで、録音しただけでは使いません。できた音声は、履歴(History)から MP3 か WAV で保存できます。

API でまとめて変換するとき

編集部は 84 本をまとめて変換するため、API(プログラムから使う窓口)を使いました。1 本ずつ、次のように送っています。声の ID とキーは、自分のものに置き換えます。

ターミナル
curl -X POST "https://api.elevenlabs.io/v1/speech-to-speech/<声のID>?output_format=mp3_44100_128" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "audio=@line01.wav" \
  -F "model_id=eleven_multilingual_sts_v2" \
  -F "remove_background_noise=true" \
  -o line01.mp3
  • model_id: 使うモデルです。日本語なら eleven_multilingual_sts_v2 です。
  • remove_background_noise: 背景のノイズの除去です。
  • voice_settings: 安定性などを、その回だけ変えるときに JSON の文字列で渡します。編集部は渡さず、声に保存された設定のまま変換しました。
  • seed: 0〜4294967295 の数です。公式には、同じ値でも同じ結果になるとは限らない、と書かれています。

設定の詰め方

Voice Changer の設定は、読み上げと共通の声の設定に、背景のノイズの除去が加わったものです。

モデル(eleven_multilingual_sts_v2)、安定性(既定 0.5)、似せ具合(既定 0.75)、スタイルの誇張(既定 0)、話者の強調(既定オン)、背景のノイズの除去(Voice Changer だけ)の 6 つのカードと、編集部の 84 本の設定
Voice Changer の設定と効き方。編集部は、抑揚を設定ではなく演技で付けた撮影・作図: 編集部

公式の説明では、よく使われるのは安定性 50・似せ具合 75・スタイル 0 で、そこから少しずつ動かします。

  • 安定性(Stability): 下げると感情の幅が広がり、上げすぎると単調、下げすぎると不自然にばらつきます。
  • 似せ具合(Similarity): 選んだ声にどこまで寄せるかです。声の元の録音に雑音があると、高くしたときに雑音まで写ることがあります。
  • スタイルの誇張(Style Exaggeration): 公式は 0 のままを勧めています。0 以外にすると処理の時間が延び、少し不安定になります。
  • 話者の強調(Speaker boost): 選んだ声に近づけます。差は小さく、処理の時間が少し延びます。

画面には話す速さの設定がなく、速さと間は録音のとおりになります。編集部の 84 本は、設定を変えずに変換しました。抑揚と間は、すべて演技で付けています。

録音のしかた

公式のドキュメントには、録音のコツとして次のことが書かれています。

  • 感情を込めて演じる: 叫ぶ・泣く・笑うといった演技も、そのまま写ります。
  • マイクの入力の大きさを合わせる: 小さすぎると聞き取られにくく、大きすぎると音が割れます。
  • 録音が出力の性質を決める: なまりも録音のとおりに残ります。欲しいなまりがあれば、そのなまりで録ります。
  • 背景のノイズの除去をオンにする

編集部は、ブラウザで録音するページを社内で作り、84 本を 1 行ずつ録りました。

録音済み 84 / 84 行の表示と、役ごとに絞り込むボタン。ナレーションの台詞のカードに、演技のメモ、台詞、読み: 結衣=ゆい、録音、この声で試聴、消す のボタンが並んでいる
編集部が作った録音のページ。① 台詞ごとの演技のメモと場面の説明 ② 録音のボタン ③ その台詞だけを役の声に変えて聞くボタン撮影・作図: 編集部
  • 台詞のカードには、①演技のメモと場面の説明を書き、名前の読み(「結衣=ゆい」など)も添えました。
  • ②「録音」を押して話し、「停止」を押すと保存されます。聞き直して気になったら、その行だけ消して録り直せます。
  • ③「この声で試聴」を押すと、その台詞だけを役の声に変換して聞けます。変換のたびにクレジットを使います。
1 台本を 1 行ずつに分ける、2 ブラウザで録る、3 前後の無音だけ切る、4 Voice Changer で役の声に変える、の流れ。変換した台詞 84 本、音声の長さ約 5 分 49 秒、83 本をまとめて約 3 分半で変換、失敗は 0 本。息の音を小さくする処理は不自然になったのでやめた
台詞 84 本を STS で作った流れ。下ごしらえは、前後の無音を切るだけにした撮影・作図: 編集部
  • 録音のあと、話し始めの前と話し終わりのあとの無音だけを切りました(前後に 0.09 秒を残す)。台詞の中の息や間には、手を加えていません。
  • 一度、息の音を小さくする処理(ノイズゲート)も入れましたが、息の消え方が大きすぎて不自然になったので外しました。背景の雑音は、Voice Changer の背景のノイズの除去に任せています。
  • 変換は API で 1 本ずつ順に送り、83 本が約 3 分半で終わりました(録り直した 1 本は、あとで変換)。変換の失敗は 0 本でした。

日本語でつまずく所

左は読み上げの読み違いの例(御社が「ごしゃ」、焦ってが「ちょって」、「点検で伺いました」が「転換で思いました」と書き起こされた)と直し方。右は STS の注意で、書き起こしが台本と違った台詞の数を、1.5 秒未満の台詞(元の録音 0 本、STS 11 本)、心の声(1 本、4 本)、そのほか(5 本、9 本)で比べたグラフ
日本語の読みと聞き取りやすさ。読み上げでは読み違いが起き、STS では短い台詞が聞き取りにくくなることがあった撮影・作図: 編集部

読み上げでは、漢字の読み違いが起きる

編集部は、ElevenLabs の読み上げで作った声を、書き起こしの AI(Whisper。音声を文字にする AI)にかけて台本と比べました。「御社」が「ごしゃ」と書き起こされるなど、読みが台本と合わない所があり、「おんしゃ」のようにひらがなで書き直しました。

ElevenLabs には、読み方の辞書(Pronunciation dictionaries)もあります。書き方は、語を別の綴りに置き換える alias と、発音記号で指定する phoneme の 2 つです。phoneme が効くのは Eleven v4・v3・Flash v2 だけで、ほかのモデルでは alias を使います。英語以外で発音記号を使うときは Eleven v4 を使う、と書かれています。日本語での使い方は、公式のドキュメントには書かれていませんでした。

VOICEVOX にも「読み方&アクセント辞書」があり、読み違える語を登録できます。

STS では、読みは演じる人が決める

STS では、読み方とアクセントは演じた人のとおりになります。編集部は、台本の横に名前の読みを書いておき、演じるときに読み違えないようにしました。関西の言葉の台詞(グラフの台詞)も、高さの動きは演技とほぼ同じでした。

STS の出力は、短い台詞を聞いて確かめる

84 本の元の録音と STS の出力を、どちらも書き起こしの AI(Whisper large-v3)にかけ、台本とひらがなで比べました。台本と 15% 以上違って書き起こされた台詞は、元の録音では 6 本、STS の出力では 24 本でした。とくに 1.5 秒未満の短い台詞では、元の録音は 15 本すべてが台本に近く書き起こされたのに、STS の出力は 11 本が違う言葉になりました。

これは書き起こしの AI の結果なので、人の耳でも聞き取りにくいとは限りません。それでも、STS で作った声は、短い台詞と小さい声の台詞を中心に、自分の耳で聞いて確かめます。台本との照合に書き起こしの AI を使うと、聞き直す台詞をしぼれます。

料金

読み上げ(Multilingual v2)は 1 文字 1 クレジットで、84 本の台本 2,029 文字なら約 2,000 クレジット。STS は 1 分 1,000 クレジットで、84 本の 5 分 49 秒なら約 5,800 クレジット。下に、プランごとの月額・月のクレジット・STS に使える分数の表
ElevenLabs の料金の数え方。読み上げは文字数、STS は長さで数える。編集部の 84 本で計算した目安つき撮影・作図: 編集部
  • STS(Voice Changer)のクレジットは、音声の長さだけで決まり、1 分で 1,000 クレジットです。読み上げは文字数で数え、Multilingual v2 は 1 文字 1 クレジットです。
  • 編集部の 84 本で計算すると、1 回の変換は STS で約 5,800 クレジットです。同じ台本を読み上げで作ると約 2,000 クレジットなので、STS のほうが多く使います。録り直しや試聴の分は、別にかかります。
  • API で使うときは、クレジットではなく米ドルで払います。STS は 1 分 0.12 ドル、読み上げ(Multilingual)は 1,000 文字 0.08 ドルです。
  • 無料のプラン(Free)は、商用には使えません。無料のプランで作ったものを公開するときは、題名に「elevenlabs.io」か「11.ai」を入れる決まりです。有料のプランには、どれも商用のライセンスが付きます(ベータの機能を除く)。

最新の料金は、ElevenLabs の料金ページで確かめてください。

使う前に確かめること

  • ElevenLabs の禁止事項(Prohibited Use Policy。2026年10月9日更新)では、生きている人の声を、本人のはっきりした同意などなしに複製・合成・なりすましすることを禁じています。
  • 利用規約(2026年10月9日更新)では、必要な権利を持っていない入力(録音など)を渡したり、出力を作ったりしてはいけない、とされています。編集部の 84 本は、編集部のスタッフが自分で演じた録音です。
  • 変換の先に選ぶ共有の声(Voice Library)は、ほかのユーザーが共有した声です。一部の声は有料のプランでだけ使え、無料のプランでは API から使えません。編集部は、共有の声から日本語の声を役ごとに選びました。

ほかの選択肢とくらべる

くらべるところ VOICEVOX ElevenLabs の読み上げ ElevenLabs の STS
抑揚の付け方 エディタで 1 音ずつ、高さ(イントネーション)と長さを直す。「抑揚」の数値を小さくすると棒読みに近くなる 文章・タグ・設定で変える 自分で演じる
日本語の読み 「読み方&アクセント辞書」に登録する ひらがなで書く・読み方の辞書(alias) 演じる人が読む
手間がかかる所 1 音ずつ手で直す 台詞ごとに文章やタグを直して作り直す 全部の台詞を演じて録音する
料金 無料(商用・非商用とも。声ごとの規約に従う) 文字数でクレジットを使う 長さでクレジットを使う(1 分 1,000)
使うときの決まり VOICEVOX を使ったと分かるクレジット表記が要る(「VOICEVOX:キャラクター名」など) 無料のプランは商用に使えない 無料のプランは商用に使えない

編集部の 84 本では、STS の変換はすべて成功し、間の取り方はすべての台詞で演技のとおりに残りました。声の高さの動きも、多くの台詞で演技とほぼ同じです。抑揚を細かく決めたいときは、自分で演じて ElevenLabs の Voice Changer で声を変えると、言い方を自分で決められます。変換のあとは、短い台詞を中心に聞いて確かめてください。

参考にした公式の情報

XFacebookはてブLINE

この記事は、ハック!でAI編集部が AI を使って執筆しました。画面の画像は、編集部の検証環境で実際に操作して撮影したものです(引用の画像は出典を記載しています)。内容の誤りはお問い合わせからお知らせください。

連載

生成AIで声と映像を作る
全 2 回の目次
  1. 1声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定(この記事)
  2. 2AI で長い映像を作る(3 分・10 分の作品の作り方)

あわせて読みたい