RTX 5070 Ti 16GBでVoxCPM2を検証:日本語音声・音声クローン、高速化を通常運用で使わなかった理由
RTX 5070 Ti 16GBで、VoxCPM2を使った日本語の音声生成を検証しました。文章からの音声生成に加え、声の雰囲気を文章で指定するVoice Designと、元の音声の特徴をもとに別の文章を読み上げる音声クローンを試しました。
前回のGPT-SoVITSの記事では、自分の声を再現するために追加学習を行い、原稿を分割して生成した音声を結合する長文ナレーションを扱いました。今回は自分の声ではなく、AIで生成した音声を音声クローンの元に使っています。検証で生成した音声から5本を紹介します。
音声生成の高速化も比較しました。各設定の最初の1件では高速化設定の方が時間を要した一方、続く短文3件は速くなりました。ただし、最初の1件を含む8件全体では通常設定の方が短時間で、GPUメモリ使用量も少なかったため、今回は通常設定で運用することにしました。
検証環境とWeb操作画面
音声生成にはローカルPCのGPUを使い、ブラウザーから操作しました。操作には、VoxCPM2の公式アプリケーションに用意されているGradioベースのWeb画面を利用しました。
| 項目 | 今回使用した環境 |
|---|---|
| GPU | NVIDIA GeForce RTX 5070 Ti(16GB) |
| 実行環境 | WSL2/Docker |
| 音声生成AI | VoxCPM2(openbmb/VoxCPM2) |
| 操作画面 | VoxCPM2付属のWeb画面(Gradio) |
WSL2はWindows上でLinuxを動かす仕組み、Dockerはソフトウェアの実行環境をまとめる仕組みです。
再現用の情報として、VoxCPMのプログラムは公式ソースコードのGitコミットf0c787f(変更履歴の識別子)に固定しました。
基本の操作は、読み上げる文章を入力して生成ボタンを押す流れです。声の雰囲気を指定する場合は指示欄を使い、音声クローンでは元になる音声を読み込みます。
検証の過程で生成した11本から、5本を掲載しました。後半の速度比較は別に測定したもので、掲載音声の生成時間を示すものではありません。
日本語音声を生成する
最初は、声の雰囲気を指定せず、医療系の文章だけを入力して日本語音声を生成しました。
以下の音声はVoxCPM2で生成したAI音声です。音声クローンの元にした音声もAIで生成しており、実在人物の音声は使用していません。
実際に聴いた範囲では、句読点の間や発音が比較的自然に感じられました。「2026年度」「ICT」「生成AI」「医療機関、薬局、介護事業者」といった語も自然に聞こえ、目立つノイズは気になりませんでした。
文章で声の雰囲気を指定する
Voice Designでは、元になる音声を読み込まずに、声の特徴や話し方を文章で指定します。今回は声の指示を英語で、読み上げる文章を日本語で入力しました。
同じ医療系の文章に対して、声の指示欄には次の3種類の指示を入れました。表は英語の指示内容を日本語で要約したものです。
| 声の雰囲気 | 指示の概要 |
|---|---|
| 落ち着いた声 | 温かみがあり、明瞭に、中程度の速さで話す |
| 明るく活発な声 | 快活で表情豊かに、通常より少し速く話す |
| 明るく自然な声 | 親しみやすく自然に、少し軽快な速さで話す |
試聴では、それぞれ声の印象が異なりました。「明るく活発な声」の音声は全体として大きな破綻を感じなかった一方、出だしの日本語のトーンに少し違和感がありました。「明るく自然な声」を指定した別の音声は、出だしも自然に感じられました。掲載したのは後者です。
声の指示だけを変えた比較ではないため、ここでは試聴した印象を紹介しています。
AI音声を元に音声クローンを試す
声を文章で指定するVoice Designに対し、音声クローンでは元になる音声を読み込み、その声の特徴をもとに別の文章を読み上げる音声を生成します。ここでは、AIで生成した音声を元に2種類の方式を比べました。
通常方式と、文字起こしも使う方式
どちらの方式も、元になる音声と、新しく読み上げる文章を指定します。Ultimate Cloneでは、元の音声で話されている内容を文字にした文章も一緒に指定します。
| 方式 | 使用する入力 |
|---|---|
| 通常方式(Standard Clone) | 元になる音声、新しく読み上げる文章 |
| 文字起こしも使う方式(Ultimate Clone) | 元になる音声、その音声の文字起こし、新しく読み上げる文章 |
同じ音声を元に聴き比べる
元になる音声は、前章の3種類とは別の指示と文章で、同じVoice Design機能を使って生成しました。自然で親しみやすく、温かく落ち着いた声で、中程度の速さで話すよう指定しています。候補を聴き、安定して聞こえると感じた音声を選びました。それが掲載した03です。
04と05は、03の音声を元に、同じ文章を読み上げる音声を生成したものです。その文章は「おはようございます。今日は新しい取り組みについてご紹介します。」で始まり、03が読み上げている文章とは異なります。2方式で共通の生成設定もそろえました。
今回の試聴では、文字起こしも使う方式の方が元の音声に似ていて、音声クローンの品質も高い印象でした。少数の音声を聴いた感想であり、元の声との一致率を数値で測った比較ではありません。
音声生成を速くすると、何が変わるのか
音声生成を速くする設定(torch.compile)を試しました。同じGPUと実行環境で、入力文章や生成設定をそろえ、通常設定と高速化設定でそれぞれ8件の音声生成を行いました。
最初の1件と、続く短文3件を比べる
各設定の最初の1件には、通常設定で約59秒、高速化設定で約118秒かかりました。最初の生成時にはモデルの読み込みなどの準備を行い、高速化設定では高速化の準備処理も加わります。測定時間は音声生成までを含み、処理ごとの所要時間は分けて測っていません。
各設定で最初に行った音声生成の後、短文3件を続けて生成しました。この3件の生成速度は、音声の長さの違いを考慮すると、高速化設定が通常設定の約2.6倍でした。比較には、各生成にかかった時間を音声の長さで割り、設定ごとに3件の中央値を使っています。
続く短文3件の速さだけでなく、最初の1件を含む8件全体の時間と、GPUメモリ使用量も比べました。
| 比較項目 | 通常設定 | 高速化設定 |
|---|---|---|
| 各設定の最初の1件にかかった時間 | 約59秒 | 約118秒 |
| 続く短文3件の生成速度(音声の長さを考慮) | 基準 | 約2.6倍 |
| 最初の1件を含む8件の生成時間の合計 | 約138秒 | 約154秒 |
| GPUメモリ使用量(音声クローンの生成中) | 約6.5 GiB | 約7.4 GiB |
GPUメモリ使用量も高速化設定の方が多くなりました。表の値は、音声クローンの生成中に約1秒ごとに記録した、GPU全体の使用量の最大値です。
8件全体では通常設定の方が速かった
8件の生成時間の合計は、通常設定で約138秒、高速化設定で約154秒でした。続く短文3件の生成は速くなりましたが、最初の1件を含む8件全体では通常設定の方が短時間でした。
8件の内訳は、最初の生成1件、短い文章からの音声生成3件、やや長い文章からの音声生成2件、通常方式の音声クローン2件です。やや長い文章でも、生成した音声は約16秒でした。
生成時間は、音声生成を依頼してから結果を受け取るまでを測りました。VoxCPM2を動かす実行環境の起動・停止や、生成と生成の間の休止時間は、この合計に含めていません。
今回の通常構成では高速化設定を使わなかった
短文生成の速度だけでなく、最初の生成にかかった時間、8件全体の合計時間、GPUメモリ使用量を踏まえ、今回は通常設定を使用することにしました。
長時間にわたって連続生成する場合には、判断が変わる可能性がありますが、今回はその比較は行っていません。
利用を広げる前に確かめたいこと
今回の検証は、1台のPCで少数の音声を生成した結果です。文章や条件が変われば、音声の印象や生成時間も変わる可能性があります。
- 音声の品質: 文章や用途によって、求める声の自然さや似ている度合いは異なります。ここで紹介した評価は試聴による感想です。高速化設定による音質の違いは比較していません。
- 長い音声の生成: 長い文章では、末尾まで音声になっているかも重要です。約30.08秒で文章の途中で終わった例と、別の生成で約31.68秒の音声となり、末尾まで生成できた例がありました。後者が掲載した03です。途中で切れた原因や、生成できる長さの限界は分かっていません。
- 速度比較の範囲: 今回は各設定で同じ8件を1回ずつ測定しましたが、音声を生成する回数が増えた場合も同じ結果になるとは限りません。通常設定、高速化設定の順に測定したため、実行順や保存済みデータが結果に影響した可能性もあります。
- 外部通信: ローカルPCで音声を生成していても、外部サービスへの通信に依存する部分があります。今回の環境では、ノイズ除去用モデルの読み込みに、AIモデルの公開・配布サービスであるModelScopeへの情報照会が関わっていました。インターネット接続なしですべての処理を実行できるかは、確認していません。
まとめ
VoxCPM2を使い、文章から日本語音声を生成しました。声の雰囲気を文章で指定するVoice Designも試しました。さらに、AIで生成した音声を元に、通常方式と文字起こしも使う方式の2種類で音声クローンを生成しました。今回はその結果から5本の音声を紹介しました。
高速化設定では、最初の1件に時間がかかる一方、続く短文3件は速くなりました。最初の1件を含む8件全体の時間とGPUメモリ使用量を踏まえ、今回は高速化設定を使わず、通常設定で運用することにしました。
関連記事