声の複製への懸念について
最終更新:
voice-commons は自分の声を自分の意思で共有する場です。ボイスクローンによる声の複製への懸念に対してその共有を支える決まりと仕組み、そして仕組みでは塞げないことを書きます。
はじめに
人の声を AI に学習させその声で話させることが誰にでもできるようになりました。自分の声が知らないところで複製されて使われる。その懸念は正当なものだと考えています。
voice-commons は自分の声を自分の意思で共有する場です。提供者は自分の声を録音して公開し、取得者はそれをボイスクローン(音声合成や声質変換のモデル)の学習と学習したモデルによる音声の生成に使います。この文書にはその共有を支える決まりと仕組み、そして仕組みでは塞げないことを書きます。
決まり: 公開できるのは自分の声だけ
- voice-commons で公開できるのは提供者自身の声だけです。これを自声原則と呼んでいます。
- 取得者がどう使えるかは共通ライセンスが決めています。提供者が同意しているのは学習と生成、生成した音声の非商用の利用までです。商用の利用は提供者が収録スタイルごとに許したときだけ加わります。
- 共通ライセンスは次の用途を禁じています(第 5 条)。
- 性的な内容、政治的または宗教的な主張・勧誘、提供者その他の人物へのなりすまし、詐欺その他の違法行為、ヘイト・誹謗中傷・差別的表現。
- 学習したモデルからの再学習、ほかの話者の声との合成、ボイスサンプルを入力にして提供者以外の声に変換すること。
- サンプルの音声や学習したモデルを第三者に渡すこと。
- 生成した音声を公開・配布するときは AI が生成したものだと明示することを求めています(第 7 条)。
- 取得できるのはアカウントを登録した 18 歳以上の人だけです。誰が・どのサンプルを・どの版の条件で・いつ取得したかを記録しています。
仕組み: 抑止を重ね抜けたものを落とす
録音が本人の声であることを仕組みで確かめきることはできません。ブラウザーのマイクに、録音済みの音や合成した音声を流し込むことを止める手段が無いからです。そこで voice-commons は手間と痕跡を増やす抑止を重ね、それでも抜けたものを通報と人の審査で落とす形を取っています。
- 発話チャレンジ: 最初にランダムに出る 5 つの文を出題から 10 分以内に読み上げてもらいます。その声から照合の基準(基準声紋)を作ります。
- 話者照合: 録音した 100 文をつないだ音声を基準声紋と照合します。一定の線を超えたものが公開に進みます。
- 再チャレンジ: 線に届かなかったときはその場で出る 2 文を読み上げてもらい、その声がサンプルの声と一致するか基準声紋と食い違わないかを確かめます。確かめられなければ人の審査に回ります。
- 台帳: 録音した音声のハッシュ(SHA-256)をサーバーで計算して記録しあとからの差し替えを見つけます。
- 通報と審査: 公開中のサンプルは登録していない人も通報できます。提供者本人の声ではないという通報を受けたら原本を照合し直し、AI 生成の検出器の結果も参考にして人が判断します。故意に他人の声や複製した声を公開したと判断したらサンプルを削除しアカウントを停止します。
どの層も攻撃を塞ぐものではありません。手間を増やして割に合わなくし痕跡を残して後から見つけられるようにするためのものです。
仕組みでは塞げないこと
他人の声を AI で複製しその複製した声で登録から公開までを通す使い方は仕組みでは塞げません。
発話チャレンジも 100 文の録音もその場で合成した声で読まれてしまえば、照合は同じ人の声と判定します。話者照合は声が似ているかを比べる仕組みで声が生身のものか合成されたものかは見分けません。
照合と検出の数値は次のとおりです。照合の線は運用している 0.60 です。
- 別の人の生の声: 照合でおおむね弾けますが完全ではありません。スタジオで録った 100 人の音声(JVS コーパス)で本番と同じ長さ(約 100 文)をつないで測ると、同性の他人の 6.7%(性別を問わなければ 3.3%)が線を超えました。
- 本人の声を AI で複製した音声: 照合ではほとんど止められません。4 秒の見本から作った複製 24 件(8 人ぶん)の照合のスコアは 0.56〜0.86、平均 0.735 で、8 人とも複製の平均は線の 0.60 を超えていました。この測定は 1 文ずつの照合で本番の 100 文をつないだ照合では測っていません。
- AI 生成の検出器: 複製 24 件はすべて AI 生成と見分けましたが、本物の録音 8 件のうち 5 件(62.5%)も AI 生成と判定しました。本物の声の提供者を誤って弾くことになるので検出器は自動の判定には使わず、通報を受けたときの参考にだけ使っています。
どの数値も運営が 2026 年 8〜9 月に測ったものです。スタジオの録音とブラウザーで家庭で録る録音とでは条件が違います。
撤回でできること、できないこと
- 提供者はいつでもサンプルを撤回できます。撤回すると新しい取得はすぐに止まります。すでに取得した人には一律 30 日の猶予があり、猶予が明けると原本・取得ファイル・試聴プレビューは削除されます。
- ただし猶予が明けるまでに作られた学習モデルと生成物に撤回は及びません。撤回は先に向かってだけ効きます。
音声業界の声明との関係
声の無断利用について音声業界から次の声明が出ています。voice-commons がどこに応えていてどこに応えていないかを書きます。
「生成 AI に関する音声業界三団体の主張」(新しいタブで開く)(2024 年 11 月 13 日)
協同組合日本俳優連合、一般社団法人日本芸能マネージメント事業者協会、一般社団法人日本声優事業社協議会が次の 3 つを求めています。
- 生成 AI 音声をアニメーションや外国映画などの吹替で使わないこと。
- 生成 AI 音声を学習・利用するときは本人の許諾を得ること。そのうえで生成 AI 音声を使うビジネスでは買取り契約(一回の支払いで無期限に使える契約)ではなく、案件ごとに個別の契約を結ぶこと。
- 生成 AI 音声に AI による生成物であることを明記すること。
- 応えていること:
- 2 の本人の許諾: 公開できるのは提供者が自分の意思で公開した自分の声だけという決まりです。ただし上に書いた塞げない使い方があります。
- 3: 共通ライセンス第 7 条で生成した音声を公開・配布するときに、AI 生成であることの明示を取得者に求めています。
- 応えていないこと:
- 1: 共通ライセンスはアニメや吹替での利用を一律には禁じていません。禁じている用途は第 5 条に挙げたものです。
- 2 の後段: 共通ライセンスは提供者が許した範囲で案件を限らずに使えて撤回されるまで続きます。有償の収録スタイルを買ったときの個別有償許諾も 1 回の購入で撤回まで続きます。案件ごとの個別の契約にはなっていません。
「NOMORE 無断生成AI」(新しいタブで開く)(2024 年 10 月に声優有志が開始)
実演家や著作権者の許諾なく無断で追加学習・生成・公開された AI 生成物を「無断生成AI」と呼び、議論を通じたルール作りを呼びかけています。
- voice-commons で取得された声の学習と生成は提供者が共通ライセンスで同意した範囲のものです。
- ただし上に書いた塞げない使い方が起きれば本人が許諾していない声が配られることになります。見つかったものは通報と審査で削除します。
声が無断で使われていると思ったら
- 各サンプルのページから通報できます。登録していなくてもメールアドレスを確かめたうえで通報できます。
- 自分や依頼人の声が無断で公開されているときは「権利侵害」を選び、本人・代理人・第三者のどれにあたるかを選んでください。
- 審査のあと対応したかどうかをお知らせします。削除すると決めたサンプルはすぐに公開を止めます。