ソートリーダー

2023年にビジネスで倫理的にジェネレーティブAIボイスを使用する方法

mm
Unite.AI を Google の優先ソースに追加

2022年の終わりは、OpenAIやChatGPTの人気により、AI技術が広く採用されるようになった。AIは、ビジネス成果を生み出すのに有用であることを証明し、初めて大衆的な魅力を得た。

2023年に革命的なように見える多くのAI技術は、実際には数年前から大企業やメディアで活用されていた。私と一緒に、特に音声クローニングのためのジェネレーティブAIシステムを支える技術、ビジネス上の利点、AIを使用するための倫理的なアプローチについて詳しく見てみましょう。

音声クローニングはどのように機能するか

簡単に言えば、音声クローニングにより、1人が別人の声で話すことができるようになる。

ジェネレーティブAI技術を使用して、人物の声の録音を作成し、それを使用して新しいオーディオコンテンツを生成する。基本的に、誰かが実際に話さなくても、誰かが話すことができるようにする。

技術的な側面では、複雑そうに見えないが、始めるために最低限の要件がある。

  1. 音声クローニングするためのソース音声を録音するには、少なくとも5分間の高品質のオーディオが必要である。これらの録音は、ノイズや歪みがなく、明確でなければならない。歪みがあると、モデルの出力の精度に影響する可能性があるからだ。
  2. 次に、これらの録音をジェネレーティブAIモデルにフィードして、「ボイスアバター」を作成する。
  3. 次に、モデルをトレーニングして、ピッチとタイミングのスピーチパターンを正確に再現する。
  4. 完了すると、このトレーニング済みモデルは、他の人の声で無限のコンテンツを生成できるため、リアルな音声を生成するための強力なツールになる。

ここで、多くの人々が倫理的な懸念を表明する。誰かの口から別のテキストを入力し、本当の言葉か偽物か区別がつかない場合に何が起こるのか。

はい、これはすでに現実になった。OpenAIやChatGPTの場合のように、無視できない多くの倫理的な問題に直面している。

AIにおける倫理基準

多くの新しい技術と同様に、初期の採用段階では、技術そのものに対する否定的なイメージを作るのではなく、脅威を認識し、有益な知識を得るための議論を促進することが重要である。悪い行為者が技術とその製品を悪用する方法を暴露し、軽減策を講じ、継続的に学び続けることが必要だ。

現在、ジェネレーティブAIの使用に関する倫理基準に関する3つの枠組みを持っている。国家および超国家レベルの規制枠組みは、初期段階にある。政策世界は、技術の開発のスピードに追いついていないかもしれないが、すでにEUが EUのAI規制提案 および 2022年のデジタル情報操作に対する行動規範 を主導しており、大手テクノロジー企業が悪意のあるAI操作コンテンツの拡散に対処するための期待を示している。国レベルでは、米国と英国がこの問題に対処するための規制の第一歩を見ており、米国の 国立ディープフェイクおよびデジタル起源タスクフォース と英国による オンライン安全法案 がある。

テクノロジー業界の枠組みは、企業や技術者が新しい現実を受け入れ、社会的セキュリティとプライバシーへの影響について議論しているため、より速く進んでいる。ジェネレーティブAIの倫理に関する議論は活発であり、ジェネレーティブAIの使用に関する行動規範(例: 合成メディアのためのパートナーシップon AI行動規範)や、企業が発表する倫理声明の開発に道を開いている。質問は、どのようにして実践的な行動規範を作ることができるか。製品、特定の機能、チームの手順に影響を与えることができるか。

メディア、エンターテインメント、サイバーセキュリティ、AI倫理コミュニティとこの問題に取り組んだ結果、AIコンテンツと特に音声について、実践的な原則をいくつか考案した。

  1. IP所有者とクローン音声を使用する会社は、法的な合意書に署名することで、オリジナルの音声を使用することによる潜在的な複雑さを避けることができる。
  2. プロジェクト所有者は、クローン音声の使用を公に開示することで、リスナーを欺くことがないようにする必要がある。
  3. 音声のためのAI技術を開発する会社は、AI生成コンテンツを検出および識別する技術を開発するためのリソースの一部を割り当てる必要がある。
  4. AI生成コンテンツにウォーターマークを付けることで、音声認証が可能になる。
  5. 各AIサービスプロバイダーは、社会的、ビジネス的、プライバシー面での影響を評価した上で、各プロジェクトに取り組むことに同意する必要がある。

当然、AIの倫理原則は、自作のディープフェイクがオンラインで広まるのを防ぐことはできない。しかし、グレーゾーンにあるプロジェクトを一般市場から遠ざけることができる。

2021年から2022年にかけて、AI音声は、倫理と社会に大きな影響を与えるさまざまな主流プロジェクトで使用された。これには、若いルーク・スカイウォーカーの音声のクローニング が含まれており、ゴッド・オブ・ウォー2のAI音声 、および リチャード・ニクソンの音声による歴史的な「月の災害」演説 などがある。

テクノロジーへの信頼は、メディアやエンターテインメントを超えて成長している。伝統的なビジネスは、さまざまな業界でクローン音声を使用している。以下は、最も顕著なユースケースのいくつかである。

業界のユースケース

2023年、音声クローニングは、さまざまなビジネスがその多くの利点を享受するために、さらに成長する。ヘルスケア、마케팅、カスタマーサービス、広告業界など、音声クローニングは、組織がクライアントとの関係を構築し、ワークフローを合理化する方法を変革している。

音声クローニングは、オンライン環境で働くヘルスケア専門家やソーシャルワーカーに利益をもたらす。医療専門家と同じ声を持つデジタルアバターは、患者との間に強い絆を築き、信頼を築き、顧客を維持するのに役立つ。

映画やエンターテインメント業界における音声クローニングの潜在的な応用は広大である。複数の言語への吹き替え、子供や大人の追加の音声代役、無限のカスタマイズオプションなどが、この技術によって可能になる。

同様に、運用部門では、AI駆動の音声クローニングが、インタラクティブ音声応答システムや企業向けトレーニングビデオにコスト効率の高いソリューションを必要とするブランドにとって優れた結果をもたらす可能性がある。音声合成技術を使用すると、俳優はリーチを拡大し、録音からの収入を増やすことができる。

最後に、広告制作スタジオでは、音声クローニングの出現により、コマーシャルの制作に伴うコストと時間が大幅に削減された。利用できない俳優からの高品質の録音があれば、コマーシャルは迅速かつ創造的に制作できるようになった。

興味深いことに、企業や中小企業は、ブランドにユニークなものを作成するために音声クローニングを活用できる。大規模なプロジェクトは、最も野心的な計画を実現でき、小規模なビジネスは、以前は高額だったスケールモデルにアクセスできる。つまり、真の民主化である。

まとめ

AI音声クローニングは、ユニークな顧客体験の作成、自然言語処理機能の統合、完全にリアルな音声の生成など、ビジネスに革命的な利点をもたらす。

2023年に競争上の優位性を維持したい企業は、AI音声クローニングを検討するべきだ。企業は、この技術を使用して、新しい可能性を開拓し、顧客を維持するために、倫理的に責任を持って行動することができる。

Annaは、ウクライナに拠点を置くエミー賞を受賞したボイスクローニング技術のRespeecherの倫理とパートナーシップ責任者です。Annaは、AIを搭載したシンセティックメディアアプリのRefaceの元ポリシーアドバイザーであり、Startup Wise Guysアクセラレータープログラムによって資金提供されたカウンターディスインフォメーションツールCapptureのテクノロジー共同創設者です。Annaは、11年のセキュリティと防衛政策、テクノロジー、および耐久性構築の経験を持っています。彼女は、タリンとプラハの国際防衛・安全保障研究所、プラハ安全保障研究研究所の元研究員です。また、キーウ経済大学のハイブリッド戦争タスクフォースの一環として、主要なウクライナ企業に対する耐久性構築についてアドバイスをしています。