📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

OpenAI Unveils NEXT-GEN AI Audio! - TTS, Speech-to-Text, Audio Integrated Agents, and more!

Matthew Berman14:53

Transcription

オープンAIが、オーディオモデルのアップデートを発表しましたね。ライブストリームを見て、私の考えをお伝えしましょう。今日は本当に本当にエキサイティングです。テキストから音声エージェントへと進化しているのです。ある意味、音声は非常に自然な人間インターフェースであり、今日は開発者や企業が音声エージェントを構築できるようにします。

完全に同意します。音声は間違いなく将来のAIインターフェースになるでしょう。現在、非常に活用が不足しています。なぜなら、私たちは非常に優れたテキスト読み上げ、音声認識、音声合成モデルを持っているのに、開発者は音声ファーストインターフェースについてもっと考えるべきだと思います。そこで、新しいモデルとツールを発表します。それでは、開発チームから直接お聞きしましょう。

ありがとうございます、オリビア。

皆さん、こんにちは。シェンです。オープンAIリサーチチームで働いています。

こんにちは、私はヤロスラフです。オープンAIチームのエンジニアです。

そして、私はジェフ・ハリスです。オープンAI API Pro製品チームで働いています。

今日は、開発者が人間らしい豊かな音声体験を簡単に構築できるように設計された、3つの新しいモデルと多くの新しいツールと機能をリリースします。

私たちの以前のモデルであるWhisperを文字通りテストしたすべての言語で凌駕する、2つの新しい最先端の音声認識モデルがあります。

開発者がモデルが何を言うかだけでなく、どのように言うかを初めて制御できる新しいテキスト読み上げモデルがあります。

そして、テキストベースのエージェントを音声エージェントに簡単に変換できるように、私たちのAgent SDKを大幅にアップデートしました。

それでは、もう一度質問しましょう。音声エージェントとは何ですか?どのように構築すればよいですか?

素晴らしい質問ですね。一般的にエージェントとは、ユーザーまたは開発者の代理として独立して行動できるAIシステムだと考えています。

ウェブサイトにアクセスして、右下にチャットボックスが表示され、製品カタログや最近の注文について問い合わせたい場合、テキストによるエージェントが使用されます。音声でも同じことができます。電話してAI音声と話すことができます。

音声エージェントの使用方法は他にもあります。私の好きな方法の1つは、言語学習体験です。発音を指導してくれる音声エージェント、学習プランを作成してくれる音声エージェント、学習中の言語で模擬会話をしてくれる音声エージェントなどがあります。音声エージェントを構築する方法はたくさんあります。

私は今でもAdvanced Voice Modeを頻繁に使用しています。iPhoneのアクションボタンにマッピングしており、画面を使用できないときに常に使用しています。運転中や、簡単な質問があって入力したくない場合、情報を得る最速の方法です。実際に何かを達成したい時点からAIからの応答を得るまでの速度はまだ改善の余地がありますが、これからさらに良くなるでしょう。

これから説明するのは、2つの音声モデルの種類です。より洗練された最近の方法である音声合成モデルは、音声を入力として音声を出力するモデルであり、途中で転写しません。従来の方法とは、AIモデルが音声を入力としてテキストに転写し、処理してから、最後にオーディオに変換する方法です。ChatGPTのAdvanced Voice Modeを使用すると、音声合成モデルを使用することになり、私の意見では、はるかに優れています。なぜなら、あなたのイントネーション、気分、話し方、特定の言葉への強調などをよりよく理解しており、特定の言葉への強調などを使ってそれを反映できるからです。

では、見続けましょう。開発者が採用する2つの主要なアプローチがあります。1つ目は、より未来的な音声合成モデルを使用することです。

ここで1秒間一時停止しましょう。この方法1は、より新しく、より高度なアプローチです。中央に1つのモデルがあり、音声を入力として音声を出力します。従来の方法は、音声をテキストに変換し、テキストを処理してから、音声を再び音声に変換することです。彼らが言おうとしているように、方法2、より従来のアプローチは、モジュール化されていて良いのですが、2つの主要な問題があります。1つは、異なるモデルを使用し、テキストと音声の間で変換する必要があるため、レイテンシがはるかに大きくなることです。そして、2番目、これは実際には最大の課題ですが、音声をテキストに変換すると、多くの情報が失われます。単語の強調、トーン、音声のすべての感情が、テキストに変換されると失われます。

興味深いのは、インターネット上では非常に豊かなテキストベースの文化があり、友人や家族とテキストメッセージを送信したり、RedditやTwitterなどに投稿を作成したりするときに、テキストにさらに強調を加える方法を考案してきたことです。イタリック体、太字、絵文字など、そしてミーム文化はさらにそれを推し進めました。しかし、私が見たところでは、コメントで訂正してください、典型的なテキスト転写で失われるこれらのテキスト装飾を利用した音声認識モデルは本当に見たことがありません。

そして、他に何によって動いているかご存知ですか?OpenAIモデルです。今日のビデオのスポンサーであるAdmin Companionです。Admin Companionは、Linuxシステム用のAI搭載共同管理者です。つまり、高レベルの自然言語を使用して、詳細な実行計画と実際のLinuxコマンドを作成し、これらすべてをLinuxシェル内で実行し、Linux管理者として実行する必要がある作業を大幅に簡素化できます。また、ユーザーの承認なしにAIがコマンドを実行するのを防ぐ組み込みのセキュリティ層もあります。このクイックデモをご覧ください。これは、DockerとOracleデータベースコンテナを単一の文でインストールしています。トラブルシューティングの高速化とログファイルの迅速な分析の別の例を次に示します。Admin Companionを無料で試してみてください。サインアップリンクを下に表示しますので、説明にあるそれをクリックして確認してください。そして、Admin Companionにこのビデオのスポンサーになっていただき、改めて感謝申し上げます。ビデオに戻りましょう。

開発者は、チェーンアプローチを好むことが多いです。モジュール式であるため、さまざまなコンポーネントを自由に組み合わせることができ、ユースケースに最適なモデルを使用できるからです。また、非常に高い信頼性を達成する最も簡単な方法であるためにも好まれています。知能のゴールドスタンダードはまだテキストベースのモデルですが、音声合成モデルは急速に追いつきつつあります。そして3番目の理由は、簡単に始められることです。テキストベースのエージェントで行った作業をすべて取って、一側に音声認識モデルを追加し、もう一側にテキスト読み上げモデルを追加するだけで、音声エージェントが完成します。

より最新のSpeech-to-Speechモデルを使用して何かを構築する場合は、そのことを念頭に置いて最初から構築する必要があります。彼が言ったように、最先端モデル、Claude 3.7、003など、ほとんどの大規模言語モデルはテキストベースのモデルであるため、従来の転写方法を使用して音声を追加できます。

今日のフォーカスは、このチェーンアプローチを使用して音声エージェントを構築するのに役立つ新しいツールです。始めましょう。いくつか説明事項があります。音声認識から始めましょう。GPT-4 TranscribeとGPT-4 Mini Transcribeの2つの新しいモデルがあります。GPT-40は、この時点では古いモデルです。01、03、GPT-4.5などがありますので、これらの新しいモデルに対してまだこの古い名前を使用しているのは少し驚きです。新しい音声認識モデルについて、より技術的な詳細をご紹介しましょう。前の世代のモデルであるWhisper 2とWhisper 3と比較して、新しい世代のモデルは、私たちの大規模音声モデルに基づいています。つまり、この新しいモデルは数兆個の音声トークンでトレーニングされています。また、最新の技術とモデルのアーキテクチャも取り入れています。また、より大きなモデルをはるかに小さなサイズのものに縮小しました。それが、GPT-40 Mini Transcribeです。より小さなサイズのモデルは高速で効率的であり、より大きなモデルと比較して、可能な限り良好な転写機能を維持しています。

モデルの精度をどの程度高められたか見てみましょう。転写の精度は、単語誤り率によって測定されます。単語誤り率とは、モデルが間違えた単語の割合です。もちろん、単語誤り率が低いほど、モデルのパフォーマンスが高くなります。濃い青色が最新の40で、その隣が40ミニです。ご覧のとおり、Whisper 2とWhisper 3の前の世代のモデルと比較して、最新のモデルは事実上すべての言語でほぼ同じように機能しています。

素晴らしいですね。

かなり大きな改善のように見えます。Whisper Large V2とWhisper Large V3の誤り率はすでにかなり低かったですが、特定の言語では大幅な改善が見られます。GPT-40 TranscribeとGPT-40 Mini Transcribe。40は、今日APIで1分あたり6セントで利用可能です。Whisperと同じ価格です。40 Mini Transcribeは、3セントです。半額です。本当に素晴らしい最先端のオプションです。音声認識APIも強化しています。

確かに良い価格ですが、正直なところ、音声認識やテキスト読み上げを行う場合、事実上無料のオープンソースモデルを使用する方が良いように感じます。もちろん、本番環境で実行する必要がある場合は、GPUのバックアップが必要です。しかし、すでに本当に良いものなのです。誤り率の違いが何かパーセントであっても、多くのユースケースでは違いがないかもしれません。突然、1分あたり3セントまたは6セントの支払いから、オープンソースモデルを使用してその一部の支払いになるのです。これらのテキスト読み上げと音声認識モデルの多くは、完全にローカルで実行できます。コンピューターで実行する必要があるユースケースがある場合、ホストされたオプションを使用することが最悪の選択肢になる可能性があります。

開発者は、連続したオーディオストリームをモデルに渡し、応答として連続したテキストストリームを取得できます。これにより、非常に高速な体験を構築しやすくなります。また、これらのAPIには、開発者が音声体験を構築するために解決する必要がある多くの困難な問題がバンドルされています。ノイズキャンセリング機能も含まれていますので、モデルはバックグラウンドノイズによって混乱しません。また、新しいセマンティック音声活動検出器も含まれており、モデルがユーザーが実際に話し終えたと判断した時点に基づいてオーディオをチャンクに分割します。開発者として、半ば話されたアイデアを処理する心配をする必要はありません。

本当に素晴らしい機能ですね。ノイズキャンセルが自動的に行われ、音声チャンクも自動的に行われます。おそらく、これらの機能が必要な場合に支払うことになるのはそれでしょう。これらの機能は、音声認識APIとリアルタイムAPIの両方で使用できます。ぜひ確認してみてください。

次の機能は、新しいテキスト読み上げモデル、GPT-40 Mini TTSです。Yさんに、このモデルの動作方法を見せていただければ幸いです。

では、これを表示させてください。これはOpenFMです。この新しいモデルで簡単に遊べるように構築したウェブサイトです。ご覧のとおり、選択できる音声がたくさんあります。事前に生成されたプロンプトもいくつかありますが、独自のテキストを入力することもできます。これは基本的に、モデルにテキストの読み上げ方を指示する説明フィールドです。では、狂気の科学者の声で試してみましょう。

承知しました。ご覧のとおり、どのように伝えたいか、どのようなトーンにしたいかを基本的に指示しました。本当に素晴らしいですね。テキストを読み上げるよう指示するときに、これらの追加の指示を与えることができます。繰り返しますが、指示を与えてテキストを用意しますが、間違いなくまだ何かが失われています。トーンと感情を伝えることは、特に音声認識からテキストへの変換において重要です。人間の言葉をテキストに変換し、その感情とトーン、リズムなどを維持することが重要です。少なくとも、近い将来は解決できないと思います。実際のテキストの横に、各音節、単語、または文がどのように話されるかを伝えるメタデータレイヤーが必要です。星々は私の天才の前で震え、裂け目は開き、エネルギーは高まり、不安定で、おそらく危険であり、確かにキャプテン・ライランドです。これは本当に強烈ですね。

では、同じ声を使って、もう少し別の例を試してみましょうか?例えば、「ライブストリームは順調に進んでいます。素晴らしいですね」という感じで。

承知しました。「ライブストリームは順調に進んでいます。素晴らしいですね」ですね。

承知しました。どちらも本当に素晴らしいですね。

次に、最近発表されたAgent SDKを使用して、テキストベースのエージェントを音声ベースのエージェントに変換する方法を示します。コーディングが少し含まれており、ライブで視聴するのはそれほど面白くないので、この部分はスキップします。そして、実際に動作している様子を見てみましょう。

「最後の注文は何でしたか?」と聞いてみましょう。ツールコールを実行していますね。「あなたの最後の注文は2024年2月9日でした。オリーブ色のパタゴニアのショートパンツを注文しました。すべて完了しています。何かお困りのことがあればお申し付けください。」「注文番号は何でしたか?」「パタゴニアのショートパンツの注文番号はA507です。他に何かございましたら、お気軽にお申し付けください。」

本当に素晴らしいですね。これらの新しいAPIを使用して、すでに持っているAIワークフローに簡単に音声を追加できるのは本当に素晴らしいと思います。そして、繰り返しますが、音声は人工知能の未来のインターフェースだと本当に思います。しかし、最高の点は、テキストと音声の両方のオプションがあることです。開発者として、音声エージェントを構築する場合、どのようにデバッグするか、正しく機能しているかどうかをどのように判断するかが気になります。その点についてはどうでしょう?

とても良い質問ですね。これは、先週デモしたトレースUIで、現在はオーディオに対応するように更新されました。では、見てみましょう。これは私の最新のチャットのようです。かなり練習しました。そして、最新の会話からのトレースがあります。これを更新してみましょう。これは最新のチャットです。ご覧のとおり、さまざまなイベントがあります。例えば、このイベントをクリックできます。これはエージェントへの私の最初のリクエストです。再生してみましょう。「最後の注文は何でしたか?」オーディオと統合され、再生でき、メタデータを参照でき、さまざまなタイムラインを確認できます。これはかなり巧妙なデバッグインターフェースとトレースインターフェースですね。本当に気に入っています。実はまだ自分で試したことはありませんが、試してみるつもりです。

以上が主要な発表です。オーディオモデルには多くの素晴らしいアップデートがあり、開発者には多くの素晴らしい新機能があります。ぜひチェックしてみてください。OpenFMで、これらの音声の一部を試してみてください。このビデオがお気に召したら、いいねとチャンネル登録をお願いします。次回お会いしましょう。