📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Audio Models in the API

OpenAI15:26

Transcription

こんにちは皆さん、そしてOpenAIのもう一つのライブストリームへようこそ。Olivia Garです。皆さんご存知の通り、私たちは過去数ヶ月間、エージェントの構築に忙しくしていました。Deep Operator Research、Deep Research Operator、そして先週、皆さん自身のカスタムエージェントを構築できるAgent SDKをリリースしました。

今日は本当に本当にエキサイティングです。テキストから音声エージェントへと移行します。多くの人が、書くことや読むことよりも話すことと聞くことを好みます。ですから、音声は非常に自然な人間インターフェースなのです。今日は、開発者や企業が信頼性が高く、正確で、柔軟な音声エージェントを構築できるようにします。そのため、それに関する新しいモデルとツールをいくつか発表します。それでは、そのオファリングを構築したチームから直接お話を聞きましょう。ありがとうございます、Olivia。

こんにちは皆さん、Shenです。OpenAIリサーチチームで働いています。こんにちは、Yaroslavです。OpenAI APIチームのエンジニアです。そして、Jeff Harrisです。OpenAI APIプロダクトチームで働いています。今日は、開発者が豊かで人間らしい音声体験を簡単に構築できるように設計された、3つの新しいモデルと多くの新しいツールと機能をリリースします。

私たちには、テストしたすべての言語で以前のモデルWhisperを凌駕する2つの新しい最先端の音声テキスト変換モデルがあります。開発者がモデルが何を言うかだけでなく、どのように言うかを初めて制御できる新しいテキスト音声変換モデルがあります。そして、テキストベースのエージェントを音声エージェントに簡単に変換できるように、Agent SDKを大幅に更新しました。

少し休憩しましょう。音声エージェントとは何か、そしてどのようにして構築するのか。

素晴らしい質問ですね。一般的にエージェントとは、ユーザーまたは開発者の代わりに独立して行動できるAIシステムのことだと考えています。ウェブサイトにアクセスして、右下にチャットボックスが表示され、製品カタログや最近の注文について質問したい場合、それはテキストによるものです。同じことを音声で行うことができます。電話をかけてAI音声と話すことができます。

音声エージェントを使用する他の方法もあります。私のお気に入りの1つは、言語学習体験です。発音の指導、レッスン計画の作成、学習している言語での模擬会話を行う音声エージェントを利用できます。音声エージェントを構築する方法はたくさんあります。そして、開発者が取る2つの主要なアプローチがあると認識しています。

1つ目は、より未来的な音声音声変換モデルを使用することです。これらは、オーディオを直接理解し、直接話し返すことができるモデルです。非常に高速で、高度な音声モードとChatGPT、そしてリアルタイムAPIを強化しています。

多くの開発者が音声の開始方法として採用しているもう1つのアプローチは、私たちがチェーンアプローチと呼んでいるものです。音声テキスト変換モデルを使用してユーザーの発言を理解し、テキストトランスクリプトに変換します。次に、GPT-4などのテキストLLMによって処理され、そのモデルが適切な応答を考え出し、テキスト音声変換モデルに渡してユーザーに話し返します。

開発者は、モジュール式であるため、チェーンアプローチを最初に好むことがよくあります。さまざまなコンポーネントを自由に組み合わせることができるため、ユースケースに最適なモデルを使用できます。また、非常に高い信頼性を簡単に実現できるためにも好まれています。インテリジェンスのゴールドスタンダードは依然としてテキストベースのモデルですが、音声音声変換モデルは急速に追いつきつつあります。そして、3つ目の理由は、開始が容易であることです。テキストベースのエージェントで行った作業をすべて取り込み、一方に音声テキスト変換モデル、もう一方にテキスト音声変換モデルを配置するだけで、音声エージェントが完成します。

そのため、今日は主に、そのチェーンアプローチを使用して音声エージェントを構築するのに役立つ新しいツールについて説明します。始めましょう。いくつか説明する必要があります。音声テキスト変換から始めます。GPT-4 TranscribeとGPT-4 Mini Transcribeという2つの新しいモデルがあります。これらのモデルに取り組んできました。どのように構築され、どのように機能するかをお聞かせください。

ありがとうございます、Jeff。新しい音声テキスト変換モデルのより技術的な詳細を紹介します。前回の世代のモデルWhisperとWhisper 3と比較して、私たちの新しい世代のモデルは、私たちのLar Speechモデルに基づいています。つまり、この新しいモデルは、数兆ものオーディオトークンでトレーニングされています。また、最新のテクノロジーとモデルのアーキテクチャも採用しています。また、より大きなモデルをはるかに小さなサイズに蒸留しました。それがGPT-4 Mini Transcribeです。小さなサイズのモデルは、高速で効率的です。また、大きなモデルと比較して、可能な限り良好な転写能力を維持しています。

私たちのモデルがどれほど優れているか見てみましょう。転写の精度を単語誤り率で測定します。単語誤り率とは、モデルが間違えた単語の割合です。もちろん、単語誤り率が低いほど、モデルのパフォーマンスは高くなります。濃い青色は最新のGPT-4、その隣にあるのはGPT-4 Miniです。ご覧のとおり、以前の世代のモデルWhisper 2とWhisper 3と比較して、私たちの最新のモデルは、実際、すべての言語でほぼ同じように機能しました。私たちは全般的にパフォーマンスを発揮しました。

素晴らしいですね。市場の他の選択肢と比較して、どこにいるのかも見てみましょう。

ここで私が見ているのは、新しいモデルが多くの言語(英語、スペイン語など)で最先端であるということです。そして、実際、GPT-4 Miniは、より大きな兄弟モデルでなくても最先端です。

非常に高精度な転写モデルを探しているなら、私たちのモデルは間違いなく最適な選択肢です。

素晴らしいですね。それはGPT-4 TranscribeとGPT-4 Mini Transcribeです。GPT-4は本日APIで利用可能です。価格はWhisperと同じ1分あたりわずか6セントです。GPT-4 Mini Transcribeは3セント、つまり半額です。本当に素晴らしい最先端のオプションです。

また、ストリーミング機能を使用して音声テキスト変換APIを強化しています。開発者は、モデルに継続的なオーディオストリームを渡し、継続的なテキスト応答ストリームを取得できます。これにより、非常に高速なエクスペリエンスを構築しやすくなります。また、これらのAPIには、開発者が音声体験を構築するために解決する必要がある多くの困難な問題をバンドルしています。そのため、ノイズキャンセリング機能が搭載されているため、モデルはバックグラウンドノイズによって混乱しません。また、モデルがユーザーが実際に話し終えたと考えられる時点に基づいてオーディオをチャンク化する新しいセマンティック音声アクティビティ検出器も含まれています。そのため、開発者は、半ば話されたアイデアを処理する必要はありません。これらの機能はすべて、音声テキスト変換APIとリアルタイムAPIで使用できます。ぜひお試しください。

次の機能は、新しいテキスト音声変換モデルGPT-4 Mini TTSです。Yav、このモデルの機能を紹介してください。

では、これをご覧ください。これはOpenAI FMです。この新しいモデルで簡単に遊べるように構築したウェブサイトです。ご覧のとおり、選択できる音声がたくさんあります。事前に生成したプロンプトもありますが、自分で入力することもできます。これは基本的に、追加した新しいフィールドです。モデルにテキストをどのように話させたいかを指示する指示フィールドです。では、狂った科学者を試してみましょう。

承知しました。ご覧のとおり、基本的に、どのように配信したいか、どのようなトーン(高エネルギー、カオス的)にしたいかを指示しました。では、どうなるか見てみましょう。

ちょっと忙しいようです。もう一度やり直しましょう。星々は私の天才の前に震える。裂け目は開いている。エネルギーは高まり不安定だ。危険かもしれない。ほとんど確実に、ライランド艦長。

これは本当に強烈ですね。同じ音声で、例えば、「ライブストリームは順調に進んでいます。よくやっています。」といった内容を試してみたらどうなるか気になります。

承知しました。では、「ライブストリームは順調に進んでいます。よくやっています。」としてみましょう。

ライブストリームは順調に進んでいます。よくやっています。ありがとうございます。

素晴らしいですね。レトロな感じが気に入りました。開発者がこれを使って実際にコーディングする方法を知りたい場合はどうすればよいですか?

ここではクリックするだけで、PythonやJavaScriptのスニペットが表示されます。または、直接curlすることを好む場合もあります。

念のためですが、トーンやパーソナリティはモデルに調整されているわけではありません。単に指示されているだけです。

そうです。指示することができます。そして、ペースや動きについて具体的に指示することができます。

非常に簡単に遊ぶことができます。このフォームに従う必要すらなく、自由に何でも入力できます。

素晴らしいですね。素晴らしいですね。それはGPT-4 Mini TTSです。本日APIで利用可能です。1分あたりわずか1セント。非常に経済的なオプションで、生き生きとしたオーディオを生成できます。

最後に紹介するのは、これらがどのように連携するかです。そのため、Agent SDKを更新してリリースします。Agent SDKは先週リリースされました。信頼性の高いテキストエージェント、ガードレール、関数呼び出し、WRツールに関する多くのベストプラクティスをカプセル化する方法です。これらはすべて自動的に処理されます。そして今日、既に構築したテキストエージェントを音声エージェントに簡単に変換できるようにします。Yav、その変換に必要なコードの変更を示してください。

では、これは先週お見せしたデモです。AIスタイリストです。パタゴニアジャケットの注文を検索するために使用できるカスタマーサポートエージェントです。では、まずそれがどのように機能するかを見てみましょう。これは単なるテキストベースのエージェントです。最近の注文について聞いてみます。デバッグ情報が表示されますね。そして、最新の注文が表示されます。先週お見せしたものと同じです。では、電話でこれを使いたい場合はどうすればよいですか?

コードを表示してみましょう。ご覧のとおり、先週と同じ設定です。Agent SDKを使用しており、ここに3つのエージェントがあります。最初のメッセージを受け取り、どのエージェントが処理するかを決定する3つのエージェントがあります。スタイリストエージェントは、Web検索ツールにアクセスできます。スタイルの選択に役立ちます。そして、先ほど見たカスタマーサポートエージェントがあります。過去の注文にアクセスでき、払い戻しの申請もできます。では、バックエンドサーバーのコードを開いてみましょう。非常にシンプルなWebソケットバックエンドです。先週以来、私たちのチームはUIに変更を加えました。そのため、UIはオーディオを録音して再生できるようになり、そのオーディオはWebソケット接続を使用してバックエンドにストリーミングされます。ここではワークフローを示しています。Agent SDKが既にサポートしているのと同じタイプのワークフローです。テキストベースのワークフローなので、ユーザーテキストを受け取ると、それをランナーに渡し、LLMにフィードします。そして、ストリーミング形式でテキストとして出力を受け取り、UIに送信して、ダウンストリーム処理で使用できるようにします。この部分は同じです。そして、バックエンドの実装です。基本的に、ユーザーからメッセージを受け取ると、ワークフローを実行し、テキストを取得してUIにストリーミングします。では、数行のコードで音声エージェントに変換する方法を見てみましょう。まず、UIからのオーディオメッセージも処理する必要があります。デモを簡単にするために準備したスニペットがいくつかあります。基本的に、オーディオの新しいチャンクを取得し、最初にそれらのオーディオチャンクを蓄積する必要があります。バッファの初期化を忘れないようにする必要があります。では、完全なオーディオを取得したら、何をする必要があるか見てみましょう。エージェントに送信する必要があります。ここでは、オーディオを取得し、すべてのチャンクを連結して、この音声パイプラインにフィードします。音声パイプラインは、導入する新しい概念です。基本的に、既存のワークフローを取り込み、一方に音声テキスト変換、もう一方にテキスト音声変換を追加できます。基本的に、オーディオを取得し、テキストに変換して、先ほど説明したワークフローにフィードします。必要に応じてストリーミング形式でテキストを取得し、音声に変換します。そして、音声として出力を受け取ります。これらのイベントはすべてオーディオです。そして、UIに送信して再生します。保存しました。見てみましょう。更新してみましょう。では、見てみましょう。「最後の注文は何でしたか?」

ツールコールを実行しています。あなたの最後の注文は2024年2月9日でした。オリーブ色のパタゴニアショーツを注文しました。すべて完了しています。他に何か必要なものはありますか?パタゴニアショーツの注文番号はA507です。他に何か必要なものがあれば、お気軽にお尋ねください。

素晴らしいですね。音声エージェントを作成するのに9行のコードしかかかりませんでした。非常にクールですね。そして、開発者であれば、音声エージェントを作成した場合、どのようにデバッグするのか、うまく機能しているかどうかをどのように判断するのか疑問に思うでしょう。そこには何がありますか?

非常に良い質問です。これは、先週デモしたトレースUIです。そして、オーディオをサポートするように更新しました。見てみましょう。これは私の最近のチャットのようです。たくさん練習しました。そして、最新の会話からのトレースがあります。更新してみましょう。これは最新のチャットです。そうです。最新の会話からのトレースがあります。ご覧のとおり、さまざまなイベントがあります。例えば、これをクリックできます。これはエージェントへの私の最初のリクエストです。再生してみましょう。「最後の注文は何でしたか?」

オーディオと統合されています。再生でき、メタデータを確認でき、さまざまなタイムライン、レイテンシ、エラーなどを確認できます。

素晴らしいですね。素晴らしいですね。2つの新しい音声テキスト変換モデル、GPT-4 TranscribeとGPT-4 Mini Transcribe。新しいテキスト音声変換モデルとOpenAI FMをリリースします。そして、Agent SDKを更新して、すべてを信頼性の高い豊かな音声体験に簡単にまとめることができるようにします。素晴らしいですね。これらの新しいテクノロジーでどのような音声エージェントを構築するのか楽しみです。そして、今後数ヶ月でさらに多くの機能が登場します。

別れを告げる前に、最後に1つ。Yosが狂った科学者でデモしたOpenAI.FMは、実際にはライブです。OpenAI.FMは、率直に言って、過去数日間、これを使って非常に楽しんでいました。そこで、なぜコンテストをしないのかと考えました。一種の旧式のラジオ局のような、ラジオコンテストです。そのため、金曜日の夜までOpenAI.FMにアクセスして、そのテキスト音声変換テクノロジーの最も創造的な使用方法を考え出し、OpenAIのTwitterで共有してください。そして、3人の勝者を決定します。勝者には、Teenage Engineeringの友人たちからの素晴らしいプレゼントがあります。特別な版のラジオです。世界に3つしかないのです。背面にOpenAIのロゴがあるからです。とにかく、OpenAI.FMにアクセスして、Twitterで共有してください。コンテキストの条件に関する詳細を説明するツイートを送信します。楽しんでください。では、また。ありがとうございました。[音楽]