📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

We have a problem with AI and hallucinations—and not what you think

AI News & Strategy Daily | Nate B Jones9:18

Transcription

私はこれをしたくありませんでした。幻覚について話しましょう。幻覚について話さなければならない理由は、人々が私に対して幻覚の話をするのをやめさせられないからです。だから、ここにいます。やっています。えーっと、結局のところ、ChatGPTがその能力レベルでリリースされたということは、私たちが取り戻さなければならない莫大な信用力の不足があるということです。ChatGPTは人々が信じているよりもずっと信頼できます。Claudeも人々が信じているよりもずっと信頼できます。これはChatGPTだけの話ではありませんが、このことを気にする人にとって、それは常にChatGPTです。なぜなら、それが彼らが知っている言語モデルだからです。Geminiも同じです。私が言いたいのは、ChatGPTが2022年にリリースされたとき、非常に注目を集めた幻覚がいくつかあり、人々はAIが実際に何ができるのかを誤解し、それをたくさんの嘘だと片付けてしまったということです。そして、私は今でもそれを常に聞いています。そして、私はただ、毎日毎日これを聞いていて、ただ対処しているだけです。私が言いたいのは、AIに対しては人間とは異なる基準を持っているということです。人間の場合、もし私が信頼できない研究者、率直に言ってインターンである人間の研究者がいて、そのインターンが1週間かけて40ページのレポートを準備し、そのインターンがその40ページのレポートで3つの間違いをしたとしたら、私は「素晴らしい」と言うでしょう。そして、私は自分が取り組んでいるものにそのレポートを使いたいと思うでしょう。もしAIが30分で40ページのレポートを提出して3つの間違いをした場合、私たちは「それは十分ではない、完璧でなければならない」と言います。なぜ完璧でなければならないのでしょうか?なぜ人よりも完璧でなければならないのでしょうか?他の理由もあります。幻覚はそれほど大したことではないと言う理由です。しかし、私はそれが最も説得力のある理由だと思います。なぜなら、AIに有用な作業をさせたいのであれば、それが行う作業は、幻覚をチェックする時間よりも有用であると信じなければならないからです。そして、私たちはそれをはるかに超えています。それは幻覚が重要ではないという意味でしょうか?それは、弁護士がAIを使用している場合、ケースバイケースの引用をチェックすべきではないという意味でしょうか?医師がAIの医学的根拠をチェックすべきではないという意味でしょうか?明らかに違います。明らかに、私たちはチェックすべきであり、幻覚を減らすために努力すべきです。しかし、AIが明らかに、明らかに有用な作業ができるようになったということは、AIが事象の地平線を越えたということです。もはや単なる遊び道具ではなく、私たちが一緒に仕事ができるものなのです。そして、残念ながら、その信用力の不足がこの業界のお尻を噛んでいると思います。なぜなら、結局のところ、このYouTubeサークルに座っていないほとんどの人々は、もし私がAIの幻覚について話したとしても、口から出る最初の言葉、彼らが最初に話すのは、「ねえ、幻覚はどうなの?でっち上げると聞いたよ。嘘をつくと聞いたよ」ということです。正直に言って、それは平均的な人間よりも嘘をつきません。ほとんどの場合、幻覚率は、ちなみに幻覚率を測定するのは本当に難しいですが、私はこれについて調べてSubstackを書きました。読んでみたいなら読んでください。読みたくないなら気にしません。しかし、良い読み物です。そして、それは幻覚とは何かについて深く掘り下げています。そして、私が本当に興味深いと思うことの1つは、私たちが幻覚率と呼んでいるものが、与えるタスクによって10倍も変化するということです。同じモデルでも、1.5%と15%になる可能性があります。ちなみに、私はそれをでっち上げていません。ChatGPT 4.5が、使用する幻覚測定方法によって大まかにその範囲に入る場所です。文脈は本当に重要です。与えるタスクの種類は本当に重要です。私が個人的に幻覚を心配していない理由の1つは、AIに幻覚を起こしやすい状況を与えず、それをAIのせいにしないようにしているからです。それは私の従業員を誤管理しているようなものです。なぜそんなことをするのでしょうか?私は、AIに事実上不可能なことをするように求めることはありません。なぜなら、それは想像したり、幻覚を起こしたり、でっち上げたりする情報を必要とするからです。それは無駄です。なぜそんなことをするのでしょうか?それは非常に強力なツールなので、うまくできることをなぜ指定しないのでしょうか?参照元を指定して、どこを探してほしいかを指定するべきではないでしょうか?プロンプトを注意深く明確で構造化されたものにするべきではないでしょうか?私がそうするとうまくいきます。それは私にとって単に簡単です。実際には幻覚を減らすこれらの多くのことが、AIを使うためのベストプラクティスであることが判明しました。ベストプラクティスに従うべきだと思います。だから、私にとって、OpenAI、Anthropicはこれに取り組んでいるのでしょうか?そうです。GoogleのDeepMindもこれに取り組んでいるのでしょうか?もちろんそうです。来年、幻覚のないモデルが100%になるという意味でしょうか?来年、それが実現するとは保証できません。そして、私はまた、それが問題にならないとほぼ保証できます。現実の仕事には問題になりません。しかし、それは世間の認識には非常に重要になります。なぜなら、私たちはコンピュータは完璧でなければならないと考えるように訓練されているからです。なぜなら、100年間、いや100年とは言わず60年間、コンピュータで使われてきたものはすべて決定論的な計算だったからです。それは、a + b = cであれば、それが何であれというプログラムです。すべてが数学です。すべてがアルゴリズムです。すべてがプログラムの実行時に決定されます。ですから、私たちは完璧さを期待することができます。そして、私たちの映画のすべても同じことを言っています。私たちは、岩に思考を教え、それが詩的な夢想家であることが判明するようなAIにはまだ準備ができていません。私たちはそれに備えていません。AIが本質的に事実の世界モデルを持っていないという事実、ChatGPT 4.5の特定の幻覚テストにおける1.5%のエラー率について話すことができるという事実は、奇跡です。私は驚いています。これらのものは夢を見て、あなたが探しているものと一致すると考えている確率的なトークンを考え出します。それらは下部に事実の世界モデルを持っていません。何かが正しくなること自体が驚くべきことです。それは素晴らしいことです。ですから、その世界の中で、私は人間を基準にすべきだと思います。私は、それらが機能するという事実を真剣に受け止めるべきだと思います。そして、私たちは業界として、「それは嘘をつくだけだ」「それはでっち上げだけだ」と言う人々に対して、より良い答えを考え出す必要があると思います。ちなみに、そう言う人は、自分自身もかなり信頼できない語り手である傾向があります。私は、ある程度AIによって個人的な脅威を感じ、それを軽視する必要のある人でない限り、そのような攻撃的な反論的な発言を聞いたことがありません。ここでは変化の先端が絶対にあります。自分の仕事について心配している人、自分の仕事に何が起こるかを心配している人は、AIを軽視する可能性が高くなります。それについて研究をしていますか?正直に言って、していません。それは私が何百人もの人と会話したことに基づいています。それは私が観察してきたことです。では、それは私たちをどこに導くのでしょうか?結局のところ、AIは、ほとんどの分野でほとんどの人間よりも信頼できるようになる時点に達するでしょう。そうなれば、AIの幻覚についてはそれほど心配する必要がなくなり、論理的に自分自身の幻覚について心配するべきです。しかし、そうはしていません。そうではない理由は非常に単純です。それは、自動運転車が、はるかに安全であるにもかかわらず、それほど普及していないのと同じ理由です。それは、統計的に見て、米国のテストでは自動運転がすでにはるかに安全であるにもかかわらず、米国で人間の運転を禁止していないのと同じ理由です。人間の運転手を道路に留めておくことは、人命を犠牲にしています。米国と言ったのは、そこでテストが行われたからです。おそらく世界中の他の場所でも同様でしょう。私たちは頑固な、頑固な種族です。私たちは、私たちが真実だと考えているものを簡単に諦めることはありません。私たちは人間が運転すべきだと考えています。私はそれがすぐに消えるとは思いません。たとえそれが人々を殺すとしてもです。私たちはAIが幻覚を起こすと考えています。私は、それが明らかに簡単に証明できる無益な信念であるにもかかわらず、その信念が消えるとは思っていません。しかし、私たちは試みなければなりません。私たちは人々に何が本当に重要なのかを説明しようと努力しなければなりません。私たちは教育を最大限に努力しなければなりません。これは業界の私たち全員にとっての課題です。私は幻覚の話にうんざりして、巨大なSubstackを書きました。これをしました。私たちはそれをできるようにしなければなりません。