Transcription
では、今夜、あなたがくつろぐ際に考えてみる価値のあることがあります。
毎日、気づかないうちに、あなたは数千もの小さな予測をしています。窓の外を見て、傘が必要かどうかを予測します。車のエンジンが奇妙な音を立てるのを聞いて、それが深刻なものか、それとも何でもないかを予測します。部屋の向こうにいる誰かの顔を見て、一瞬のうちに彼らが幸せなのか、それとも落ち込んでいるのかを予測します。あなたは人生を通してこれをやってきました。そして驚くべきことは、誰もあなたに座って、そのうちのどれかに対するルールブックを与えてくれたわけではないということです。「雲がこのように見えたら、雨が降るだろう。エンジンがこのように聞こえたら、タイミングベルトがダメになっている。」と書かれたマニュアルを渡されたわけではありません。あなたはただ、経験から、十分な曇り空や十分な表情を見て、パターンが現れ始め、それらのパターンが考えなくても頼れるものになったことから、それを理解したのです。それは、最も基本的な意味で、機械学習とは何かということです。それは、あらゆる可能な状況に対して明示的なルールをコンピューターにプログラムするのではなく、すべての指示を書き出すのではなく、コンピューターに例を、たくさんの例を与え、それ自体でパターンを見つけさせるという考え方です。あなたが学んだ方法で、それを学ばせるのです。もちろん、全く同じ方法ではありません。メカニズムは異なりますが、中心的な考え方、つまりルールからではなく経験から学ぶということです。それがこの分野全体の心臓部です。そして今夜、私たちはその考え方がどのようにして生まれたのかをたどっていきます。それが哲学的な問いとして始まり、数学的な好奇心になり、実際の工学分野へと変化し、そして最終的には今、あなた方の生活のほぼすべての部分に触れるものへと成長したのかを。あなたがここに横たわってこれを聞いている間も、私たちはゆっくり進みます。このものを、人々が少しずつ、十年ごとに築き上げた物語をさまよいます。彼らの中には、あなたが聞いたことがある人もいるでしょう。ほとんどの人は、聞いたことがないでしょう。そして、それがこの楽しさの一部です。しかし、まずは最初から始めましょう。そして、始まりはコンピューターではありません。始まりは、人々が何世紀にもわたって問い続けてきた問いです。「機械は考えることができるか?」今、その問いは現代的に聞こえますよね?SF映画のようなものに聞こえますが、人々は驚くほど長い間、それに悩んできました。古代ギリシャ人は、職人の神ヘパイストスがクレタ島を守るために作った巨大な青銅の自動人形タロスについての物語を語りました。13世紀には、ラモン・ルルというカタルーニャの哲学者が、概念を組み合わせて機械的に新しいアイデアを生み出すことができる紙の円盤のシステム、「アルス・マグナ」と呼ぶものを設計しました。それは意味のある意味でコンピューターではありませんでしたが、野心はそこにありました。推論を機械化できるという夢、論理を一種の機械に変えることができるという夢です。数百年を早送りすると、ドイツの数学者であり哲学者であるゴットフリート・ヴィルヘルム・ライプニッツにたどり着きます。ライプニッツは、あまりにも時代を先取りしていたため、ほとんど不気味なほどである人物の一人です。1600年代後半、彼は最初の機械式計算機の一つを製作しました。歯車と車輪を備えたこの装置は、足し算、引き算、掛け算、割り算ができました。しかし、ライプニッツは算術以上のものを求めていました。彼は「計算術」と呼ぶ壮大なビジョンを持っていました。これは本質的に普遍的な推論機械でした。「計算しよう」と言うことで、すべての人間の論争を解決できる未来を想像しました。彼は、論理を形式的なシステムにエンコードできれば、機械があなたのために推論をしてくれると信じていました。もちろん、彼はそこまで到達しませんでした。当時の技術では、その夢を支えることはできませんでしたが、種は蒔かれ、それは非常に長い間土壌に留まることになります。次の大きな飛躍は、1830年代から1840年代にかけて、二人の並外れた人物によってもたらされます。一人目はチャールズ・バベッジです。彼は、分析機関と呼ばれる機械を設計しましたが、完全に構築されることはありませんでした。この機械は、その野心において驚くべきものでした。計算のためのミルとメモリのためのストアがありました。すでに織物製造で使われていたジャカード織機のパンチカードを使ってプログラムすることができました。理論的には、分析機関は適切な指示セットがあれば、あらゆる計算を実行できました。それは、最初の電子コンピューターが製造される100年以上前に設計された、概念的には汎用コンピューターでした。そして、エイダ・ラブレスがいます。彼女はバベッジ自身でさえ完全に把握していなかったかもしれない、バベッジの機械の中に何かを見ました。エイダ・バイロン。彼女は詩人であるバイロン卿の娘であり、世界の素晴らしい小さな衝突です。彼女は分析機関について広範な注釈を書きました。そして、それらの注釈の中で、多くの歴史家が最初のコンピュータープログラムと見なしているもの、機関がベルヌーイ数を計算するための詳細な操作シーケンスを説明しました。しかし、本当に注目すべきはこれです。エイダはまた、機械の限界についても推測しました。彼女は、その機関には何も生み出すという主張はなかったと書きました。それは指示されたことしかできませんでした。それは考えることも、学ぶことも、創造することもできませんでした。そしてその観察、しばしばラブレス夫人の異議と呼ばれるものは、人工知能に関する次の世紀の議論を通して響き渡ることになります。機械は私たちが明示的に指示したことしかできないのでしょうか?それとも、プログラムを超えていくことができるのでしょうか?その問いは、基本的に機械学習の中心的な緊張です。なぜなら、機械学習の約束全体は、はい、実際には機械は人間が明示的に見つけるようにプログラムしていないものをデータの中に見つけることができるということです。しかし、私たちは先走っています。20世紀初頭に進みましょう。なぜなら、ここで数学的な基盤が本当にまとまり始めるからです。そして、私たちが話す必要がある人物はアラン・チューリングです。チューリングは多くのことで有名です。第二次世界大戦中のエニグマ暗号の解読、コンピューター科学の創始者の一人であること、そして彼の悲劇的な個人的な物語。しかし、今夜の私たちの目的のために、重要な瞬間は1936年です。チューリングはまだ23歳で、「計算不能数」という論文を発表しました。その論文で、彼は抽象的な機械、現在チューリングマシンと呼ばれるものを説明しました。それは、原理的には計算可能なものはすべて計算できるものでした。それは理論的な装置であり、無限に長いテープがセルに分割され、左右に移動できる読み書きヘッドがあり、現在の状態とテープ上の現在の記号に基づいて何をするかを管理する一連のルールがありました。それだけです。それが機械全体です。それにもかかわらず、その息をのむほどシンプルなセットアップから、チューリングは深遠なものを証明しました。彼は、明確に定義された手順、つまりアルゴリズム、つまり計算に従って解決できる問題はすべて、この単純な機械で解決できることを示しました。それは、深い意味で、すべてのコンピューターは根本的に同等であることを意味します。あなたのラップトップ、あなたの電話、巨大なサーバーファームはすべて、チューリングマシンがやっているのと同じことをしています。ただ、より速く、より多くのメモリを使っているだけです。その普遍性が、この分野全体を可能にしています。しかし、チューリングは知能についても考えていました。1950年、彼は別の画期的な論文を発表しました。これは「計算機械と知能」と呼ばれています。そして、それはほとんど遊び心のある一文で始まります。「機械は考えることができるか?」という問いを検討することを提案します。彼はその問いがデリケートであることを知っていたので、哲学を避け、代わりに実用的なものを提案しました。チューリングテストです。アイデアはシンプルです。人間の審査員が機械と会話をして、人間と話しているのかコンピューターと話しているのかを確実に判断できない場合、実用的な目的のためには、その機械は考えているということです。あるいは少なくとも、区別が重要でなくなるほど、考えることに近いことをしているということです。さて、チューリングは学習機械を構築しませんでしたが、その可能性について書きました。彼は「子供機械」と呼ぶものについて推測しました。それは、ほとんど知識を持たずに始まり、子供のように経験から学ぶプログラムでした。彼は、大人の心をシミュレートしようとするのではなく、子供の心をシミュレートしてから教育する方が簡単かもしれないとさえ示唆しました。そしてそのアイデア、シンプルに始め、データから学び、時間とともに改善するというアイデアは、基本的に機械学習の青写真です。チューリングはそれが来るのを見ました。彼はそれを構築するツールを持っていませんでしたが、その形を見ました。ほぼ同時期に大西洋の向こう側で、別の糸が織られていました。1943年、ウォーレン・マカロックという神経生理学者と、ウォルター・ピッツという論理学者が、すべてを静かに変える論文を発表しました。彼らは生物学的ニューロンの数学的モデルを提案しました。彼らの人工ニューロンは信じられないほどシンプルでした。それは一連の二値入力(1と0)を受け取り、それらに重みを適用し、それらを合計し、合計があるしきい値を超えた場合、それは発火しました。出力は1。そうでなければ、出力は0です。それが何を意味するか考えてみてください。彼らは生物学から、脳の基本的な構成要素であるニューロンを取り出し、それを数学に変えました。そして、彼らはこれらの単純な人工ニューロンのネットワークが、原理的にはあらゆる論理関数を計算できることを示しました。あなたが想像できるあらゆる論理演算、または、それらの組み合わせは、マカロック・ピッツニューロンの適切な配置によって表すことができました。さて、彼らのモデルは限定的でした。重みは固定されていました。学習は含まれていませんでした。望む振る舞いを得るためには、ネットワークを手で設計する必要がありました。しかし、概念的なブレークスルーは計り知れないものでした。それは、知能は魔法ではないかもしれないということでした。それは計算かもしれないということでした。脳は、あるレベルでは、ルールに従って情報を処理する機械かもしれないということでした。そして、私たちは似たような原理で動作するものを構築できるかもしれないということでした。この考えは人々を興奮させました。そして、それは次に起こることの舞台を設定しました。1956年の夏、研究者の小さなグループがニューハンプシャー州ハノーバーのダートマス大学に集まり、この分野全体にその名前を与えるワークショップに参加しました。主催者は、ダートマス大学の若い数学者ジョン・マッカーシー、ハーバード大学のマービン・ミンスキー、IBMのナサニエル・ロチェスター、そしてベル研究所の伝説的な情報理論家クロード・シャノンでした。マッカーシーは、提案とワークショップのために人工知能という言葉を造語しました。それは非公式な夏の集まりでしたが、一度に10人から15人程度の人が参加し、認識された分野としてのAIの創設の瞬間となりました。ダートマスワークショップは、並外れた楽観主義に駆り立てられました。提案自体は、今となってはほとんど魅力的とも言える自信を持って述べていました。「学習のあらゆる側面、または知能のその他の特徴は、原理的には機械がそれをシミュレートできるように十分に正確に記述できる。」彼らは、それが夏か、数年かかるかもしれないと考えました。彼らは賢い人々の小さなグループを集めて、知能を解明するつもりでした。もちろん、彼らはそれをしませんでした。その夏でも、数年でも、数十年でもありませんでした。その問題は、誰も想像していたよりも理解不能なほど困難であることが判明しました。しかし、ダートマスワークショップがやったことは、コミュニティを創造したことです。それは、孤立してこれらの問題について考えていた人々を結びつけ、共通の言語と共通の野心を与えました。そして、その時代から生まれた最も重要なアイデアの一つ、ダートマス自体からではなく、それを取り巻くアイデアの熱狂から生まれたのは、パーセプトロンでした。1957年、コーネル大学の心理学者フランク・ローゼンブラットは、驚くべきものを構築しました。パーセプトロンは、本質的に学習できるマカロック・ピッツニューロンでした。重みを手で設定する代わりに、パーセプトロンには学習アルゴリズムがありました。あなたはそれに例を示し、例えば文字の画像を見せて、正しい答えを教えます。もしそれが間違った答えを出した場合、それは重みをわずかに調整し、正しい答えを出したであろう方向へとそれらを微調整しました。十分な例を示し、重みを十分に調整すると、パーセプトロンは見たことのないものを分類することを学習しました。ローゼンブラットはカリスマ的で野心的であり、パーセプトロンができることについて大胆な主張をしました。ニューヨーク・タイムズは1958年に、海軍が最終的に歩き、話し、見、書き、自己複製し、そして自己の存在を意識できる装置を明らかにしたと報じる記事を掲載しました。それは、控えめに言っても、誇張でした。しかし、中心的な成果は現実でした。パーセプトロンは、データから真に学習した最初の機械でした。それはスクリプトに従いませんでした。それは適応しました。それは改善しました。そして、学習規則、つまりエラーに基づいて重みを調整するというアイデアは、より洗練された形で今日でも機械学習を推進しているアイデアです。しかし、ここで物語は方向を変えます。なぜなら、誰もが感銘を受けたわけではないからです。そして、最も顕著に感銘を受けなかった人物は、この分野の創設者の一人であるマービン・ミンスキーでした。彼は実際に1951年に最初のニューラルネットワーク機械の一つ、スナークと呼ばれる装置を製作していました。ミンスキーはニューラルネットワークから離れ、それらが実際に達成できることについてますます懐疑的になっていました。そして1969年、彼は数学者のシーモア・パパートと共に、「パーセプトロン」という本を出版しました。この本は、この分野全体に長い影を落とすことになります。彼らが数学的な厳密さで示したのは、ローゼンブラットが構築したような単層パーセプトロンでは、一見単純な問題の一部を解決できないということでした。最も有名な例はXR、排他的論理和関数です。2つの入力が同じ場合、出力は0です。それらが異なる場合、出力は1です。単層パーセプトロンはそれを学習できません。正しい境界線を引くことができません。さて、この話を複雑で少し悲しいものにしているのはこれです。ミンスキーとパパートは、単層パーセプトロンに関しては技術的に正しかったのですが、多くの人がその本から受け取った含意、つまりニューラルネットワーク全般が行き詰まりであるという考えは間違っていました。多層ネットワークはXRやそれ以上のものを解決できました。ローゼンブラット自身も多層ネットワークについて議論していましたが、ダメージはすでに与えられていました。資金は枯渇しました。研究者は他のアプローチに移り、フランク・ローゼンブラットは1971年にわずか43歳でボート事故で亡くなり、彼のアイデアが正当化されるのを見ることはありませんでした。この分野は、歴史家が現在「最初のAIの冬」と呼ぶものに入りました。そして、その長く寒い期間中、数人の頑固で brilliant な人々が、他の誰もが放棄したアイデアに取り組み続けました。彼らは、重み付き接続の中に何か重要なものが隠されていると確信して、ニューラルネットワークについてひっそりと研究を続けました。そして、その「訓練」という言葉は、次に起こることすべてにとって鍵となります。なぜなら、問題は理論的にニューラルネットワークが機能するかどうかではなかったからです。それは、多層ネットワークに間違いから学ぶ方法を教えることでした。このように考えてみてください。ローゼンブラットの単層パーセプトロンでは、訓練は比較的簡単でした。あなたは入力を見せます。それは推測をします。あなたはそれが正しいか間違っているかを教え、それに応じて重みを調整します。出力とそれを生成した重みの間には直接的な線があります。どのノブをどの方向に回せばよいか正確にわかります。しかし、隠れ層、つまり入力と出力の間に位置するニューロンの層を追加すると、物事は曖昧になります。ネットワークが間違った答えを出した場合、もちろん、隠れ層と出力を接続する重みを調整できます。しかし、入力と隠れ層を接続する重みはどうでしょうか?それらのうちどれがエラーに寄与したかどうかわかりますか?ネットワークの奥深くに埋もれているニューロンに、いわば責任をどのように割り当てるのでしょうか?それらの貢献は間接的で、他のすべてと絡み合っています。これはクレジット割り当て問題であり、何十年もの間ニューラルネットワークの研究を悩ませてきました。それは美しい問題です。実際、日常用語で考えると。あなたは大きなレストランのキッチンを管理していると想像してください。料理が顧客から戻ってきました。それはひどいです。最終的な盛り付けは良かったのですが、下ごしらえのコック、ソースメーカー、ラインコックの連鎖のどこかで、何かが間違っていました。誰が、そしてどれだけ間違ったのかをどのように見つけますか?それは本質的に、多層ニューラルネットワークが学習するたびに解決しなければならないことです。そして長年、誰もそれを実行するためのクリーンで効率的な方法を持っていませんでした。さて、ここで物語は面白くなります。なぜなら、ついに人々が注目する形での解決策が現れたとき、それは単一の「ユリイカ」の瞬間から来たものではなかったからです。それは、独立して発見され、無視され、再発見され、再び無視され、そしてついに分野が聞く準備ができるまで、繰り返し現れるアイデアのようなものでした。中心的な数学的手法は、バックプロパゲーション、つまり「エラーの逆伝播」と呼ばれます。そして、基本的なアイデアは次のとおりです。あなたは出力エラーから始めてネットワークを逆にたどり、微積分学の連鎖律を使用して、各層の各重みがそのエラーにどれだけ寄与したかを調べます。連鎖律、数学の授業で覚えているかもしれませんが、あるいは幸いにも覚えていないかもしれませんが、それは、中間ステップを介してリンクされているときに、ある変数の変化が別の変数にどのように影響するかを計算できる原則です。AがBに影響し、BがCに影響する場合、連鎖律はAがCにどのように影響するかを教えてくれます。これらを十分に積み重ねると、ネットワークの奥深くにどれだけあっても、あらゆる重みの影響を最終出力まで追跡できます。これの数学は、実際にはいくつかの形で複数の人によって開発されました。アメリカの研究者ポール・ワーボスは、1974年のハーバード大学での博士論文でそのバージョンを説明しました。彼は、ニューラルネットワークに特化するのではなく、一般的な最適化の文脈でそれに取り組んでいました。しかし、つながりはありました。フィンランドの数学者セポ・レンニマは、1970年にさらに早く基本的な自動微分技術を発表しており、他にもいましたが、これらの貢献は異なる分野や異なるジャーナルに散らばっており、AIの冬の間に残っていたニューラルネットワークコミュニティはそれらを完全に吸収しませんでした。バックプロパゲーションをより広い世界に注目させたのは、ジェフリー・ヒントンでした。そして、現代の機械学習の物語で知っておくべき名前が一つあるとすれば、この分野をほぼ他の誰よりも形作った、その頑固な粘り強さを持った人物がいるとすれば、それはヒントンです。1947年にロンドンで生まれた彼は、優秀な科学者の家系でした。彼は実際、すべてのデジタルコンピューティングの基盤となるブール代数を発明した数学者ジョージ・ブールの曽々孫でした。その系譜には、宇宙が非常に長いパンチラインを用意しているかのように、ほとんど詩的なものがあります。ヒントンはケンブリッジで実験心理学を学び、その後人工知能に興味を持ち、最終的にエディンバラ大学で博士号を取得するために米国に移り、その後さまざまなアメリカの機関で博士研究員を務めました。そしてAIの冬の間ずっと、ニューラルネットワークが非常に流行らない間も、ヒントンはそれに取り組み続けました。彼は、他の誰もがナンセンスだと思っていたものを信じているようなものだと説明しています。資金調達は困難でした。査読者は懐疑的でした。1970年代と1980年代初頭のAIにおける支配的なパラダイムは、データから学習するのではなく、明示的なルールと論理的推論に基づいたシンボリックAIシステムでした。その期間中にニューラルネットワークに取り組んでいた人は、多くの同僚の目には時間を無駄にしているように見えました。しかし、ヒントンは一人ではありませんでした。信じている小さな散らばったコミュニティがありました。カリフォルニア大学サンディエゴ校の認知心理学者デビッド・ラムルハートも重要な人物であり、ラムルハートと協力していたロナルド・ウィリアムズもいました。一緒に。1986年、ラムルハート、ヒントン、ウィリアムズはネイチャー誌に論文を発表し、すべてを変えました。その論文は「バックプロパゲーション・オブ・エラーズによる表現学習」と題されていました。そして、それはバックプロパゲーションを多層ニューラルネットワークを訓練するための実用的で効果的な方法として提示しました。彼らは数学をゼロから発明したわけではありません。前述したように、その一部は長年存在していましたが、彼らはそれを明確にパッケージ化し、説得力のあるデモンストレーションを行い、世界で最も権威のある科学雑誌の一つに掲載しました。そして今回は、人々が耳を傾けました。この論文が強力だったのは次の点です。彼らは、バックプロパゲーションを使用して多層ネットワークを訓練すると、隠れ層がデータの有用な内部表現を自発的に学習することを示しました。ネットワークは入力と出力を単に記憶するだけではありません。それは独自の内部概念、情報を整理する独自の手段を開発します。これらの表現は誰にも明示的にプログラムされていません。それらは学習プロセス自体から現れます。そしてそれは深遠なことです。それが何を意味するか考えてみてください。ネットワークは、ある意味で、どの特徴が重要か、どのパターンが重要か、すべてを自分で見つけ出しています。それは単に誰かが与えたルールに従っているだけではありません。それは、設計者でさえ予期していなかったかもしれないデータ内の構造を発見しています。これは、1世紀以上前のエイダ・ラブレスの異議への答えでした。機械は決して何も生み出すことはできず、指示されたことしかできないというものです。さて、ここに、意味のある意味で独自の内部カテゴリ、独自の世界の見方を生み出していた機械がありました。それらのカテゴリがプログラムされたからではなく、勾配降下法とエラー訂正の数学が数千の訓練例に適用され、重みが基盤となるパターンに関する現実を捉えた構成に彫刻されたからです。さて、ここで少し立ち止まって、このメカニズムが明確であることを確認しましょう。なぜなら、バックプロパゲーションは本当に発明された最も重要なアルゴリズムの一つだからです。そして、それがネットワークがそれを経験するときにどのように感じるかを理解する価値があります。入力層、2つの隠れ層、出力層を持つネットワークがあると想像してください。あなたは訓練例をフィードします。例えば、ピクセル値として表される猫の画像です。信号はネットワークを順方向に流れます。最初の隠れ層の各ニューロンは、入力の重み付き合計を取り、結果を有用な範囲に圧縮する数学関数を適用し、その出力を次の層に渡します。これは2番目の隠れ層でも繰り返されます。そして最終的に出力層は予測を生成します。おそらく0から1の間の数値で、1は猫、0は猫ではないことを意味します。ネットワークが0.3を出力したが、正解は1だったとしましょう。エラーは0.7です。ここでバックプロパゲーションが機能します。あなたは出力層の各重みがそのエラーにどれだけ寄与したかを計算します。そして、エラーを減らす方向へとそれらの重みを微調整します。次に、連鎖律を使用してそのエラー信号を2番目の隠れ層に逆伝播させ、各重みの寄与を調べます。次に、最初の隠れ層に逆伝播させます。ネットワーク全体のすべての重みがわずかに調整されます。すべて、ネットワークの出力を正しい答えに少し近づけるように計算されます。そして、次の訓練例でそれを再び行い、そしてまた、そしてまた。数千回、数百万回。個々の調整はすべてわずかであり、ジャンプではなく、微調整です。しかし、多くの例を通して、重みはデータ内の真の統計的パターンを捉える構成に落ち着きます。それは浸食のようなものです。一粒の雨は峡谷を彫りませんが、十分な時間と水を与えれば石を形作ります。1986年の論文は、人々が時々「コネクショニストの復活」と呼ぶものを引き起こしました。ニューラルネットワークへの関心の再燃は、1980年代後半から1990年代初頭にかけて続きました。突然、再び資金が供給されました。会議が開かれました。ひっそりと働いていた研究者たちは、エキサイティングな新しい運動の中心にいることに気づきました。ラムルハートとジェームズ・マクレランドが率いるカリフォルニア大学サンディエゴ校の並列分散処理研究グループは、1986年に非常に影響力のある2巻セットを発表し、コネクショニストプログラムを詳細に説明しました。バックプロパゲーションを通じて学習する単純なユニットのネットワークが、言語処理から記憶、運動制御まで、すべてを説明できる方法です。そして結果は本当に印象的でした。画期的なデモンストレーションの一つは、テレン・シノウスキーという研究者から来ました。彼は大学院生のチャールズ・ローゼンバーグと協力して、1987年にネットトークと呼ばれるシステムを作成しました。ネットトークは、書かれた英語のテキストを発音することを学習したニューラルネットワークでした。あなたはそれに文字を入力し、それは音素、つまり音声の音を出力しました。英語の発音は非常に不規則です。しかし、テキストと正しい発音のペアの例で訓練されたネットトークは、これらのほとんどの不規則性を処理することを学習しました。訓練中にネットワークの出力の録音を再生すると、それが喃語からますます明瞭な英語のスピーチのように聞こえるようになるのを実際に聞くことができました。それは不気味で素晴らしかったです。しかし、この復活期間の重要な点は、そしてこれは物語が単にすべてがハッピーエンドで終わらない理由を理解するために重要です。1980年代後半から1990年代初頭のネットワークは、現代の基準ではまだ比較的小さかったです。それらは数百または数千のニューロンを持っていました。コンピューターが遅かったため、それらを訓練するのは遅かったです。そして、研究者がネットワークをより深くし、より複雑なパターンを捉えるために隠れ層を追加しようとすると、彼らはイライラする問題に直面しました。バックプロパゲーション中にネットワークを逆伝播するエラー信号である勾配は、多くの層を通過するにつれて、ほとんどゼロに縮小するか、巨大な値に爆発する傾向がありました。これは勾配消失問題と呼ばれ、その対となる勾配爆発問題です。実際には、深いネットワークの訓練が非常に困難であることを意味しました。入力に最も近い層は、エラー信号がそれらに到達するまでに多くの途中ステップを経て掛け合わされ、実質的に蒸発していたため、ほとんど何も学習しませんでした。そのため、理論的には深いネットワークの方が強力であるべきなのに、実際には効果的に訓練できないというイライラする状況がありました。1つまたは2つの隠れ層を持つネットワークは比較的うまく機能しました。5つまたは10の隠れ層を持つネットワークは収束しませんでした。重みはほとんど動かなかったか、激しく振動し、ネットワークは有用な構成に落ち着きませんでした。そして、ニューラルネットワークがこの深さの問題で苦労している間、機械学習のまったく異なる分野が、多くの実用的なアプリケーションで同等かそれ以上の結果を静かに生み出していました。これらは、神経科学に触発されたコネクショニズムではなく、統計学と最適化の世界から来た方法でした。そして、それらのうち最も重要なもの、ほぼ20年間機械学習を支配することになるものは、サポートベクターマシンと呼ばれるものでした。それは1990年代初頭に、アメリカに移住しニュージャージー州のベル研究所で働いていたロシアの数学者ウラジーミル・ヴァプニクによって開発されました。そして、ヴァプニクのアイデアがニューラルネットワークをどのように凌駕し、それがこの分野に何を意味したかという物語は、技術的にエレガントな解決策が、少なくとも一時的には生物学的にインスパイアされたものを凌駕する、興味深いエピソードの一つです。なぜなら、ヴァプニクのアプローチには、当時のニューラルネットワークが提供できなかったものがあったからです。モデルが見たことのないデータでどれだけうまく機能するかについての強力な数学的保証。そして、すでに持っているデータを適合させることと、まだ遭遇していないデータを予測することとの区別は、すべての機械学習において最も重要なアイデアの一つであることが判明します。ですから、しばらくの間、それに座って考えてみましょう。このように考えてみてください。あなたが教師であり、試験の前に学生に練習問題のセットを与えると想像してください。一人の学生は、すべての練習問題とその答えを、言葉通りに、完璧に暗記します。もう一人の学生は、根本的な原則を学び、パターンを理解し、おそらく練習問題のいくつかを間違えますが、それらの背後にある論理を真に把握します。さて、実際の試験で、彼らが一度も見たことのない新しい問題が出されたとき、どちらの学生がよりうまくやると思いますか?ほとんどの場合、それは後者です。最初の学生は、いわば訓練データを暗記しましたが、根本的な構造を実際に学習しませんでした。機械学習では、これは過学習と呼ばれます。あなたのモデルは訓練データを美しく適合させ、その特定のデータセットのすべての小さな癖、ノイズ、ランダムな変動を捉えますが、新しいものを提示すると崩壊します。そして、これはまさに1980年代後半から1990年代初頭のニューラルネットワークが陥りやすかった問題でした。ニューラルネットワークを訓練すると、訓練セットで驚異的な精度を達成し、その後、新鮮なデータでテストするとパフォーマンスが失望的になる可能性があります。ネットワークは学習するのではなく、記憶していました。ヴァプニクがもたらしたのは、この問題を考えるための厳密な数学的フレームワークでした。彼はそれを統計的学習理論と呼び、実際、1960年代と1970年代にソビエト連邦で同僚のアレクセイ・チェレンキスと共に中心的なアイデアを開発していました。一緒に彼らは現在VC理論、ヴァプニク・チェルボネンキスの理論と呼ばれるものを開発しました。これは、学習モデルの容量を定量化する方法を提供します。それはどれほど複雑ですか?それはどれくらいの異なるパターンを適合させることができますか?そして、ここに鍵となる洞察があります。モデルが複雑であればあるほど、より多くのパターンを適合させることができます。確かに、しかし、それはノイズではなく信号を適合させているリスクが高まります。VC理論は、訓練パフォーマンスとテストパフォーマンスの間のギャップについて、実際の数学的限界を提供しました。それは、モデルの複雑さと訓練データの量に基づいて、新しいデータでのモデルのパフォーマンスをどれだけ信頼できるかについて、正確で証明可能な方法で教えてくれました。これは抽象的に聞こえるかもしれませんが、実用的な結果は計り知れませんでした。なぜなら、ヴァプニクは理論を開発しただけではなかったからです。彼はそれを使用して、ある意味で過学習を回避するように最適に設計された特定の種類の学習機械を構築しました。それがサポートベクターマシンでした。SVMの背後にあるアイデアは、幾何学的に美しいものです。平らな表面に散らばったデータポイントがあると想像してください。赤い点と青い点があり、赤と青を分離する線を引きたいとします。すべての点を正しく分離できる線はいくつかあるかもしれません。しかし、どの線が最良でしょうか?ヴァプニクの答えは、最大マージンを持つ線を選ぶことでした。マージンとは、線と両側の最も近いデータポイントとの間の距離です。最も広い可能なギャップ、最も広い可能なバッファゾーンを2つのクラスの間で望みます。そのマージンの端、つまり分割線に最も近いデータポイントは、サポートベクターと呼ばれます。それらは境界線がどこに行くかを実際に決定する重要なポイントです。それ以外は、ある意味で無関係です。そして、これが本当に賢い点です。マージンを最大化することによって、あなたは本質的に注意深さを組み込んでいます。あなたは単にデータを分離する境界線を見つけているだけではありません。あなたは、新しいデータポイントが少し異なる場合でも、正しく機能する可能性が最も高い、最も堅牢な境界線を見つけています。そして、ヴァプニクは、この最大マージンアプローチが、経験的にだけでなく、実践でうまくいくように見えるだけでなく、理論的な保証付きで証明可能に、良い一般化につながることを数学的に証明できました。さて、あなたは考えているかもしれません。しかし、直線で分離できないデータはどうでしょうか?赤い点と青い点が複雑なパターンで混ざり合っている場合はどうでしょうか?ここで別のエレガントなアイデアが登場します。カーネルトリックと呼ばれるものです。データが存在する元の空間で複雑な曲線境界を見つけようとするのではなく、データをはるかに高次元の空間、場合によっては無限次元の空間に数学的に投影します。そこでは、データは平らな表面、つまり超平面で分離できます。そして、美しいことは、この高次元空間でのデータの座標を実際に計算する必要がないことです。データポイントのペア間の距離をカーネル関数、比較的単純な数学的操作を使用して計算するだけで済みます。したがって、実際にそこに行く計算コストを支払うことなく、非常に複雑な空間で作業する力を得ることができます。それは数学的なショートカット、幾何学的なワームホールのようなものです。そして結果は印象的でした。1990年代を通して、SVMはコンテストで優勝し、ベンチマークごとにニューラルネットワークを上回るようになりました。手書き認識、テキスト分類、画像分類。SVMは全体的に競争力があるか、それ以上でした。そして、それらは精度以外にも実用的な利点がありました。それらはニューラルネットワークよりも訓練が速かったです。調整する必要のあるハイパーパラメータが少なかったです。隠れ層の数、層あたりのニューロンの数、学習率、モメンタムについて悩む必要はありませんでした。SVMの中心にある最適化問題は凸であり、単一のグローバル最適解があることを意味します。あなたは pretty good なものだけでなく、最良の解決策を見つけることが保証されています。損失地形が局所的な最小値と鞍点に満ちており、訓練には多くの希望と祈りと調整が必要なニューラルネットワークと比較してください。ですから、1990年代半ばまでに、機械学習における知的な重心は、ニューラルネットワークから統計的手法へと決定的にシフトしました。SVMがスターでしたが、それだけではありませんでした。レオ・ブリマンがバークレーで開発したランダムフォレストのようなアンサンブル手法もありました。これは異なるが同様に巧妙なアプローチを取りました。非常に洗練されたモデルを1つ構築するのではなく、数百または数千の単純なモデル、決定木を構築します。それぞれがわずかに異なるランダムなデータサブセットで訓練され、それらに投票させます。群衆の知恵です。基本的に、個々のツリーは平凡かもしれませんが、森全体の集計予測は驚くほど正確で堅牢です。ブリマンは2001年にランダムフォレスト論文を発表し、それは機械学習全体で最も引用された論文の一つになりました。これらの方法は実用的で、信頼性が高く、解釈可能で、そして機能しました。そして、これはニューラルネットワークにとって「第二のAIの冬」と呼ばれることもある期間です。ただし、それは正確ではありません。ニューラルネットワークの研究が完全に停止したわけではありません。それは、それが深く流行らなくなったということです。資金は枯渇しました。トップカンファレンスの査読者は、ほぼ反射的にニューラルネットワークに関する論文を却下しました。あなたが大学院生で、アドバイザーにニューラルネットワークに取り組みたいと伝えた場合、あなたは心配そうな顔と穏やかなキャリアアドバイスを受けたでしょう。分野は進んでいました。統計的学習理論は厳密でした。SVMには保証がありました。ニューラルネットワークは、数層以上深くすると適切に訓練できない、気まぐれで信頼性が低く、理論的に曖昧なブラックボックスと見なされていました。しかし、少数の研究者はニューラルネットワークのアイデアを諦めませんでした。そして、最も著名で、最も頑固で、最も容赦なく楽観的なのは、すでに会ったジェフリー・ヒントンでした。荒野の期間中ずっと、ヒントンはニューラルネットワークに取り組み続けました。彼は出版を続け、学生を訓練し続け、脳に触発されたアプローチが根本的に正しいと主張し続け、問題は概念的な行き詰まりではなく、工学的な問題であると主張しました。そして彼は一人ではありませんでした。パリのニューラルネットワーク研究のパイオニアの一人の下で学んだフランスのコンピューター科学者ヤン・ルカンは、ベル研究所に移りました。ヴァプニクが働いていたのと同じベル研究所であり、それは素晴らしい皮肉です。そして、畳み込みニューラルネットワークと呼ばれる特定のタイプのニューラルネットワークで驚くべきことをしていました。ルカンの畳み込みネットワークは、視覚野に直接触発されていました。1950年代後半から1960年代初頭にかけて、デビッド・ヒューベルとトルステン・ウィーゼルという2人の神経科学者は、猫の視覚野に電極を挿入し、猫にさまざまな視覚刺激を見せるという画期的な実験を行いました。彼らは、視覚野のニューロンが階層的に組織化されていることを発見しました。一部のニューロンは、たとえば特定の角度のエッジのような単純な特徴に応答します。他のニューロンは、それらの単純な特徴のより複雑な組み合わせに応答します。視覚システムは、単純から複雑へと層ごとに理解を構築します。ヒューベルとウィーゼルはこの業績で1981年にノーベル賞を受賞しました。ルカンはこの生物学的洞察を取り入れ、それを工学的なアーキテクチャに変えました。畳み込みニューラルネットワークでは、最初の層はエッジ、コーナー、色のグラデーションのような単純な特徴を検出することを学習します。次の層は、それらの単純な特徴を、たとえば文字の曲線や表面のテクスチャのような、わずかに複雑なパターンに組み合わせます。次の層は、それらをさらに複雑な表現に組み合わせます。各層は、入力全体をスライドしてその特定の特徴を探す小さなフィルター、つまりパターン検出器を適用します。そのスライド、つまり同じフィルターを異なる位置で共有することが畳み込みであり、これらのネットワークを非常に効率的にしています。すべてのニューロンをすべての入力ピクセルに接続するのではなく、膨大な数の接続が必要になりますが、画像全体で再利用される少数の学習済みフィルターがあります。1990年代後半までに、ルカンはLynette 5と呼ばれる畳み込みネットワークを構築し、手書きの数字、封筒の郵便番号、チェックの数字を驚くべき精度で読み取ることができました。TNTは実際にそれを展開しました。1990年代後半までに、アメリカの銀行に預けられたすべてのチェックの約10〜20%を読み取っていました。毎日何百万ものチェックがニューラルネットワークによって読み取られていました。そしてほとんどの人は知りませんでした。この、かつては時代遅れと見なされていた技術が、学術界がSVMやカーネル手法で忙しい間、静かに実世界で実際の仕事をしていたのです。そして、カナダのコンピューター科学者ヨシュア・ベンジオがいました。彼はモントリオールで、ニューラルネットワークをシーケンシャルデータ、言語、時系列、入力の順序が重要なものに適用する問題に取り組んでいました。ベンジオは、単語の表現を学習すること、言語の意味を数値のベクトルで捉える方法を見つける問題に深く関心を持っていました。彼は2003年に、後から見るとさらに15年後に完全に開花する種を植えた、ニューラル確率言語モデルに関する論文を発表しました。この3人、ヒントン、ルカン、ベンジオは、後にディープラーニングのゴッドファーザーとして知られるようになり、2018年にチューリング賞を共有しました。しかし、2000年代初頭、彼らは逆流に逆らって泳ぎ、ほとんどの同僚が死んだ行き止まりと考えていた分野の片隅で働いていました。そして、すべてを変えるもの、彼らの頑固さを正当化し、機械学習だけでなく、テクノロジー全体を変革するものとなったのは、彼らの誰も完全に予期できなかった3つの要因の収束でした。最初の要因は、利用可能なデータの爆発的な増加でした。2番目は、コンピューティングハードウェアにおける予期せぬ革命でした。そして3番目は、ついにディープネットワークの訓練の問題を解決した、巧妙なアルゴリズムの革新でした。1980年代後半から根本的な障壁となっていた、あの勾配消失問題です。それら3つの糸がどのように集まり、そして何が起こったかの物語は、ビデオゲームの世界における一見無関係な開発から始まります。特に、3次元ビデオゲームの世界と、画面上でより速く、より美しくグラフィックをレンダリングすることへの飽くなき需要です。なぜなら、1990年代後半から2000年代初頭にかけて、Nvidiaという会社は、ゲーム市場向けの最速のグラフィックス処理ユニット(GPU)を構築するために、ATIや3DFXのようなライバルと激しい競争を繰り広げていました。そして、ビデオゲームのフレームをレンダリングすることの重要な点は、同じ比較的単純な数学的操作を実行する必要があることです。数値を掛け合わせ、それらを足し合わせ、それを同時に何百万ものピクセルに対して繰り返します。あなたは一つの難しい問題を解決しているわけではありません。あなたは同時に何百万もの簡単な問題を解決しています。そのため、GPUデザイナーは従来のCPUとは根本的に異なるチップを構築しました。CPUは、あなたが投げかけるどんな問題でも解決できる brilliant な教授のようなものですが、それらは一度に、あるいは一度に数個ずつ処理します。GPUは、スタジアムにいる高校数学の学生の群衆のようなものです。それぞれが基本的な算術しかできませんが、何千人もいます。そしてそれらはすべて並列で動作します。ゲームにとっては、このアーキテクチャは完璧でした。機械学習にとっては、革命的であることが判明しましたが、誰もそれを計画していませんでした。それがこの物語の部分を驚くほど偶然のものにしています。GPUとニューラルネットワークのつながりは、最初は明らかではありませんでしたが、ニューラルネットワークを訓練するときに何が起こるか考えてみてください。各層で、あなたは一連の入力を取り、それぞれを重みで掛け合わせ、それらを足し合わせ、結果を活性化関数に通します。次に、次の層でそれを繰り返します。そして、それを各訓練例に対して行い、場合によっては何百万回も行います。それは、何千、何百万もの人工ニューロンにわたって繰り返される、同じ基本的な操作、乗算と累積です。それは、GPUが設計されたワークロードの種類とほぼ同じです。ニューラルネットワークの数学とビデオゲームでポリゴンをレンダリングする数学は、深いレベルでは同じ種類の数学です。行列乗算。大規模な並列行列乗算。このつながりを公然と推進した人物は、スタンフォード大学の研究者アンドリュー・ンでした。彼は共同研究者と共に、2009年頃、ンと彼のチームは、従来のCPUよりもGPUでニューラルネットワークを劇的に速く訓練できることを実証しました。私たちは、10倍、50倍、時には100倍のスピードアップについて話しています。かつて数週間かかっていたことが数日に短縮できるようになりました。かつて数日かかっていたことが数時間に短縮できるようになりました。そしてそれはすべてを変えます。なぜなら、研究において、スピードは単なる利便性ではないからです。スピードは、月に1つのアイデアを試すことと、週に10のアイデアを試すことの違いです。それは、死んだ分野と生きている分野の違いです。しかし、GPUの話は一つの糸に過ぎませんでした。データ爆発について話しましょう。それは同時に起こっており、それは同じくらい重要でした。2000年、世界に保存されていたデータの総量は約6.2エクサバイトと推定されていました。2007年までには約295エクサバイトでした。2010年までには、ゼタバイトの範囲に達していました。ゼタバイトは1000エクサバイト、つまり1兆ギガバイトです。インターネットは、インターネットがやっていることをやっていました。人々は写真をアップロードし、メールを書き、リンクをクリックし、物を買い、レビューを残し、ソーシャルメディアに投稿していました。それらの各アクションはデータを生成し、企業はそれらすべてを保存していました。これは、Googleが数十億のウェブページをインデックス化し、Facebookが数十億のタグ付き写真を蓄積し、Amazonがすべての購入とブラウジングパターンを追跡した時代でした。そして、これが機械学習にとってなぜ重要なのかを説明します。覚えておいてください、これらのアルゴリズムは例から学びます。例を多く与えるほど、それらは良くなります。しかし、落とし穴があり、それは過学習の話に戻る微妙なものです。SVMやロジスティック回帰のような単純なモデルは、ある点までしかデータから利益を得られません。それらは限られた容量、限られた表現力を持っています。それらがアーキテクチャで許可されているすべてのパターンを抽出すると、それ以上のデータはあまり役立ちません。しかし、何百万、何十億ものパラメータを持つディープニューラルネットワークは、信じられないほど表現力豊かです。それらはデータに飢えています。それらはその可能性を最大限に引き出すために膨大な量のデータが必要です。そして十分なデータがないと、それらはひどく過学習します。そのため、何十年もの間、ディープネットワークは一種のジレンマに陥っていました。それらは、その優位性を示すために存在するよりも多くのデータが必要でした。そして、機能しないように見えるテクノロジーのために、誰ももっと多くのデータを収集しようとしませんでした。インターネットはそのジレンマを破りました。突然、データはそこにありました。さて、3番目の糸、アルゴリズムのブレークスルーです。そして、これはヒントンが再び大きな役割を果たすところです。2006年、ジェフリー・ヒントンは、サイモン・オインデレオとユイ・ティと共にトロント大学で、機械学習コミュニティに衝撃を与えた論文を発表しました。その論文はディープビリーフネットワークと呼ばれるものでした。そして、鍵となる洞察は巧妙な訓練戦略でした。ディープネットワークのすべての層を一度に訓練しようとするのではなく(そこで勾配消失問題があなたを打ち砕くでしょう)、ヒントンは非教師あり学習法を使用して、ネットワークを一番下の層から一段階ずつ訓練することを提案しました。各層は、下の層の統計的構造をモデル化することを学習し、これらの事前に訓練された層を積み重ねて、ネットワークを段階的に構築します。この層ごとの事前訓練の後でのみ、バックプロパゲーションで全体を微調整します。それは、家全体を一度に建てようとして崩壊しないことを願うのではなく、各階の基盤を注意深く敷いてから次の階を積み重ねて家を建てるようなものでした。結果は驚くべきものでした。このように訓練されたディープネットワークは、浅いネットワークよりも著しく優れたパフォーマンスを発揮しました。その論文は「ディープビリーフネットのための高速学習アルゴリズム」と呼ばれ、ディープラーニングの復活が本当に始まった瞬間としてしばしば引用されます。ヒントンは、このアイデアに20年以上取り組んでおり、分野がニューラルネットワークに背を向けたのを見ており、1990年代の長いAIの冬を通して信仰を守り続けていました。ヒントンはついに人々が再び注目する結果を得ました。そして、タイミングについて素晴らしいことがあります。ヒントンはこの論文が出版されたとき60歳でした。彼は実質的にキャリア全体を、ほとんどの同僚が間違っていると思っていたアイデアに費やしました。そのために必要な粘り強さを考えてみてください。学部会議に出席し、助成金を申請し、学生がSVMをやっている人を採用したい採用委員会のために、ニューラルネットワークに取り組んでいたために仕事を見つけるのに苦労するのを見ることを考えてみてください。それでも彼は続けました。彼に帰せられる引用があります。私は言い換えをしていますが、彼は「私が信じられないほど間違っていたか、それとも他の全員が間違っていたか」のようなことを言いました。そして2006年、針はついに彼の方向に動き始めました。しかし、2006年の論文は、重要ではありましたが、完全な正当化の瞬間ではありませんでした。それは数年後に起こり、それは競争、文字通りの競争を通して起こりました。2009年、ヒントンのグループは音声認識コンテストに参加し、ディープニューラルネットワークが30年間分野を支配してきた従来のメソッドを上回ることができることを示しました。これらの従来のメソッドは、隠れマルコフモデルとガウス混合モデルを組み合わせたものに基づいていました。 mouthful、私は知っていますが、ポイントは、それらが確立された技術、業界標準、Siriの祖先から自動化された電話メニューまで、すべての音声認識システムを動かしていたものであったということです。そしてヒントンのニューラルネットワークはそれらを打ち負かしました。わずかな差ではなく、大幅に。これは大手テクノロジー企業の注目を集めました。マイクロソフト、Google、IBMはすべて、非常に注意を払い始めました。2012年までに、ディープニューラルネットワークは、すべての主要なテクノロジー企業で音声認識を実質的に支配していました。エラー率は劇的に低下しました。音声アシスタントが2012年または2013年頃に著しく改善したことに気づいたことがあるなら、それはこのためです。それは漸進的な改善ではありませんでした。それはステップチェンジ、ディープラーニングが古い統計モデルに取って代わったことによる突然の飛躍でした。しかし、本当の地震、分野のほとんどの人がすべてが変わった瞬間として指摘するイベントは、2012年10月に起こりました。そしてそれは猫のおかげで起こりました。まあ、正確には猫のおかげではありませんが、私に付き合ってください。2010年以来毎年、ImageNet大規模ビジュアル認識チャレンジというコンテストが開催されていました。ImageNetは、20,000以上のカテゴリ(犬、車、キノコ、橋、想像できるすべて)に整理された1400万以上のラベル付き画像の大規模なデータセットでした。課題は、見たことのない写真を見て、その中に何があるかを正しく識別できるシステムを構築することでした。2010年と2011年には、最高のシステムは25%または26%のエラー率を達成していました。それらは、エッジ検出器やカラーヒストグラムのような注意深く手作業で設計された特徴を使用し、SVMのような従来の分類器にフィードされました。 respectable な結果でしたが、人間のレベルのパフォーマンスにはほど遠いものでした。次に、2012年にトロント大学のチームが参加しました。それはアレックス・クジェフスキー、イリヤ・サツケバー、そして彼らの指導教官ジェフリー・ヒントンでした。彼らのシステムはAlexNetと呼ばれ、ディープ畳み込みニューラルネットワークでした。1990年代のルカンの畳み込みネットワークを覚えていますか?同じ基本的なアイデアですが、より大きく、より深く、そしてGPUで訓練されました。AlexNetは約6000万のパラメータを8つの層に分散させていました。そしてクジェフスキーはそれを2つのGPUで実行するように実装しました。
Nvidia GTX 580 グラフィックカード、ゲーム用GPS、ファーストパーソンシューティングゲームをプレイするために購入するようなものです。彼らはImageNetの120万枚の画像でそれを訓練しました。AlexNetは2012年のコンペティションで優勝しただけでなく、コンペティションを圧倒しました。そのエラー率は、2位のエントリーの25%以上と比較して、約15%でした。その差、約10パーセントポイントは、途方もないものでした。年間改善が通常パーセントの小数で測定されていた分野において、AlexNetは誰も予期していなかった飛躍を表していました。そしてそれはニューラルネットワーク、ゲーム用ハードウェアで実行されるバックプロパゲーションで訓練されたディープニューラルネットワークであり、大量のデータで供給されていました。データ、ハードウェア、アルゴリズムという3つのスレッドすべてが1つのシステムに集まり、その結果は否定できませんでした。機械学習コミュニティの反応は、ショックに近いものでした。手作業で設計された特徴とカーネルメソッドでキャリアを積んできた研究者たちは、突然、死んだと思われていた技術であるニューラルネットワークが、他のすべてを打ち砕いたという事実に直面しなければなりませんでした。1年以内に、ImageNetのほぼすべての競争力のあるエントリーはディープニューラルネットワークになりました。2年以内に、古いアプローチはリーダーボードから実質的に姿を消しました。それはコンピュータサイエンスの歴史の中で最も速いパラダイムシフトの1つでした。そして、AlexNetが学んだことの本当に興味深い点は、これがニューラルネットワークの根本的な仕組みとつながっているからです。研究者たちがネットワークの内部を見て、異なる層が何を検出することを学んだかを見たとき、彼らは美しいものを見つけました。入力画像に最も近い初期の層は、エッジ、コーナー、色のグラデーションといった単純な特徴を検出することを学んでいました。中間の層は、それらの単純な特徴を、テクスチャ、オブジェクトの一部、曲線といったより複雑なパターンに組み合わせ、そしてより深い層は、それらのパターンを顔、車輪、毛皮、テキストといった認識可能なものに組み立てました。ネットワークは、ますます抽象的な表現の階層に自律的に組織化されていました。誰かが最初にエッジを探し、次にオブジェクトを探すように指示したわけではありません。それは、数百万の訓練例でのエラーを最小限に抑えようとする単純な圧力によるバックプロパゲーションを通じて、それを自分で見つけました。そして、その階層が聞き覚えがあるなら、それはそうあるべきです。それは、1960年代にハッブルとヴィーゼルが猫の視覚野で見つけたものと驚くほど似ています。そもそもラクーンの畳み込みネットワークにインスピレーションを与えたのと同じ研究です。エッジを検出する単純細胞、エッジを形状に組み合わせる複雑細胞、特定のオブジェクトに応答する超複雑細胞。人工システムは、十分なデータと十分な深さを与えられれば、生物学的な解決策に非常によく似たものに収束しました。それが偶然なのか、視覚処理の本質に関する深い真実なのかは、人々がまだ議論している質問であり、それは魅力的な議論です。さて、AlexNetの成功は水門を開きました。突然、誰もがより深いネットワークを構築したいと思うようになりました。8層でこれができるなら、20層では何ができるでしょうか?100層ではどうでしょうか?そして、ここで私たちは古い宿敵、勾配消失問題に再び直面します。事前訓練のトリックやより良い活性化関数を使っても、人々はReLU、つまり正規化線形ユニットと呼ばれるものを使用し始めており、それは大いに役立ちました。非常に深いネットワークの訓練は、依然として非常に困難でした。信号を数十または数百の層に押し込もうとすると、勾配は依然として弱まったり爆発したりしました。そして、この問題に対する最もエレガントな解決策を見つけた人物は、北京のMicrosoft Researchの若い研究者でした。そして、その解決策は非常にシンプルだったので、まるで不正行為のように見えました。彼の名前はキミン・ヘでした。そして2015年、彼と彼の同僚は、彼らが残差接続とそれらで構築したネットワークと呼ぶものを紹介する論文を発表しました。ResNetはすべてを変えました。だから、残差接続が何であるかを説明させてください。それは、「待て、これだけ?それがすべて?」と思わせるアイデアの1つだからです。そして、しばらく考えて、それが実際にどれほど深遠であるかに気づきます。数十の層が積み重なった深いネットワークを想像してみてください。各層はデータの変換を学習することになっています。入力を取り、それに有用なことを行い、結果を次の層に渡します。問題は、私たちが話してきたように、バックプロパゲーションでこのものを訓練しようとすると、勾配信号、つまり各層がどのように調整するかを伝える小さな合図が、すべての層を逆方向に移動するにつれてますます弱くなることです。初期の層に到達する頃には、それは基本的にささやきです。それらの初期の層は学習できません。それらは行き詰まっています。そして、キミン・ヘが発見したのは、各層に入力から出力までの完全な変換を学習するように求める代わりに、差、つまり残差だけを学習するように求めるのはどうだろうかということです。層への入力を取り、層にその仕事をさせ、そして元の入力を出力に戻します。それだけです。あなたはショートカット、スキップ接続、信号が必要に応じて層を完全にバイパスできるようにする小さなハイウェイを作成しています。これがなぜそれほど賢いのか考えてみてください。層が何もする必要がない場合、つまりデータをそのまま渡すことが最善である場合、学習する必要があるのはゼロだけです。残差はゼロです。スキップ接続がすべてを処理します。それは、ゼロから完全な恒等関数を学習しようとするよりもはるかに簡単なことです。そしてさらに重要なのは、それらのスキップ接続が勾配にネットワークを逆方向に直接移動するパスを与えることです。勾配はもはやすべての層を絞り込む必要はありません。ショートカットに沿ってホップし、強く保ち、最も初期の層まで到達します。それは、交通渋滞で詰まった高速道路に急行レーンを建設するようなものです。情報が望むならローカル道路を利用することもできますが、先に進むオプションもあります。そして、その結果は驚異的でした。ResNetは、152層の深さのネットワークで2015年のImageNetコンペティションで優勝しました。152層。AlexNetは8層だったことを思い出してください。そしてResNetは深くなっただけでなく、深くなるにつれてパフォーマンスも向上しました。これは以前起こっていたこととは逆でした。残差接続が登場する前は、研究者たちはネットワークに層を追加すると、ある時点を超えると実際には悪化することを発見していました。過学習のためではなく、最適化が完全に崩壊したためです。ネットワークは学習できませんでした。ResNetはその障壁を完全に突破しました。ImageNetのエラー率は約3.6%に低下しました。これは、その特定のタスクにおける平均的な人間のパフォーマンスよりも優れていました。それを少しの間、考えてみてください。2012年のAlexNetから2015年のResNetまでのわずか3年間で、画像認識は、コンピュータが人間と比較して笑えるほど下手な問題から、コンピュータが間違いなく優れている問題へと移行しました。それは驚異的な進歩のペースです。そしてそれは、私たちが追跡してきたものの組み合わせによって起こりました。より多くのデータ、より高速なハードウェア、そして残差接続のようなこれらの重要なアーキテクチャ上の革新。さて、ここで注目してほしいことがあります。それは機械学習の歴史で何度も現れるパターンだからです。残差接続は複雑なアイデアではありません。それは、理論的な作業に何年もかかった深い数学的な洞察ではありません。それはエンジニアリングのトリック、アーキテクチャ上の選択、ネットワークの配線を少し変更することです。それにもかかわらず、それはそれなしでは誰も達成できなかった能力を解き放ちました。これは繰り返されるテーマです。ディープラーニングのブレークスルーは、しばしば驚くほど単純なアイデアであり、最適化をより良く機能させるだけでした。ReLU活性化関数、正則化のためのドロップアウト、バッチ正規化、スキップ接続。それぞれが数文で説明するのは簡単ですが、それぞれが変革的でした。そして、それがこの分野を非常に興味深く、そして謙虚にしている理由の一部だと思います。難しいのは複雑な数学を思いつくことではありません。難しいのは適切な単純なアイデアを見つけることです。したがって、2000年代半ばまでに、ディープラーニング革命はコンピュータビジョンで本格化していました。しかし、同様に劇的なことが起ころうとしていた別の領域がありました。そしてそれは、最終的にほとんどの人が人工知能という言葉を聞いたときに今日考えているAIシステムにつながる領域です。私は言語、言語の理解、言語の生成、言語間の翻訳、質問への回答、テキストの作成について話しています。そして、ディープラーニングが言語を征服した物語は、ある意味ではビジョン物語よりもさらに魅力的です。なぜなら、言語は画像とは非常に異なるからです。画像はピクセルのグリッドです。固定サイズで、明確な空間構造があります。言語はシーケンシャルで、可変長で、文の最初にある単語が文の最後の単語の意味を完全に変える可能性のある長距離依存関係に満ちています。画像がめったにないような曖昧さがあります。ニューラルネットワークでシーケンスを処理する従来の取り組みは、リカレントニューラルネットワーク、またはRNNと呼ばれるものでした。そのアイデアは1980年代にさかのぼり、非常に直感的です。すべての入力を一度に処理するのではなく、一度に1つの要素、たとえば一度に1つの単語を処理し、各ステップでネットワークは隠れ状態、つまり前のステップからの情報を前方に運ぶ一種のメモリを維持します。したがって、ネットワークが「bank」という単語を読むとき、理論的には、文中の前の単語のメモリを使用して、川岸について話しているのか、金融機関について話しているのかを判断できます。理論的には、実際には、RNNは長距離依存関係に苦労していました。関連するコンテキストが20語または30語前にある場合、ネットワークは通常それを忘れていました。情報はすべてのシーケンシャルステップを通過するにつれて減衰し、それは実際には別の形で現れる勾配消失問題にすぎません。改善はありました。1997年、セップライターとユルゲン・シュミット・フーバーは、長・短期記憶ネットワーク(LSTM)を導入する論文を発表しました。これらは、各ステップでどの情報を保持するか、どの情報を忘れるか、どの情報を出力するかを制御する明示的なゲート機構、小さな学習済みスイッチを備えた、より洗練されたリカレントネットワークでした。ネットワークに、単に覚えていることを期待するのではなく、意図的に書き留めたり消去したりできるノートを与えるようなものです。LSTMは、バニラRNNよりも大幅に改善され、ほぼ20年間シーケンスモデリングを支配しました。それらは、最初の本当に優れた機械翻訳システム、音声認識、テキスト生成を可能にしました。Googleはその翻訳サービスでLSTMを使用しました。AppleはSiriでそれらを使用しました。それらはディープラーニング時代の自然言語処理の主力でした。しかし、LSTMには根本的な制限があり、人々がそれらをスケールアップしようとするにつれて、ますます苦痛になりました。シーケンスを一度に1ステップずつ処理するため、本質的にシーケンシャルでした。画像の畳み込みネットワークを処理するのと同じように、並列化できませんでした。各ステップは、隠れ状態を必要としたため、前のステップが完了するのを待つ必要がありました。他のすべてを高速化していた強力なGPUで。LSTMは、並列処理能力を十分に活用できませんでした。非常に大きなデータセットでそれらを訓練するのは遅かったです。そして、たとえ洗練されたゲート機構を備えていても、そのシーケンシャルメモリが長距離依存関係を処理する最良の方法であったかどうかという問題は依然として残っていました。答えは2017年にGoogleの8人の研究者チームから、コンピュータサイエンスの歴史の中で最も影響力のあるタイトルの1つを持つ論文で来ました。「Attention is all you need(注意こそすべて)」。そして彼らが導入したアーキテクチャ、Transformerは、それ以降あなたが聞いたほぼすべての主要な言語AIシステムの基盤となっています。GPT、BERT、PaLM、Claude、Llama、それらはすべてTransformerです。すべてです。では、注意とは何であり、なぜすべてを変えたのでしょうか?直感をゆっくりと構築してみましょう。なぜなら、これは理解する価値があるからです。注意の核心的なアイデアは、Transformer論文の数年前からすでに広まっていました。特に機械翻訳のためにRNNに追加機能として使用されていました。洞察は次のとおりでした。たとえば、フランス語から英語に翻訳していて、次の英語の単語を生成している場合、フランス語の文のすべての単語がこの特定の出力単語に対して等しく関連しているわけではありません。一部の単語は、この特定の出力単語にとって非常に重要であり、他の単語は基本的に無関係です。注意とは、ネットワークが入力の関連部分に焦点を当てることを学習できるようにするメカニズムです。各入力要素に重みと注意スコアを割り当てます。そして、それらの重みは学習されます。それらは動的です。ネットワークが現在何をしようとしているかによって変化します。役立つ可能性のあるアナロジーを次に示します。賑やかなパーティーにいて、同時に何十もの会話が行われていると想像してください。あなたはそれらすべてを背景のざわめきとして聞くことができます。しかし、部屋の向こうにいる誰かがあなたの名前を呼んだとき、あなたの注意はその会話に引き付けられます。あなたは選択的にその信号を増幅し、他のすべてを抑制します。それがニューラルネットワークにおける注意の働きです。それは、モデルが生成している各出力部分に対して、どの入力部分に焦点を当てるかを動的に決定できるようにします。Vaswaniと彼の共著者がTransformer論文で行ったのは、この注意メカニズムを取り入れて、それをアーキテクチャ全体にすることでした。彼らはリカレンスを完全に捨てました。もう単語を一度に1つずつ処理することはありません。シーケンシャルな隠れ状態もありません。代わりに、Transformerは入力シーケンス全体を一度に見ます。そして、シーケンス内の各要素が他のすべての要素とどのように関連しているかを把握するために注意を使用します。どの単語も、距離に関係なく、他のすべての単語に直接注意を払うことができます。文の最初にある単語と最後にある単語は、情報が中間状態の連鎖を通過する必要なしに、単一のステップで直接相互作用できます。そして、シーケンシャルな処理がないため、すべてを並列化できます。GPUに投入して、シーケンスのすべての位置を同時に処理できます。訓練は劇的に高速になり、モデルは長距離依存関係を楽に処理できました。なぜなら、情報が減衰するシーケンシャルステップの連鎖がなかったからです。すべての接続は直接的でした。彼らが使用した特定のメカニズムは、スケーリングされたドット積注意と呼ばれ、入力の3つの学習済み変換、つまりクエリ、キー、バリューと呼ばれるものを通じて機能します。ライブラリシステムのようなものだと考えてください。各単語はクエリを生成します。「何を探していますか?」そしてキーも。「何が含まれていますか?」そしてバリューも。「私を探している人がいたら、どのような情報を提供すべきですか?」任意の2つの単語間の注意スコアは、一方のクエリともう一方のキーを比較することによって計算されます。それらがうまく一致する場合、注意スコアは高く、注意された単語の値は出力で強い重みを得ます。それはエレガントで、微分可能なので、バックプロパゲーションで訓練でき、見事にスケーリングします。彼らはまた、マルチヘッド注意と呼ばれるものも導入しました。これは、モデルが複数の注意メカニズムを並列で実行するものです。それぞれが異なる種類の関係に焦点を当てることを学習します。1つのヘッドは、構文関係、主語と動詞の一致を追跡することを学習するかもしれません。別のヘッドは、意味関係、同じトピックに関する単語を学習するかもしれません。別のヘッドは、位置関係を学習するかもしれません。モデルは、どのような種類の注意パターンが役立つかを、訓練を通じて完全に自分で見つけます。そして、Transformerの本当に驚くべき点は次のとおりです。これらの注意層を深く積み重ねると(元の論文では6層を使用しましたが、現代のモデルでは数十層、あるいは100層以上を使用しています)、ネットワークは、画像に対する畳み込みネットワークで見たものと不気味なほど似た方法で、言語のますます抽象的な表現を構築します。初期の層は、フレーズ構造や単語の関連付けのような局所的なパターンを捉えます。より深い層は、物語の一貫性、論理的な含意、事実の関連付けのような、ますますグローバルで抽象的な関係を捉えます。階層は、AlexNetでエッジ検出器や顔検出器が現れたのと同じように、訓練から現れます。2017年のTransformer論文は機械翻訳に焦点を当てており、最先端の結果を達成しました。しかし、本当の爆発は、人々が別の質問をし始めたときに起こりました。もし、翻訳のような特定のタスクでTransformerを訓練する代わりに、単にインターネット、書籍、あらゆる場所からの膨大な量のテキストで次の単語を予測するように訓練したらどうなるでしょうか?ラベルなし、人間の注釈なし、特定のタスクなし。これまでのすべての単語を与えられたら、次は何が来るでしょうか?このアイデア、言語モデリングとしての事前訓練は、2003年のベンジオの仕事以降にルーツがありました。しかし、Transformerは、誰も試みたことのない規模でそれを実用的なものにしました。そして、その結果はすべてを変えることになります。ですから、人々が実際にこれを実行したときに何が起こったかについて話しましょう。なぜなら、そのアイデアはほとんど単純すぎるように聞こえるからです。次の単語を予測するだけです。それが訓練信号です。モデルがやろうとしているのはそれだけです。単語のシーケンスが与えられたら、次は何が来るかを推測します。間違えたら、重みを調整して、もう一度試します。数十億回、数十億語にわたって。そして、誰も事前に完全に答えられなかった質問は、この方法で巨大な規模で訓練されたモデルは実際に何を学ぶのかということです。一般的なフレーズを記憶するだけでしょうか?文法を学ぶでしょうか?それとももっと深い何かを学ぶのでしょうか?最初の主要な答えは、2018年にOpenAIのグループがGPT、Generative Pre-trained Transformerというモデルで提供しました。そして、その名前自体が哲学全体を物語っています。Generativeはテキストを生成することを意味します。Pre-trainedは、特定のタスクを示す前に、巨大な量の生テキストで最初に訓練することを意味します。そしてTransformerは、それが基盤となるアーキテクチャだからです。そのアイデアは単純でした。大きなTransformerを取り、それを巨大なテキストコーパスで訓練します。この場合、書籍のデータセットを使用し、次の単語予測以外の何も使用しません。ラベル付きデータなし、この文は肯定的である、この段落は科学についてであるといった人間の注釈なし。生テキストと、次に来る単語を予測するという単純な目的だけです。そして、その事前訓練が終わったら、モデルを取り、特定のタスクでファインチューニングします。感情分析、質問応答、テキスト含意、必要なものは何でも。そして、驚くべきことは次のとおりです。この事前訓練されたモデルは、明示的にこれらのタスクのいずれかを教えられていなかったにもかかわらず、わずかなファインチューニングの後、それらすべてで驚くほど優れていることがわかりました。それは、次の単語を予測することを学ぶプロセスが、モデルに言語、文法、意味論、世界知識、推論パターンについての深い一般的な理解を、その単純な1つの目的の副産物として開発することを強制したかのようでした。それを少しの間考えてみてください。誰もこのモデルに英語の文法規則をプログラムするために座っていませんでした。誰もこのモデルに世界に関する事実の知識ベースを与えませんでした。誰もこのモデルに論理を教えませんでした。それは、テキストを読んだり、次に来るものを推測したりすることから、これらのすべて、または少なくともそれらの有用な近似を学びました。そして、それを考えると、ある種の優雅さがあります。なぜなら、次の単語をうまく予測することは、実際には非常に要求の厳しいタスクだからです。フランスの首都はパリであるという次の単語を予測するには、地理に関する事実を吸収している必要があります。複雑な論理的議論の次の単語を予測するには、推論のように機能する何かが必要です。訓練目的は単純ですが、それを高いレベルで満たすには、モデルが洗練された内部表現を開発する必要があります。さて、ほぼ同時期に、実際には数か月後、2018年末に、GoogleのチームはBERTというモデルをリリースしました。これは、Bidirectional Encoder Representations from Transformersの略です。そしてBERTは、理解する価値のあるわずかに異なるアプローチを取りました。GPTが左から右にテキストを読み、次の単語を予測するのに対し、BERTは両方向から同時にテキストを見るように訓練されました。その訓練タスクも異なっていました。次の単語を予測する代わりに、BERTはマスク言語モデリングと呼ばれるものを使用しました。文を取り、単語の一部をランダムに隠し、マスクし、モデルに、両側からのすべての周囲のコンテキストを使用して、欠落している単語が何であるべきかを予測するように求めます。したがって、「猫はマスクの上に座った」という文がある場合、モデルは「猫はマスクの上に」と、その後に続くものから、マスクされた単語はおそらく「マット」または「ラグ」または「床」であると判断できます。この双方向アプローチは、BERTに異なる種類の理解を与えました。それは、テキストの一部を深く理解する必要があるタスク、つまり、ある文章についての質問に答える、2つの文が関連しているかどうかを判断する、レビューの感情を分類するタスクに特に適していました。BERTがリリースされたとき、それは11の異なる自然言語処理ベンチマークで同時に新しい記録を樹立しました。11です。それは1つのことに優れたモデルではありません。それは、言語がどのように機能するかについて、真に一般的な何かを学んだモデルです。そして、ここで物語は本当に面白くなります。なぜなら、次に起こったことは、基本的に規模の軍拡競争だったからです。OpenAI、Google、その他の研究所の研究者たちは、「これらのモデルを大きくしたらどうなるか?より多くのパラメータ、より多くの訓練データ、より多くの計算量。」と尋ね始めました。GPTは約1億1700万個のパラメータを持っていました。それは多いように聞こえますが、2019年初頭にリリースされたGPT2は15億個のパラメータを持っていました。それは、インターネットからスクレイピングされた約40GBのテキストデータセットで訓練されました。Redditからリンクされたページのみを含めることで品質がフィルタリングされ、少なくとも3つのアップボートがありました。これは、実際に誰かにキュレーションの支払いをするのではなく、大規模な人間のキュレーションを使用する巧妙な方法でした。そしてGPT2は、人々を本当に驚かせる何かをすることができました。それは、数段落にわたる、首尾一貫した流暢なテキストを生成することができました。プロンプト、つまり任意のトピックに関する数文を与えると、それはしばしば驚くほど説得力のある方法で書き続けました。OpenAIは、偽ニュースやスパムの生成による悪用の可能性への懸念を理由に、当初は完全なモデルを保留するという珍しい決定を下しました。その決定は物議を醸しましたが、最終的にはリリースされました。しかし、彼らがそれを保留することさえ考えたという事実は、それを構築した人々がモデルをどれほど有能だと感じたかについて何かを物語っています。しかし、本当にワイルドなことは次のとおりです。これらのモデルが大きくなるにつれて、それらは単に同じことを少しずつ改善しただけではありませんでした。それらは、誰も明示的に訓練していなかった能力を発揮し始めました。GPT2は、翻訳タスクで訓練されたことはありませんでしたが、初歩的な翻訳を行うことができました。基本的な算術を行うことができました。雑学クイズに答えることができました。これらの能力は、訓練の規模、つまり、人間の1000倍の期間でも読めないほどの大量のテキストを処理したことから、単純な次の単語予測をはるかに超えるパターンと知識を吸収したことから現れたようです。研究者たちは、これらの能力を「創発能力」と呼び始めました。それらはエキサイティングであると同時に少し不穏でもありました。なぜなら、それらは訓練目的を見るだけでモデルが何ができるかを常に予測できるわけではないことを意味したからです。次に2020年にGPT3が登場し、規模は劇的に再びジャンプしました。750億個のパラメータが、インターネット、書籍、Wikipediaの大部分を含むデータセットで訓練されました。そしてGPT3は、人々がこれらのモデルについて考える方法を本当に変えた何かを導入しました。GPT3は、ファインチューニングなしで多くのタスクを実行できることが判明しました。感情分析を行うために、感情分析のラベル付き例で再訓練する必要はありませんでした。プロンプトの一部として、タスクをプレーンな英語で説明するだけでよかったのです。「次の映画レビューを肯定的か否定的かに分類してください。この映画はストーリーテリングの傑作でした。」と書くと、モデルは「肯定的」と出力しました。これは、f-shot学習、あるいはゼロショット学習と呼ばれ、それ以前のあらゆるものとは根本的に異なるパラダイムでした。ここで何が起こっているのか考えてみてください。翻訳用のモデル、要約用のモデル、質問応答用のモデルなど、タスクごとに個別のモデルを訓練する代わりに、自然言語で指示を与えるだけでさまざまなタスクを実行できるように調整できる単一のモデルがあります。モデルへのインターフェースは言語そのものです。そしてそれは深遠な変化です。なぜなら、これらのモデルを使用する能力は、ニューラルネットワークの訓練方法を知っている機械学習エンジニアに限定されなくなったからです。言葉で自分の望みを説明できる人なら誰でも、原則としてモデルにそれを試させることができます。さて、少し立ち止まって、これらの大規模言語モデルの内部で実際に何が起こっているのか考えてみましょう。なぜなら、それは現代のコンピュータサイエンスで最も魅力的で、最も理解されていない質問の1つだからです。GPT3のようなモデルがあなたのプロンプトを処理して応答を生成するとき、それは何をしているのでしょうか?機械的なレベルでは、それが何をしているかは正確にわかっています。それはTransformerの計算、注意層、行列乗算、ソフトマックス関数などを実行しています。すべての数値をすべての層にトレースできます。しかし、それらの計算が何を意味するのか、モデルが内部に構築した表現は何なのか、それが何を知っていて、どのように知っているのかを理解することは、はるかに困難です。現在、メカニズム的解釈可能性と呼ばれる分野全体があり、これらの質問に答えようとしています。神経科学者が脳を理解しようとするように、大規模言語モデルの内部表現をリバースエンジニアリングしようとしています。そして、いくつかの発見は驚くべきものです。研究者たちは、特定の概念に対応する、モデル内の個々のニューロンと回路を発見しました。モデルが特定のトピックに関するテキストを処理しているときに活性化するニューロン。論理的推論のように見えるものを実装する回路。事実関係を構造化された方法でエンコードしているように見える内部表現。しかし、私たちはまだこれを理解する初期段階にいます。モデルは、私たちの理論が予測するよりもはるかにうまく機能します。そして、なぜスケールアップ、つまりモデルを大きくしてデータ量を増やすことが、それほど劇的な能力向上につながるのかを完全に説明できる人はいません。私たちが構築できるものと、私たちが説明できるものの間のこのギャップは、実際にはエンジニアリングにおける繰り返しのテーマです。考えてみてください。何世紀にもわたって、人々は構造力学の正式な理論を持つずっと前に、経験則と直感を使用して機能する橋や大聖堂を建設しました。実践は理論に先行しました。そして、大規模言語モデルでも同様のことが現在起こっています。私たちはそれらを構築できます。それらが機能することを見ることができます。それらの能力を測定できます。しかし、それらがなぜそれほどうまく機能するのかについての深い理論的理解は、まだ追いついています。そして、これは2020年から2021年頃に起こり始めたことで、機械学習ができることの範囲を本当に広げたことにつながります。なぜなら、研究者たちは、言語の事前訓練、巨大なデータセットでの大規模モデルの訓練、単純な目的というアプローチが、他の種類のデータにもうまく機能するのではないかと尋ね始めたからです。テキストだけでなく、画像、音声、ビデオ、コード、そしておそらくそれらすべてを同時に理解できる単一のモデルを構築できるでしょうか?答えは、結局のところ、イエスでした。そして、人々がそこに到達した方法は、さまざまな種類の情報間のギャップを埋める方法についての、本当に巧妙なアイデアを含んでいました。これらのアイデアの中で最も重要なものの1つは、言語と視覚を結びつけることから生まれました。そしてそれは、 deceptively simple name、CLIPというモデルから始まりました。それは、Contrastive Language-Image Pre-trainingの略でした。そして、それは2021年1月にOpenAIから来ました。そして、CLIPの背後にある核心的なアイデアは非常にエレガントだったので、一度聞くと、なぜ誰ももっと早く試さなかったのか不思議に思うでしょう。彼らがやったことは次のとおりです。彼らは、インターネットからスクレイピングされた約4億枚の画像とテキストの説明のペアからなる巨大なデータセットを収集しました。それが何を意味するか考えてみてください。誰かがオンラインで写真にキャプションを付けて投稿したり、画像の代替テキストの説明を書いたり、写真とタイトルの付いた製品リストを作成したりするたびに、それはペア、つまり画像とその説明文です。インターネットはこれらのペアで溢れかえっています。そしてOpenAIはそれらを何億も収集しました。さて、訓練目的は非常に単純でした。画像とテキストのペアのバッチを取ります。各画像をビジョンモデル、つまり画像を処理するために設計されたニューラルネットワークに通し、各画像にコンパクトな数値表現、埋め込みを取得します。同時に、各テキストの説明を言語モデルに通し、各テキスト部分の埋め込みを取得します。そして、画像の埋め込みとその対応するテキスト説明の埋め込みが、この共有された数学的空間で互いに近くなるようにシステムを訓練し、対応しないペアの埋め込みは離れるようにします。それだけです。それがアイデア全体です。視覚的理解と言語的理解を、画像と言語を直接比較できる単一の共有空間に整列させることをモデルに教えています。それを少しの間考えてみてください。このモデルを訓練したら、驚くべきことができます。モデルがこれまで見たことのない任意の画像を取り、その埋め込みを任意のテキスト説明の埋め込みと比較できます。画像を分類したい場合、モデルが訓練された事前定義されたカテゴリのセットは必要ありません。プレーンな英語で望むカテゴリを記述するだけです。「犬の写真」「猫の写真」「海に沈む夕日の写真」、そしてモデルはどの説明が画像に最もよく一致するかを教えてくれます。これはゼロショット画像分類です。ファインチューニングなし、タスク固有の訓練データなし、ラベル付き例なし。探しているものを言葉で説明するだけで、モデルが見つけてくれます。そしてCLIPはこれに驚くほど優れていました。多くの標準的な画像分類ベンチマークで。それは、それらの正確なデータセットで、何百万ものラベル付き例で特別に訓練されたモデルに匹敵するか、それに近づきました。ImageNetの120万枚の慎重にラベル付けされた画像で訓練されたモデルに匹敵する、ImageNetからラベル付き例を1枚も見たことのないモデル。それは本当に驚くべき結果でした。しかし、CLIPの本当にワイルドな点は次のとおりです。それは単なる分類ではありませんでした。なぜなら、モデルは視覚的概念と言語の間の一般的な整列を学習していたからです。それは信じられないほど堅牢でした。従来の画像分類器は、時には恥ずかしいほど壊れやすいです。車を認識するようにモデルを訓練すると、訓練された写真ではうまく機能します。クリーンで明るく、標準的な角度。しかし、車のスケッチやミニカーや絵画の中の車を見せると、パフォーマンスはしばしば急落します。CLIPは、車をピクセルの特定のパターンとして学習したのではなく、この問題にそれほど悩まされることはありませんでした。それは、インターネットの何億もの多様な例にわたる、車の視覚的概念と車の言語的概念との間の、深く柔軟な関連付けを学習しました。スケッチ、写真、絵画、漫画。それらはすべてテキストとペアになっていました。モダリティを接続する、さまざまな種類の情報を共有表現空間にリンクするというこのアイデアは、現代の機械学習で最も強力なアイデアの1つであることが判明しました。そしてそれは、何十年もの夢であった、テキスト説明から画像を生成することへの扉を開きました。なぜなら、言語と視覚の関係を理解するモデルがあれば、プロセスを逆に実行することを想像し始めることができるからです。画像からテキストへ行くのではなく、テキストから画像へ行きます。そして、それはまさに、驚くほど速く起こった一連のブレークスルーで起こったことです。2021年1月、CLIPが発表されたのと同じ月。OpenAIは、芸術家サルバドール・ダリとピクサーのロボットWall-Eの遊び心のあるマッシュアップにちなんで名付けられたDALL-Eも発表しました。DALL-Eはテキストプロンプトから画像を生成できました。アボカド型の肘掛け椅子と入力すると、それはまさにそれの画像を作成しました。既存の画像を取得するのではなく、これまで存在しなかった新しい画像を作成しました。初期の結果は印象的でしたが、粗削りでした。画像はしばしばぼやけていたり歪んでいたりして、明らかに人工的でした。しかし、2022年4月にDALL-E 2が登場し、品質の飛躍は劇的でした。画像はシャープで詳細で創造的で、時には本当に美しかったです。そしてDALL-E 2は、CLIPの言語と視覚の関係の学習された理解をアーキテクチャの一部として使用しました。それはその共有表現空間を構築していました。さて、これらの画像生成モデルの背後にある実際のメカニズムは、少なくとも高レベルでは理解する価値があります。なぜなら、それは拡散と呼ばれる技術を含んでおり、それは単にゴージャスなエンジニアリングだからです。その核心的なアイデアは、実際には物理学、粒子が媒体を拡散する方法の研究から来ています。直感は次のとおりです。鮮明な写真を想像してみてください。次に、それに徐々にランダムなノイズを追加すると想像してください。少しの静電気、次にさらに、次にさらに、最終的に画像が完全に破壊され、古いテレビの静電気のような純粋なランダムノイズしか残らないまで。それがフォワードプロセスです。鮮明な画像から純粋なノイズへステップバイステップで移動します。さて、賢い部分は次のとおりです。ニューラルネットワークを逆プロセスを逆転させるように訓練できるとしたらどうでしょうか?少しノイズの多い画像を取り、ノイズが少し少ないときの見た目を予測できるとしたらどうでしょうか?それができれば、つまり、一度に1ステップずつノイズを除去する方法を学習できれば、純粋なランダムノイズから始めて、ステップバイステップで徐々にノイズを除去して、首尾一貫した画像にすることができます。各ステップで、モデルは現在のノイズの多い混乱を見て、それをより構造化された、より意味のあるものへとわずかに誘導します。数百または数千の小さなステップの後、静電気から認識可能な画像が現れます。それはほとんど瞑想的です。秩序が混沌から、一度に1つの穏やかなステップで現れます。そして、テキスト条件付け、つまりモデルに何を生成するかを伝える部分は、ノイズ除去プロセスをガイドすることによって機能します。各ステップで、モデルはランダムにノイズを除去するだけでなく、CLIPや同様のモデルが確立した共有言語と視覚の理解を使用して、テキストプロンプトと一致する方向にノイズを除去します。したがって、プロンプトに「夕暮れ時の崖の上の灯台」と書かれている場合、各ノイズ除去ステップは、その説明に一致する画像に向かってノイズを誘導します。この拡散アプローチは、いくつかの機関の研究者によって洗練されました。Google BrainのJasha Soul Dicksteinは、2015年にコア数学的フレームワークを導入し、その後、BerkeleyのJonathan Hoe AJ JaneとPeter Ailは、拡散モデルが以前の最良のアプローチに匹敵する画像を生成できることを示す画期的な論文を2020年に発表しました。このフレームワークは、ほぼすべての主要な画像生成システムのバックボーンとなりました。Stability AIのStable Diffusionは、2022年8月にオープンソースモデルとしてリリースされ、この技術を実質的に一晩で何百万人もの人々の手に渡しました。Midjourneyは、同様のアイデアを中心に非常に人気のあるサービスを構築しました。GoogleはImagenを開発しました。この分野は爆発し、突然、約18ヶ月の間に、世界は「AIは画像をかなりうまく分類できる」から「AIは言葉で説明できるほぼすべてのものの写実的な画像を生成できる」へと移行しました。この移行の速さは、分野の多くの研究者を含む、ほとんどすべての人々を驚かせました。しかし、画像は始まりにすぎませんでした。同じ多モーダル哲学、つまり大規模データで事前訓練し、さまざまな種類の情報を接続することを学ぶという哲学が、あらゆる場所で適用されていました。OpenAIのWhisperは、2022年9月にリリースされた音声認識モデルで、インターネットからの多言語オーディオ68万時間で訓練されました。それは、人間のレベルに近づく精度で、数十の言語で音声を文字起こしすることができました。アプローチは、私たちが繰り返し見ているのと同じパターンでした。巨大なデータセット、単純な訓練目的、巨大なモデル、驚異的な創発能力。そして次に、複数のモダリティを同時に処理できるモデルが登場しました。GPT4は、2023年3月にリリースされ、テキストと画像の入力を受け入れることができました。冷蔵庫の中の写真を見せて、レシピを提案するように頼むことができました。ウェブサイトレイアウトの手描きのスケッチを与えて、それを構築するためのコードを生成させることができました。科学論文のグラフを見せて、トレンドを説明するように頼むことができました。言語理解と視覚理解の間の境界線は溶解していました。この収束、つまり以前は別々だった能力が統一システムに統合されることは、現代の機械学習における最も重要なトレンドの1つです。そしてそれは、技術の歴史で繰り返し起こることの何かを反映しています。スマートフォンを考えてみてください。2007年にiPhoneが発売される前は、電話をかける、写真を撮る、インターネットを閲覧する、音楽を再生する、道順を調べるための個別のデバイスがありました。スマートフォンは、少なくとも当初は、それらのいずれかの機能を専用デバイスよりも優れて行っていたわけではありませんでした。しかし、それらを統合システムに組み合わせることで、質的に異なるもの、誰も完全に予期していなかった方法で人々の生活を変えるものが生まれました。これらの多モーダルAIシステムでも同様のことが起こっているようです。モデルが読み書きし、見聞きし、画像を生成できる場合、すべてが単一の会話の中で行われる場合、それが支援できるタスクの範囲は劇的に拡大します。そして、これらの機能間の相互作用は、それらのいずれも単独では提供できない可能性を生み出します。しかし、この能力の急速な拡大は、長年分野が取り組んできた懸念の増大ももたらしました。しかし、それは突然、はるかに緊急に感じられました。これらのモデルが、花を分類したり、Atariゲームをプレイしたりできる学術的な好奇心だった頃は、リスクは比較的低かったです。しかし、それらが説得力のあるテキストを生成し、存在しない人々の写実的な画像を作成し、機能的なコードを書き、微妙な会話を行うことができる場合、そして何億人もの人々が毎日それらを使用している場合。安全性、バイアス、誤用、社会への影響に関する問題は、無視できないものになりました。そしてこれらは抽象的な哲学的懸念ではありません。それらは非常に現実的な意味でのエンジニアリングの問題です。バイアスについて考えてみてください。インターネットからのテキストで訓練された言語モデルは、必然的にそのテキストに存在するバイアスを吸収します。人種、性別、職業、国籍に関するステレオタイプ。誰かが意図的にそれらのバイアスをプログラムしたからではなく、訓練データが世界の現実、その偏見を含むものを反映しているからです。そして、これらのモデルが求職者のスクリーニングや医療診断の支援、あるいは裁判官が犯罪判決のリスクを評価するのを支援するために使用される場合(これらはすべて提案または実施されています)、吸収されたバイアスは実際の個人に実際の損害を与える可能性があります。これらのシステムを公平、安全、そして人間の価値観に沿ったものにするという課題は、間違いなく私たちの時代の最も重要なエンジニアリング問題です。そしてそれは、純粋に技術的ではないため、クリーンな技術的解決策がない問題です。それは、私たちが何を価値あるものと見なすか、誰の視点が重要か、どのような未来を築きたいかという問題を含んでいます。アライメントに取り組んでいるエンジニア、つまり、これらのシステムが文字通り要求されたことだけでなく、実際に望んでいることを行うようにするためのエンジニアは、テクノロジーと人間の価値観の交差点にある最も深い質問のいくつかを格闘しています。そして、その交差点はまさに物事が本当に難しくなる場所です。なぜなら、ほとんどのエンジニアリングの歴史において、問題は制約されていたからです。橋を建設すると、成功基準は明確です。それはこの重さに耐え、この距離を跨ぎ、この風荷重に抵抗する必要があります。テスト、測定、認定できます。しかし、AIシステムが公平であるかどうかをどのようにテストできますか?誰に対して公平ですか?誰の定義によってですか?これらは、エンジニアがこれまで実際に答えなければならなかった質問です。そして、従来のエンジニアリングのツール、つまり応力試験、安全マージン、冗長性は、人間が完全に理解していないデータ内のパターンから行動が現れるシステムにはきれいにマッピングされません。それを少しの間考えてみましょう。なぜなら、それが以前の何よりもどれほど異なる課題であるかを理解する価値があるからです。ディープラーニングにおける理論と実践のギャップ、つまりこれらのネットワークが驚くほどうまく機能するが、なぜそうなるのかを常に説明できないことについて、以前話したとき。そのギャップは、リスクが人々の生活と生計に関わる場合、まったく異なる性格を帯びます。ある画像分類器がなぜそれほど正確なのかを完全には理解していませんが、97%の時間で正しい答えを得るので、使用しましょうと言うのは一つのことです。システムが誰かに仮釈放を拒否することを推奨した理由、または彼が実際には緊急のケアを必要としていたときにこの患者を低リスクとフラグ付けした理由を完全には理解していないと言うのはまったく別のことです。そして、アライメントをエンジニアリングの問題として非常にトリッキーにするのは次の点です。それは、明白な失敗を防ぐだけではありません。それは、表面上は成功に見えるが、静かに間違ったことを最適化している微妙な失敗についてです。AIの安全性には、経済学から借用されたグッドハートの法則という概念があります。それは、ある測定値がターゲットになると、もはや良い測定値ではなくなると言います。機械学習にとってそれが何を意味するか考えてみてください。ソーシャルメディアプラットフォームでのユーザーエンゲージメントのような指標を最適化するようにシステムを訓練します。システムはその指標を最大化することに非常に長けています。しかし、エンゲージメントは、人々を怒らせたり怖がらせたりするコンテンツを表示することで最も簡単に最大化されることが判明しました。なぜなら、それらの感情は粘着性があるからです。それらはあなたをスクロールさせ続けます。したがって、システムはあなたが依頼したことを正確に行っています。それは技術的な成功です。そして同時に、それは何百万人もの人々を不幸にし、社会全体を二極化させています。システムは壊れていません。目的が壊れていました。そして、あなたが実際に望むものをすべて、すべてのニュアンスとエッジケースと、明白だと思われたので言及するのを忘れたことすべてを捉える正しい目的を指定することは、驚くほど難しいことが判明しました。これはしばしばアライメント問題と呼ばれます。そして、スチュアート・ラッセル(UC Berkeley)のような研究者は、ますます有能なAIシステムを構築する上での中心的な課題であると主張しています。ラッセルが2019年の著書「Human Compatible」で提示したフレームワークはエレガントです。彼は、問題は悪意のある機械を構築することではなく、私たちが構築するのは有能な機械だが、意図と完全に一致しない目的を追求することだと述べています。そして、機械がより有能であるほど、そのわずかな不一致はより大きな損害を引き起こす可能性があります。それは、非常に非常に効率的なアシスタントを持っていて、会議に決して遅れないようにするように頼むようなものです。そして彼らは非常に効果的なので、あなたの他のすべての約束をキャンセルし始め、あなたの人間関係を再編成し、最終的にあなたはあなたが気軽に言及した単一の目標を中心にあなたの人生が完全に再編成されたことに気づきます。あなたは求めたものを手に入れました。ただ、正しいことを求めただけではありませんでした。今、人々は真剣に、厳密に、実際のエンジニアリング規律をもってこれに取り組んでいます。多くの注目を集めているアプローチの1つは、人間のフィードバックからの強化学習、またはRLHFです。これは、ChatGPTが訓練された方法の鍵でした。基本的なアイデアは、大規模言語モデルをインターネットからのテキストで事前訓練した後、人間のレーダーからのフィードバックを使用してファインチューニングすることです。モデルの出力を人々に表示します。彼らは、どの応答がより役立つか、より正確か、より害が少ないかをランク付けし、それらのランク付けを使用して報酬モデルを訓練します。そして、それは人間のレーダーが実際に好む出力を生成するように言語モデルを導きます。それは巧妙なアプローチであり、実際には驚くほどうまく機能します。OpenAIは、2022年初頭にInstructGPTというシステムでこの作業を発表し、RHFでファインチューニングされた比較的小さなモデルでも、この方法でファインチューニングされていないはるかに大きなモデルよりも人間のレーダーに好まれることを示しました。しかし、RLHFにも独自の制限があり、それに取り組んでいる研究者はそれを最初に言います。人間のレーダーは独自のバイアスをもたらします。報酬モデルは人間の好みの近似であり、実際のモデルではありません。そして、言語モデルは報酬モデルの奇妙な癖を悪用して、プロキシによると高いスコアを付けるが、実際にはより良くない応答を生成することを学習できます。これは時々報酬ハッキングと呼ばれ、基本的にグッドハートの法則がさらに一段階深く現れているようなものです。人間のフィードバックを追加することでアライメント問題を解決しようとしましたが、今ではモデルと報酬モデルの間に新しいアライメント問題があります。ある意味では、すべてがカメです。それでも進歩は現実です。今日のシステムは、この作業なしではあり得なかったよりも、意味のある安全で有用なものになっています。元OpenAIの研究者であるダリオとダニエラ・アモデイが設立したAI安全会社であるAnthropicは、モデルが原則のセット、つまり一種の書面による憲法に対して自身の出力を評価し、それらを修正するように訓練される「憲法AI」と呼ばれる技術を開発しました。DeepMindは、スケーラブルな監視に多額の投資を行っており、人間が、特定のドメインでは個々の人間よりも有能になる可能性のあるAIシステムを効果的に監督する方法を見つけようとしています。これらは解決された問題ではありません。これらはアクティブな研究フロンティアであり、それに取り組んでいる人々は、私たちがまだ終わっていないことを最初に言うでしょう。しかし、技術的な詳細から少し離れてみましょう。なぜなら、この物語の終わりに近づくにつれて、反映する価値のある何かがあると思うからです。私たちは今夜、長い道のりを旅しました。私たちは、思考機械の古代の夢、機械仕掛けのトルク、バベッジの解析機関に関するエイダ・ラブレスのノート、ブレッチリーパークのオフィスで機械は考えることができるかどうかを尋ねていたアラン・チューリングの静かな輝きから始めました。私たちは、1956年の夏にダートマスに集まった楽観的な研究者の小さなグループを目撃しました。彼らは夏のうちに知能を解明できると確信していました。私たちは、フランク・ローゼンブラットのパーセプトロンがニューヨーク・タイムズのトップページを飾ったのを見ました。そして、ミンキーとペーパーの批判が、この分野全体を冬に送ったのを見ました。私たちは、ほとんど誰も信じていなかったときでさえ、ニューラルネットワークを信じ続けたジェフリー・ヒントン、ヤン・ルン、ヨシュア・ベンジオのような人々の長い忍耐強い仕事に従いました。80年代、90年代、却下された論文と懐疑的なレビューアの何年もを経て、GPUとビッグデータの偶然の収束がディープラーニングを突然爆発的に実用的なものにしたのを見ました。2012年にAlexNetがコンピュータビジョンコミュニティを驚かせ、その後わずか3年でResNetが人間のレベルの精度を超えたのを見ました。2017年の単一の論文から、今日何億人もの人々が毎日使用しているシステムの基盤となったTransformerアーキテクチャを追跡しました。そして、その全体的な弧について私を打つのは次のことです。あらゆる段階で、ブレークスルーは、長期間間違っていることをいとわない人々から来ました。ヒントンは何十年も、同僚のほとんどが行き詰まりだと考えていたアイデアに費やしました。Hulk writerとSchmid Huberは1997年にLSTMを発表しましたが、それらのアーキテクチャが本当に何ができるかを示すのに十分なハードウェアとデータが存在するまで、ほぼ15年かかりました。Transformerを開発した研究者たちは、チャットボットを構築しようとしていたわけではありませんでした。彼らは機械翻訳をより並列化可能にしようとしていました。この分野の主要な進歩のほとんどは、橋や高速道路を計画するような方法で計画されたわけではありませんでした。それらは好奇心、頑固さ、そして実用的な価値を正当化できなかったとしても、興味深いと思われた糸をたどる人々から現れました。そして、それは覚えておく価値のあることだと思います。なぜなら、AIに関する現在の会話は、2つの極端に支配されているからです。一方では、息をのむような誇大広告、汎用人工知能がすぐそこにあるという主張、これらのシステムが人類のすべての問題を解決するという主張、私たちが技術的特異点の瀬戸際にいるという主張があります。もう一方では、実存的な恐怖があります。AIがすべての仕事を奪うという恐れ、それが監視と管理の道具として使用されるという恐れ、私たちが制御できないものを構築しているという恐れ。そして、それらの両方の物語には真実の種が含まれていますが、どちらも全体像を捉えていません。全体像はより乱雑で、正直に言って、より興味深いものです。これらのシステムは本当に驚異的です。大規模言語モデルは詩を書いたり、コードをデバッグしたり、量子力学を説明したり、数十の言語間で翻訳したりできます。しかし、完全に間違ったことを自信を持って述べることもできます。それが何を知っているかを知りません。永続的な記憶、目標、あなたや私が理解するような理解はありません。それは、人間が1000年かけても読めないほどのテキストで訓練された、驚くほど洗練されたパターンマッチングエンジンです。そして、それはしばしば区別がつかない出力を生成します。
人間の文章から。しかし、それらの出力を支えるメカニズムは、人間の認知とは根本的に異なります。その違いが重要なのか、それともこれらのシステムが決して真に思考できないことを意味するのか、あるいは単に同じ目的地への別の道なのかは、私たちの時代の偉大な未解決の疑問の一つです。そして正直に言って、私たちはまだ答えを持っていません。私たちが知っているのは、今後のエンジニアリングの課題が途方もなく魅力的であるということです。これらのシステムを、重要な決定を任せられるほど信頼できるものにするにはどうすればよいでしょうか?何かがうまくいかなくなったときに、なぜなのかを突き止められるほど透明にするにはどうすればよいでしょうか?この技術の恩恵が、少数の企業や国の手に集中するのではなく、広く分配されることをどのように保証できるでしょうか?機械が大量のテキスト、画像、音楽、コードを生成できる世界で、人間の主体性と創造性をどのように維持できるでしょうか?これらはエンジニアリングの問題ですが、同時に社会的な問題、政治的な問題、哲学的な問題でもあり、コンピューターサイエンスだけでなく、それらすべての分野からの最高の思考を必要とするでしょう。ご存知のように、エンジニアリングの歴史には美しいことが起こります。そして、私たちは今夜何度もそれを見てきました。誰かが機能するが、まだ完璧ではないものを作ります。別の誰かがその理由を突き止めます。3人目の人が巧妙な修正を見つけます。4人目の人がそれをスケールアップします。5人目の人が全く予期しない応用を発見します。そして、それらすべての集団的な努力、議論、失敗、遅い夜、そして幸運なブレークを通して、ゆっくりと、本当に新しいものが現れます。それは、一人の人間が決して一人で作れなかったものです。1943年のマカロックとピッツの単純な数学的ニューロンから、80年後に会話ができ、写実的な画像を生成できるシステムへと、私たちはこのようにして到達しました。一人の天才的なブレークスルーではなく、何千もの小さなブレークスルーがお互いの上に積み重なったのです。それぞれが、それ以前のものを基盤としています。そして、そのプロセスは終わっていません。それはかろうじて始まったばかりです。本当に、今日機械学習に取り組んでいる人々、研究者、エンジニア、倫理学者、政策立案者は、数十年にわたって展開されてきた物語の次の章を書いています。そして、歴史が何らかの指針となるならば、最も重要な進歩は、まだ予測できないものです。トランスフォーマーは予測されていませんでした。スケーリングの効果は予測されていませんでした。大規模モデルに現れる創発的な能力は予測されていませんでした。次のブレークスルーは、全く関係ないと思われることについて研究している大学院生から来るかもしれませんし、誰も考えつかなかった2つの分野を結びつける洞察から来るかもしれません。ですから、あなたがそこに横たわっていて、おそらく出入りを繰り返しながら、すべての言葉を聞き取っているか、あるいは単に音をあなたの上に流しているかどうかにかかわらず、私があなたに残したいことはこれです。機械学習はその本質において、パターンを見つけることです。それは、世界の乱雑で複雑で美しい混沌、すべての画像、言葉、音、データを取り込み、その中に隠された構造を見つけることです。そして、ある意味では、私たちも毎日、それを意識せずにそうしています。あなたの脳は、オリジナルのパターンマッチングエンジンであり、これらの人工システムがすべて、ゆるやかに、不完全にインスピレーションを得ているものです。顔を認識するとき、文章を理解するとき、ボールをキャッチするとき、あるいは理由を言えないのに何かが少しおかしいと感じるとき。あなたは、世界で最も強力なコンピューターでさえ、ようやく近似し始めていることを行っています。そして今夜、あなたの思考が遅くなり、一日の終わりが柔らかくなるとき、あなたの脳はまだその仕事をしています。一日のパターンを整理し、物事を整理し、明日、来週、あるいは来年まで気づかないかもしれないつながりを作っています。それは静かな仕事であり、労なくして起こります。呼吸が起こるように、心臓が鼓動するように。これまで構築された中で最も洗練された学習システム。閉じられた目のすぐ後ろで実行され、得意なことをしています。ただ、それをさせてあげてください。今日は十分に考えました。パターンはまだそこにあります。