📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Pre-Training GPT-4.5

OpenAI46:34

Transcription

どのように多くのパラメータがまだあるのか、それとも気にしないのでしょうか。私たちはただ、了解です。通常、このようなことを行うのは、もうすぐ発売する新製品について話すためですが、今日は少し違います。GPT-4.5を発売した際の製品開発に関する研究についてお話しします。私たちは、人々が気に入ってくれると思っていました。モデルをとても誇りに思っていましたが、人々は私たちの予想以上に気に入ってくれました。「このような経験をモデルについて話すとは思わなかった」「GPT-4とは全く違う」「明らかに優れている点、説明しにくい点など、様々な点で優れている」など、様々なことを言われました。しかし、GPT-4.5の開発には多くの関心が寄せられました。そこで今日は、GPT-4.5を開発した主要メンバーを招いて、その開発についてお話しします。開発内容、学んだこと、このような巨大モデルを作るために必要なことなどについてお話しします。では、まず巨大モデルを作るには何が必要でしょうか? あなたからどうぞ。

多くの人、多くの時間、そして多くの計算資源です。皆さん、自己紹介をしましょう。アレックス、始めますか?

はい、こんにちは。アレックスです。私はプリチューニングデータに多く携わっており、GPT-4.5のプリチューニングMLも主導しました。私はアミン・チアンです。OpenAIのチーフシステムアーキテクトとして、システムとネットワーク全般を監督しています。ダンです。データ効率とアルゴリズムに取り組んでいます。

では、何が必要なのでしょうか?

このプロジェクトは、約2年前に開始されました。新しい大規模クラスタがオンラインになることがわかっており、実行に含めたい機能について確信を持つための作業を開始しました。大規模なリスク軽減ランを実行し、これに対する非常に長期的な計画を立てました。システム、MLなど、フルスタック全体にわたるものでした。そして、リスク軽減、実行の準備、そして非常に大規模な取り組みである実行自体と、長い実行の歴史でした。

これは、ML側とシステム側の協力から始まり、正確にどのモデルをトレーニングしたいかを知る時点まで続くプロセスです。その後、作業ペース、特に最新のコンピュータを活用しようとする中で、完全に優先順位付けされた計画を立てることが難しくなります。

そのため、ほとんどの場合、解決されていない問題を抱えたままローンチに臨み、あらゆる課題にもかかわらず、ランを通して前進しようとします。より多くの計算資源を追加し、予測できなかった可能性のあるすべての問題を解決し、予測される結果と実際の結果のギャップを埋めるよう努めます。これは非常に高いレベルで、最も広い範囲で、プロセスの全体像であり、その末尾は実行です。トレーニングプロセスをこなすには、長期間にわたって多くの人、多くのエネルギー、そして勢いが必要です。

予想どおりに事が進んだと感じますか?

通常、システム側の話ですが、開始時は期待値からかけ離れています。ローンチを遅らせて、より多くの問題が解決されるまで待つのか、早期にローンチしてその場で解決するのか、常にバランスを取っています。プロセスを不当に遅らせるべきではありませんが、開始時には必ずしもわからない問題が常にあります。プロセスの全体は、可能な限り既知の問題に対処し、ランがどのように進むべきかという計画を立て、進捗に合わせて未知の問題に対処することです。たとえば、ランが成功した場合、どれくらいの時間がかかるかという変動性などです。

彼らはどのくらい進歩しましたか?

最高レベルで言えば、このプロジェクトではGPT-4.5を目標に設定しました。つまり、GPT-4より10倍賢いということです。これは、2年前に設定した最初の目標でした。その後、色々なことが起こりました。「もっとうまくできるか、または悪いかもしれない」と考えました。非常に複雑な道のりでしたが、最終的に、GPT-4より10倍賢いモデルに到達したと感じています。効果的な計算資源という点では。実行面では、当初は予想していた時間から非常にかけ離れていました。予想以上に時間がかかりましたが、プロセスはこれを短縮して、私たちがやっていたことに合わせようとするものです。

これに関する2つの質問があります。1万個のGPUから10万個のGPUに移行する理由、なぜそれによって問題がはるかに難しくなるのでしょうか?

多くの問題があります。規模が大きいと観察される問題は、注意深く観察すれば小さな規模でも観察できると思います。大規模でしか現れないわけではありませんが、まれな発生が、規模が大きくなると壊滅的なものになります。特に、それを予測していなかった場合。

どのような種類の問題が捉えられましたか?

よく知られているものの1つは、インフラストラクチャの問題です。観測される障害率、障害の種類と数です。ベンダーが観測していないものを観測できるようになります。これは大規模なサンプルプールであり、実行している大量のリソースの統計的分布全体を観測できます。ネットワークファブリックは常にその一部であり、個々のアクセラレータも一部ですが、最終的にはこれがその美しさです。結果を得るためには、ほぼすべてが期待どおりに機能する必要があり、仕事は基本的にその分散を最小限にすることです。質問の2点目は、明らかに、皆さんにとって規模の限界で物事を成し遂げるのは本当に難しいということです。次のトレーニングランに進んだとしても、さらにクレイジーなことです。しかし、私はまた、今では最先端ではなくなったことを行うことがはるかに容易になっていることに気づきました。GPT-4.5を実行するには、OpenAIのほぼすべての努力を要する数百人もの人が必要でした。もし皆さんの中から誰でもいいので選んで、今日の知識とシステムを使ってGPT-4を最初から再トレーニングできるOpenAIの最小チームは何人だと思いますか?

GPT-4レベルのモデルに到達するには、おそらく5〜10人程度の規模でしょう。GPT-4.5では、過去の取り組みが多かったため、より多くの人が集まり、以前とは大きく異なる取り組みでした。しかし、その作業を終えた今、スタックが大きく改善されたと思います。GPT-4.5の研究プログラムから生まれた多くの同じものを利用してGPT-40というGPT-4レベルのモデルを再トレーニングしました。そして、そのラン自体を実行するのに、実際にはより少ない人数で済みました。

ダン、あるいは大規模モデルのトレーニングが難しい理由について、あなたの視点から教えてもらえますか?

新しいことを行うのは難しいと思います。他の人が何かをしたことを発見するだけでも、はるかに簡単になります。なぜなら、難しいのは、まず最初に何かをするという確信を持つことだからです。何かが可能であるという事実が、巨大なチートコードになり、物事を簡単にします。

私たちは常に、以前のGPTプリトレーニングランよりも10倍の規模でスケーリングしています。そして、必ずしも予測できなかった興味深い新しいものが見つかることがあります。プリトレーニングの規模、データ効率を次の10倍、または100倍にするには何が求められますか?

簡単な答えは、もちろん知っていますが、それはどういう意味ですか?トランスフォーマー、GPTはデータの生産的な使用に優れています。情報を吸収し、ある程度圧縮し、一般化します。しかし、その定義する特徴、シグネチャーは、計算能力で非常に効率的に情報を吸収することです。しかし、データから得られる洞察の深さにはある程度の限界があり、計算能力がどんどん増え、データはそれほど早く増えないため、ある時点でデータが標準的なパラダイムのボトルネックになります。そして、同じ量のデータからより多くのことを学ぶために、より多くの計算能力を費やすことができるアルゴリズムの革新が必要です。他に何が必要だと思いますか?

システム側の答えだと思います。私たちがトレーニングしたさまざまなGPT間でも、GPT-4.5は、基本的に必要な変更の膨大な量でした。これは、モデルの仕様の結果であり、GPT-4と同じスタックではGPT-4.5をトレーニングできなかったでしょう。たとえば、状態管理のアプローチは変更され、より多くの計算能力にスケーリングする必要がありました。その計算能力は1つのクラスタでは利用できず、マルチクラスタトレーニングに切り替える必要がありました。このような多くの異なるワークストリームが短期間に集まる必要があります。そして、もちろん、さらに10倍のジャンプをするには、以前は存在すると知っていた他の問題もあります。実行を迅速化するための選択として、今回のものはスキップしましたが、次のものはそうはいきません。常にこのような選択が、完璧なシステムを構築するタイムラインを大幅に長くします。システムはそれ自体が目的ではありません。それが生成する製品です。したがって、次の10倍のジャンプのためには、フォールトトレランスが必要です。ワークロードと共同設計できるフォールトトレランスです。このような大規模なランを継続するための運用上の負担を心配する必要はありません。これまでのスタックではGPT-4.5は、私たちが追いつける限界にありました。GPT-4.5のランで、どこかのコンポーネントが原因で失敗したステップの割合はどのくらいでしたか?

正確な数値はすぐにはわかりませんが、通常はこうなります。これは興味深いことです。新世代のハードウェアの寿命の初期段階では、必ずしも十分に理解または研究されていない問題があります。プロセスを開始し、このような問題が存在する中で前進しようとするので、ランの初期段階では障害率は非常に高くなります。必ずしも、根本原因を見つけて排除すると、障害の総数は大幅に減少します。これはよくあることです。インフラストラクチャのクリーンアップ、またはインフラストラクチャに関する基本的な問題の理解を通して、より多くのことを学び、状態が大幅に改善されます。しかし、実行の初期段階は、新しい障害モードを学習しながら前進しようとするため、常に非常に困難です。新しいインフラストラクチャにおいて、当然のことながら、後で障害率は大幅に低下し、アップタイムは全体として向上します。しかし、これは以前の問題であり、この初期段階のインフラストラクチャの寿命の障害リスクがどのようなものになるかを予測するのは困難であり、定常状態を設計すると、プロセスの初期段階では非常に低い可用性につながる可能性があります。

明らかに、推論モデルは私たちの未来の大きな部分を占めていますが、もしこれを一旦脇に置いて、現在のすべての問題を抱えたまま、つまり、フォールトトレラントトレーニングを解決しておらず、現在のデータしか持たないなどの場合、古典的なプリトレーニングモデルでどこまで行けるかを考えてみましょう。私たちは、GPTの主要な数字ごとに100倍の増分という慣例を使用しています。今日の知識でトレーニングできるのは、GPTいくつまででしょうか?

アルゴリズムの面では、GPT5.5程度までだと思います。明確な限界は見つかっていません。データ効率の良いアルゴリズムの表面をなぞっているに過ぎないと考えています。そして、私たちが持っているデータを活用するより良い方法だと思います。非常に興味深いのは、GPT-4まで、私たちは主に計算能力に制約された環境にいたことです。そのため、すべての研究はそこに注がれていました。しかし、今では4.5から始まって、データのある側面では、はるかにデータに制約された非常に異なる体制にあります。そのため、この研究に対する興奮が増しています。これは、世界はまだ理解していないクレイジーなアップデートです。私が違うものを選ぶべきです。世界はまだ理解していないもの。私たちが生産できる最高のモデルでは、もはや計算能力に制約されていないということです。それは私たちが長い間生きてきた世界でした。GPT-4.5トレーニング中に学んだ最も興味深いMLのことは何ですか?共有したいことはありますか?

おお、難しいですね。一般的に共有できることとしては、予測から外れ、なぜ予測された傾斜から外れているのかを理解しようと試みることだと思います。最も驚くべきことは、ML側で取り組んでいたことと、ランに入れたもののスケーリングの程度の違いだと思います。そして、いくつかのものはうまくスケールし、うまくスケールしなかったものもありました。このモデルのトレーニングを通して発見したことです。トレーニングを通して多くを学びました。GPTパラダイムの2つの定義する特性は、テスト損失を予測でき、予測可能にスケールすることです。魔法のように低いテスト損失は、これらの不可解で驚くべき神秘的な方法で、より大きな知能を意味します。あなたはそれについて最大限主義者ですか?完全に信じているのですか?

GPT-4.5から得られた興味深いことの1つは、再度テストしたところ、モデルには、誰も予想していなかった非常に微妙な能力が備わっていました。確信は、事前に特徴付けるのが非常に難しい方法でより賢くなるということです。そして、展開、ユーザーの満足度を見てみると、非常に微妙な方法でより賢くなっていることがわかります。より常識的な知識があり、ニュアンスやコンテキストを理解しています。これが、テスト損失のわずかな増加から生まれた魔法です。そして、スケーリングの一部は本当にうまくいきました。トレーニングラン全体で最もポジティブな瞬間は何でしたか?お気に入りの思い出はありますか?痛みも多かったでしょうが、うまくいくことを願っています。

はい、あります。ML側のランの作業にも多く携わりました。ラン中に私たちが行った変更の中には、非常に良い影響があったものがありました。予想以上に良い影響があったと思います。これは私たちにとって非常にエキサイティングな瞬間でした。

私にとって、これはおそらく、ラン中の作業時間に関して最も大きな取り組みでした。私たちは並行して物事を構築しているので、より速く到達するために、作業を積極的に並列化しています。それは報われるという確信があり、モデルを本質的にトレーニング不可能にするパフォーマンスの崖を乗り越えるでしょう。計画があり、誰もが実行していますが、時間がかかります。想像していたよりもはるかに困難な仕事です。私の予測は、これらの問題を解決するのにどれくらいの時間がかかるかという点で間違っていました。いくつかの問題が解決され、大きなパフォーマンスの向上が見られた瞬間を見たとき、チーム全体のエネルギーが変わったのがわかりました。皆、興奮し、さらにやる気に満ちて、最後まで押し進めていました。ステータストラッカーのETAが、たとえば2年から何か具体的なものに変更されたときの影響は、チームの士気など、すべてにおいて、私はそれが美しさだったと思います。私が指摘したいもう1つの部分は、ML側は、ローンチ時に停止しませんでした。後から対応しようとした問題にも、人々は積極的に取り組み、実行時間を短縮するようなものを提供していました。チームの境界がない、つまり自分の仕事が終わったらあなたに渡すという精神は非常に強力です。

ラン自体が困難で、予測も困難だったことに焦点を当ててきましたが、これは非常に高度な計画にもかかわらずです。

さらに説明しますか?

はい、私たちは、ランのトレーニングを開始する1年前から、基本的にこのプロジェクトに取り組み始めました。これを通して、多くの非常に大規模なリスク軽減ランを行いました。私たちは何を、非常に慎重にシーケンスしました。それは、GPT-4のような非常に高い信頼性を持つ既知の良好な構成から開始すると考えられます。MLの観点から見ると、この設定は本当に理解しています。そして、物事を重ねて、私たちが行っている変更のスケーリングを非常に慎重に研究しています。いくつかの程度の成果が見られるだけでは十分ではなく、新しい機能からのすべての成果は、規模全体で持続的で、減少しないものでなければなりません。小規模ではうまく見える多くのものは、大規模ではうまく見えません。そのため、このプロセスを通して非常に用心深くなければなりませんでした。そして、私たちはスケーリングの法則の方法論を繰り返し改善しました。このリスク軽減のプロセスを通して、その点で多くのことを学びました。それは、将来のGPTを導き続けています。

私はもう1つのとても楽しい瞬間について思い出しました。これはtorchsumのバグですが、ランを開始してバグがないということはほとんどありえないと想像してください。あらゆる種類のバグがあることは当然のことですが、前進する必要があります。そして、本当に順調に進んでいるかどうか、これらのバグがランの健全性に非常に悪影響を与えていないことを確認する必要があります。当初、重大なバグがあることは非常に確信していました。可視性と、ハードウェアの障害、どのような種類のハードウェアの障害か、何らかの種類の破損か、MLのバグ、コード内の競合状態かなどを区別するための多くのシステムを構築しました。さまざまな症状のあらゆる種類の正しさに関する問題について、いくつかの未解決のスレッドがありました。最終的に、バグを見つけて修正しました。そして、複数の未解決のスレッドがあり、これらすべてを引き起こしているのは何か、異なるバグなのか、1つのバグがすべてを引き起こしているのかについて多くの考えがありました。人々はテーブルを囲んで座り、どれが最も可能性の高い原因だと思いますか、と投票しました。バグであると判明したものは、最も少ない票数でした。これはtorchsumのバグ、単純な合計、そしてアップストリームのpytorchです。バグは何でしたか?

この特定のコードパスではトリガーしていました。コンテキストのために、私たちは主にTritonカーネルを使用していることを思い出してください。オペレーションがあまり重要でない場合、torchオペレーションを実行しても問題ありません。そして、特定のコードパス、またはデータは、torchsum関数でバグが発生していました。非常にまれにしか発生しませんでしたが、データの分布に依存しており、良いケースでは違法なメモリアクセスをトリガーしていました。オフセットとメモリのビットを計算していたからです。最後の面白い明らかになったことは、誰かがバグを修正した後、エンジニアが「バグを見つけました。この行はtorchsumです。修正を適用して、すべてが修正されるかどうか確認しましょう」と言ったことです。そして、見かけ上異なる症状を示すすべてのバグを修正しました。そして、非常に楽しかったです。私たちは複数の理論のスラックチャネルの名前を、単一のバグ理論に、またはそれに変更しました。それは、非常に楽しかったです。いつ起こったのか覚えていませんが、ランの初期から、ランのかなり大きな部分まで続きました。私は40%と言います。どのようにして見つけられたか覚えていますか?

私は覚えています。カーネル呼び出しのシーケンスがあると想像してください。2番目のものは違法なメモリアクセスをトリガーしていました。それは私たちが書いた非常に複雑なカーネルでした。そして、もちろん、私たちのチームはそこにバグがあると疑うでしょう。明らかに、そこにバグがあるに違いありません。そして、非常に賢い何人かの人々は、1行ずつ見ていました。バグが見つかりました。しかし、それらの問題のいくつかは消えましたが、すべてではありませんでした。ある時点で、誰かが、torchsumがそのカーネルの多くの入力の1つであることに気づきました。そして、私たちのエンジニアの1人がコードとさまざまなコードパスを見ていました。「おそらくほとんどの人がヒットしない非常に可能性の低いコードパスですが、私たちがヒットするものです。この行にバグがあります。変更を適用して、すべてのクラッシュが消えるかどうかを確認しましょう」と言いました。そして、消えました。

それは私たちに必要な検証でした しかし、えーっと、それはつまり、これが問題なのです それは単に、非常に非常に、つまり遅い速度でクラッシュするということです 100ステップに1回、1000ステップに1回です それは非常に簡単に無視できるものです しかし、単に、実行においてそれを許すべきではないということです 私たちが持っているべき規律として、私たちが持っている規律であり、それを諦めないことが物語なのです

アレックス、あなたの生活がどのようなものか理解しています ほとんどの人は、実行開始のボタンを押すまでのことを想像できると思います しかし、その後どうなるのでしょうか あなたの日常はどのようなものですか 損失曲線を見て座っているだけですか どのように進むのですか?

間違いなく、損失曲線の観察が多いです 私たち全員そうでした ええと、それ以降は、システムで作業を続ける様々なことがあります つまり、改良を取り入れるためです ローンチ前にコード設計面で得られなかった改良です 実行を継続的に監視して、何か傾向がないかを確認するものがたくさんあります 期待していない傾向です これは損失カーソルですが、私たちが見ることができる他の統計がたくさんあります そして、ええと、MLの観点から、実行にできる他の種類の改良に向けて少し作業を進めています

データ面では、「実行」ボタンをクリックするとすぐに忙しくなくなりますが、それ以外はまだやるべきことがたくさんあります MLに頼っているのは、正しさです ノイズの多い信号が多くあり、時にはお茶の葉を読んでいるようなものです これは健康なのかどうかです もちろん、十分に待てば、それが健康だったかどうかは分かります 責任と、誤警報がどのくらいの頻度で発生するかということです 「これは本当に悪い状況だ」と思って、大丈夫なことがどのくらいの頻度でありますか?

かなり頻繁だと思います おそらく約半分でしょう 私たちは用心深い集団なので 半分でなければ、十分に注意深く見ていないでしょう

短いライトニングラウンドの質問があります はい、どうぞ

次の大きな実行の前に、どのようなMLの質問に答えてもらいたいですか?

特定のドメインにおける限られたデータに対して、どのようなアルゴリズムを採用すべきかということです 漠然とした質問ですが、大きな答えです

現在のハードウェアに変更を加えることができれば、新しい種類のネットワークを発明したり、全く新しいチップアーキテクチャを作ったりすることができます 現時点でのシステムの制限要因は何ですか?

ネットワークトランスポートレベルの変更です アプリケーションレベルとは異なるレベルで回避できる障害があるということです ネットワークトランスポートにその役割を果たし、実行を続け、心配することなく利用可能な帯域幅を提供してもらいたいのです

その点で有望なものはありますか?

はい、話しましょう 結構です

ダンさん、2部構成です データ効率性の問題について、人間は、物事を学ぶことについて他の欠点があるとしても、信じられないほどデータ効率が良いようです 現在、私たちの最良のアルゴリズムは、人間レベルのデータ効率からどの程度離れていますか?

リンゴとオレンジを比較するのは本当に難しいと思います 雰囲気だけで判断するなら、言語では天文学的に遠い、10万倍とかそのくらいだと思います 視神経のすべてのピクセル情報を数えるかどうかによって異なりますが、アルゴリズム的にそれを活用して人間レベルのテキストにする方法が分かりません アルゴリズム的には、かなりかなり遠いです

そして、2つ目のパートです 現在のアプローチの方向性で、人間レベルのデータ効率に到達できると思いますか?それとも、それは起こらないだけで、問題ではないのでしょうか?

数十年にわたって、ディープラーニングは計算効率についてでした データと計算の増加以外に魔法のようなのは、アルゴリズムの変更が非常にうまく積み重なることです 世界中の異なる人々が、それを10%向上させる小さなトリックを見つけ、その後20%向上させるトリックを見つけ、それらは積み重なり続けます データ効率性については、まだそのような動員がありませんでした データがあり、計算能力が限られている場合は、それだけの価値がありませんでした そのため、AI研究の新しい段階に入っています ここで10%、そこで20%と、データ効率性の成果を積み重ねていくでしょう 予測できない壁を予測する理由がないため、壁にぶつかることについて予測するのは少し愚かだと思いますが、脳は、私たちが行っていることの小さな調整とは異なるアルゴリズム原理に基づいて動作します そのため、少しは慎重になる必要がありますが、楽観視する多くの理由があります

これは皆さん3人への同じ質問です はい、いいえ、または説明を加えても構いません

人類は、1000万GPU以上の同時プリトレーニングを実行しますか?

正確にはプリトレーニングの実行ではないと思いますが、1000万GPUのトレーニングのようなトレーニングの実行があると思います はい、はい、はい

今日行っていることとは全く違うものになると思いますが、その精神において、その規模の教師なし学習のようなものがあると思います だと思います

半同期型と呼びます その規模では、そう願っています 非常に興味深いと思います

完全に同期型ではないと言いました 自然の法則では完全に曲げることができません それよりも分散型になる可能性が高いと思います AIシステムで協力して学習し、作業を行う1000万個のGPUがあるでしょうが、脳のすべての部分が互いに通信するとは限りません

よりスマートでより大きな事前トレーニングされたモデルが、モデルの学習推論能力の向上とどのように相関するかについて、学んだことや観察したことはありますか?

より良い事前トレーニングと教師なし学習は、モデルの広範な知能を高め、一般化に役立つ傾向があることを観察しました 推論と非常に相補的であることが分かりました 推論は、知能の向上において、少しとがった塊状になる傾向があります したがって、良い補完物であることが分かりました

少し脱線しますが、事前トレーニングがすべてにわたって非常に一般的であるという事実に、何か奇妙な点や持ち帰れるものがありますか? モデルに推論を教えると、特定のカテゴリの事物にのみ非常に優れるようになるという事実に、何か奇妙な点や持ち帰れるものがありますか?

事前トレーニングで見ているものを考えると、それほど驚くことではないと思います 事前トレーニング用のトレーニングデータセットを作成する際に、本質的に非常に幅広いものになります 幅と多様性をターゲットにしています RLを行い、明確に良い報酬信号と良い環境を得ることができる環境について話す場合、常に同じ幅を得るのは難しいと思います

同意します しかし、事前トレーニングは本質的にデータを圧縮しているという別の要因があると思います データを圧縮することは、異なる事物間のつながりを見ること、アナロジーについて、抽象化についてです 推論は特定の問題についてです 注意深く考えることにはスキルと技術があります 注意深く考えることは、異なるドメインにおけるさまざまな種類の解決策を開放することができます しかし、事前トレーニングが行う方法でドメイン全体を圧縮するときに、より抽象的なレベルで学習する何かがあります

質問を変更します システムの進歩、チップ、プロセッサ、メモリ、ネットワーク、または電力の点で、私たちを制限するのは何ですか?これを拡大し続けるためのボトルネックは何ですか?

これがシステムの美しさです コード設計を行うと、ワークロードは構築したインフラストラクチャに適応します 例えば、ネットワークがボトルネックである、メモリ帯域幅がボトルネックである、コンピュータがボトルネックであるという記述はありません 基本的にリソースの要求をシフトするオプションがあり、モデルの同じ仕様についても、よりバランスの取れたシステムを作成するためにリソースの要求をシフトするオプションがあります しかし、プリトレーニングの答えは推論の答えとは異なるなど、言ったとしても、より多くのメモリ帯域幅があっても損はありません はい、これは難しい質問だと思います 資格なしで言えば、以前の点について、チームは、4、5回目の実行の準備をする際に、モデルの仕様についてどの程度協力していますか?

非常に密接に協力しています やりたいマッパーモルの形までです それらが最適化されていることを確認します しかし、このプロジェクトでは、実行開始の6〜9か月前にさかのぼる、はるかに深いコラボレーションがありました 実行に追加したい機能の一部と、4.5を実現するために必要なことのアスペクトについて、システムとの共同設計に特化した非常に大規模なリスク軽減実行を行いました MLとシステムを大規模にうまく連携させるためです そこで、このような大きな重点をコード設計の側面に置くのは初めてだと思います 本当に重要でした

これは、ある側面を微調整することだけではないと思います 根本的に、システム側でプロパティ全体を保持させたいということです そのプロパティはどこからともなく出現するものではありません システムを制御してそのプロパティを得る必要があります そのため、コード設計の取り組みは、モデルに組み込まれるアーキテクチャとアーキテクチャ要素を形成し、システムとMLの側面を結びつけます それはおそらく私たちが望まない特性です 理想的には、すべてを分離して、互いに最大限の空間を与えたいのですが、時々、インフラストラクチャの要件または物事のあり方に合わせた結果、物事が結び付けられることがあります 多くの場合、本当にバランスの取れたシステム、バランスの取れた通信、非常に対称的なタイプのシステムが必要であり、私たちが利用できる最高のつまみはすべてコード設計です

理想的な平均システムにどの程度近づいていますか?

私たちが望むすべてのハードウェアがあり、MLについて知っていることに対して機能する状態になることを意味するなら、それは全く近づいていません

私たちは全く近づいていませんが、楽しいです システム構築の実践は常に、物事がどのように機能すべきかという理想的な見解を持ち、それにあるものとの違いを調整することについてです 単に私たちが望むものを話すためだけに理論をしているのではなく、実現させ、できる限り理想に近づけたいのです

正直言って、システムにとってはこれがおそらく最もエキサイティングなことです 良いシステム設計とは何かという仮説を立てて、そこから始め、非常に迅速に結果を見ることができます 以前は、「これはエレガントなシステム設計です。これが正しいことなのか、間違ったことなのかは歴史が教えてくれるでしょう」と言うものでした 多くの計算能力があり、問題があり、ターゲットが分かっているので、選択が正しかったかどうかを確認します

チームは、実行に追加するものを決定しようとする際に、システム設計の制約についてどの程度考えていますか?

大規模な事前トレーニング実行を行う上では、大きな考慮事項だと思います 4.5以降、アーキテクチャ側の作業の多くは、さらなるコード設計、将来のハードウェア向けに設計できるさらなる場所、共同で構築することにも関連しています それ以来、多くの有望な作業がありました

変更後の質問です 教師なし学習はなぜ圧縮を機能させるのですか?

理想的な知能はソロモン帰納法と呼ばれ、本質的には自分がどの宇宙にいるか分からず、すべての可能な宇宙を想像し、単純な宇宙の方が複雑な宇宙よりも可能性が高いと考え、完全にベイズ的であり、進行するにつれて見解を更新します これは、これまでに見たすべてを計算する最短のプログラムを見つけることで近似できます 事前トレーニングで何をしているか、または事前トレーニングが何をしているかについて考える方法の1つは、人間がこれまでに生成したすべてのデータを説明する最短のプログラムを見つけようとしていることです そして、なぜ次のトークンの予測を見ることでそれができるのか?それは実際には微妙な質問です 長年、統計学にはパラドックスのようなものがありました ディープネットワークが、通常は統計で圧縮されないように見える場合に一般化する理由 多くのデータがあり、小さなモデルがあり、モデルがデータを予測するため、モデルは圧縮され、何かを学習しなければなりません 事前トレーニングでは、モデルは一般的に非常に大きく、データとほぼ同じようにスケールします したがって、常に、実際に圧縮されているのか、一般化されているのかという疑問がありました そしてもちろん、単に暗記して補間し、表面的であると言う批評家もいました しかし、事前トレーニングを、それが圧縮器であると見なす方法があります 非直感的な方法で 基本的には、プリクエンシャル圧縮と呼ばれるアイデアで、トレーニング中に迅速に学習するという事実は、それを優れた圧縮器に変えることができることを意味します 重みが大きいため、バイナリは重みを格納する必要はなく、バイナリは最初から事前トレーニングして解凍することができます そのため、非常に非常に速く学習しているという事実は、そのデータの大部分を非常に少ないビットでエンコードできることを意味します 基本的には、微妙な理由で、それは本当にかなり良い圧縮器であり、それが実際に知能につながる理由について、かなり満足のいく説明だと思います

付け加えることはありますか?

素晴らしいです ありがとうございます

ある程度関連していて、まだ出てきていないのは、メトリクスの規律です スケーリング則を実行するときに得られるもので、すべてのML科学は選択するメトリックに非常に依存しています

何が言いたいのですか?

テスト側について話しています 当惑について評価しています はい、困惑について評価しています はい 既にいくつかの視聴者は、大学受験試験を見ていると考えているかもしれません はい

はい、困惑を説明すべきだと思います はい モデルの知能を、人間にとって分かりやすい試験として評価しようとするのは非常に魅力的です しかし、そうすると、システムを実際にスマートにするよりも暗記を容易にする変更を支持する可能性が高くなります 私たちが持っているほとんどすべての試験は、オンラインで類似のものがあるからです インターネット全体でトレーニングできる場合、人間の場合のようにできない試験と比較して、試験はいくぶん退化します そのため、この分野の主なアプローチは、良好なデータと考えられる一部の保持データがどの程度圧縮されるかを見ることです そして、その保持データに注意しないと、トレーニングデータにあまりにも似ていて、暗記を容易にするトレーニングアルゴリズムへの変更は、テストセットを既に知っているため、スマートに見えるでしょう 単なる暗記の測定ではなく、一般化を求めています そのため、分布外一般化です はい、おそらく言及しているのはそのためです 私たちが見ている主要なテストセットは、トレーニングセットに少しでも存在しないことを非常に気にしています なぜなら、それは私たちのスケーリング則を行う方法全体を台無しにするからです そのため、これが非常に重要な点です そのため、私たちにとって最高のものは何ですか?私たちの外にはないことが分かっている内部コードベースは、多くの点で最高のものです はい、最高のものです

それは驚くべきことです モデルはモノレポ損失であると冗談を言っています 他にすべてと同じように、非常にメタな再帰的なものがあります はい 何らかの理由で、モデルを事前トレーニングするとモノレポ損失が発生し、それがどのように動作するかについて多くのことを教えてくれます 哲学の大学院生がその反応のニュアンスを見つける方法について多くのことを教えてくれますが、それは信じられないことです

信じられないことです それに関連して、ある意味最後の質問です 人、時間、お金、その他すべてにおいて非常に高価だったこの努力全体は、スケーリング則が続いていることをさらに検証するための実験であり、なぜそうなのかという点です そして、どうやらそうであり、おそらく長い間続きます 量子力学のようなスケーリング則を受け入れますが、なぜそうなのかは分かりません なぜそれが宇宙の特性であるべきなのか?

試してみます より多くの圧縮がより多くの知能につながるという事実は、非常に強い哲学的根拠を持っています 問題は、より大きく、より長くモデルをトレーニングすると、なぜより多くの圧縮が得られるのかということです ここには多くの理論があります 私が好きなのは、関連する概念が世界のデータの中でまばらであるというものです 特にべき乗則であるため、100番目に重要な概念は、ドキュメントの100分の1などに表示されます つまり、完璧なデータセットを作成して非常にデータ効率の良いアルゴリズムを考案した場合、帰ることができます それは、データの選択について非常に洗練されていることで、潜在的に指数関数的な計算上の利点が得られることを意味します しかし、基本的に、受動的にデータを収集すると、そのテールで一定数のものを得るために、計算とデータを10倍にする必要があります そして、そのテールは続き、長く、掘り続けることができます しかし、あなたが言及したように、おそらくはるかにうまくできるでしょう 良い終わり方だと思います ありがとうございました 楽しかったです ありがとうございます