Transcription
Ich liebe Cloud Code-Fähigkeiten total. Ich denke, du auch. Aber manchmal sind sie ein bisschen unzuverlässig. Ich würde sagen, etwa 70% der Zeit, wenn ich eine Fähigkeit ausführe, erhalte ich eine beabsichtigte Ausgabe. Etwa 30% der Zeit ist es ein Sack voller Steine. Was ich in diesem Video tun wollte, ist, Ihnen zu zeigen, wie Sie Claude Code-Fähigkeiten mit einer neuen Entwicklung im KI-Bereich namens Auto Research kombinieren können, um eine deutlich höhere Zuverlässigkeit und Genauigkeit zu erzielen und Ihre Fähigkeiten buchstäblich über Nacht selbst zu verbessern.
Ich werde das so einfach und geradlinig wie möglich halten. Zuerst muss ich Ihnen zeigen, woher diese Idee der Auto-Recherche stammt. Um es kurz zu machen: Eines der ehemaligen Gründungsmitglieder von OpenAI und späterer Leiter von KI bei Tesla, Andre Carpathy, hat vor ein paar Tagen ein Auto-Research-GitHub-Repo veröffentlicht. Und was das tut, ist, dass es einem Team von Agenten erlaubt, einen Prozess autonom zu optimieren. Dieser Prozess war in seinem Fall das Training eines anderen Machine-Learning-Modells namens nanoGPT. Aber in unserem Fall wird es unsere Fähigkeit sein und diese Fähigkeit im Laufe der Zeit tatsächlich verbessern, indem wir den Prompt besser, besser und lückenloser machen.
Sie müssen nicht das gesamte Repo lesen. Es gibt tatsächlich nur ein paar Dinge hier, die meiner Meinung nach wichtig und sofort anwendbar für geschäftliche Zwecke oder zur Verbesserung von Fähigkeiten sind. Und zwar sind das folgende: Dieses Repo ist bewusst klein gehalten und hat nur drei wichtige Dateien. Die erste ist die Datei prepare.py. Die zweite ist die Datei train.py. Und die dritte ist program.md.
Um es kurz zu machen, dieses prepare.py ist eher spezifisch für maschinelles Lernen. Wir müssen uns also nicht wirklich darum kümmern. Das ist etwas, das spezifisch für das Training eines Tokenizers usw. ist. Die Dinge, die für uns wirklich wichtig sind, sind train.py und program.md. Und so möchte ich, dass Sie für einen Moment so tun, als wäre dieses train.py tatsächlich Ihr skill.md. Und dann ist Ihr programm einfach Ihr Agent. Und im Grunde werden wir unserem Agenten in program.md einen Prompt geben. Und der Prompt wird lauten: "Hey, ich möchte, dass du diese Fähigkeit mit der in Auto Research besprochenen Methode verbesserst."
Die Art und Weise, wie Sie messen werden, ob die Fähigkeit fantastisch oder schlecht ist, ist wie folgt. Und dann geben wir ihm einfach einige kurze Kriterien, die in der maschinellen Lernterminologie typischerweise als "Eval" bezeichnet werden. Und auf diese Weise wird die Fähigkeit im Laufe der Zeit besser und besser.
Nur bevor ich weitermache, möchte ich, dass Sie wissen, dass dies eine ziemlich große Entwicklung ist. Sie müssen sie nicht nur für Fähigkeiten verwenden, wie ich sie Ihnen hier zeigen werde. Und das möchte ich in diesem Video klarstellen, genau wie in meinem letzten Video. Heute Morgen war mir ein bisschen langweilig und ich dachte: "Hey, wofür kann ich diese coole Auto-Research-Bibliothek verwenden?" Und mir fiel ein, dass ich diese alte App hatte, die ich vor vielen Jahren entwickelt hatte, und ich war einfach neugierig: "Hey, wie viel schneller kann ich dieses Ding machen?"
Also habe ich einfach dasselbe Repo genommen, von dem ich Ihnen gerade erzählt habe, und dann gesagt: "Hey, ich möchte, dass du den gleichen Ansatz verwendest, um meine Website schneller zu machen." Und im Laufe von etwa 67 verschiedenen Tests hat diese Auto-Research-Methodik meine Ladezeit von etwa 1100 Millisekunden buchstäblich auf 67 reduziert. Das ist im Grunde dasselbe, was wir mit unserer Fähigkeit tun werden. Nur dass wir für die Entwicklung des Eval-Sets verantwortlich sind, das ich in wenigen Momenten behandeln werde.
In unserem Fall hatten wir eine Verbesserung von 81,3 % bei der Zeit. In Ihrem Fall könnte es eine Verbesserung von 81,3 % bei der Genauigkeit sein. Wer weiß? Aber was wirklich cool daran ist, ist nicht nur die tatsächliche Verbesserung selbst, sondern Sie erhalten eine große Liste von Änderungen, die die Modelle versucht haben, um Ihre Fähigkeit zu verbessern. Das bedeutet, da KI-Modelle immer intelligenter werden, können Sie jederzeit im Laufe der nächsten Jahre diese große Liste von Dingen nehmen und sie einfach an den nächsten Agenten weitergeben. Sie können diese große Liste nehmen und sie an GPT6 oder Opus 5.0 weitergeben, und es wird in der Lage sein, dort anzuknüpfen, wo seine Vorgänger aufgehört haben. Ich denke, das wird bald eines der wichtigsten und wertvollsten Güter unserer Zeit sein, nur eine Menge Forschungsdaten. Aber egal, das interessiert Sie nicht. Sie interessieren sich dafür, wie Sie Ihre Fähigkeiten verbessern können.
Lassen Sie mich Sie also durchführen. Damit Auto Research funktioniert, benötigen Sie drei Zutaten. Sie benötigen eine objektive Metrik. Okay? Das ist eine Zahl, die Sie messen können. Es ist etwas, das sich nicht schneller anfühlt oder mehr Resonanz hat oder was auch immer die Kinder heutzutage reden. Es ist eine tatsächliche Zahl. In meinem Website-Beispiel war es die Ladezeit in Millisekunden. Ich führe jetzt Auto Research für Kalt-E-Mail-Kampagnen durch, also ist es meine Antwortrate. In unserem Fall für Fähigkeiten wird dies unser Eval oder die Auswertungsrate sein. Ich zeige Ihnen gleich, wie Sie das machen.
Als Nächstes benötigen Sie eine Form von Messwerkzeug. Idealerweise wäre dies automatisiert und zuverlässig. Es gäbe keinen Menschen im Spiel. Für das Website-Beispiel, das ich Ihnen gerade gezeigt habe, habe ich eine Reihe von Website-Testtools namens Lighthouse verwendet, die Google standardmäßig bereitstellt. So habe ich herausgefunden, wie lange es dauert, die Seite zu laden. Für meine Kalt-E-Mail-Suite verwende ich API-Analysen von Instantly.
Für uns werden wir tatsächlich einen Agenten schreiben lassen, der eine Testsuite erstellt, die nur eine Reihenfolge von Operationen ist und besagt: "Hey, ich möchte, dass du die erste Auswertung durchführst, dann die zweite Auswertung, dann die dritte Auswertung und so weiter."
Schließlich brauchen Sie offensichtlich etwas zu ändern, richtig? In meinem Website-Beispiel sind das die Code-Änderungen. Mein Kalt-E-Mail-Beispiel von gestern, das ist der E-Mail-Text selbst. In unserem Fall werden es nur die Anweisungen für die Fähigkeit sein. Im Grunde wird es der Prompt sein, okay? Es wird die Markdown-Datei sein.
Und wenn Sie logisch darüber nachdenken, werden wir, genau wie im Auto-Research-Repo von Andre Carpathy, die Fähigkeit als unsere, ich weiß nicht, unsere train.py hier bereitstellen. Und dann werden wir dem Agenten einige hochrangige Anweisungen geben. Wir werden das einfach hier in das programm stecken. Und dann werden wir ihn im Grunde sagen lassen: "Hey, jedes Mal, wenn du die Fähigkeit ausführst, möchte ich, dass du sie anhand einer von uns entwickelten Testsuite auswertest und mir sagst, ob sie besser ist als das, was wir letztes Mal gemacht haben." Und auf diese Weise möchte ich, dass sie im Laufe der Zeit immer besser und besser wird. Und ich möchte, dass Sie das alle 5 Minuten ausführen.
Und das bringt mich zu diesem Konzept des Evals. Fähigkeiten sind nur Prompts, richtig? Und Prompts sind von Natur aus verrauscht. Was ich damit meine, ist, dass Sie manchmal einen Prompt ausführen und er X tut. Ein anderes Mal führen Sie einen Prompt aus und er tut Y. Und damit wir einen standardisierten Satz oder eine Reihe von Möglichkeiten entwickeln können, die Qualität unserer Fähigkeiten im Laufe der Zeit zu verbessern, können wir sie nicht einfach einmal ausführen. Wir müssen sie viele, viele Male ausführen. Und dann müssen wir den Modus nehmen, der die Häufigkeit ist, und dann den Median, der so etwas wie der Durchschnitt der Ergebnisse ist.
Wenn ich 20 Fähigkeiten ausführe und alle aufgefordert werden, mir ein Bild zu generieren, was wir heute tun werden. Jedes Mal wird es einige leichte Unterschiede geben, aber es wird Dinge innerhalb jedes Diagramms oder jedes Bildes geben, die ähnlich sind, und es wird auch einige Dinge geben, die unterschiedlich sind. In Wirklichkeit sind alle Machine-Learning- und KI-Ausgaben Verteilungen von Daten. Und damit wir das kontrollieren und Iterationen und Verbesserungen daran vornehmen können, müssen wir sie einfach viele, viele Male ausführen.
Aber das mehrfache Ausführen reicht nicht aus. Wir müssen auch die Ausgaben unserer Fähigkeiten nach einem Standard bewerten. Es ist ein bisschen wie Tests in der Schule. Sie können alles über Astronomie wissen, okay? Aber es gibt keine Möglichkeit, Ihr Wissen zu bewerten, es sei denn, wir geben Ihnen einen Test dazu. Und diese Tests werden ähnliche Fragen sein, die auf ähnliche Weise gestellt werden.
Sie können sich also vorstellen, dass wir hier die Leistung unserer Fähigkeiten benchmarken. Und der beste Weg, dies zu tun, sind binäre Ja- oder Nein-Fragen, Wahr-oder-Falsch-Fragen.
Als wirklich meta-Beispiel möchte ich Ihnen heute zeigen, wie Sie eine Fähigkeit verbessern können, die ich Diagrammgenerator nenne. Wenn ich hier nach rechts scrolle, werden Sie sich an dieses Diagramm erinnern, das ich Ihnen gerade gezeigt und vor einem Moment markiert habe. Nun, ich habe tatsächlich KI verwendet, um das zu erstellen. Und das ist die Fähigkeit, die ich heute erfolgreich im Laufe der Zeit mit standardisierten Evals und Auto Research verbessern möchte.
In unserem Fall ist es für mich schwer, einfach nur hinzuschauen und zu sagen, ob es gut oder schlecht ist, richtig? Und deshalb möchte ich eine Reihe von standardisierten Fragen haben, die ich einem anderen Agenten stellen kann, um ihn zu überprüfen und mir zu sagen, ob dieses Ding gut ist. Und realistischerweise kann ich nicht einfach sagen: "Hey, ist der Text lesbar?" Ich kann nicht einfach sagen: "Hey, sieht es gut aus?" Ich muss es viel granularer aufschlüsseln.
Sie fragen sich vielleicht, was zum Teufel das für ein Diagramm bedeutet. In meinem Fall habe ich vier Kriterien für ein hochwertiges Diagramm festgelegt. Das erste ist: Ist der gesamte Text im Diagramm lesbar und grammatisch korrekt? Wenn ja, ist es wahrscheinlich ein gutes Diagramm. Das zweite ist: Passt es zu meiner Farbpalette, die als Pastellfarben, sanfte Farben definiert ist. Ich möchte keine super hellen Rot- oder Orangetöne oder Neongrün, weil ich finde, dass das unprofessionell und lahm aussieht. Das dritte ist: Ist es linear? Geht es von links nach rechts oder von oben nach unten? Früher habe ich viele Bilder generiert, die einfach überall verstreut waren, und ich weiß nicht, es gab verteilte Blasen und so weiter, was einfach seltsam aussah. Und viertens: Ist es frei von Zahlen, Ordnungszahlen und Reihenfolgen? Falls Sie es nicht wussten, das ist im Grunde die Anwesenheit von 1, 2, 3, 4, was ziemlich meta ist, weil ich das so nummeriert habe. Aber der Punkt ist, wenn alle meine Diagramme frei von all diesen Dingen sind, ist das wahrscheinlich ein guter Prompt. Es tut etwas, das ich will.
Also werde ich diese Anforderungen meinem Agenten geben. Ich werde ihn bitten, einen Evaluations-Testdatensatz für mich zu erstellen, und dann kann ich dieses Ding immer wieder im Autolauf wiederholen, bis meine Fähigkeit fantastisch ist.
Das Erste, was Sie tun müssen, ist, etwas einzurichten, das Ihnen die Kommunikation mit Claude Code ermöglicht. In meinem Fall mache ich das in Anti-Gravity. Ich habe also ein Anti-Gravity-Fenster mit der Claude Code-Erweiterung darin eingerichtet. Sie können das tun, wie auch immer Sie wollen.
Das Zweite, was Sie tun müssen, ist, das Andre Carpathy Auto Research Repo zu holen. Ich gehe also zurück und kopiere diesen Link. Dann werde ich das direkt an meinen Agenten weitergeben. Ich werde sagen: "Lies das."
Als Nächstes benötigen wir unsere Eval-Testsuite. Ich gehe also zurück zu meiner Chrome-Instanz und hole mir diese vier und gehe dorthin. Und dann, drittens, muss ich ihm sagen, was ich von ihm will. Ich werde also ein Sprachtranskriptionstool namens Whisper Flow verwenden. Und dann bitte ich ihn in natürlicher Sprache, dies zu tun: "Hey, ich möchte, dass du die Auto-Research-Konvention im obigen Repo verwendest, um ein sich selbst verbesserndes Fähigkeitssystem für meine Diagrammgenerator-Fähigkeit zu erstellen. Die Eval-Suite, die ich ausführen möchte, sind die vier oben genannten Einschränkungen. Was ich möchte, ist, dass alle 2 Minuten 10 Diagramme für eine bestimmte Funktion generiert werden. Welche Funktionen das auch immer sind, ist in Ordnung. Und dann möchte ich sie durch diese Eval-Testsuite laufen lassen, bewerten, wie viele davon es geschafft haben, und dann den Prompt entsprechend anpassen und verbessern, um ihn auf den Punkt zu bringen, an dem er 10 von 10 Treffern erzielt."
Ich werde dann hier auf Enter drücken. Und das wird alles in meinen Fall Opus 4.6 einspeisen. Es wird damit beginnen, das Auto-Research-Repo zu lesen, das hier oben ist. Dann wird es die Diagrammgenerator-Fähigkeit untersuchen. Sie fragen sich vielleicht, was die Diagrammgenerator-Fähigkeit ist. Nun, sie ist eigentlich ganz einfach. Sie generiert im Grunde nur saubere, handgezeichnete Diagramme aus natürlichsprachlichen Beschreibungen. Die Ausgabe sollte wie eine Whiteboard-Skizze mit pastellfarbenen abgerundeten Rechtecken, einfachen Strichzeichnungen, dünnen Pfeilen und sauberen Beschriftungen auf weißem Hintergrund aussehen.
Die Funktionsweise im Hintergrund ist, dass wir die Anfrage an Nano Banana Pro 2 senden und dann diese Dinge erhalten, die wir auf unser Excaladraw einfügen können. Meine Gesamtkosten betragen etwa 2 Cent pro Generierung mit diesem superschnellen Modell. Und das bedeutet, wenn wir jedes Mal 10 ausführen, werde ich logischerweise etwa 20 Cent pro Test ausgeben. Wenn ich es also innerhalb von 50 Tests an einen guten Punkt bringen kann, werde ich die Fähigkeit für etwa 10 Dollar optimiert haben. Und angesichts dessen, wie viel Geld meine YouTube-Videos mir einbringen, könnte ein guter Banger-Video mir jeden Tag mehrere hundert Dollar an Werbeeinnahmen einbringen. Offensichtlich ist das eine ziemlich positive Rendite für mich.
Ich werde ihm also etwas Zeit geben, alles lesen lassen, was er lesen muss, und dann zurückkommen, wenn er bereit ist. Und nur auf halbem Weg habe ich beschlossen, den Bewertungsmechanismus zu klären. Was ich möchte, wie erwähnt, ist, dass ich 10 Bilder generieren möchte. Ich habe vier Kriterien. Das ergibt eine Höchstpunktzahl von 40. Das bedeutet, dass ich 10 generieren, alle 10 anhand der vier Kriterien bewerten, die Punktzahl von 40 ermitteln, den Prompt iterieren, es erneut versuchen und dann den Gewinner auswählen werde. Und das habe ich ihm nur gegeben, weil mir nach der Sprachübertragung klar wurde, dass ich nicht ausdrücklich erwähnt hatte, dass ich 10 Mal laufen lassen wollte.
Und es öffnet jetzt ein Echtzeit-Dashboard, um mir die Ergebnisse zu zeigen, was ich wirklich cool finde. Wie Sie hier sehen können, haben wir den ersten Test bereits mit Lesbarkeitswerten und Gesamtpunktzahlen hier. Und es sieht so aus, als wäre ein weiteres Experiment gerade abgeschlossen worden, bei dem wir von 32 auf 37 gestiegen sind. Und es wird einfach weiterhin diesen Prompt besser und besser und besser machen, um im Laufe der Zeit meinen Spezifikationen zu entsprechen.
Ich meine, in meinem Fall haben wir mit 32 von 40 begonnen. Das ist also schon ziemlich gut. Realistischerweise stelle ich mir vor, dass dies nur wenige Durchläufe dauern wird, um dorthin zu gelangen, wo wir hinwollen. Aber das ist die Magie von Auto Research, denn wir werden alle unterschiedliche Definitionen von gut haben. Wir werden alle unterschiedliche, wissen Sie, Einschränkungen in Eval-Testsuiten haben. Was für mich 32 von 40 sein mag, könnte für Sie bei 2 von 100 begonnen haben. Das Einzige, was zählt, ist, wie viel Zeit Sie es laufen lassen. Wenn es also ein paar Tage, ein paar Wochen, ein paar Monate läuft, können Sie sich vorstellen, dass Sie praktisch überall anfangen können, wo Sie wollen, und schließlich wird es fantastisch sein. Das Wichtigste ist, einfach das richtige Set von Evals zu definieren. Und meine Empfehlung ist immer, sie einfach als einfache Ja- oder Nein-Antworten zu gestalten, gut oder schlecht.
Und jetzt läuft es einfach im Hintergrund. Sie können hier sehen, dass es bereits Lauf eins und Lauf zwei abgeschlossen hat. Diese beiden wurden im Thread durchgeführt, damit wir sehen können, wie sie verlaufen. Jetzt geschieht alles andere autonom. 10 Diagramme alle 2 Minuten, Bewertung über Cloud Sonnet Vision, Mutation des Prompts und dann Beibehaltung des Gewinners.
Wir können dies auf jede Fähigkeit anwenden, die wir haben. Ich kann es auf meinen Vorschlagsgenerator anwenden. Ich kann es auf Auto Research selbst anwenden. Ich kann es auf meine Agentenbewertung anwenden. Ich kann es auf meinen Modell-Chat anwenden. Und ich werde eine Meta-Fähigkeit erstellen, die durchgeht und eine Art Optimierung für buchstäblich jede Fähigkeit in meinem Repo durchführt, nur um sie so nah wie möglich an die Perfektion zu bringen.
Und Sie können sehen, dass es tatsächlich meinen Rat beim zweiten Lauf befolgt, okay, wie hier geschrieben. Keine dieser Buchstaben oder Wörter oder so etwas ist unleserlich. Es gibt keine Probleme. Es hat gerade noch einen abgeschlossen, übrigens. Es ist linear, also von links nach rechts. Es experimentiert mit ein paar verschiedenen Stilen, aber es hat diese schönen Pastellfarben, wie diese süßen Icons, und dann letztendlich diese abgerundeten Ränder, die ich mag. Und es wird einfach immer besser und besser und besser. Dies ist wahrscheinlich eines der, die fehlgeschlagen sind. Es hat "authorization" nicht richtig geschrieben.
Schließlich werden die Läufe so gut, dass es sich in dieser Art von handgezeichnetem Pastellstil befindet, was mehr oder weniger genau das ist, was ich will. Und wir haben in diesem Experiment schließlich 39 von 40 erreicht, was meiner Meinung nach ziemlich gut ist. Wenn ich 39 von 40 erreiche, ist das vergleichbar damit, dass ich 97,5 % in einem Test erhalte. Mit 97,5 % bin ich zufrieden.
Ein paar schnelle Tipps zu den Evals. Ja oder Nein ist die einfachste Art, es zu formulieren. Enthält dieses Diagramm X, Y und Z? Nur zwei mögliche Antworten. Sie können versuchen, eine Art von Bewertung oder Skalierung zu implementieren, wie eine Likert-Skala. Bewerten Sie dies mit 7 für X, Y und Z. Meiner Erfahrung nach nicht so gut. Da Sie Wahrscheinlichkeiten stapeln. Je mehr Variabilität Sie dem Modell bei jedem Schritt in der Kette geben, desto variabler wird es insgesamt. Stellen Sie sich einen kleinen Kegel vor, richtig? Er beginnt hier sehr, sehr eng, aber je mehr Variabilität, desto mehr breitet er sich aus, bis schließlich meine Antwort, meine 39 von 40, bei 39 von 40 liegen könnte oder bei 2 von 40. Gehen Sie also, wo immer möglich, binär vor.
Gehen Sie auch nicht so konkret und so eng vor, dass das Modell anfängt, für alberne Dinge zu optimieren, wie ich viele Leute sagen gehört habe: "Stellen Sie sicher, dass dies unter X Wörtern liegt." Stellen Sie sicher, dass dies keine Symbole oder Zeichen enthält. Das ist ziemlich streng, würde ich sagen. Und wenn Sie dem Modell zu viele dieser Evals geben, wird es letztendlich einen Weg finden, jeden einzelnen Bewertungspunkt zurückzugeben. Selbst wenn die tatsächliche Qualität der Sache nicht sehr gut ist, wird sie technisch als bestanden und einsatzbereit eingestuft. Das ist so ähnlich wie bei einem Schüler, der das Material nicht wirklich versteht, aber trotzdem 100 % in der Prüfung bekommt.
Und das war's. Ich gebe Ihnen hier unten Zugang dazu. Keine E-Mail, keine Gated Content. Fühlen Sie sich frei, dies zu nehmen und für Ihre eigenen Fähigkeiten zu verwenden. Und ich werde damit beginnen, dies auf den Rest meiner eigenen anzuwenden. Hoffentlich haben Sie gelernt, wie Sie Ihre eigenen Fähigkeiten mit Auto Research optimieren können. Wie erwähnt, gibt es unzählige Dinge, auf die Sie Auto Research anwenden können. Es sind nicht nur Ihre Fähigkeiten, und es sind auch nicht nur Ihre Prompts. Sie können Auto Research für Ihre Websites, für Ihre Landing Pages, für Split-Testing von Titeln, Thumbnails, E-Mails verwenden, buchstäblich was auch immer Sie wollen. Ich bin sicher, viele Leute im Ökosystem finden im Laufe der Zeit bessere und leistungsfähigere Wege, dies zu tun.
Wenn Ihnen diese Art von Dingen gefällt, aber Sie vielleicht ein wenig verloren waren bei den eigentlichen Claude-Teilen, schauen Sie sich unbedingt meinen vollständigen 4-Stunden-Claude-Code-Kurs unten an. Ich behandle alles, einschließlich Fähigkeiten, aber auch, wie die Benutzeroberfläche von Anfang bis Ende funktioniert.
Abgesehen davon hinterlassen Sie mir unten einen Kommentar mit allem, was Sie im nächsten Video sehen möchten. Ich lese jeden einzelnen, und ich werde Sie alle im nächsten Video wiedersehen. Vielen Dank für Ihre Zeit.