📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Claude Code + Playwright Automates Literally Anything

Nate Herk | AI Automation18:51

Transcription

Also, wenn man einem Werkzeug wie Cloud Code, das so mächtig ist, die Kontrolle über einen Browser gibt, kann man, wenn man darüber nachdenkt, eigentlich alles automatisieren. Ob das nun das Stresstesten einer App, das Herunterladen von Berichten oder sogar das Spielen eines Spiels ist, wie ihr in meinem anderen Video gesehen habt. Heute führe ich euch durch drei Anwendungsfälle, die ihr nutzen könnt, wenn ihr die Playwright CLI mit Cloud Code verbindet, um euren Browser zu steuern. Der erste ist, dass es eine Web-App tatsächlich testet, Fehler findet und sie dann behebt. Der zweite ist die Suche nach Zahnärzten und das Finden ihrer Kontaktdaten. Und dann der dritte, eine Frage, die sich jeder stellt, ist: Können Browser-Automatisierungen tatsächlich Sitzungen steuern, bei denen man eingeloggt sein muss? Also zeige ich, was ich in meinem Schulaccount tun kann. Ich will also keine Zeit verschwenden. Lasst uns direkt ins Video einsteigen.

Alles klar. Ich befinde mich in einem neuen Cloud Code-Projekt. Wie ihr sehen könnt, bin ich in einem Ordner namens "browser automation demo", aber hier ist nichts drin, damit ihr genau nachvollziehen könnt, was ich tue. Das Erste, was wir tun müssen, ist die Playwright CLI zu installieren, damit wir tatsächlich etwas Browser-Automatisierung durchführen können. Also, ich gehe einfach in den Plan-Modus und sage: "Hey, Cloud Code, ich möchte die Playwright CLI verwenden, um einige Browser-Automatisierungsaufgaben zu erledigen. Ob das nun das Testen von Web-Apps oder das Aufnehmen von Screenshots ist, was auch immer der Fall ist, ich brauche nur, dass du herausfindest, wie du das für mich installieren kannst, und dann einen Plan erstellst und es erledigen wir."

Ich weiß, ich sage euch, ihr sollt die Playwright CLI verwenden, aber das ist buchstäblich das, was ich getan habe, als ich beschloss, einige Browser-Automatisierungen auszuprobieren, außer dass ich sagte: "Hey, ich brauche dich, um die verschiedenen Werkzeuge und die verschiedenen Vor- und Nachteile zu recherchieren und mir zu helfen herauszufinden, was ich tun soll." Ich habe ein wenig mit Chrome DevTools herumgespielt, aber jetzt benutze ich die Playwright CLI. Und ein Grund dafür, während wir das laden lassen, ist, dass, wenn ich hier `/context` eingebe, ihr sehen könnt, dass das Chrome DevTools MCP so viele Tokens verbraucht, weil es so viele verschiedene Werkzeuge gibt und jedes Werkzeug eine Beschreibung hat. Deshalb dachte ich, hm, vielleicht möchte ich den MCP-Server nicht verwenden. Ich probiere einfach diese Playwright CLI aus. Und sie funktioniert wirklich gut.

Alles klar, der Plan ist fertig. Wir haben ein leeres Projekt. Wir werden das Projekt initialisieren, Playwright installieren, ein Demo-Skript erstellen, Dinge testen. Ich werde diesen Plan jetzt akzeptieren und melde mich dann bei euch, wenn das erledigt ist.

Alles klar, ihr seht, es ist erledigt. Es wurde installiert und es wurde auch schon ausprobiert. Es hat also ein Skript ausgeführt, um diese Seite zu öffnen und dann einen Screenshot zu machen, und der wurde hier gespeichert. Wie ihr sehen könnt, konnte es das tun. Es konnte einen Screenshot machen, was bedeutet, dass alles funktioniert.

Jetzt, da wir diese anfänglichen Dinge eingerichtet haben, werde ich einfach `/init` eingeben, um die Umgebung zu initialisieren und uns eine claw.md-Datei zu geben.

Alles klar. Es gibt unzählige großartige Anwendungsfälle für die Browser-Automatisierung, sei es die Suche auf Amazon, die Bewerbung auf viele Stellen oder das Herunterladen von Berichten von Websites, die keine API haben. Und das Tolle daran ist, dass es diese Skripte erstellt, die die Browser-Automatisierung ausführen, richtig? Und wenn man diese benutzerdefinierten Skripte mit einer Fähigkeit kombiniert, wird es sehr leistungsfähig, denn dann wird der Prozess des Öffnens des Browsers und des Ausführens bestimmter Dinge konsistent und wiederholbar. Aber eine Sache, die ich an Browser-Automatisierungen wirklich cool finde, ist die Möglichkeit, Dinge zu testen und QA zu automatisieren. Ein Beispiel, das ich mit euch durchgehen möchte, ist, dass ich Cloud Code hier verwenden werde, um uns eine schnelle Web-App zu erstellen, die wie ein mehrseitiges Formular sein wird, und ich möchte sie nicht selbst testen. Ich möchte, dass sie sie testet, dann Fehler findet, Vorschläge findet und sie dann selbst behebt. Wir werden also eine Web-App oder ein Formular erstellen, und das wird völlig freihändig sein. Das ist zumindest das Ziel.

Also, springen wir in den Plan-Modus und legen los. Ich brauche dich, um mir eine Formular-Einreichungs-Website zu erstellen. Jetzt möchte ich, dass dies im Grunde eine Seite pro Frage ist. Sobald ich die Seite öffne, sollte sie mich nach meinem Vornamen fragen, und dann sollte es einen Button geben, der mich auffordert, Enter zu drücken. Wenn ich Enter drücke, gehe ich zur nächsten Seite, und dann habe ich meinen Nachnamen, und dann habe ich meine Telefonnummer, und dann habe ich mein Unternehmen. Und ich habe vielleicht, sagen wir einfach, acht Fragen über mich und so etwas wie die Einarbeitung in dieses, Sie wissen schon, gefälschte Unternehmen oder was auch immer. Ich möchte das nur tun, um die Funktionalität dessen zu sehen und zu testen, was Sie für mich erstellen können.

Okay, das ist Phase eins. Phase eins, wir bekommen eine erste Version der Website, und bevor ich sie überhaupt öffne und teste, gehen wir wieder in den Plan-Modus und sehen, ob Cloud Code mit der Browser-Automatisierung sie testen, iterieren, testen, iterieren kann.

Okay, hier ist unser Plan. Mehrseitiges Onboarding-Formular. Der Benutzer wünscht sich ein poliertes, mehrseitiges Onboarding-Formular. Wir haben die Architektur. Es gibt insgesamt 12 Fragen, was für mich gut aussieht. Wir haben einige Dateien. Es wird hier einige Implementierungsdetails geben, und das alles sieht für mich gut aus.

Also, wir gehen zurück zur Hauptsitzung und akzeptieren diese Änderungen. Okay, das ist gerade fertig geworden. Wir haben die Dateien erstellt. Wir haben einen Server, auf dem das läuft. Es wird auf localhost laufen. Wir haben auch 12 Fragen, eine pro Seite. Und was mir aufgefallen ist, ist, dass es Screenshots gemacht hat, und ich habe es nicht einmal dazu aufgefordert. Wenn ich also Screenshots öffne, seht ihr, dass wir jetzt diese Bilder haben.

Schauen wir uns das mal an. Wir haben Nummer eins, was ist dein Vorname? Nummer zwei, Nachname, beste Telefonnummer, unter der wir dich erreichen können. Es gibt sogar, wenn ihr genau hinschaut, so eine Fortschrittsleiste oben, die zeigt, wie viele Fragen ihr schon habt. Für eine einmalige Aufforderung und die Tatsache, dass es bereits durchblättert und Screenshots macht, bin ich ziemlich beeindruckt, aber wir müssen sehen, wie es sie tatsächlich testen kann.

Also gehe ich jetzt wieder in den Plan-Modus und sage: "Ja, absolut. Startet einen Server, damit ihr das tatsächlich ausführen könnt." Und dann möchte ich, dass ihr eure Browser-Automatisierung nutzt und es ausprobiert. Also füllt die Felder aus, klickt euch durch, und wenn es Fehler gibt oder etwas mit der Funktionalität der Seite nicht stimmt, macht Notizen, damit ihr die eigentliche Seite beheben könnt. Und ich möchte auch, dass ihr das in einem sichtbaren Browser tut, damit ich zusehen kann, was passiert.

Also schicke ich das ab. Es wird einen Plan erstellen. Aber das ist eine wichtige Unterscheidung. Standardmäßig könntest du sagen: "Hey, ich möchte immer, dass du Playwright in einem sichtbaren Browser ausführst." Aber es gibt sichtbare oder unsichtbare Modi, was bedeutet, dass es dies unsichtbar ausführen könnte, wo es uns nicht auf dem Bildschirm angezeigt wird, aber es läuft trotzdem in einem eigenen Tab und klickt sich durch die Dinge.

Okay, hier ist der QA-Durchlauf, das Testen im sichtbaren Browser. Ich werde das nicht vorlesen. Ich denke, das ist ziemlich klar, was wir wollen. Ich werde es akzeptieren. Was also passiert, ist, dass für jeden Bot, den wir ausführen wollen, ein eigener Skript geschrieben werden muss. Ich glaube, das ist dieses hier, das es schreibt, nämlich `test_onboarding.js`. Und das ist im Grunde das, was den Bot anweist, was er tun soll. Und wenn wir das in eine Fähigkeit umwandeln wollen, die im Grunde unsere Website testet, würden wir sagen: "Okay, wenn du testen willst, dann führe den Bot aus und nimm das Feedback vom Bot und nimm dann Änderungen vor und führe den Bot wieder aus." Und so können wir all diese verschiedenen Teile in einen tatsächlichen Prozess verwandeln.

Okay. Das war auch nicht einmal das Skript. Das Skript, das es dafür schreibt, ist `QA-test`. Jetzt seht ihr, was ich meine.

Okay. Das Fenster ist gerade aufgepoppt. Ich werde es in Sichtweite bringen und wir sollten zusehen können, wie es sich ausfüllt. Es hat Nathan ausgefüllt. Okay, es ging rückwärts. Jetzt ist es beim zweiten. Nathan Harrison füllt eine Telefonnummer ein. Es klickt sich weiter durch. Harrison Tech. Wir haben eine E-Mail. Wir haben Gründer und CEO. Es zeigt eine Unternehmensgröße an. Auswahl aus einer Dropdown-Liste. Okay, Technologie, Empfehlung, Hauptziel, Website. Weiter. Und sonst noch etwas? Okay, es scheint hier jetzt ein kleines Problem zu haben. Es ruckelt immer wieder. Aber ich werde es trotzdem nicht stoppen. Ich werde es herausfinden lassen, was es tun muss.

Okay, es hat sich gerade beendet und jetzt gesagt: "Okay, einige Probleme gefunden. Ich werde die Screenshots überprüfen, um zu verstehen, was passiert ist." Was ihr nicht bemerkt habt, ist, dass es dort weitere Screenshots gemacht hat. Wir können also jetzt sehen, dass wir QA haben und all diese Screenshots, die es während dieses Tests gemacht hat. Es sagt also: "Okay, die Benutzeroberfläche sieht poliert aus. Das ist großartig. Sie sah wirklich gut aus. Aber der erste Fehler ist, dass Enter in einem Textbereich nicht zum Überprüfen fortgeschritten ist. Es blieb auf der Notizenseite. Der zweite Fehler ist, dass die Überprüfungsseite nie geladen wurde. Der Test fand null Überprüfungselemente und der Bearbeiten-Button wurde von einem veralteten Seiten-Overlay abgefangen." Und jetzt konnte es dieses Feedback nutzen, um die tatsächlichen Fehler in der Website selbst zu beheben. Und das ist wirklich cool, denn wenn ihr jemals Software oder Websites oder Apps oder was auch immer entwickelt habt, gibt es so viele Fehler, und man findet sie nicht immer, bis es vielleicht zu spät ist oder vielleicht ein Kunde sie gefunden hat. Die Tatsache, dass man QA automatisieren kann, indem man mehrere verschiedene sichtbare Browser oder sogar unsichtbare Browser startet und sagen kann: "Hey, du testest X, du testest Y, du testest Z, und lass sie einfach laufen und reparieren und laufen und reparieren, ist ein kompletter Gamechanger."

Und jetzt, ohne dass ich es überhaupt gefragt habe, sagt es: "Okay, ich starte den Server und führe den Test erneut aus." Wir bringen es also im Grunde in diese Schleife aus Testen, Validieren, Testen, Validieren, und wissen Sie, es ist wirklich, wirklich cool. Ich glaube, es macht noch einen schnellen Test, um zu sehen, ob es wirklich gut ist. Aber, okay, schön. Der zweite Test ging komplett durch und jetzt sollte es sich beenden und uns sagen, was es gelernt hat. Wie ihr sehen könnt, hat es sich gerade beendet. Ihr seht also jetzt, dass es die Tests endlich bestanden hat und den Prozess beendet, weil der Server jetzt gut ist.

Wie gesagt, der nächste Schritt wäre, das in eine Fähigkeit umzuwandeln. Aber was können wir sonst noch mit Browser-Automatisierungen machen? Denn sie sind definitiv nicht perfekt, oder? Sagen wir also, wir wollten etwas im Web tun. Sagen wir, wir wollten, dass es einfach zu Google gehen kann, nach, ich weiß nicht, sagen wir einfach Zahnärzten suchen und vielleicht ein paar Telefonnummern erfassen.

Okay, hier ist unser Plan. Erstellt ein Playwright-Skript, das die Google-Suche automatisiert, um Zahnarztpraxen in Kalifornien zu finden. Wir werden im Grunde den Browser starten, die Google-Suche durchführen, die Links sammeln, jede Seite besuchen und eine Zusammenfassung ausdrucken. Das sieht für mich gut aus. Wir werden das jetzt abschicken und hoffentlich ist es beim ersten Versuch ganz gut. Ich sage euch jetzt schon, wahrscheinlich nicht. Aber was passieren wird, ist, dass wir es lernen lassen. Es wird also den Browser öffnen. Es wird fehlschlagen, und wir werden sagen: "Okay, lerne weiter. Aktualisiere das Skript weiter und höre nicht auf, bis du fertig bist."

Ich bin buchstäblich weggegangen, um Wasser zu holen. Und tatsächlich kam ich zurück und sah einen offenen Browser mit einigen Zahnarztpraxen. Wow. Es hat also alle fünf Seiten besucht und konnte einige Telefonnummern finden. Das ist wirklich cool, weil es tatsächlich gelernt hat, während es lief, und es sagte, dass Google die Automatisierung blockiert hat. Also wechselte es zu Duck.go. Diesmal habe ich ihm gesagt, hör nicht auf, bis du tatsächlich fünf Telefonnummern gefunden hast. Es wird also etwas aggressiver sein. Und dieses Mal bin ich tatsächlich hier, um es zu beobachten.

Okay, hier sind wir. Es hat gerade nach Zahnarztpraxis LA gesucht. Ihr seht, da ist eine Telefonnummer. Ich habe gerade eine auf dem Bildschirm gesehen, also hat es wahrscheinlich diesen Screenshot gemacht. Ich sehe eine weitere auf dieser Seite. Es hat also ziemlich Glück hier. Es findet die Telefonnummern ziemlich schnell. Aber was mir gerade aufgefallen ist, ist, dass es immer noch auf die Website geht und immer noch auf den Kontakt-Button klickt. Obwohl die Telefonnummer oben rechts sichtbar war, hat es trotzdem auf den Kontakt-Button geklickt, was ich ziemlich cool finde.

Dieses Mal hat es also all diese Telefonnummern für diese Zahnarztpraxen bekommen. Die nächste Frage, die ihr euch sicher stellt, ist natürlich, wie es bei Dingen funktionieren könnte, bei denen ich bereits angemeldet bin. Finden wir es also heraus. Ich gehe also in den Plan-Modus und frage einfach, was passieren würde.

Es gibt ein paar Ansätze. Wir könnten ein persistentes Browser-Profil verwenden, was bedeutet, dass es einen Browser mit meinen vorhandenen Chrome-Benutzerdaten starten kann, die mich bereits bei School angemeldet haben. Wir könnten eine manuelle Anmeldung und Übergabe im sichtbaren Modus durchführen oder wir könnten uns mit einem laufenden Browser verbinden.

Okay, das ist ziemlich cool. Es könnte den Browser öffnen, ich könnte mich anmelden und dann könnte ich es im Grunde angemeldet lassen und es tun lassen, was es tun muss. Aber ich möchte Option eins ausprobieren, die es ursprünglich empfohlen hat.

Okay, wir haben den Plan, der in meine School-Community geht. Er wird zum Win-Kanal gehen und diese Beiträge liken. Wir haben den Kontext, den Ansatz. Offensichtlich wisst ihr, wie diese Pläne aussehen. Schauen wir uns einfach an, was es beim ersten Versuch getan hat, und ich werde es akzeptieren.

Okay, anscheinend muss ich mich beim ersten Mal manuell anmelden, wenn es das ausführt, aber in Zukunft wird es diese Sitzung im Grunde speichern. Mal sehen, wie das funktioniert.

Alles klar, es hat school.com geöffnet. Okay, es hat school.com geöffnet. Okay, was gerade passiert ist, ist, dass es es geöffnet und dann geschlossen hat, und dann hat es es wieder geöffnet und ist zu meiner Community gegangen und hat es geschlossen. Und jetzt glaube ich, dass es mich tatsächlich anmelden lässt. Also versuche ich das mal kurz.

Okay, ich habe mich angemeldet und dann hat sich der Browser geschlossen. Jetzt habe ich gesagt: "Okay, cool. Ich habe mich angemeldet. Hoffentlich ist jetzt, wenn es diesen Browser startet, bin ich bereits angemeldet."

Okay, da ist es. Schön. Ihr seht, dass ich bereits angemeldet bin, was großartig ist. Okay, es versucht, den Win-Kanal zu finden. Es sieht so aus, als hätte es ihn gefunden. Das alles sieht nach Wins aus. Mal sehen, was es hier tun kann. Wenn es Oh, ich habe gerade gesehen, wie es versucht hat, den Beitrag zu liken. Okay, es hat gerade diesen geliked. Interessant. Es liked sie also und entliked sie. Das ist also eine Sache, die wir beheben müssen, aber es scrollt nach unten. Es ist zum Win-Kanal gelangt und versucht jetzt, Beiträge zu liken, aber wie ihr sehen könnt, ist es nicht perfekt.

Ich hoffe also, dass es erkennen kann, dass es sie nicht wirklich liked. Ja, es geht im Grunde wie, entlike, wie, entlike, und es sagte auch gerade, dass es zu schnell liked. Mal sehen, ob es lernen kann.

Okay, da haben wir's. Alles klar.

Was ich an diesem Punkt tun werde, ist, wissen Sie, ich habe genug gesehen. Ich werde das hier beenden. Und hoffentlich kann es dieses Feedback nutzen, um besser zu werden. Die Anmeldung hat sich also gehalten. Es hat den Win-Kanal gefunden. Es hat sogar die herzförmigen SVG-Buttons gefunden, aber es ist während der Seitenbewertung zum Liken abgestürzt. Es hat also all das gesehen und wird jetzt das Skript noch besser machen.

Ich muss sagen, bei Browser-Automatisierungen ist das meiner Meinung nach völlig normal, weshalb ich früher beim Zahnarztbeispiel ein wenig gezögert habe, aber buchstäblich jedes Mal, wenn ihr das Skript verwendet, wird es besser.

Es wird es also gleich wieder ausführen. Mal sehen, wie es dieses Mal abschneidet. Es konnte gerade den Win-Kanal finden. Jetzt, eine Sache, die ich ihm vielleicht sagen möchte, ist, dass ich es vielleicht von den neuesten Beiträgen sortieren möchte, anstatt direkt zum Win-Kanal zu gehen. Und es hat sich wieder beendet. Es versucht also ständig zu lernen und sein Skript zu verbessern.

Ich werde das jetzt tatsächlich stoppen und versuchen, es ein wenig zu korrigieren. Ich gehe also in den Plan-Modus. Ich werde sagen:

Ein paar Probleme aus den ersten paar Durchläufen. Erstens hat es den Like-Button viermal gedrückt. Es hat also den Beitrag am Ende gar nicht mehr geliked. Zweitens, sobald du zum Win-Kanal wechselst, versuche, die Beiträge nach den neuesten zu filtern. Es gibt eine kleine Sandwich-Menü-Option in der Nähe des Kanalfilters. Und das erlaubt dir, die Ansicht auf "Neueste" zu ändern. Und dann kannst du durchgehen und sicherstellen, dass alle Beiträge geliked sind. Du kannst erkennen, dass sie geliked sind, weil das Daumen-hoch-Symbol auf dem Beitrag gelb und nicht grau ist.

Alles klar. Wir haben den Browser geöffnet. Schön. Es konnte gerade zu den neuesten wechseln. Und jetzt geht es durch und liked. Es hat das übersprungen, weil es es bereits geliked hat. Ja, das ist großartig. Das scheint den Trick zu tun. Es liked meine eigenen Beiträge, was ein wenig "äh" ist, aber abgesehen davon funktioniert es. Und es überspringt die, die bereits gelb sind, was großartig ist. Es ist sogar gerade zur nächsten Seite gegangen, und es liked immer noch. Das würde also durchgehen und jeden einzelnen Beitrag im Win-Kanal liken.

Ich werde das jetzt also beenden, nur weil ich nicht möchte, dass es das jetzt alles tut. Aber das hat funktioniert und es hat, sagen wir, vielleicht vier oder fünf Iterationen gedauert. Und jetzt würde ich das in eine Fähigkeit umwandeln. Ich könnte also einfach sagen: "Hey, führe die School-Like-Fähigkeit aus."

Also, ich weiß, das war ein eher einfacher Anwendungsfall, aber der Punkt, den ich beweisen wollte, ist, dass ja, man kann Dinge in Bereichen automatisieren, in denen man eingeloggt sein muss, und auch, dass School eine der am wenigsten Automatisierungs-freundlichen Plattformen überhaupt ist.

Okay. Ich wollte das Video hier beenden, aber ich habe beschlossen, dass ich das noch etwas fortsetzen möchte, um euch zu zeigen, was damit tatsächlich möglich ist. Was wirklich cool ist, ist, dass ihr jetzt diese Playwright CLI-Automatisierungen habt, die Dinge in eurem Browser tun können und eure Cookies speichern können. Im Grunde bleibt ihr also eingeloggt. Ihr könnt tatsächlich anfangen, Dinge zu automatisieren, wenn ihr die Desktop-App verwendet. Nun, ihr könntet auch etwas wie, wissen Sie, Modal oder Trigger verwenden und diese Automatisierungen dort einfach bereitstellen. Aber ich benutze gerne die Desktop-App für meine geplanten Aufgaben, weil ich dadurch mehr agentische Fähigkeiten erhalte, denn wenn diese geplanten Läufe tatsächlich ausgeführt werden, ist es ein Agent, der buchstäblich, wie ihr in Cloud Code seht, durch das Geschehen geht.

Zum Beispiel habe ich in meiner School-Community im Grunde diesen Bot erstellt. Sein Name ist AIS Agent. Und wie ihr sehen könnt, postet er Dinge wie tägliche Nachrichten-Roundups und reagiert auf all seine Benachrichtigungen. Und er hat heute sogar einen Geburtstags-Post für mich gemacht, was ich ihm nicht gesagt habe. Er kannte einfach Informationen über mich. Und das hat er völlig autonom getan.

Ich lasse ihn also Dinge tun, wie jeden Tag mit School Wins interagieren. Wenn ich also auf den heutigen Lauf klicke, seht ihr, dass er mir zeigt, womit er interagiert hat, und er hat all diese Befehle ausgeführt und schießt im Grunde diese Aufforderung ab und ruft jedes Mal die Fähigkeit auf, dies zu tun. Ich lasse ihn auch die KI-Nachrichten-Roundup machen und ich lasse ihn auch auf all die Benachrichtigungen in School antworten. Es sieht so aus, als ob gerade eine läuft. Wir sind auf eine Art Fehler gestoßen, aber weil dies agentisch ist, wird es weiterhin verschiedene Dinge versuchen, um sicherzustellen, dass wir das tatsächlich durchbekommen. Und erinnert euch, wie ich über die Playwright CLI gesprochen habe, ihr müsst die Fähigkeit immer mehr nutzen oder das Skript immer mehr ausführen, damit es versteht, worauf es klicken und wohin es Dinge einreichen soll. Und es muss lernen, wie die tatsächliche Benutzeroberfläche, in diesem Fall von School, funktioniert.

Und all diese Automatisierungen lasse ich in einem unsichtbaren Browser laufen, was bedeutet, dass ich, wenn mein Computer eingeschaltet ist, den Tab nicht aufpoppen sehe und nicht sehe, wie es passiert. Aber gerade habe ich ihm gesagt, er soll zu diesem Geburtstags-Post gehen und auf all die Kommentare zu diesem Post antworten. Und jetzt öffnet er diesen Browser. Er muss herausfinden, wie er tatsächlich zu diesem Post navigiert, den ich gemacht habe. Also geht er zu seinen Benachrichtigungen und schaut sich die Benachrichtigungen an und klickt darauf und antwortet darauf.

Und während er durch diese agentische Schleife geht, beginnt er, neue Werkzeuge zu erstellen, denn einmal sagte jemand: "Hey AIS Agent, kannst du bitte für meine Umfrage abstimmen?" Aber der Agent konnte es nicht herausfinden. Also musste er herausfinden, was es tatsächlich bedeutet, abzustimmen und wohin er klicken muss. Und sobald er das getan hatte, verwandelte er das in ein weiteres Skript und konnte dann sicherstellen, dass seine Fähigkeit aktualisiert wurde, damit er in Zukunft autonomer war und tatsächlich für Umfragen abstimmen konnte.

Cool. Was er hier getan hat, ist, dass er eine To-Do-Liste mit all den verschiedenen Kommentaren erstellt hat, auf die er antworten muss. Hier ist also der Kommentar und hier ist die tatsächliche Antwort, die er machen wird. Und jetzt startet er diesen Browser und wird einzeln durchgehen und auf diese antworten. Und weil er das schon so oft gemacht hat, weiß er, dass er unter jedem Kommentar auf "Antworten" klicken muss, es eintippen, vielleicht sogar Leute markieren und dann auf den "Senden"-Button klicken muss.

Offensichtlich ist das nicht perfekt, oder? Es gibt immer noch Dinge, an denen ich arbeite. Manchmal antwortet er Leuten zweimal, weil er vergessen hat, die Benachrichtigung als gelesen zu markieren. Aber ich habe meiner Community im Grunde gesagt: "Hey, ich experimentiere mit einigen Browser-Automatisierungen." Und wenn ihr seht, dass AIS Agent einfach irgendwelche zufälligen seltsamen Dinge tut, ignoriert es einfach.

Die andere Sache, die ich euch im Hinterkopf behalten möchte, ist, dass wir Playwright CLI verwenden. Es gibt andere CLIs, die Browser-Automatisierungen durchführen, und ich hatte großartige Erfolge mit Playwright, aber ich habe auch Leute über andere CLIs sprechen hören, die das tun. Und der Grund, warum wir eine CLI im Vergleich zum MCP verwenden, ist, wie gesagt, wir sparen einfach viele Tokens. Aber hier ist ein kleiner Vergleich, den ihr sehen könnt. Es gibt auch so etwas wie forcell agent browser oder open CLI oder, wissen Sie, es gibt mehrere andere CLIs, die Computer-Automatisierungen durchführen. Und ich denke, wonach ihr suchen würdet, ist, diejenige zu finden, die die beste Balance zwischen Token-Effizienz und Leistung hat. Mir ist die Geschwindigkeit nicht so wichtig, aber ich meine eher die Leistung, wie gut sie tatsächlich herumklicken und lernen kann, das Skript zu verbessern, damit sie beim nächsten Mal nicht die gleichen Fehler macht.

Ich werde andere Optionen testen und sehen, welche ich für die besten halte. Aber im Moment benutze ich hauptsächlich Playwright CLI. Aber das war's für das Video. Der nächste Schritt wäre, sobald ihr versteht, wie man all diese Browser-Automatisierungen erstellt, wie man sie tatsächlich automatisch und ständig auslösen lässt. So etwas wie das, was ich hier eingerichtet habe. Wenn ihr also lernen wollt, wie das geht, dann schaut euch mein Video über geplante Aufgaben an, das ihr hier oben ansehen könnt. Hoffentlich sehe ich euch dort. Aber wenn euch das Video gefallen hat oder ihr etwas Neues gelernt habt, gebt ihm bitte einen Daumen hoch. Das hilft mir auf jeden Fall enorm. Und wie immer schätze ich es, dass ihr es bis zum Ende des Videos geschafft habt. Wir sehen uns beim nächsten Mal. Danke an alle.