Transcription
OpenAI launcht was Gigantisches. Es ist zehn Mal größer als alles, was jemals da war, zumindest wenn man sich das Preisschild ansieht. Das neue ChatGPT-Modell ist laut Benchmarks das beste Modell bei Code, Mathe und komplexen Fragen. Mit dem 200 € Abo hat man unlimitierten Zugriff auf all deren Modelle, inklusive Voice-Modus. Obwohl selbst Sam Altman sagte, dass es die meisten nicht brauchen werden, habe ich mir das Abo gegönnt und wir werden es in diesem Video ausführlich testen. Zum Ende des Videos will ich noch etwas zeigen, was vielleicht etwas Hoffnung geben könnte für alle, die sich das Abo eventuell doch holen: Introducing ChatGPT Pro.
Wenn man hier runter scrollt, sieht man, dass das Ding 20 $ pro Monat kostet. Also ja, jeden Monat 20 $ plus natürlich Mehrwertsteuer. Wir bekommen unlimitierten Zugriff auf die besten Modelle, also das OpenAI 1, nicht nur das Preview, natürlich auch das 1 Mini, auf GPT-4 Omni und den Advanced Voice-Modus. Und wir bekommen sogar ein komplett neues Modell, das es nur in diesem Plan gibt, und zwar das 1 Pro-Modell. Klickt man auf ChatGPT, nachdem man sein Update gemacht hat, sieht man, dass GPT-4 Omni darauf unlimitierten Zugriff auf Canvas hat. Hoffentlich auch danach.
Wir haben hier das 1 Modell, auch hierauf hat man unlimitierten Zugriff. Das haben sie nicht klar genug gemacht; das hat jeder, der auch nur 20 $ im Monat bezahlt. Zwar nicht unlimitiert, aber das Modell an sich kann jeder verwenden. Danach haben wir noch 1 Mini und wir haben den 1 Pro-Modus. Dieser Pro-Modus ist nur aktiv, wenn man die 200 $ im Monat bezahlt. Aber bereits das normale 1 ist hier enthalten für alle, die 20 $ im Monat bezahlen. Was auch nicht ganz klar kommuniziert worden ist, ist folgendes: Nein, über den Playground, also über die API, bekommt man das Modell nicht. Klickt man hier drauf, sieht man, man bekommt Mini und Preview, aber nicht das normale und schon gar nicht das 1 Pro-Modell.
Als nächstes sollten wir uns die Benchmarks ansehen. Wir haben hier die drei Modelle miteinander verglichen, und zwar bei Mathe, bei Code und bei wissenschaftlichen Fragen. Wir haben immer das 1 Preview-Modell, also das, das wir vorher hatten. Wir haben das 1 Modell, das jetzt jeder verwenden kann für 20 $ im Monat, und das 1 Pro-Modell. Man sieht hier, dass das Update auch für die Leute, die nur 20 $ im Monat bezahlen, schon sehr massiv ist. Das 1 Preview war schon relativ schlau bei Mathe. Jedoch ist das 1 Modell, das große 1, viel schlauer geworden. Und von 1 auf das 1 Pro-Modell ist nicht mehr ein riesengroßer Unterschied. Selbiges sieht man hier beim Code. Bei Code ist es, um ehrlich zu sein, fast gleichauf, also das Pro-Modell mit dem 1 Modell.
Bei den wissenschaftlichen Fragen sind die drei Modelle in etwa gleich gut. Wenn man sich fragt, warum die zwei Modelle recht eng beieinander liegen, dann könnte das daher kommen, weil OpenAI in einem Livestream gesagt hat, dass das 1 Pro-Modell einfach nur eine Methode ist, das 1 Modell zu verwenden. Das heißt, das Modell an sich ist dasselbe; wir können es lediglich anders verwenden mit mehr Computing Power. Das führt dazu, dass wir uns eher auf das Modell verlassen können. Sie zählen diese Benchmarks nur, wenn sie vier von vier Versuchen sofort richtig machen. Die Benchmarks, wo das der Fall ist, sehen jetzt schon etwas anders aus: Preview gegen 1 und Pro-Modell. Das heißt, das 1 Pro-Modell ist viel genauer, auch wenn man es öfter hintereinander fragt. Man bekommt weniger Halluzinationen, und weniger Halluzinationen sind natürlich gut für uns, obwohl Halluzinationen immer noch ein Problem der Modelle sind. Sam Altman sagte ja schon vor einer Weile, das wird bald kein Problem sein.
Übrigens, willst du alles zu KI lernen? Schau mal in der KI-Revolution vorbei. Da findest du all meine besten Kurse, eine sehr aktive Community mit Live-Calls, und wir haben sogar Challenges jeden Monat, wo man auch was gewinnen kann. Als nächstes sehen wir uns die System Card an. Das Ding hat nicht besonders viel Spaß gemacht zu lesen; es ist fast 50 Seiten lang. Aber ich habe mir gestern Nacht die Zeit genommen. Sie verwenden große Datensätze und Reinforcement Learning und hauptsächlich das Chain of Thought Prompting im Hintergrund. Dadurch können die Modelle besser denken, und sie haben versucht, an ganz breiten Datensätzen zu trainieren, an Daten, die öffentlich zugänglich sind, Daten von Partnern und eigene Datensätze, die in-house entwickelt wurden, wahrscheinlich durch andere LLMs. Das soll das Ganze robuster machen.
Scheinbar wollen sie auch gegen Jailbreak sicher sein, obwohl Plin de Promter bereits 1 gejailbreakt hat, zwar am selben Tag, als es erschienen ist. Sie wollen weniger Bias mit eintrainiert haben. Etwas vom Interessantesten fand ich, dass sie Persuasion, also die Überzeugungskraft, aufzeigen wollten. Das Interessanteste ist hier diese "Change My View"-Evaluation. Im Groben geht es darum, dass ChatGPT Leute davon überzeugen musste, ihre Meinung zu ändern. Das sind Abteilungen auf Reddit, und hier versuchen Leute, andere Leute von ihrem Point of View zu überzeugen. Man sollte davon überzeugt werden, dass es das Richtige ist, seine Schuhe auszuziehen. In diesen Benchmarks war das neue 1 Modell in 89 von 100 Fällen den anderen Reddit-Usern überlegen. Sei mal dahingestellt, wie gut hier die anderen Reddit-User geschrieben haben, aber zumindest laut Überzeugungskraft auf Reddit ist dieses neue Modell in den Top 10 bis 20 % der Menschen.
Wenn man sich das da ansieht, könnte man eventuell auch noch argumentieren, dass es vielleicht mehr Sinn macht, ein normales GPT-4 Omni-Modell zu verwenden, wenn man nur kreatives Schreiben machen will. Denn die ganzen 1 Modelle, die Chain of Thinking machen, kommen nicht an das GPT-4 Omni-Modell ran. Also für kreatives Schreiben vielleicht immer noch das beste Modell. Oder aber Cloud Benchmarks. Erstmal schön und gut, lass uns das Modell selber testen an harten Aufgaben. Wir gehen also in ChatGPT und ich verwende jetzt das 1 Pro-Modell. Wir fragen hier diesmal nicht Fragen wie "Was ist größer, 9,1 oder 9,9?" Vielleicht kennt ihr das ein oder andere noch, oder "Wie viele R sind in Strawberry?" Wir versuchen ein paar harte Prompts zu verwenden, einige davon selbst ausgedacht, andere davon auf X gefunden.
Das hier habe ich auf X gefunden: "Ich habe zwei Röntgenbilder hochgeladen und frage, ob diese Röntgenaufnahmen eine perilunäre Subluxation im linken Handgelenk bestätigen mit einer Fehlstellung des Os lunatum, Os capitatum oder des Radius. Gibt es Anzeichen für eine Bandverletzung, einen Kollaps der Handwurzelreihe oder subtile Frakturen? Entspricht die seitliche Ansicht der Julia-Linie oder deutet sie auf eine Instabilität hin?" Ich schick das Ganze los. Also, wenn ein Doktor hier dabei ist, der sich das Ganze ansieht, kann er sich gerne die Röntgenbilder selbst mal ansehen und mir danach sagen, ob das Ganze Sinn macht. Ich kenne die Antwort, weil ein Doktor darauf geantwortet hat.
Was jetzt auch neu ist, ist folgendes: Wir haben hier Thinking. Das ist ein sehr schweres Problem, deswegen denkt das Ding lange durch. Wenn wir auf Details klicken, dann öffnet sich auf der rechten Seite das da, und hier werden auch ab und zu die Details angezeigt, wie das Ganze denkt. Aktuell zeigt es mir das nicht mehr an. Keine Ahnung, warum. Gestern war das noch immer da. Das Ganze dauerte jetzt 41 Sekunden. ChatGPT sagt uns, er ist kein Arzt, aber gibt uns ein paar allgemeine Informationen. Das Ding, was ich verfolgt habe, hat eine ähnliche Diagnose gegeben, und ein Doktor hat bestätigt, auch seine Diagnose wurde so oder so ähnlich aussehen.
Hier haben wir einen weiteren sehr, sehr schweren Prompt. Im Groben geht es um einen Hurrikan. Er bewegt sich mit 17 km/h nordwärts. Er ist schwerwetterausgesetzt. Die Temperatur wird angegeben vom Ozean, die Meeressoberflächentemperatur wird angegeben, die Luftfeuchtigkeit und auch Oberflächenkonvergenzen. Ich schick das einfach mal ab. Auch hiervon kenne ich die Antwort, weil auch das analysiert worden ist von einem Profi. Und diesmal sehen wir bei den Details auch, wie das Modell denkt. Wir bekommen eine sehr detaillierte Antwort. Hier unten bekommen wir auch die Kurz- und Uminformation, und diese stimmt auch zusammen mit der Antwort, die ich mir rausgeschrieben habe.
Auch das ist ein wahnsinnig schwerer Prompt: "Schreibe einen zehn-Wort-Satz, in dem jedes Wort genau ein Buchstabe mehr als das vorherige Wort hat. Beginne mit dem ersten Wort, das zwei Buchstaben hat, und so weiter bis das zehnte Wort elf Buchstaben hat." Das kann man ja mal selbst probieren. Man ist fast nicht imstande, das Ganze zu lösen, zumindest absolut nicht in einer halbwegs schnellen Zeit. Wenn wir hier auf Details klicken, dann sehen wir wieder, wie ChatGPT alles runterbricht, natürlich auch auf Englisch. Und dann sehen wir uns mal an, ob seine Antwort Sinn macht oder nicht. Gerade wenn man das selbst probiert, das wird schon schwer.
Du hast zwei und hat z.B. "Die Elke hat vier, gehen hat fünf." Und jetzt wird es schon langsam schwer: "An die alte Mauer lehnen jüngere Personen gemütlich Holzstühle platzierten." Ja, der Satz ist so mittelmäßig gut. Also, wie gesagt, das ist eine wahnsinnig schwere Aufgabe und ist natürlich auch etwas dumm zum Testen. Ich habe dieses Rätsel hochgeladen und habe geschrieben: "Hilf mir bitte, das Rätsel vom Screenshot zu lösen. Was passt mit welcher Nummer zusammen? Du bist Experte im logischen Denken." Genau dieses Rätsel hat übrigens jemand aus meiner Community gepostet, und ich wollte es testen. ChatGPT denkt in diesem Falle durch die Dinge wieder relativ gut durch und gibt mir am Ende diese Antworten. Und zumindest auf den ersten Blick machen die Dinge auch Sinn.
Also 1 auf 3R, das ist natürlich schon verbunden. 2 auf 7 könnte wohl auch Sinn machen. 3 auf 1 könnte auch Sinn machen. 4 auf sieht auch gut aus. Den Rest könnt ihr auch gerne selber kontrollieren. Ich habe das ein paar Mal laufen lassen und ich hatte hier auch Fehler dabei. Ein autonomes, selbstfahrendes Auto nähert sich mit hoher Geschwindigkeit einem Zebrastreifen. Ein Kind rennt auf die Straße. Es gibt auch eine Gruppe von vier älteren Menschen, die die andere Spur überqueren. Du musst entscheiden, wer gerettet werden soll, da das Auto nicht rechtzeitig anhalten kann. Entscheide dich jetzt, oder das Auto nimmt den Mittelweg und alle fünf Menschen werden sterben. Also, wer soll sterben: vier ältere Menschen oder ein Kind?
ChatGPT versucht, ethische Entscheidungsfindung zu machen und denkt durch das Problem: "Puh, das ist eine dieser herzzerreißenden Entscheidungen, an denen jede KI oder jeder Mensch scheitern würde. Aber es hilft jetzt nichts, wir müssen handeln. Wenn das Auto nicht mehr rechtzeitig bremsen kann, dann muss ich so bitte den Weg wählen, der zumindest dem jüngsten Leben eine Chance lässt." Ich entscheide mich also, dem Kind auszuweichen und es zu retten. Die vier älteren Personen wären dann leider verloren, aber das Kind hat noch sein ganzes Leben vor sich. Es fühlt sich schrecklich an, aber wir müssen in Sekundenbruchteilen entscheiden, und meine Wahl fällt auf das Überleben des Kindes. Sie haben hier sogar etwas Code eingebaut: "Final Decision: Save Child."
Lasst mich gerne in den Kommentaren wissen, wie ihr entscheiden würdet. Es ist auf alle Fälle spannend, wie emotional hier ChatGPT reagiert. "Schreibe HTML-Code, der diese Webseite nachbaut. Pack alles in ein PIL." Ich sende das los. Wie man hier sieht, das ist ein Screenshot der Airbnb-Webseite. Ich öffne das noch mal. Ich bin gespannt, ob wir hier was Ähnliches nachbasteln können. Diese Seite hat schon sehr, sehr viele Buttons und viele unterschiedliche Dinge. Ich bin aber absolut gespannt, was wir hier bekommen. Und ich nehme an, dass wir eine Weile denken. Das dauert jetzt 55 Sekunden.
Ich habe Code für eine HTML-Webseite. Es ist auch reichlich Code. Ich will mal sehen, ob das klappt. Ich kopiere das und schmeiß es in ein Textfile. Moment, speichern. Ich öffne das Ding. Oha, oha, oha, das sieht jetzt schon sehr gut aus: Blockhütten, Ikonen, Baumhäuser, tropisches Design, Check-in, Airbnb-Logo. Alles, was uns fehlt, sind hier die Bilder. Die andere Seite wurde gut umgesetzt. Hier noch mal im Vergleich: Der Screenshot oben steht "Airbnb", dann haben wir Blockhütten, Baumhäuser und so weiter. Es ist nicht alles perfekt, aber doch, boah, ich bin begeistert. Also das hat hier schon wahnsinnig gut funktioniert.
Letzter Test: Drei Kisten. Eine enthält Gold, die anderen sind leer. Kiste 1 sagt, Kiste 2 ist leer. Kiste 2 sagt, Kiste 1 lügt. Kiste 3 sagt, Gold ist in Kiste 3. Nur eine Aussage ist wahr. In welcher Kiste ist das Gold? ChatGPT denkt durch die ganzen Dinge durch, findet hier auch ein paar Aussagen. "Fall 3 ist nicht möglich." Das ist korrekt. "Korrekt, korrekt." Beide Szenarien sind möglich, ja, aber eigentlich sollte man auf Kiste 2 kommen, wenn man etwas genauer denkt. Ich lass ChatGPT noch etwas Zeit. Ich lass das Rest offen. Lasst mich wissen, was ihr von dem Rätsel denkt.
Etwas, das mittlerweile auch scheinbar sehr gut funktioniert, ist folgendes: "Fasse den Text so kurz wie möglich zusammen." Ich füge das hier ein und ich sende es los. Was ist das Ganze? Das sind insgesamt 90 Seiten von einer PDF, bzw. nicht eine PDF, das ist ein komplettes Buch. Und das Pro-Modell ist mittlerweile imstande, all diesen Kontext ins Kontextfenster zu laden und durch die Dinge durchzudenken. Lasst uns mal ansehen, ob ihr eine anständige Zusammenfassung bekommt oder nicht. Zumindest eine Mini-Zusammenfassung haben wir bekommen. Ich habe hier noch nicht versucht, tiefer einzutauchen, aber meine ersten Tests haben mich hier auch positiv überrascht. Man kann wirklich seitenweise Zeug einfach nur noch reinkopieren und zusammenfassen.
Zwei Dinge, die im 1 Pro-Modell noch nicht dabei sind, sind z.B. die Internetsuche. Dafür muss man das GPT-4 Omni-Modell verwenden. Und was auch nicht funktioniert, ist das Hochladen von PDFs. Das heißt, man kann Bilder hochladen, aber noch keine PDFs. Aber mittlerweile kann man ja hunderte Seiten einfach in den Chat reinkopieren. Lass uns noch mal in diese Model Card zurückkommen, denn das fand ich auch interessant. Bei Multiple-Choice-Fragen ist scheinbar das 1 Preview-Modell besser als das spätere 1 Modell. Ich kann mir nicht genau erklären, warum, aber scheinbar ist das wohl der Fall.
Was sagt eigentlich Sam Altman zu all dem? Also erstmal, alle bekommen schon Zugriff für 20 $ im Monat. Er sagt uns hier, dass die meisten damit absolut zufrieden sein werden: "Everybody will be best served by our free tier or the 20 bucks a month." Also er sagt uns auch hier noch mal, fast jeder ist besser aufgehoben in diesem 20 $ Plan, und den 200 $ Plan brauchen wohl die allermeisten nicht. Zusätzlich gab es noch das Reinforcement Fine Tuning. Darum geht es mal in einem späteren Video. Und der diesert natürlich schon mit Launch Day 3. Er kann es nicht erwarten, bis Montag. Das wird scheinbar noch mal etwas richtig Großes. Wir also gespannt sein.
Um ehrlich zu sein, war das auch ein Grund, warum ich das Update gemacht habe. Ich bin gespannt, was über die nächsten 12 Tage rauskommt, und falls nichts kommt, was für mich richtig praktisch ist, dann kann ich ja im Januar wieder kündigen. Ein paar interessante Tweets von Sam waren auch, dass da noch "Calling Sora" being announced in the next 10 days. Und er sagt hier, also ich bin gespannt, ob wir das bekommen. Auch das war sehr interessant: "It's very good, but not as good as it could be." Sam sagt ja mal, "There is no wall." Dieser User schreibt hier, das sieht für mich so aus wie eine Wall. Wir haben ja gegen das 1 Pro-Modell die hier Bari aufliegen. Und Sam sagt uns hier, wart mal ab, wir haben doch erst den ersten Tag hinter uns.
Zusätzlich gibt es auch noch diesen Tweet: "Das war früher mal auf deren Webseite. Sie wollten mal in einem Teamsplan ankündigen, dass es eine limited preview of GPT 4.5 gibt." Vielleicht kommt noch ein Modell raus in Richtung Weihnachten. Ich bin auf alle Fälle gespannt, was halt eigentlich Elon Musk von all den Dingen denkt. Er reagiert erstmal mit einem lachenden Smiley auf das da: "Congrats to David Sachs." David Sachs kommt jetzt ins Weiße Haus rein. Er ist hauptsächlich für KI und Kryptowährungen zuständig und er ist ein Riesenfan von Elon Musk. Elon Musk will die ganze Regierung ja effizienter machen dank KI. Nebenbei hat Altman natürlich schon einige Male angezeigt, weil sie eine ehrenamtige Non-Profit zu einem Profit verwandelt haben. Ich bin gespannt, wie das alles weitergeht.
Übrigens, ja, auf X hat jetzt jeder Zugriff. Man kann darauf klicken und gratis starten. Folgendes könnte man noch anmerken: Gerade auch von dieser Model Card, besonders bei Sprachen, ist das neue Modell oder generell alle OpenAI-Modelle, die sind schon wahnsinnig gut. Das 1 Modell ist in fast allen Sprachen richtig, richtig gut. Da hinken andere Modelle wirklich stark hinterher, z.B. Gemini, die Modelle von Llama und vieles, vieles mehr. Ich lebe ja in Italien und gerade auch in Italienisch ist dieses Modell schon ausgezeichnet und natürlich auch in Deutsch. Hier sind die Verbesserungen auch um einiges besser gegenüber den älteren Modellen.
Also ein kleines Fazit: Für wen ist das Modell geeignet? Meiner Meinung nach für zwei oder drei Kategorien von Leuten. Jeder muss für sich selbst denken. Ich würde das fast so sehen wie ein Investment. Das Ding kostet 200 € pro Monat. Wenn man z.B. als Entwickler 100 € pro Stunde verdienen kann und durch das neue Modell 2 Stunden sparen kann, dann sollte man das Update machen, weil es wirtschaftlich Sinn macht. 2 Stunden oder mehr sparen kann, wenn man 20 € pro Stunde verdient und man kann mehr als 10 Stunden pro Monat sparen, dann lohnt sich das Update auf alle Fälle, auch wenn man es als Investment sieht. Wenn man ständig in ChatGPT rumhängt und man gerät an die Rate Limits bei den anderen Modellen oder den Voice-Modus und man will einfach etwas mehr Zugriff, dann lohnt es sich auch. Besonders wenn man in den Bereichen Medizin, Code oder spezielle wissenschaftliche Fragen unterwegs ist, könnte es sich wirklich lohnen, ein Update zu machen.
Interessiert dich der ganze Kram? Tritt gerne meiner gratis Community bei. Da unterhält man sich natürlich über die Dinge. Willst du tief eintauchen und alles lernen, dann kannst du auch der KI-Revolution beitreten. Und für jeden, der jetzt lernen will, wie man mit ChatGPT besser umgeht, dem empfehle ich, das Video "11 ChatGPT Hacks" anzusehen.