Transcription
Künstliche Intelligenz verlässt jetzt das Chatfenster. Chat und Cloud visualisieren ab sofort alles für dich und arbeiten nahtlos in Excel und PowerPoint weiter. Wir schauen uns gleich an, wie du es für dich nutzt und welches Tool gerade wirklich führend ist.
Microsoft gibt uns schon einen klaren Hinweis mit Copilot Cower. Dieses integriert jetzt inic Modelle, während Google sich auf den eigentlichen Unterbau fokussiert mit Gemini Bedding 2, dem ersten nativ multimodalen Bedding Modell, dass deine Texte, Bilder, Videos, Audios und Dokumente in denselben Vektorraum einbettet.
Was du jetzt über KI Wissenspeicher wissen musst, besprechen wir gleich live mit einem deutschen KI Unternehmer, der gerade eine 20 Millionen Dollar Runde abgeschlossen hat und sich mit 70 Mitarbeitern in Köln, Denver und New York ausschließlich mit dieser Frage beschäftigt.
Diese Woche war mal wieder super viel los in der KI Welt und ich fasse dir wie jede Woche seit nun zwei Jahren alles kompakt zusammen, sodass du die Abkürzung zu den Infos hast, die dich in der Praxis wirklich voranbringen, um Zeit zu sparen und mehr Geld zu verdienen. Mein Name ist Leonard Schmeding, also starten wir direkt rein.
Künstliche Intelligenz verlässt nicht nur die Chatbox, sondern wandert jetzt auch immer mehr in die physische Welt und in der Folge in deinen Haushalt. Figer AI, das Unternehmen hinter dem Figer 3 Human Roboter, veröffentlicht einige Updates. Und zwar kann Figer jetzt dein Haushalt für dich schmeißen. kann bimanuell Gegenstände einsortieren, also Gegenstände mit der einen Hand einsammeln und greifen und dann mit der anderen Hand ein Korb halten, in das die Gegenstände einsortiert werden. Es kann Werkzeuge wie eine Sprühflasche bedienen, es kann aber auch den Fernseher an und ausschalten. Es kann Gegenstände wie Kissen auf den Ursprungszustand zurückschmeißen.
Und das Besondere hierbei ist, dass es sich nicht um eine teleoperierte Demo handelt oder um neu gecodete Fähigkeiten, so wie es ja bei den meisten Demos da draußen aktuell der Fall ist, die du so im Internet siehst. Sie sind meistens Zieleoperiert oder die Fähigkeiten wurden aufwendig vorprogrammiert. Das ist hier explizit nicht der Fall, sondern Feger hat lediglich einige neue Beispieldaten bekommen. Das schreibt das Unternehmen eben selbst. Ein einziges Modell lernt neue Fähigkeiten rein durch einfache Beispiele aus der realen Welt.
Und das ist wichtiger als die meisten denken, denn du brauchst jetzt nicht mehr große Trainingsläufe oder eben enorme Aufwände, um diese Fähigkeiten einzu programmieren, sondern das Ziel ist, dass ich die Modelle in Echtzeit auf Basis neuer Beispiele, die sie bekommen, neuer Trainingsdaten, verbessern können und das unterschätzen ja auch die meisten, dass Human Roboter kollektiv lernen können. Ja, also wenn ein Roboter etwas lernt, weil diese basieren ja alle auf dem gleichen Modell, laufen auf dem gleichen Modell, dann können die neue Fähigkeit auch alle anderen humanöen Roboter und das macht das ganze System natürlich deutlich skalierbarer und genau dieses Verständnis haben wir auch schon lange in Deutschland. Ich war selbst diese Woche an der Theo München, habe dort mit einigen Robotikern und Robotikprofessorin genau über dieses Thema gesprochen. Da werden übrigens schon bald ein paar sehr spannende Interviews nur zu diesem Thema Homaniü Roboter in der Tiefe erscheinen, wenn ich das interessiert.
Und die Theo München, die veröffentlicht ein großes Update und zwar das weltweit größte Trainingszenter für humanoide Roboter. Und da diese Meldung so wichtig ist, hören wir kurz rein.
Physical AI does not emerge by accident. Physical AI requires structured training and also data. The new initiative between TUMI robotics and of course the Munich Institute of Robotics and Machine Intelligence is for us one of the best way for having convergence between corporate and university. We are going to create one of the largest data farming center in order to develop our own proprietary foundation models and deploy foundation model.
Ja, so in Deutschland in Kooperation der Theo München und neuer Robotics wird das weltweit größte Forschungs- und Trainungszentrum für Robotik im wissenschaftlichen Bereich entstehen. Und es geht eben genau um dieses Problem, was wir gerade eben und immer wieder hier auf dem Kanal schon skizziert haben und auch David Regie auch von Neurer Robotics noch mal konstatiert, der entscheidende Wettbewerbsfaktor in der intelligenten Robotik ist nicht mehr die Mechanik, sondern er liegt in den Daten, wer über hochwertige Realitätsnah Trainingsdaten verfügt, definiert das Tempo und demnach ist diese Entwicklung für allich in Deutschland natürlich absolut zu befürwor.
Ja, aber auch die KI hinterm Bildschirm bekommt immer mehr Fähigkeiten und zwar Skills. Skills sind eine der wichtigsten und mächtigsten Funktionen, die es gerade ganz grundsätzlich im Bezug auf das Arbeiten mit KI Systemen gibt. Und genau diese werden jetzt auch von Chat GBT integriert und wurden jetzt bereits ausgerollt im Business und Enterprise Plan leider und ich verstehe echt nicht warum. Ja, weil es ist so wichtig und so nah liegend noch nicht in den normalen persönlichen Plänen, aber wenn du im Business, also im Teampplan bist, na, dann solltest du jetzt auch Zugriff auf Skills in Chat GBT haben, genauso wie auch bald auf Sora. Also Open AI plant Sora nahtlos in Chat GBT zu integrieren. Bedeutet, du wirst dann auch über Chat GBT direkt Videos erstellen können.
Ja, das größte Update ist jetzt aber der interaktive Lernmodus in Chat GBT. Was bedeutet das? Du erhältst von ChatGBT ab sofort nicht mehr rein textbasierte Antworten, sondern visuelle interaktive Erklärungen. Diese Funktion ist bereits für alle verfügbar. Du brauchst dafür nichts machen, selbst im kostenlosen Plan und kannst einfach etwas schreiben, wie hilf mir den Satz des Pythagoras zu verstehen und jetzt habe ich ihr diese interaktive Visualisierung von Chat GBT erhalten.
Ja, du solltest sich aber nicht zu früh freuen, das ist nämlich extrem beschränkt von Chat GBT. Also, wenn ich alleine sowas sag wie, erkläre mir exponentielles Wachstum anhand der Compound Interest Formel, dann erstellt er jetzt hier keine interaktive Visualisierung mehr, sondern schreibt hier einen Codechnipsel, der ja nicht mal ausführbar ist und einen Fehler auswirft und Open AI schreibt selbst das jetzt besonders relevant für Schüler der Oberstufe und Studenten und wir planen das interaktive Lernen im Laufe der Zeit auf weitere Fächer auszuweiten und kontinuierlich Tool zu entwickeln, die das Lernen mit Chat GBT unterstützen.
Und das übersehen halt die meisten, ich sag dazu gleich, aber noch mal abschließend etwas, denn zunächst würde ich hier mal auf Cloud schauen. Diese ziehen nämlich innerhalb kurzer Zeit nach und veröffentlichen eine, ich würde sagen, deutlich bessere Funktion in der Beta. Ja, das heißt auch in Cloud ist diese Funktion jetzt in der Beta verfügbar. Du kannst hier in deinen Einstellungen unter Fähigkeiten noch einmal schauen, ob du die Inline Visualisierungen aktiviert hast. Dann hast du Zugriff auf diese neue Funktion. Test mir das mal aus. Visualisiere mir interaktiv ein einfaches neuronales Netz mit drei Layern. Input hinput leer zeigt mir die Gewichte als Verbindungslinien zwischen den Neuronen und die gleiche Aufgabe gebe ich jetzt auch noch einmal ChatGVT, damit wir den direkten Vergleich haben.
Ja, und hier sieht man jetzt noch mal super den Unterschied. Also ChatGVT generiert hier nach wie vor einen Code. Cloud ist bereits fertig und hat jetzt hier tatsächlich eine interaktive Visualisierung generiert. Also ich habe genauso ein einfaches neuronales Netz erhalten, wie ich es beim Prompt angefordert habe. Ich kann die Gewichte und Biases zufällig neu initialisieren. Ich kann die einzelnen Werte aber auch selbst teinjustieren und dies wirkt sich dann direkt unmittelbar auf die Verbindungslinien. aus und das wirklich ein Grund zu liedes Superergebnis genauso wie ich mir das vorgestellt habe und wohing gegen Chatchvt wie gesagt jetzt keine interaktive Vorschau generiert hat, sondern eben einen Code geschrieben hat.
Ja und das muss man zumindest sagen, Chat hat jetzt zumindest mal eine funktionierende Demo generiert, aber eben eine eigene Vorschau und eben nicht interaktiv direkt im Chat. Und woran liegt das hier? Dazu müssen wir jetzt beide Konzepte einmal verstehen. Chat hat nämlich lediglich 70 vordefinierte STEM Konzepte, also im Endeffekt 70 vordefinierte Konzepte aus dem Mintbereich auf Highschool und College Level und mehr ist nicht möglich. Also individuelle Visualisierungen, wie wir es gerade eben gesehen haben, das funktioniert nicht und es funktioniert auch nur für Matth und Naturwissenschaft und bei Cloud funktioniert das grundsätzlich anders und zwar du kannst unbegrenzt für jedes Thema on Demand diese Visualisierungen erstellen. Egal ob Business, Technik, Education, Kreativ.
Ja, und warum das so ist, das liegt letztlich in der technischen Umsetzung unter der Haube. Bei Opi handelt sich nämlich um eine proprietäre Widget Engine, die vermutlich React und Kenwas basiert ist und fest in chatbt integriert ist und keinen sichtbaren Code ausgibt und Cloud generiert ja on the Fly HTML, Inline SVGs und JavaScript Code und das Ganze wird dann live gerändert direkt im Chat und ist auch downloadbar. Also ich kann mir die Datei herunterladen oder kopieren und kann den Code dann letztlich auch selber nutzen oder erweitern. Auch das ist bei Chat GVT nicht möglich und damit komme ich zu dem Fazit, ja, dass ChatGVT einfach extrem begrenzt ist. Also die Funktion ist ja durchaus hilfreich und vielleicht für Schüler, die jetzt spezifische Fächer lernen wollen, ja, vielleicht hilfreich, aber es ist eben extrem begrenzt auf diese vordefinierten Demos. Anthropics Ansatz erscheint mir hier langfristig definitiv als sinnvoller und skalierbarer bei immer besser werenden Modellen vor allem.
Ja, also wir müssen ja immer davon ausgehen, dass die Modelle besser und besser werden und somit auch immer besser am Coding werden und ob man dann wirklich ja diese einzelnen Konzepte star ja vorprogrammieren oder vorgeben muss. Das ist aus meiner Sicht fraglich, ob das wirklich so der finale Ansatz sein sollte, den Open AI hier wählt. In jedem Fall wird KI visuell und kommt somit auch jedem visuellen Menschen enorm zugute. Ja, und reine textbasierte Ansätze reichen eben nicht mehr aus.
Ja, genau. Das erkennt auch Microsoft und zwar stellen sie Microsoft Copilot Cowork vor. Ja, du kennst natürlich bereits Cloud Cowork und wie du dir sicherlich schon gedacht hast, handelt es sich eben hier um ein direktes Pandor von Microsoft zu Cloud Cowork. Ja, und nicht nur das, tatsächlich wird Microsoft Copilot von Enhropics Technologie, also von Cloud Cowork betrieben. Also es handelt sich letztlich um eine Cloud Cowork Microsoft Rapper.
Ja, das ist natürlich einerseits super nützlich für alle, die im Microsoft Ökosystem verhaftet sind oder querer Firma einfach nichts anderes nutzen dürfen als Microsoft Core Pilot. Ja, aber es wirft natürlich auch große Fragen im Hinblick auf Microsoft und Open AI auf, da Microsoft ja seit jeher groß Investor in Open AI ist und offenbar selbst ja, dann muss man sich ja doch die Frage stellen, wieso Microsoft jetzt hier gezwungen ist Cowork zu integrieren und eben keine Open AI Lösungen zu integrieren oder gar etwas eigenes zu bauen, denn Cowork an sich ist ja jetzt auch kein höchst komplexes Tool und man sollte meinen, dass Microsoft sowas auch selbst hinbekommt, aber in jedem Fall bestätigt es ja genau das, was ich jetzt ja immer wieder seit fast einem Jahr Prediger Also das Corporate LLMs, sprich Unternehmens KI Lösungen, in den du verschiedene Modelle und Anbieter integriert hast, die auch DSGVO konform sind, Microsoft Hits mal ausgeklabbert an der Stelle, der zentrale Ort sind, wie wir im Unternehmen mit KI arbeiten sollten.
Ja, das erkennt der Microsoft jetzt sogar selbst, dass sie nicht mehr nur auf einen Anbieter setzen, sondern mehrere Anbieter in einer zentralen Unternehmensinfrastruktur kombinieren. Ja, und für alle Privatnutzer und Powernutzer bleibt Cloud Code nach wie vor die beste Lösung, mit der du jetzt arbeiten kannst. Und es gibt abermals neue Updates. Wir gehen jetzt n in aller Kürze darauf ein und unter anderem Cloud Code Review, denn in Frack hat auch verstanden, dass je mehr KI Code generiert wird, desto mehr muss dieser KI generierte Code auch wieder überprüft werden, was so einem enormen Aufwand bei Developern führt. In Tropic sagt selbst, dass ihr Output pro Entwickler sich im letzten Jahr um 200% verdoppelt hat und somit Code Review ein zentraler Flaschenhalt im Unternehmen geworden ist und sie dieses Feedback auch jede Woche von Kunden erhalten. Und von diesem Hintergedanken haben sie im Cloud Code Review entwickelt. Hierbei handelt sich eben um Agents, die auf das Review von Pull Request spezialisiert sind und Bugs finden und diese verifizieren.
Was man hierbei jetzt aber fairerweise beachten muss, dass das für die meisten jetzt einfach noch nicht relevant ist. Wir haben uns das auch angeschaut, aber das ist aktuell wirklich nur im Teamsplan und dem Enterprise Plan verfügbar und du zahlst pro Review 15 bis 25$ extra. Ja, und der Return on Invest, wir haben Selbstentwicklerteam von mittlerweile über 30 Leuten, der erklärt sich mir zum aktuellen Zeitpunkt zumindest noch nicht.
Ja, aber auch alle Privatnutzer dürfen sich freuen. Es gibt ein paar Quality of Live Updates in der mobilen Version und zwar einen verbesserten Voicemode in Cloud, verbesserte Transkriptionen, eine verbesserte Anzeige der Artefakte, MCP Konnektoren, Dokumentenupload und vieles mehr. Ja, und im Geschäftsalltag nutzen die meisten halt immer noch Excel und PowerPoint und die Integration von Cloud in Excel und PowerPoint, die wurde jetzt auch dramatisch verbessert. Also, wenn du jetzt deine standardisierten PowerPoint Skills hast, dann kannst du diese Skills jetzt auch direkt über das PowerPoint Cloud Adin verwenden. Genau das gleiche gilt auch für Excel.
Ja, und genau zu diesen und vielen weiteren Updates lohnt sich mittlerweile einfach eigene Videos zu machen und deswegen wird es bereits anfangen nächste Woche noch mal ein dediziertes Video nur zu allen Cloud Code Updates geben und auf ein großes Update in Bezug auf den Cloud Code Kurs. Die Warteliste ist jetzt seit zwei Wochen in etwa offen und nächste Woche wird es soweit sein. Also da unbedingt deine E-Mails regelmäßig checken, wenn du auf der Warteliste stehst. Der nächste Woche wird definitiv unser umfassender Cloud Code Kurs auf den Markt kommen, in den du in über 10 Stunden von A bis Z alles lernst, um von Anfänger zum absoluten Cloud Code Profi zu werden.
Ja, und auch im Text zu Speech Bereich gibt es einige Updates und zwar von Fischaudio. Fischaudio ist bereits ein alter Hase, kein unbekannter Spieler und diese veröffentlichen jetzt Fish Audio S2, eine neue Generation und laut eigener Aussage das expressivste Text to Speech Modell. Also, es hat jetzt eben auch kontrollierbare Emotionen und ist laut eigener Aussage vollständig open source. Das scheint nicht ganz zu stimmen. Also ihre Lizenz und sagt unter anderem kommerzielle Nutzung, aber prinzipiell kannst du es eben kostenlos verwenden. Dazu kannst du einfach auf fisch. Und deine eigene Stimme klonen. Äh, das machen wir jetzt mal. Ich habe jetzt hier eine 30 Sekunden Sequenz aus dem Intro dieses Videos hochgeladen. Dann gehst du auf weiter zu Details. Name der Stimme ist in dem Fall Demo Leo. Einmal das auswählen und dann auf erstellen klicken. Das hat jetzt etwa eine Minute gedauert und jetzt kann ich die Stimme verwenden. Dann stellst du einmer sicher, dass du hier das S2 Pro Modell ausgewählt hast und dann kannst du jetzt hier den Text einfügen und das funktioniert jetzt eben ziemlich ähnlich zu den 11 Labs drei Emotion Tags. Also du kannst eben über diese Emotion Tags ja eingeben, welche Emotionen du haben willst und dann testen wir das einfach mal aus. Also, ich habe ihm hier mal einen einfachen Text gegeben, dann klicke ich auf Sprache erzeugen.
Heute wissen, was morgen Realität ist. Wenn du allen anderen immer den entscheidenden Schritt voraus sein willst und profitieren möchtest vom führenden deutschen KI Netzwerk, dann stelle sicher, dass du den YouTube-Kanal Everlast AI abonniert hast.
Ja, Wahnsinn. Also schreibt mir noch mal deine Meinung und Erfahrugung dazu in die Kommentare. Das ist schon wirklich erschreckend gut und der Rubikon ist längst überschritten, was KI Audio betrifft und du solltest unbedingt mit Menschen in deiner Familie, in deinem Umfeld Codewörter vereinbaren, da wie wir jetzt hier gesehen haben, jede Stimme also nahezu perfekt klonbar ist und das auf Basis einer einfachen Audiosequenz.
Auch von Google gibt es einige konkrete Updates. Logan Kill Patrick schreibt: "Es wird eine spaßige Woche mit vielen Lounges und genauso ist dann auch gekommen. Zunächst einmal haben wir Updates bekommen von Gemini in Docs, Sheets, Slides und Google Drive, insbesondere im Hinblick auf die AI Overviews und eben die Gemini Integration in das gesamte Google Ökosystem. Und das ist auch das zentrale Update jetzt hierbei, also, dass du dich in deinem Google Doc befinden kannst und dann deine E-Mails referenzieren kannst oder du möchtest ein Google Slide Präsentation erstellen und referenzierst dann über Gemini deine Drive Dokumente oder deine Google Sheets. Also diese natlos Integration von Gemini im gesamten Google Ökosystem, das ist hier letztlich das entscheidende Update.
Des weiteren hat Google scheinbar erkannt, dass sie ja auch noch Google Maps haben und hier gibt es jetzt auch einige neue AI Integrationen, die durchaus spannend sind. Und zwar kannst du jetzt komplexe Anfragen über normale Konversationen in Gemini stellen, wie beispielsweise finde die nächst gelegenen Ort, an den ich mein Handy laden kann. und Gemini in Maps nutzt dann letztlich die Inses von über 300 Millionen Orten und über 500 Millionen Community Contributern, um dir bei deiner Planung zu helfen. Ja, und die immersive Navigation liefert die größte Navigationsüberarbeitung seit über 10 Jahren mit lebendigen 3D Routenansichten, intelligenter Sprachführung und Hervorhebung von Fahrspuren und Sehenswürdigkeit sowie Informationen und Routenabwegungen in Echtzeit. Also jeder, der Google Maps nutzt, der profitiert jetzt direkt von den ja, Gemini Integrationen und Updates.
Ja, und bei all diesen vielen Updates mittlerweile ist es einfach wichtig, den Durchblick zu behalten und zu verstehen, worauf kommt es denn wirklich an, worauf muss ich mich jetzt als Unternehmen fokussieren, während andere sich auf OpenCla oder irgendwelche Verbraucherspiele reinstürzen oder diese gar versuchen im Unternehmen einzusetzen, was natürlich völlig absurd und lächerlich ist, wie ich es ja schon seit jeher gesagt habe. Also jeder, der auf diesen Open Glow Hype Train aufspringt und der irgendwelche YouTube Videos dazu präsentiert, ja, der entpuppt und entlarft sich als jemand, der einfach null Ahnung davon hat, wie KI wirklich im Geschäftsalltag integriert hat, denn niemand ja kein ernstones Geschäft wird OpenC integrieren und nicht mal Privatnutzer die es richtig macht, sondern jeder der ja bisschen tiefer im Thema drin ist und Cloud Court und diese ganzen Möglichkeiten nutzt, der hat verstanden, dass KI Wissenspeicher und deine zentrale auf KI Agentenoptimierte Datenbank im Unternehmen die zentrale Infrastrukturen des zentrale Fokus Thema jetzt gerade mal sind, weil ansonsten ist alles andere ja sowieso redundant und Spielerei und hier gibt's wirklich ein spannendes Update von Google und zwar mit Gemini Embedding 2, ein neues Dateof multimodales Embedding Modell, welches Text, Bilder, Video, Audio und Docs in einem Embeding Modell integriert und das gab es bisher so nicht.
Ja, dieses Modell kann nämlich nicht nur jeweils eine Modalität verarbeiten, sondern versteht auch nativ verschachtelte Eingaben, sodass mehrere Eingabemodalitäten wie Bild und Text in einer einzigen Anfrage übermittelt werden können. Ja, und um zu sehen, was das in der Praxis bedeuten kann, habe ich mal diese kleine Demo hier gebaut für das Gemini Embeding 2 Modell und zunächst einmal schauen wir das auf Basis eines Ersatzteilkataloges an, also ein klassischer Rackuse Case zu Produkten oder Unternehmenswissen chatten zu können. Und genau dafür braucht es ja letztlich diese Embelling Modelle.
Ja, den Ersetzteilkatalog habe ich hochgeladen und wie man sieht, wird die PDF jetzt nun vom Gemini im Beding 2 Modell analysiert und die Teile extrahiert und das hat jetzt auch schon geklappt. Er hat die 19 Teile aus der PDF extrahiert und als Beding indexiert und ich könnte jetzt auch per Foto oder Text suchen, da Multimodal ist. Foto macht natürlich wenig Sinn, weil wir keine Beispielfotos haben. Könnt jetzt aber mal eine Frage dazu stellen, z.B. was kostet das Plangetriebe? Und es ging natürlich super schnell. Ich habe das jetzt so gebaut, dass er mehrere Treffer ausgibt nach Wahrscheinlichkeit und das beste Match mit 62,1% Wahrscheinlichkeit gefunden bei dem Preispunkt von 1290 € und das ist auch exakt korrekt, also genauso wie es sein soll.
Und um jetzt wirklich noch mal diese Besonderheit zu sehen, testen wir das noch mal mit Bildern. Also ich habe jetzt hier mal sechs Bilder hochgeladen von dem Strand, von dem Hund, von dem Auto, von dem Computer mit Code und das ist natürlich auf alles übertragbar. Also vor allem auf Produktbilder beispielsweise, die du hier hochladen kannst. Das jetzt wie gesagt natürlich die Stärke, wenn ich jetzt sowas frage, wie auf welchem Bild ist ein Tier zu sehen? So und der hat jetzt die Bilder analysiert und mit der höchsten Wahrscheinlichkeit das beste Match den Hund herauskristallisiert, ne? So genauso wie es sein soll.
Und worauf genau es beim KI Wissensmanagement jetzt wirklich ankommt, darüber sprechen wir jetzt live mit Oliver Drabert. Oliver ist deutscher Unternehmer, der jetzt gerade eine 20 Millionen Dollar Seedrunde geraced und sich mit Octonomy AI genau diesen Fragestellungen widmet und damit schalte ich jetzt live rüber. zu Lea und Oliver.
Ja, Oliver, ihr habt 2025 mit einer 20 Millionen Dollar Seedfinanzierung abgeschlossen und habt jetzt auch Standorte in Köln, in Denver und New York. Was genau macht ihr jetzt mit Autonomie und warum braucht der Markt euch?
Ja, das ist eine super Frage, weil es gibt ja heute sehr, sehr viele KI Plattformen und darum einfach mal die Frage zu stellen, wo differenzieren wir uns eigentlich? Ich glaube, es ist extrem relevant und ich würde sagen, in einem Satz zusammengefasst, sind wir die beste KI Plattform für komplexes Wissensmanagement und das ist, glaube ich, extrem relevant, weil wenn wir von Wissen sprechen, sprechen wir nicht nur von Text. Und wenn wir uns heute die meisten Plattformen angucken, dann fokussieren die sich halt 100% auf Text. Aber so funktioniert die Welt halt nicht und auch nicht die Welt im Unternehmen, sondern ich habe immer komplexere, auch andersweitig strukturierte Informationen. Ich habe immer komplexe Tabellen, ich habe äh Prozessbeschreibungen, ich habe Grafen, ich habe vielleicht elektrische Pläne, hydraulische Pläne, also ganz viel visuelle Informationen und klassische Herangehensweise sind halt diese Racksysteme Retrieval Augmentation Generation. Das heißt, man geht dann im Wesentlichen hin, nimmt ein PDF, extrahiert den ganzen Text, macht da Chance draus und legt das in die Vektordatenbank. So, bei diesem Prozess verliert man in der Regel einfach unglaublich viel Information. Ja, weil alles, was eben nicht textlich war, also visuell, kommt am Ende eben gar nicht mehr vor.
Und Octonomy arbeitet halt grundlegend anders. Wir arbeiten visuell. So, und die Idee kam uns, als wir uns angeschaut haben, wie funktioniert eigentlich der visuelle Cortex bei Menschen? Und der visuelle Cortex bei Menschen, wie der Name schon sagt, ist halt visuell. Das heißt, ich gucke mir so eine Seite an, Worddokument oder PDFDkument und das erste, was ich eben sehe, sind halt verschiedene Bereiche. Dann sehe ich halt, oh, das eine ist ein Graf, das andere ist eine Tabelle, das andere ist reiner Fließtext. Und in meinem visuellen Cortext verbindet sich jetzt in der nächsten Ebene das gesehene mit der Bedeutung. Das ist sozusagen ein wichtiges Element. Das heißt, wir haben eine hundertprozentige Verarbeitung der relevanten Informationen. Gleichzeitig muss man die halt wiederfinden. Da haben wir ein fotografisches Gedächtnis. Ja, ist ungefähr so als wenn du jemanden kennst, der ganz viele Bücher gelesen hat, dann stellst du dem eine Frage, dann sagt er, ach ja, in dem Buch Seite 200 unten rechts. Und genau das macht Octonomy auch. Es hat auch ein visuelles Gedächtnis. Es weiß genau, wo es welche Informationen gesehen hat und dazu speichert halt unheimlich viel Meta und Kontextinformation, um genau die relevante visuelle Information wiederzufinden. Und diese beide und dann die Kombination aus beiden Systemen visueller Cortex plus fotografisches Gedächtnis. Damit erreichen wir dann eine Antwortgenauigkeit von 95%.
Du ist jetzt gerade gesagt, dass eure KI da eine 95%zentige Antwortgenauigkeit auch erreicht, während so der Marktstandard bei 50% liegt. Wie schafft ihr das und was macht euren Ansatz da wirklich noch mal so besonders?
auch, also wie ich gerade eben schon sagte, der grundlegende andere Ansatz ist, dass wir alles visuell verarbeiten, ja, und es eben auch so aufbereiten, dass wir halt über das fotografische Gedächtnis genau die relevante Information wiederfinden und damit verarbeiten wir 100% der Informationen. Wir haben am Anfang natürlich angefangen, wie es alle machen. Ja, haben aber relativ schnell festgestellt, dass das eben nicht funktioniert und wir waren halt in der glücklichen Lage Mitarbeiter zu gewinnen, die von Stability AI kommen und auch von Aleb Alpha und gerade von Stability AI, da kommt hal das ganze noch how her. wie ich Information optimal visuell verarbeite und das hat uns halt extrem weitergeholfen und da muss man auch ganz klar sagen, wir nehmen halt nichts auf the shelf, sondern wir machen eigene Research in eigenen ML Research Team und das führt dann eben am Ende auch zu den extrem guten Ergebnissen.
Seid ja auch jetzt letztes Jahr rasant auch auf 70 Mitarbeiter gewachsen. Was sind denn dann eure nächsten großen Schritte und woran arbeitet ihr genau aktuell?
Genau. Also wichtig ist es erstmal Go to Market. Also, wir haben das Produkt, würde ich mal sagen, ähm seit Anfang letzten Jahres im Markt mit schon recht viele Kunden gewonnen und das Jahr 25 sehr erfolgreich abgeschlossen. Am Ende sind wir halt in dem ganzen KI Umfeld in Wettlauf und der Wettlauf ist eben auch geprägt durch eine gute Execution, das heißt eine sehr gute Go-to Market Organisation, weil das beste Produkt hilft dir halt nicht echt weiter, wenn du kein Marketing und Vertrieb hast, die das eben auch wirklich an den Mann und die Frau bringt. Und wenn wir uns jetzt eben angucken, da haben wir jetzt extrem investiert und haben uns von Anfang an auch gesagt, na ja, die USA ist einfach einer der größten KIM Märkte der Welt. Den auszulassen wäre eigentlich fahrlässig. Ja, weil gerade in Deutschland und in Europa, da denken wir immer erstmal in Regulierung. Die Amerikaner denken immer in Möglichkeiten. Ja, und von daher fahren wir da jetzt eben zweigeleisig gleichzeitig Go to Market in der Dachregion ausbauen und aber auch in den USA.
Viele KI Projekte scheitern ja auch in der Praxis. Was würdest du jetzt Unternehmen auch raten, die KI im Support effektiv einsetzen wollen? Also, worauf kommt es da noch mal wirklich an?
Ja, ich glaube, wenn man eine Lösung aussucht, dann sollte man nicht per se mit dem einfachsten US Case anfangen. Ja, weil wenn ich eine ganz einfache Anforderung habe, sag mal einfache Frage Antwort, da kriege ich immer eine gute Lösung hin. Aber sobald es halt ein bisschen anspruchsvoller wird, funktioniert das eben nicht mehr. Und am Ende sollte man halt eine Lösung auswählen, die eben eine große Bandbreite an Anwendungsfällen im Unternehmen abbilden kann. Von daher ist immer unser Rat, sich im Markt zu informieren und erstmal mit einem herausfordernden Uscase zu starten, um halt die beste Lösung auszuwählen, weil eine Lösung, die komplexe Daten verarbeiten kann, die kommt dann in der Regel auch mit einfachen Anwendungsfällen klar. Und ich glaube, was halt wirklich hilft, ist dann eben eine Plattform zu haben, die man auch konfigurieren kann. Also Autonomy ist nichts, wo man programmieren muss, sondern ein Business Analyst kann sich die Anwendungsfälle konfigurieren. Also deshalb bei der Auswahl immer gucken, dass man mit einem, würde ich mal sagen, anspruchsvollen Uscase startet, damit man sich sicher ist, dass ich eben hinterher alle US Case im Unternehmen abbilden kann.
Jetzt noch mal meine letzte Frage, wie können jetzt auch Zuschauer mehr über Octonomy erfahren oder auch mit euch in Kontakt treten?
Also erstmal kann man sich natürlich auf unserer Webseite informieren, aber wir sind eben jetzt auch auf vielen Messen vertreten. Ja, versuchen eben einfach auch durch Vorträge auf Veranstaltungen Präsenz zu zeigen. Am Ende vom Tag sind wir halt eine kleine Firma, muss man einfach so sagen. Ja, wir sind halt ein Startup und was halt für uns extrem wichtig ist, dass wir eben erstmal Sichtbarkeit im Markt erlangen. Ja, weil es gibt ja so, würde ich mal sagen, diese Linkin Blase, da ist es einfacher Sichtbarkeit zu erzeugen. Aber jetzt so in der Breite, wenn wir z.B. gucken im Maschinenbau oder so, wo unsere Lösung ganz besonders gut funktionieren, ist das halt recht herausfordernd. Also, ich glaube, unser Ansatz ist so, dass wir auch ein Trusted Advisor sind für unsere Kunden und eben auch denen helfen und die an die Hand nehmen, damit die halt verstehen, wo kann ich KI einsetzen, wo kann ich vielleicht auch nicht einsetzen. Ja, es ist nicht jemand, der sagt, KI löst alle Probleme der Welt, sondern es hängt halt immer vom Anwendungsfall ab. Und es ist glaube ich ganz ganz wichtig, weil aktuell, wenn ich so auf LinkedIn gucke, dann geht alles. Alles ist super einfach, ja? Alles geht durch Vibecoding, musst du gar nichts machen, aber in der Praxis, ja, bis so Dinge dann in der Produktion sind, ist halt noch ein weiter Weg und von daher ist es, glaube ich, gut mit Experten zu sprechen, die da einfach die Erfahrung haben aus sehr, sehr vielen Projekten, wie man so ein Thema Wiki KI wertschätzend angeht.
Auf jeden Fall. Also, danke. Das war einmal Oliver Tra, Co-Funder von Octonomy. Ja, vielen Dank, Oliver. Und damit zurück in die KI News.
Ja, mal wieder höchst interessante Einblick und genau darum geht es mir ganz grundsätzig mit allem, was wir bei Everlast AI machen, also dass du bei dem ganzen Rauschen, ja, des der ganzen Ablenkung und unnötigen Hype im KI Bereich du wirklich die Dinge bekommst, die gerade mal wirklich wichtig und wirklich relevant sind und Wissenspeicher und das Optimieren der Unternehmensdaten auf Agenten. Das ist jetzt die zentrale Aufgabe für jedes Unternehmen auch für jede KI Agentur da draußen und die wenigsten sprechen darüber. Wir machen das mit Kunden jetzt mittlerweile seit Jahren, bauen genau solche KI Infrastrukturen auf und ich bin wirklich dankbar. Ja, für die ganzen Kunden, die wir schon erfolgreich begleiten durften, genau in diesem Bereich.
Und die große Fragestellung, die ich mir schon seit einiger Zeit dabei stelle, ist wie sinnvoll ist dieses ganze Arbeiten, wie wir es am Laptop noch tun, überhaupt noch? Also gerade das Hin und Herchicken von PDF-Dateien, Worddokumenten, Excel Dateien, denn die sind ja alle nicht optimiert auf KI Agenten. Die sind schwer zu verstehen für KI Agenten und letztlich werden KI-Agenten mehr am Computer arbeiten als wir ja mit all diesen Dateien. Und genau das versteht arschif.org. Das ist sehr interessant, denn diese stellen jetzt einen Skill bereit, welcher ihre Paper direkt als Markdown Datei für KI Agenten bereitstellt, weil sie ihm verstanden haben, ja, die meisten Menschen lesen jetzt gar nicht mehr selbst PDF-Datei, sondern sie laden die PDF ihrem Agenten hoch. Das ist aber ineffizient, weil es viel Kontext verbraucht, viel Token verbraucht. Viel sinnvoller wäre es doch dem Agenten direkt eine Markdown Datei mitzugeben. Und genau das macht der archef.org Skill. Den kannst du dir einfach über diesen Link hier über archvef.org org in dein Cloud Code reinziehen und alle Paper direkt über Markdown abrufen und das ist auch wieder mal ein sehr gutes Beispiel dafür, wie man im Unternehmen letztendlich auf seine Dokumente strukturieren und bereitstellen muss, s dass jeder auf alle Dokumente im Mark eben über gleich die zentrale KI Wissensdatenbank zugreifen kann.
Und wenn du lernen willst, wie das funktioniert auch auf einfachem Wege, ja, in deinem Unternehmen, dazu werden wir beid schon einen Live Workshop haben am 8.4. und unsere besten Learnings aus über 2100 Projekten rund um das Thema Corporate LMs mit Detailen. Du kannst dir einen kostenlosen Platz sichern und dort werden wir dir zeigen, wie du dein gesamtes Firmenwissen vernetzt in einer Infrastruktur darstellst. DSGVO konform und sicher all die Möglichkeiten und Fähigkeiten von Coding Agenten wie Cloud Code in deinem Unternehmen ausschöpst und vor allem einfach verständlich für alle Mitarbeiter ausrollst. Also sicher dir sehr gerne deinen Platz für unseren Live Workshop am 8.4.
Ja, und bei all dem Trubel um KI Tools Chaptivity und Cloud ist sicherlich mal spannend zu schauen, wie sich das denn in den Nutzerzahlen wirklich widerspiegelt. Dazu habe ich dir mal zwei Statistiken von A6C aus dieser Woche mitgeworft. Ja, das sind einmal die Unique Monthly Visits der Top 50 generativen KI Websites und einmal die monatlich aktiven Nutzer der Top 50 generativen KI Mobile Apps. Ja, man sieht es auch hier, dass ChatGBT bei den Konsumenten nach wie vor führend ist und das ist aus meiner Sicht auch verständlich, weil Cloud und Cloud Code ja explizit auf Business US Cases optimiert sind, was ja auch der Grund ist, weshalb ich hier auf diesem Kanal immer darüber rede, weil ich seit jeher sage, hier geht's darum, wie du KI im Gewinn bringt und auch im Geschäftskontext nutzt und eben nicht als reine Spielerei. Dafür gibt's andere, die dir das zeigen können, ne? Wie du da irgendwelche Spieleaps programmierst oder irgendwelche bunten Bildchen mit KI baust. Und das sind ja letztlich genau die Leute, die nach wie vor auch Chat GBT nutzen, was ich ja natürlich hier auch widerspiegelt, dass mittlerweile auch AI Powered Apps wie beispielsweise CapCut eben hier entsprechend mit aufgenommen sind.
Ja, und all das könnte nah Zukunft natürlich trotzdem irrelevant sein, wenn KI nämlich einfach zu günstig zu messen ist und so eegenwärtig wie Lebensmittel oder Strom ist. Ja, und genau das sagt Open ACO Sam Oldman diese Woche. Im Grunde wird unser Geschäft und ich denke das Geschäft jedes anderen Modellanbieters wie der Verkauf von Token aussehen. Wissen Sie, Sie können von größeren oder kleineren Modellen stammen, was sie mehr oder weniger teuer macht. Sie können mehr oder weniger logisches Denken nutzen, was sie ebenfalls mehr oder weniger teuer macht. Sie könnten die ganze Zeit im Hintergrund laufen und versuchen ihnen zu helfen. Sie laufen vielleicht nur, wenn Sie sie brauchen, falls Sie weniger bezahlen wollen. Sie könnten extrem hart arbeiten, wissen Sie Millionen, Hunderte Millionen, eines Tages Milliarden von Dollar für ein einziges Problem ausgeben. Richtig, das ist wirklich wertvoll. Aber wir sehen eine Zukunft, in der Intelligenz ein Versorgungsdienst ist, wie Strom oder Wasser und die Leute sie von uns kaufen nach Zählerstand und sie für alles mögliche nutzen. Die Nachfrage, die wir dafür sehen, scheint einfach so weiterzugehen. Und wenn wir nicht genug haben, können wir es entweder nicht verkaufen oder der Preis steigt enorm. Und es geht, wissen Sie, eher an reiche Leute oder die Gesellschaft trifft eine Reihe von zentralen Planungsentscheidungen, die meiner Meinung nach fast immer schiefgehen. Etwa wir nutzen unsere begrenzte Rechenleistung hierfür und nicht dafür. Das Beste ist für mich in der gesamten Geschichte des Kapitalismus, der Innovation, was auch immer, den Markt einfach zu fluten.
Ja, also den Markt mit Intelligenz fluten und das, was Sam Oldman hier beschreibt, das ist mehr als realistisch. Genau dazu wird es im übrigen bereits nächste Woche ein tiefgründiges Gespräch geben. Also was genau sind die Konsequenzen davon, wenn Intelligenz zur Massenware wird und wieso das letztendlich wichtiger sein wird als beispielsweise ein bedingungsloses Grundeinkommen, was ja mittlerweile auch schon nahzu Konsens ist und all das ordnet Markeson aus der übergeordneten Perspektive ein. Er sagt, wir befinden uns in der Science Fiction Dekade und Greg Brookman, CFunder von Open AI, sagt Benchmarks, da wo wir hingehen, brauchen wir keine Benchmarks, also ein für Su im Hinblick auf zurück in die Zukunft. Da wo wir hinfahren, brauchen wir keine Autos.
Ja, und deswegen gründet unter anderem Enhropic das Enhropic Institute. Dieses soll sich nämlich genau mit dieser Fragestellung auseinandersetzen, also der Welt von dem zu erzählen, was wir lernen, wenn wir leistungsstarke KI Modelle bauen und was das für die Gesellschaft bedeutet. Und es ist einfach ein Fakt, dass die meisten Leute natürlich nicht die Zuschauer von Everlast AI, aber alle anderen da draußen sich nicht im Ansatz im Klaren darüber sind und das auch nicht im Ansatz mit der nötigen Ernsthaftigkeit betrachten und besprechen, was hier gerade in diesem Moment passiert.
Ja, und wenn du das jetzt noch mal in einem aktuellen Diskurs rund um die Themen humanoide Roboter, Bewusstsein, Zukunft und Haftungsfragen vertiefen möchtest, genau darüber habe ich mit Professor Dr. Oliver Bendel diese Woche gesprochen. Das Interview habe ich dir jetzt hier verlinkt. Ja, und wenn du dich jetzt noch mal direkt für unseren letzten KI Manager Workshop für Angestellte eintragen möchtest, den Link findest du jetzt hier. Ich freue mich dich dort wiederzusehen. Bis dahin.