📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Локальные ИИ-агенты - ВСЕ, что тебе нужно знать - параметры, железо, скорость, приватность

Продуктивный Совет33:56

Transcription

Kann lokale KI das Abonnement von Chat GPT und Cloud ersetzen? In den letzten Monaten erleben wir einen Boom im Open Source, was allein die Veröffentlichung von GLM 5.2 wert ist, die in vielen Metriken Fable 5 übertrifft. Intelligenz, Agentenfähigkeit, Code-Fähigkeiten lokaler KIs wachsen ständig, während ihre Hardware-Anforderungen gleich bleiben oder sinken. Bedeutet das, dass wir Abonnements bereits jetzt kündigen und vollständig auf private und lokale KI umsteigen können? Welche Hardware wird dafür benötigt? Lohnt es sich, einen Server zu mieten, eine neue Grafikkarte zu kaufen, eine DGX Spark Box oder reicht ein alter Mac auf Intel 7? Alles, was Sie über lokale LLMs wissen müssen. Parameter, Quantisierung, KV-Cache. Wie man nicht nur ein lokales LLM startet, sondern es in einen Agenten verwandelt. Leute, Roboter, hallo. Dies ist eine Folge über lokale KIs, und wie Sie vielleicht erraten haben, werden wir alles analysieren, damit Sie verstehen, wie Sie Ihren Weg zur lokalen privaten Intelligenz beginnen können. Likes, Abonnements, Kommentare helfen bei der Verbreitung dieses Videos. Lassen Sie uns beginnen. Wir haben einen Telegram-Kanal, und dort gibt es viele nützliche und aktuelle Nachrichten. Abonnieren Sie. Schauen Sie, gerade jetzt läuft ein Modell mit 9 Milliarden Parametern auf meinem PC. Es funktioniert hier. Und ich löse eine ganz praktische Aufgabe. Ich schreibe einen Abschnitt meiner Website neu. Es funktioniert ziemlich schnell. Mit einer Geschwindigkeit von 34 Tokens pro Sekunde habe ich keinen Cent ausgegeben. Nun, abgesehen von den Kosten des MacBooks und 1,5% seiner Aufladung. Lassen Sie uns analysieren, wie und warum das funktioniert. Bevor wir uns mit Hardware und Modellen befassen, müssen wir fünf grundlegende Begriffe verstehen: Inferenz, CPU, VRAM, Quantisierung, Formate. Ohne sie wird nichts verständlich sein, und ich möchte nicht, dass Sie das Video ansehen, ohne die Sprache zu kennen, mit der wir hier versuchen zu kommunizieren. Neuronales Netz – das ist ein bereits trainiertes Gehirn, und jemand hat Millionen von Dollar ausgegeben, damit dieses Gehirn lernen kann zu sprechen, Code zu schreiben, Fragen zu beantworten. Und Sie trainieren dieses Gehirn nicht, wenn Sie mit dem neuronalen Netz interagieren. Sie nehmen einfach ein fertiges, stellen ihm eine Frage, und in dem Moment, in dem Sie einen Prompt schreiben, erhalten Sie eine Antwort. Das ist Inferenz. Das ist ein ziemlich wichtiges Konzept, denn es gibt auch das Training von Modellen, das Fine-Tuning von Modellen. Das erste ist, wenn ein Modell von Grund auf trainiert wird. Das zweite ist, wenn ein bereits trainiertes Modell für eine bestimmte Aufgabe weiter trainiert wird. Das brauchen wir alles nicht. Das ist unglaublich teuer und ziemlich kompliziert. Deshalb trainieren wir das Modell nicht, wir nehmen einfach ein fertiges, laden es herunter, starten es und nutzen den Videospeicher auf unserem Gerät. Woher bekommen wir diesen Videospeicher? Richtig. Wir brauchen eine GPU – einen Grafikprozessor, genau den, der in der Grafikkarte steckt, die Gamer und Miner kaufen, um Cyberpunk zu spielen oder neue Blöcke im Bitcoin-Netzwerk zu öffnen. Warum gerade eine GPU und kein normaler Prozessor? Ein Modell ist im Grunde eine riesige Matrix von Zahlen, Milliarden, manchmal Hunderte von Milliarden von Zahlen. Und wenn Sie eine Frage stellen, müssen all diese Zahlen miteinander multipliziert und das schnell geschehen. Ein normaler Prozessor, eine CPU, ist intelligent, aber sequenziell. Er nimmt eine Zahl, multipliziert sie, nimmt die nächste, multipliziert sie wieder. Für alltägliche Aufgaben ist das ziemlich schnell, aber für die Multiplikation von Milliarden von Zahlen unglaublich langsam. Eine GPU funktioniert anders. In ihr befinden sich Tausende von Rechenkernen, die gleichzeitig rechnen. Das ist, als ob man 1.000 Kassierer in einem Geschäft aufstellt und jeder gleichzeitig seine Ware scannt. Sehr dumm für ein Geschäft, aber ideal für die Arbeit mit KI. Deshalb braucht man für lokale Modelle eine GPU. Und nicht, weil es unmöglich ist, alles auf einer CPU laufen zu lassen, sie wird es tatsächlich auch berechnen, aber Sie werden alt, bis Sie auf eine Antwort warten. Eine GPU erledigt die Arbeit massenhaft, parallel. Von ihr wird abhängen, ob Sie eine Antwort in Sekunden, Minuten oder sogar Stunden erhalten. VRAM. Ein sehr wichtiges Wort, wenn wir über Hardware sprechen. Das ist Videospeicher. Speicher, der sich direkt auf der GPU befindet. LLMs sind diese Milliarden von Zahlen, über die wir gesprochen haben. Und damit die GPU schnell damit arbeiten kann, muss das gesamte Modell vollständig in den Videospeicher passen. Nicht auf die Festplatte, nicht in den Arbeitsspeicher, sondern genau in den VRAM, denn nur von dort kann die GPU sie schnell genug lesen. Das Modell ist jedoch noch nicht alles. Wenn Sie dem Modell eine Frage stellen, müssen Sie nicht nur sich selbst berechnen, sondern auch den Kontext des Gesprächs speichern. Jeder Prompt, jede Antwort wird in einem speziellen Cache gespeichert, der Key-Value-Cache oder kurz KV-Cache genannt wird. Und je länger das Gespräch ist, desto größer ist dieser Cache, desto mehr Kontext und Speicher werden benötigt. Es gibt eine ziemlich einfache Logik, die Ihnen hilft zu verstehen, welche Modelle Sie je nach Ihrem Speicher ausführen können. Je mehr Parameter ein Modell hat, desto mehr Speicher wird benötigt. Ich denke, das ist ziemlich offensichtlich. Ein Modell mit 70 Milliarden Parametern in voller Präzision benötigt etwa 140 GB Videospeicher. In quantisierter Form, über die wir später sprechen werden, wird es um das Zweifache oder mehr komprimiert. Plus 4-8 GB sollten für den KV-Cache reserviert werden. Es gibt recht praktische Websites und Rechner, auf denen Sie den Modellnamen eingeben, die Quantisierung, die Kontextlänge auswählen und sofort sehen können, wie viel VRAM es verbraucht. Zum Beispiel sagt uns diese Tabelle, dass für die Ausführung von Llama 3 13 Milliarden in voller Quantisierung 62 GB VRAM benötigt werden. 8-Bit-Quantisierung 36 GB, 4-Bit 17 GB. Und von hier aus können wir eine Grundregel ableiten. Wenn Sie Modelle vollständig ausführen möchten, benötigen Sie vereinfacht gesagt doppelt so viel Videospeicher wie die Parameter des Modells. Ein Modell mit 12 Milliarden Parametern läuft bereits auf 25 GB. Und in LM Studio gibt es einen praktischen Schieberegler, mit dem Sie bestimmen können, wie viel zusätzlichen VRAM für den KV-Cache reserviert werden muss. Um ein Modell mit 9 Milliarden Parametern in 4-Bit-Quantisierung auszuführen, benötige ich nur 5,8 GB VRAM mit einem Kontext von 8.000, etwas mehr als 6,2 GB mit 32.000, fast 7 GB und mit 128.000 bereits 10 GB Videospeicher. Je größer das Kontextfenster, das wir benötigen, desto größer wird der KV-Cache des Modells und desto mehr Speicher benötigt es für die Inferenz. Und nun zur Quantisierung. Ein ziemlich beängstigendes Wort, ein einfaches Konzept. Ein Modell besteht aus Zahlen, und standardmäßig werden diese Zahlen in hoher Präzision gespeichert, 16 Bit pro Zahl. Das ist, als würde man ein Foto im RAW-Format speichern. Die Qualität ist maximal, und es wiegt auch ziemlich viel. Quantisierung ist Rundung. Sie nehmen jede Zahl und reduzieren ihre Präzision. Aus 16 Bit werden 8, aus 8 werden 4, aus 4 werden 3 und so weiter. Das Modell wird kleiner, verliert aber etwas an Qualität. Das ist wichtig, denn je stärker Sie komprimieren, desto dümmer wird das Modell. Und der Unterschied zwischen 16 Bit und 8 Bit ist nicht wirklich spürbar. Zwischen 8 und 4 ist er etwas spürbarer. Aber für die meisten Aufgaben ist es tolerierbar, und ich habe in meinen Tests zum Beispiel 4-Bit-Quantisierung verwendet, aber 3 Bit ist schon grenzwertig. Und ich empfehle Ihnen nicht, solche Versionen zu wählen. Grundregel. Wenn Sie genügend Speicher haben, wählen Sie die volle 16-Bit-Quantisierung. Wenn nicht, können Sie problemlos zu Q4KM oder 4-Bit übergehen, und Sie werden beide Bezeichnungen finden. Auf Hugging Face, einer weiteren Website, von der Sie Modelle herunterladen können. Das ist gut sichtbar. Darüber hinaus können Sie Ihr Gerät hinzufügen, und der Dienst zeigt Ihnen an, ob ein Modell darauf passt oder ob es ein Problem gibt. Es ist auch wichtig zu verstehen, in welchem Format Sie das Modell herunterladen und ausführen und welches Sie für Ihre Hardware wählen. Sehr beliebt ist GGUF, GGUF, wenn Sie so wollen. Das ist das Format, in dem quantisierte Modelle gespeichert werden. Sie können sie mit dem Lama.cpp-Framework und Anwendungen auf Basis dieses Frameworks ausführen. Die beliebtesten, bekanntesten, von denen Sie wahrscheinlich schon gehört haben, sind Llama und LM Studio. Unsloth, ebenfalls ein ziemlich bekannter Name in dieser ganzen Szene. Das ist ein Team, das sehr hochwertige, quantisierte Versionen beliebter Modelle erstellt. Wenn Sie ihren Namen sehen, ist das ein gutes Zeichen. Es gibt auch MLX – das native Framework von Apple für M-Serie-Chips. Wenn Sie also einen Mac haben, wird MLX das Maximum daraus herausholen. Versuchen Sie immer, diese Architektur zu wählen. Sie ist speziell für Unified Memory von Apple Silicon geschrieben. Sie arbeitet direkt mit dem Speicher, ohne Zwischenschicht, und bedeutet in der Praxis mehr nutzbaren Speicher und höhere Geschwindigkeit. Wenn Sie einen PC mit Nvidia oder AMD haben, fällt diese Option weg. GG ist unsere Wahl. Ich habe einen Mac. Die Grundlagen sind also geklärt. Sie wissen, was Inferenz ist. Warum eine GPU benötigt wird und wie Quantisierung die Situation rettet. Die Hauptfrage: Worauf soll man das ausführen und wie viel kostet es? Beginnen wir mit der klassischen Nvidia-Grafikkarte. Woher kommt diese proprietäre Technologie von Nvidia? Fast die gesamte Software für maschinelles Lernen ist speziell dafür geschrieben. Nehmen Sie jede Nvidia-Grafikkarte, installieren Sie jedes Tool, und es funktioniert. Keine Hexerei. Und dafür zahlen Sie tatsächlich einen Aufpreis. Die beliebtesten Grafikkarten von Nvidia sind 3, und viele von Ihnen haben wahrscheinlich schon von ihnen gehört. Die erste, die billigste, die RTX 3090 – das ist die vorherige Generation, aber sie hat 24 GB Videospeicher, genau wie die Top-Modell 4090. Nun, eine neue ist fast unmöglich zu finden. Gebraucht auf Avito für etwa 60-120.000 Rubel. Es scheinen Anzeigen zu hängen. Und auf dieser Grafikkarte passen Modelle mit 32 Milliarden Parametern in 4-Bit-Quantisierung. Das Hauptrisiko ist, dass die Karte beim Mining beschädigt worden sein könnte. Wenn Sie sich also für diese Option entscheiden, sind sorgfältige Prüfungen unerlässlich. Die zweite ist die RTX 4090. Sie unterscheidet sich in der Anzahl der CUDA-Kerne und der Speichergeschwindigkeit. Wahrscheinlich die beliebteste Grafikkarte für den Betrieb von KIs. Ebenfalls 24 GB. Insgesamt können Sie ähnliche Modelle in Bezug auf die Anzahl der Parameter ausführen. Die Modelle werden auf dieser Grafikkarte offensichtlich schneller laufen, aber es gibt viele Nuancen. Natürlich hat NVIDIA die 4090 aus der Produktion genommen, die Preise sind gestiegen. Eine neue kostet jetzt etwa 220-300.000. Gebraucht etwa 160-200.000. Insgesamt möchte man ein bisschen weinen. Nun, und dann kommt die RTX 5090. Das ist der aktuelle Flaggschiff. 32 GB Speicher. Doppelt so schnell wie die 4090. Der Preis von 350-450 geht in astronomische Höhen. Sehr teuer. Gebraucht, vielleicht beschädigt. Hervorragende Unterstützung für alle Frameworks zum Ausführen lokaler KIs, aber das ist nur eine Grafikkarte. Sie müssen tatsächlich den Rest des PCs zusammenbauen, wenn Sie darüber nachdenken. 24 bis 32 GB Videospeicher. Wirklich sehr große Modelle passen hier nicht hinein. Was tun? Schauen Sie in Richtung AMD. Für weniger Geld können Sie die gleiche Menge an Videospeicher erhalten. Radeon RX 7900 XTX, 24 GB wie die 4090, aber billiger. Ein realistischer Richtwert sind 70-100.000 Rubel. Der Hauptnachteil von AMD ist natürlich die Software, anstelle von CUDA haben sie ihre eigene Technologie namens ROCm. Und sie scheint für Lama.cpp, LM Studio, all das zu funktionieren. Aber aus dem, was ich im Internet recherchiert habe, können nicht alle Modelle ausgeführt werden. Oft zickt etwas. Sie müssen googeln, patchen. Der Weg ist nicht so glatt wie bei Nvidia. Aber im Prinzip wird Ihnen diese ganze Geschichte billiger kommen, nicht umsonst. Es gibt noch einen dritten Akteur, den alle vergessen. Intel, ja, sie stellen auch Grafikkarten her, überraschenderweise für den Betrieb lokaler KIs, aber das ist ehrlich gesagt eher zum Spielen. Intel Arc A770, 16 GB Speicher, kostet nur 24-32.000 Rubel. Der absolut billigste Einstieg in lokale KI überhaupt. Und so viel Speicher reicht Ihnen für Modelle mit 7, 13, vielleicht 16 Milliarden Parametern, wenn Sie sich sehr anstrengen, in 4-Bit-Quantisierung. Die Intel-Software ist ebenfalls eine eigene Geschichte. Hier müssen Sie sich Mühe geben. Anscheinend sagen Foren, dass alles funktioniert, Lama.cpp funktioniert, LM Studio funktioniert, Llama anscheinend schlechter. Hier müssen Sie sich definitiv mit der Einrichtung dieses ganzen Wunders auseinandersetzen. Und Agenten werden Ihnen helfen, wenn Sie sich dafür entscheiden. Grafikkarten sind bei weitem nicht die einzige Möglichkeit, lokale KIs auszuführen. Seit 2025 erscheinen solche Geräte für lokale KIs, bei denen der Speicher gemeinsam genutzt wird. Hier muss eine kurze Erklärung zur Unified Memory gegeben werden. In einem normalen Computer gibt es zwei Speicher, das haben Sie wahrscheinlich schon gehört: Es gibt den Arbeitsspeicher RAM, der auf dem Motherboard sitzt und den Prozessor bedient, und es gibt den Videospeicher VRAM, über den wir bereits gesprochen haben. Auf der Grafikkarte bedient er die GPU. Dazwischen befindet sich der PCI-Bus, und Daten werden ständig hin und her geschickt. Unified Memory bedeutet, dass der Speicher gleichzeitig für den Prozessor und die Grafikkarte zugänglich ist. Keine Übertragungen über den Bus, alles in einem Pool. Und Apple hat dies 2020 mit dem M1-Chip in den Massenmarkt gebracht. Die drei wichtigsten Boxen auf dem Markt sind derzeit NVIDIA DGX Spark, AMD Strix Halo und Ryzen AI Max + 395 Chip, der in einer Reihe von Boxen und Mac Studio enthalten ist. Die erste hat 125 GB Unified Memory. GB10 Grace Blackwell Chip. Voller CUDA-Stack out-of-the-box. NVIDIA gibt bis zu 200 Milliarden Parameter an. Modelle können ausgeführt werden. Fine-Tuning bis zu 70. Kostet katastrophale Summen ab 590.000 Rubel. Und im Allgemeinen werden Sie sie kaum finden, denn es gibt keine echte Verfügbarkeit und Lieferung. Wahrscheinlich irgendein paralleler oder senkrechter Import. Kurz gesagt, was Sie finden, das finden Sie. KHALA, die gleichen 128 GB Unified Memory, offene Plattform Lindex Windows und es gibt Mini-PCs darauf. Und sie scheinen sogar verkauft zu werden. Nun, ich habe sie nicht gekauft, nicht ausprobiert, aber im Internet habe ich sie gesehen. Gim KC Evo X2 Mini Forum Bink, die kleinere Version mit 64 GB ab 180.000, die Top-Versionen mit 128 GB Speicher 410-490.000 Rubel. Hier ist das gleiche ROCm wie bei diskreten AMD-Karten, die Software ist nicht auf CUDA-Niveau. Hier müssen Sie sich etwas mehr Mühe geben, um Modelle auszuführen. Mac Studio Apple hat Unified Memory zuerst in die Massen gebracht, und ist damit der absolute Marktführer in Bezug auf die Menge in seinen Geräten. Auf dem M4 Max Chip beginnt der Einstieg ab 300.000 Rubel, die Version mit 128 GB, 430-510.000. M3 Ultra, wo bis zu 512 GB Unified Memory. Wie haben sie das überhaupt hineingepackt? Und die maximalen Konfigurationen gehen weit über eine Million hinaus. Plus das MLX-Framework, das auf Apple-Hardware zugeschnitten ist. Die Stabilität von macOS ist ein Minuspunkt, aber das ist absolut verrücktes Geld. Hier ist zu erwähnen, dass, wenn Sie nur lokale KIs lernen und keine Monster mit 120 GB Unified Memory wollen und nicht verstehen, wie und warum Sie das überhaupt brauchen, Sie durchaus MacBooks in Betracht ziehen können. Zum Beispiel kostet mein Gerät Mac M4 Pro mit 24 GB Unified Memory derzeit etwa 200.000 Rubel. 48 GB sind bereits ab dreihundert, aber das ist auch ein Top-Laptop und nicht nur eine LLM. Und die letzte Option ist, nichts zu kaufen. Einen Cloud-GPU-Server mieten. Sie wissen wahrscheinlich oder vermuten, dass wir mit Selectel zusammenarbeiten, deshalb werde ich in diesem Video deren Ressourcen nutzen, um alle Modelle, die meiste davon, zu testen. Die Logik ist hier einfach. Nehmen Sie einen Server mit A100 oder H100 für einen Tag, eine Woche, starten Sie alles, was Sie brauchen, ohne Hardware zu kaufen und Ihren eigenen Server zusammenzubauen. Außerdem können Sie mehrere Grafikkarten zu einem Cluster verbinden und Modelle mit bis zu 700 Milliarden Parametern ausführen. Ich weiß nicht, wie es bei anderen Anbietern ist, aber hier gibt es diese Möglichkeit. Und die Grafikkarten sind auch die Top-Modelle. A100, H100, H200. Volle Ausstattung beim Videospeicher. Ich würde mir so etwas auf einem Server wünschen. Vielleicht kann ich sie bitten, mir für zukünftige Integrationen ein paar RTX zu geben. Vorteile dieser Option: Zugang zu Top-Grafikkarten ohne Kauf. Keine Kühlung nötig, keine Stromkosten. Nehmen, arbeiten, einschalten, ausschalten. Nachteil: Es ist immer noch nicht lokal. Ihre Daten gehen an den Server. Und das ist eine großartige Option für diejenigen, die verschiedene Ressourcen und verschiedene Grafikkarten testen möchten. Sie wissen nicht, was Sie kaufen sollen. Nun, zum Beispiel können Sie einen Server für eine Stunde mieten, verschiedene Modelle testen, ihre Leistung sehen und dann überlegen, ob Sie eine lokale Lösung in Ihrem Keller aufbauen wollen. Hier ist eine zusammenfassende Tabelle dessen, was wir hier besprochen haben. Ich werde nicht anhalten und es durchsprechen. Drücken Sie auf Pause, lesen Sie, weiter geht's. Und nun zum süßen Teil: Tests. Wir haben ein Gesamtbild erhalten, wie lokale KIs funktionieren, welche Hardware es dafür gibt, wie viel es kostet. Es bleibt die wichtigste Frage zu klären: Welches Intelligenzniveau können wir aus der Hardware herausholen, die uns der Markt derzeit bietet, und was begrenzt uns – unsere Gier oder Unfähigkeit? Hier sind alle Modelle, die ich getestet habe, und ich habe sie in fünf Gruppen eingeteilt: Krümel, Klein, Mittel, Groß und Giganten. Ich habe versucht, die Top-Modelle in ihrer Kategorie auszuwählen, um Ihnen das reale Intelligenzniveau zu zeigen, das man aus einem Modell herausholen kann. Mein Referenzpunkt wird die aktuelle Top-Open-Source-KI GLM 5.2 sein. Das ist ein Modell von unglaublichen absoluten Größen, obwohl es 3-Bit- und 2-Bit-Quantisierungen gibt. Im Allgemeinen hätte man es zum Laufen bringen können, aber ich habe einfach die API über Llama verwendet, um Ihnen zu zeigen, wie das Modell in meinem Test abschneidet. Lassen Sie es uns auf Russisch sagen, damit wir uns nicht streiten. Erstens, in der Tabelle sehen Sie bereits Benchmarks. Und ich habe den Intelligenzindex als Grundlage genommen. Das ist ein aggregierter Benchmark, der eine Menge verschiedener Metriken umfasst: von Coding bis hin zu Agentenaufgaben, Mathematik und Allgemeinwissen in allen Bereichen. Das heißt, man kann bereits verstehen, was Modelle auf diesem Intelligenzniveau leisten. Und wie Sie sehen können, haben größere Modelle in der Regel einen höheren Intelligenzindex. Zum Beispiel ist OSS 120B ein ziemlich altes Modell von Open AI, Open Source. Im Allgemeinen ist es sogar schlechter als Llama 4 mit 26 Milliarden Parametern. Was war mein Prompt? Er sieht so aus. Eigentlich eine ziemlich einfache Geschichte, aber hier habe ich getestet, wie das Modell ein Werkzeug verwenden wird. Ich habe mehrere Skills, die das Modell lesen und ein paar Skripte verwenden musste, um Statistiken von meinem YouTube zu erhalten, diese Daten zu analysieren und ein HTML-Dashboard zu erstellen. Alle Modelle habe ich mit einem Kontextfenster von 64.000 Tokens getestet. Dementsprechend haben sie hier etwas mehr Speicher verbraucht, als ursprünglich angenommen, wenn wir ein Modell ganz ohne Kontextfenster ausführen. Das ist der KV-Cache und der Speicherbedarf dafür. Davon habe ich bereits gesprochen. Und fangen wir sofort mit dem Modell GPT OSS 120 Milliarden Parameter an. Warum? Weil es unglaublich einfach zu starten ist. Dazu habe ich Selectel verwendet, und die Jungs haben seit kurzem einen interessanten Service. Hier können wir ohne jegliche Probleme einen Inferenz-Service erstellen, indem wir eines der Modelle im Katalog verwenden. Hier müssen Sie sich nicht einmal darum kümmern, einen Cloud-Server einzurichten, ihn zu starten, alle notwendigen Bibliotheken hochzuladen, Lama.cpp zu installieren, eine Grafikkarte auszuwählen. In meinem Fall habe ich einfach das Modell GPT OSS 120 Milliarden Parameter gewählt. In der Quantisierung ist es 16, also volle Quantisierung. Die Kontextmenge ist hier fest. Das heißt, die Einstellungen sind ziemlich begrenzt, was für diejenigen, die sich noch nicht so gut auskennen und bereits mit Modellen auf dem Server arbeiten möchten, großartig ist. Es gibt eine praktische Dokumentation, Informationen darüber, wie die Metriken des Modells berechnet wurden. Zum Beispiel generiert OSS 120B mit einer Geschwindigkeit von 111 Tokens pro Sekunde. Auf dieser Hardware, die ich hier gewählt habe, mit 141 GB Videospeicher, was mehr als genug ist, um diesen Krümel zu starten. Krümel mit 120 Milliarden Parametern, das habe ich natürlich übertrieben. Nachdem wir den Inferenz-Service aktiviert haben, erhalten wir einen Endpunkt, über den wir auf dieses Modell zugreifen können, und einen API-Schlüssel. Und sehen Sie, wie einfach es ist, lokale Modelle innerhalb von KI-Agenten zu verwenden. Ich habe dieses ganze Wunder genommen, bin zu meinem Hermes gegangen, habe auf die Schaltfläche geklickt, um einen neuen benutzerdefinierten Endpunkt hinzuzufügen, habe den Endpunkt eingegeben, den mir Selectel gegeben hat. Danach habe ich den API-Schlüssel hinzugefügt. Selbstverständlich sollte man ihn niemandem zeigen. Und alles hat funktioniert. Ich kann jetzt das Modell auswählen und anfangen, damit zu kommunizieren. Es läuft irgendwo auf dem Server, der in keiner Weise mit OpenAI verbunden ist, was großartig ist, besonders wenn Sie im russischen Raum arbeiten und alle Datenübertragungsnormen einhalten müssen. Die Infrastruktur von Selectel entspricht den Anforderungen der Zentralbank Russlands. Sie unterliegt allen Gesetzen. Kann in Projekten verwendet werden, bei denen personenbezogene Daten gesammelt und verarbeitet werden. Daher ist dies besonders relevant, wenn Sie im russischen Informationsraum arbeiten. Nun, ich beginne, direkt über Hermes mit dem Modell zu kommunizieren. Im Grunde ist das ein Agent, der jetzt Werkzeuge hat. Und lassen Sie uns den ersten Test durchführen. Ich gebe ihm den Prompt, das Modell mit unglaublicher Geschwindigkeit, aber es war etwas langsamer, etwa 90 Tokens pro Sekunde. Dann habe ich in den Logs nachgesehen, es hat gearbeitet und sehr schnell habe ich das Ergebnis erhalten. Ein absolut erbärmliches HTML-Dashboard hat es zusammengestellt. Das ist ein Modell mit 120 Milliarden Parametern. Es ist schon ziemlich alt. Ich habe es hier nur ausgewählt, weil es in diese Kategorie großer Modelle passt. Ehrlich gesagt, ich weiß nicht, wie man es derzeit verwenden kann. Höchstens in einem Support-Chat, ein Agent, der einfache Fragen von Kunden, Kontrahenten oder Ähnlichem beantwortet, durchaus, da es sehr schnell arbeitet. Aber für echtes anspruchsvolles Coding, Agentenarbeit, glaube ich nicht, dass es die ideale Lösung ist. Dennoch hat es gut funktioniert. Es hat übrigens auch unser Logo und alle Links zu den analysierten Videos extrahiert. Zusammenfassend zu Selectel. Alles wird extrem schnell installiert und in Betrieb genommen. Wie bereits erwähnt, erhalten Sie einen Schlüssel, und Sie können mit KI-Agenten arbeiten. Denn ich habe später alles auf den Servern eingerichtet, da muss man schon ein bisschen fummeln, damit alles läuft. Direkt im Katalog können Sie für Modelle abstimmen, die noch nicht in der Liste sind, aber Selectel kann sie in Zukunft hinzufügen, wenn es eine Nachfrage gibt. Achten Sie also darauf, registrieren Sie sich über den Link in der Beschreibung, beginnen Sie mit der Nutzung von Modellen ohne separate Einrichtung und Bereitstellung von Cloud-Servern in nur 3 Minuten. Und nun weiter zu den Tests. Ich zeige Ihnen sofort das Ideal dessen, was man hätte tun können. Obwohl es hier auch einige Mängel gibt, sozusagen. GLM 5.2 hat mir ein solches Dashboard zusammengestellt. Ich werde nicht ins Detail gehen. Insgesamt sind alle Informationen korrekt. Und tatsächlich konnten alle Modelle die Werkzeuge richtig aufrufen, was mich ehrlich gesagt überrascht hat. Hier hat GLM einen seltsamen Graphen, der nicht angezeigt wurde, aber insgesamt ist die Präsentation der Informationen ästhetisch gelungen. Es wurde gesagt, was am besten funktioniert. Die Top 5 besten, Top 5 schlechtesten Videos wurden gezeigt, was die Daten, Schlussfolgerungen und Forschungsergebnisse sagen. Hermes, der absolute Hit des Quartals, ja, das stimmt. Unser Video hat 72.000 Aufrufe erzielt. Es sagt: "Füge noch eine Übersicht und Agenten pro Woche hinzu. Halte das Tempo von zwei bis drei Videos pro Woche." Nicht nur eine gut gemachte und in unserem Stil umgesetzte Website, sondern auch gut mit Informationen gefüllt. Eine recht angenehme Aufteilung, das Dashboard ist gut lesbar. Das ist unser Referenzpunkt und Ideal. Merken Sie sich das. Aber wir haben uns verzettelt. Springen wir stark zurück und schauen uns an, wie sich kleinere Modelle verhalten. Der kleinste Vertreter meiner heutigen Tests sind 3,54 Milliarden Parameter, 4 Milliarden dichte Parameter, nennen wir es so. Das Modell verbrauchte 6 GB Videospeicher bei der Inferenz. Es generierte mit einer Geschwindigkeit von 24 Tokens pro Sekunde, was fast fünfmal langsamer ist als zum Beispiel bei GPT OSS 120B. Und dieses Modell, wie auch die folgenden drei, habe ich auf meinem lokalen Computer mit LM Studio getestet. Ich habe die Modelle auf das MacBook geladen, und sie haben dort gearbeitet und Ergebnisse geliefert. Dieses Modell ist das kleinste, sowohl in Bezug auf die Größe als auch auf den Intelligenzindex. Es erreicht nur 20 Punkte. In allen Dashboards können die Zahlen leicht variieren, aber ich habe nachgesehen, alle Werkzeuge wurden korrekt aufgerufen, und insgesamt hat das Modell die Skills kompetent genutzt. Und das Dashboard sieht so aus. Es ist viel banaler. Einige wichtige Schlussfolgerungen hat das Modell geliefert. Nun, und diese Liste mit grundlegenden Statistiken für jedes Video. Dieses Design und Layout ist sehr typisch für kleine Modelle. Wir haben hier keine tiefgehende Analyse erhalten, aber noch einmal, das Modell hat alle Werkzeuge verwendet. Das nächste Modell im Test war Ornis 1.0 mit 9 Milliarden Parametern. Ein brandaktuelles Modell. Es generierte bei mir mit einer Geschwindigkeit von 34 Tokens pro Sekunde. Und übrigens, ich habe es nicht auf MLX, sondern auf GGUF ausgeführt. Nun, aus irgendeinem Grund habe ich es so heruntergeladen. Fragen Sie nicht, warum. Es verbrauchte mehr Videospeicher, 8,3 GB in Spitzenzeiten. Und dieses Dashboard hat es generiert. Insgesamt unbefriedigend. Hier sehe ich keine Ästhetik und keinen wirklichen visuellen Stil. Es ähnelt eher dem, was OSS 120B gemacht hat, aber nicht ganz genau. Beachten Sie, dass hier zum Beispiel ein Video von Open Cloud vom 28. Januar aufgetaucht ist. Ich habe nach dem letzten Quartal gefragt, was etwas weiter als ein Quartal ist. Solche Dinge sind also bei lokalen Modellen zu beobachten. Sie verstehen nicht ganz, was Sie von ihnen wollen, und folgen den Anweisungen nicht sehr genau. Llama 4 mit 12 Milliarden Parametern, ebenfalls ein neues Modell, 22 ist sein Intelligenzindex. Quantisierung ist die gleiche Q4KM und es verbrauchte etwas mehr Videospeicher in Spitzenmomenten bis zu 10,8 GB. Und die Anzahl der Tokens pro Sekunde habe ich nicht angegeben. Warum? Weil es bei mir nicht gestartet ist. Und das ist meiner Meinung nach ein ziemlich aussagekräftiges Beispiel. Sie werden sich abmühen, wenn Sie anfangen, mit lokalen KIs zu arbeiten, denn es gibt ein bestimmtes Schema, wie es die Nachricht vom Benutzer, die Nachricht von sich selbst und die Token-Erzeugung erkennt. Und bei mir hat es über Hermes nicht funktioniert. In LM Studio hat es im Prinzip normal funktioniert. Aber als ich versuchte, daraus einen Agenten in LM Studio zu machen, muss man nur hierher gehen, den Server starten und dann zu Hermes gehen, einen neuen Endpunkt erstellen, die Adresse dieses lokalen Servers hinzufügen, und alles, alle Modelle funktionieren jetzt innerhalb von Hermes, arbeiten mit Werkzeugen, arbeiten als vollwertige KI-Agenten. Sehr einfach und schnell. Daher habe ich keine Ergebnisse von GM 12B. Nun, entschuldigen Sie, habe ich Ergebnisse von Llama 26B? Auch nein. Und hier ist die Geschichte. Das Modell hat angefangen zu meckern, als ich versuchte, es zu starten. Und in LM Studio musste ich die Einschränkungen mildern, die die Anwendung auf die Ausführung von Modellen auferlegt, weil die Anwendung dachte, ich hätte nicht genug Videospeicher, aber nach meinen Berechnungen sollte alles ausreichen. Und tatsächlich, als ich die Schutzgeländer entfernte, konnte ich dieses Modell starten. Und es lief mit einer Geschwindigkeit von fast 64 Tokens pro Sekunde. Das ist sehr schnell. Aber hier ist der Trick, dass das Modell keine Dense-Version ist. Hier sind nur 4 Milliarden Parameter aktiv. Ich werde nicht ins Detail gehen, aber in der Regel laufen Modelle, die aktive Parameter und eine Mixture-of-Experts-Architektur haben, und führen diese Dekodierungsphase schneller durch, generieren schneller Tokens. Und im Ergebnis, als ich versuchte, das alles in Hermes zu starten, stürzte das Modell ständig ab. Mac meckerte, MLX meckerte, sagte, du hast zu wenig Videospeicher, Freund. Anscheinend konnte es diese Menge an Tokens am Eingang des Modells innerhalb des Agenten nicht verarbeiten, aber innerhalb von LM Studio ging es. Ich halte ein negatives Ergebnis auch für ein Ergebnis, deshalb erzähle ich Ihnen ehrlich, dass ich dieses Modell hier auf dem Mac nicht zum Laufen bringen konnte. Und im Allgemeinen habe ich aufgegeben, Modelle über 12 Milliarden Parameter auszuführen. Man hätte noch etwas bis 20 Milliarden herumspielen können, aber ich bin dann auf den Server gegangen und habe bei Selectel eine RTX 4090 gemietet und alles andere Wunder gestartet. Das nächste in der Liste ist Qwen 3 627 Milliarden Parameter. Dieses und alle nachfolgenden habe ich auf einer RTX 4090 mit 24 GB Videospeicher ausgeführt. Und es generierte bei mir mit einer Geschwindigkeit von 44 Tokens pro Sekunde und verbrauchte 21 GB Videospeicher. Wiederum, im Kontextfenster von 64.000 Tokens. Das heißt, diese Menge an Videospeicher reicht durchaus aus, um bereits ein anständiges Modell von 27-35 Milliarden Parametern auszuführen. Und beachten Sie, der Intelligenzindex ist hier wirklich bemerkenswert. 37 ist der zweite Platz nach JLM 5.2 in unserem heutigen Test. Und andere Benchmarks, wie Sie vielleicht bemerkt haben, bringe ich auch mit. Sie können sie vergleichen. Das ist ein Coding-Benchmark, Agenten-Benchmarks, Werkzeugnutzung. Ich glaube nicht, dass der Stil unseres Dashboards perfekt übernommen wurde, aber die Ergebnisse sind hier in Ordnung. Und andererseits hat es hier interessante Dynamiken in den Graphen gegeben. Das heißt, das Dashboard ist etwas abwechslungsreicher geworden. Ja, ehrlich gesagt, es ist einfach nicht ästhetisch, aber in Bezug auf den Inhalt und die Abwechslung gefällt es mir deutlich besser als fast alles, was wir bisher gesehen haben. Es gibt auch Schlussfolgerungen und Empfehlungen. Dieses Format habe ich getestet. Absoluter Spitzenreiter. Die Engagement-Rate steigt. Die Beteiligung steigt, Freunde. Beteiligen Sie sich. Lassen Sie uns diesen Trend gemeinsam fortsetzen. Nun, danke dafür. Übrigens, der monatliche Trend der sinkenden Aufrufe. Und diesen Trend werden wir im Keim ersticken. Empfehlungen für das nächste Quartal. Insgesamt ist dieses Dashboard von Qwen 3 627B entstanden. Das nächste Modell 35 Milliarden Parameter. Hier hat es tatsächlich Mixture of Experts und nur 3 Milliarden aktive Parameter. Aber beachten Sie, wie viel schneller das Modell auf der gleichen Grafikkarte läuft. 155 Tokens pro Sekunde und verbrauchte etwas mehr Videospeicher in Spitzenzeiten bis zu 22,7 GB. Nach dem Intelligenzindex liegt es etwas hinter der vorherigen Version. Es hat dieses Dashboard zusammengestellt. Es gefällt mir weniger als das, was insgesamt bei der 27-Milliarden-Parameter-Version herauskam. Die Top-Aufrufe sind alle 25 Videos im Quartal, warum auch immer. Nicht ganz klar, warum. Hier gibt es keine Links. Bei 120 gab es Links, wichtige Erkenntnisse wurden geliefert. Und meiner Meinung nach ist es etwas langweiliger als das, was wir bisher gesehen haben. Und schließlich Ornette. Ein Modell mit 35 Milliarden Parametern. Es hat sehr bemerkenswerte Werte im SWE Bench Verified, im Terminal Bench. Auf dem Intelligenzindex habe ich bei der Vorbereitung dieses Videos nichts gefunden. Vielleicht habe ich es während der Bearbeitung noch gefunden, ich weiß es nicht. Dieses Modell ist das neueste von allem, was ich hier getestet habe, zusammen mit der gleichen Version mit 9 Milliarden Parametern. Und es scheint das klügste zu sein. Es generierte bei mir 166 Tokens pro Sekunde. Absoluter Spitzenreiter auf der gleichen Grafikkarte, verbrauchte 22 GB Videospeicher. Dieses Bericht-Dashboard haben wir erhalten. Ich wiederhole, alle Modelle haben tatsächlich erfolgreich Werkzeuge aufgerufen und die Skills erfolgreich geladen. Das heißt, ich dachte, kleine Modelle würden das gar nicht schaffen. Deshalb habe ich den Test ehrlich gesagt recht einfach gehalten, gemessen an mittleren Modellen. Aber Sie sehen, alle haben es geschafft, deshalb müssen wir nur noch nach Ästhetik und Informationsumfang vergleichen. Hier sind die wichtigsten Schlussfolgerungen eher primitiv. Wieder der Haupt-Hit des Quartals Hermes und der Agent. Das haben wir bereits verstanden. Stabile Content-Strategie: ein Video pro Woche. Das Kernthema und Agenten. Nun, alle haben verstanden, dass Agenten gerade im Hype sind. Oh, hier kann man auch klicken, sehen Sie, zu unseren Folgen. Nun, cool. Danke. Es stellt sich heraus, dass es immer noch Qwen Reorder Next gab. Ich habe es noch nicht getestet. Vielleicht habe ich es während der Bearbeitung noch getestet und Sie erfahren jetzt etwas darüber, vielleicht auch nicht. Es hat einen ziemlich niedrigen Intelligenzindex, nur 21,2, etwas mehr als Qwen mit 3,54 Milliarden Parametern. Deshalb war es mir irgendwie peinlich, so viel leistungsstarke Hardware zu verwenden, denn 80 Milliarden Parameter bei einem Modell, nun ja, das sind keine beeindruckenden Werte. Hier ist unsere zusammenfassende Tabelle. Sie können sie ansehen, bewerten, verstehen, die Menge an Speicher, die die Modelle während der Tests verbraucht haben, mit welcher Geschwindigkeit an Tokens pro Sekunde sie generiert haben. Nun, ich hoffe, ich konnte Ihnen ein ziemlich umfassendes Bild vermitteln, darstellen, alle Karten auf den Tisch legen, damit Sie verstehen, wann Sie in diesem unruhigen, ziemlich wilden Ozean lokaler Modelle navigieren müssen. Beantworten wir die Hauptfrage. Kann man Abonnements jetzt mit lokalen KIs ersetzen? Ehrlich gesagt, nein. Das heißt, vielen gefallen die Ergebnisse von GLM 5.2 nicht, obwohl ich es ziemlich mag. Aber alle Modellversionen, die wir von Krümeln bis zu mittleren Modellen ausgeführt haben, zeigen deutlich schlechtere Ergebnisse als die Top-Open-Source-Modelle und erfordern bereits eine beträchtliche Menge an Rechenleistung. Das heißt, Sie haben bemerkt, mein Mac mit 24 GB stöhnt bereits, wenn ich auf 256-30 Milliarden Parameter komme. Einzelne Aufgaben, einzelne Automatisierungen, nicht komplexe und nicht sehr umfangreiche Werkzeuge, Datenverarbeitung, Kategorisierung, punktuelle Patches in der Codebasis. Ja, zweifellos kann all das abgedeckt werden. Aber wenn Sie dachten, Sie könnten ein Modell auf Ihre Hardware stellen und es wäre auf dem gleichen Niveau wie die Abonnement-Versionen, dann natürlich nicht. Bleiben Sie bei uns, abonnieren Sie den Kanal, hinterlassen Sie Likes, Kommentare, erzählen Sie uns, was Sie genauer erfahren möchten. Vielleicht über LM Studio und die Einrichtung, vielleicht detailliertere Tests kleiner Modelle, vielleicht in einem engeren Bereich, denn ich beobachte sehr deutlich, dass Open Source mit unglaublichem Tempo wächst und tatsächlich zu geschlossenen proprietären Versionen aufholt. Ich wäre nicht überrascht, wenn in zwei Jahren kleine Open-Source-Modelle auf dem Intelligenzniveau mit den aktuellen GPT 5.5, Opus 4.8 vergleichbar sein werden. Wir werden dieses Video in 2 Jahren gemeinsam ansehen. Bis zu zukünftigen Folgen. Tschüss. Mhm.