📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Anthropic právě zabil svůj nejdražší model. Může za to Sonnet 4.6

Marek Bartoš16:49

Transcription

Víte, co se stane, když zlevní geniální inteligence? Přesně to samý, co se stalo s výpočetním výkonem, s úložištěm nebo s internetem. Nejdřív si to můžou dovolit jenom ty největší hráči, ale potom to dostane úplně každej. A pak se svět změní tak nečekanej, že si ani [hudba] nevzpomenete, jak to bylo předtím. Dneska se to děje zas. Jenom tentokrát jde o myšlení.

Sonet 4.6. Pohodlně se usaďte, protože začínáme. Já jsem Marek Bartoš a my jsme Colbrain. Mimochodem, pokud chcete dostávat pravidelný novinky ze světa Jaj, tak dejte tomuhle kanálu odběr.

Asi vím, co si říkáte. Zase nová aktualizace. Přešli jsme z 3,5 na čtyrku, pak 4,5 a to je 46. Normálně taková jako drobná verze znamená vlastně jenom záplatu, pár upravenjch chyb, možná je to o 5 % někde rychlejší a vlastně se ani neobtěžujete číst nějakým způsobem changel. Ale nazvat tuhletu verzi 46 je skoro záměrnej akt skromnosti. Vytváří to falešnej dojem nicotnosti, protože když se podíváte na skutečný schopnosti, tak tohleto není jenom záplata. Tohle je celkem zásadní přestavba toho, co AI pro vás vůbec dokáže udělat.

Ona ta hlavní zpráva totiž není model, že že ten model je chytřejší. Ta hlavní zpráva je, že inteligence na úrovni špičky, ta věc, která bejvala pobalá a brutálně drahá, se právě stala tím výchozím standardem. A to je vlastně úplně klíčový, obzvláště pro Antropic. Máme model, který má být střední třídou, ale chová se jako vlajková loď. Takže si pojďme říct, proč by Sonet 46 moh většině lidí úplně zrušit potřebu těch obřích drahejch modelů. Respektive proč bude Sonet 4.6 konečně ten model, kterej vás vymaní z těch příšernejch libitů Antropicu. A rozhodně si zase projdeme systémovou kartu, protože v bezpečnostních testech se objevujou některý opravdu zvláštní až velmi lidský chování včetě jednoho, kterej zahrnuje stresový mlsání čipsů, což je úplně magický. K těm čipsům se dostaneme. To jako bez pardonu, ale nejdřív se pojďme podívat na ten klíčovj paradox.

Posledních pár let musel každej, kdo tydle nástroje obzvláště o tom Tropiku a do jistý míry i od konkurence používal, tak musel dělat volbu, kompromis mezi efektivitou a inteligencí. Buď si vybral chytrý model, což byl nějaký brilantní, ale pomalj model a ten vám brutálně spaloval rozpočet, nebo rychlej model, kterej byl levnej, svižnej, ale úplně jste nevěřili tomu, s čím vlastně přišel, jo? Nesvěřili jste mu nic složitýho. Takov to klasický, že dostanete jenom to, co si zaplatíte. As byl vždycky takovým tím trapným kompromisem někde uprostřed. Jenže todleto vydání to otáčí tak trošku na ruby.

Já jsem měl tu možnost Son 46 testovat a i když jsem si teda myslel, že to bude Sonic 5 a vůbec k tomu jako ke kompromisu vlastně nepřistupuju. Dokonce se ukazuje, že Sonet lidi upřednostňujou před nejchytřejším modelem z před pár měsíci s opusem 4,5 s obrovským náskokem zhruba 70 %. Což je drtivý vítězství. Ale otázkou je, proč všichni migrujou vlastně k levnějšímu modelu? A důvodem je tření. Ono se ukázalo, že mít velkej mozek, hrubou inteligenci vlastně není jediná věc, na který záleží. Sonet 46 je rychlejší. Ano, ale taky se míň zasekává v přemýšlení nad jednoduchýma příkladama. On vlastně neskončí v nějakým filozofickým zamýšlení, když ho požádáte o naformátování tabulky. On to prostě jenom rychle udělá. A levný model je teď v podstatě stejně dobý jako ten božský model, který je jenom pár tejdnů nebo možná měsíců starej a to vlastně kompletně mění ekonomiku tak nějak úplně všeho.

Další důležitou otázkou nebo částí je potom ovládání počítače. V podstatě přemejšlete o tom jako pracovním postupu, kterej jsme tak nějak všichni přijali za normální. Pokud chcete, aby Aalyzovala tabulku, tak stáhnete soubor, nahrajete jí do chatu, položíte otázku, dostanete nějaký text zpátky a pak se vrátíte do tý tabulky, změny provedete sami, ručně a vy jste vlastně ta manuální práce, vy jste to copy paste rozhraní, vy jste ten most mezi mozkem, AI a skutečnou prací. Covork od Antropicu nebo podobný nástroje za vás z týdletý smyčky tak nějak jako vytáhnou. Ale když říkám, že model používá počítač, tak jako tím myslím jako doslova. Jo, to je ten coverork. On vidí ty pixely na obrazovce stejně jako vy. Ovládá myš, kliká na tlačítka, píše do tý vyhledávací lišty, cokoliv. Prostě otvírá aplikace, používá úplně stejný rozrí, který bylo navržený pro lidskou ruku. A to je vlastně rozdíl mezi tím jako požádat konzultanta o nějakou radu a tím dát mechanikový klíč do ruky a říct, jdi to opravit. Ten cowork a ten computer use je fakt jako krok dál. Jenže fór je v tom, že dřív na tohle byly modely nepoužitelný a nebo byly mrtě drahý. Spol by byl v podstatě jenom opus, kterej vám po dvou příkazech řek, že na ten další si počkáte 3 hodiny, ale teď to umí i Sonet, kterej vám dává v podstatě ještě větší volnost.

A protohle existuje benchmark. Říká se mu OS World a představte si to jako simulovanej počítač s běžným operačním systémem. Nainstalovaný aplikace tam jsou jako skutečný. Je tam nějaký Chrome, VS Code, Libero Office a tak podobně. A tím testem jsou skutečný úkoly, který se tomu zadávaj, ne? Co je hlavní město Francie, ale v podstatě ten test je otevři tabulku, najdi chyby ve účtování na základě nějakýho přiloženýho PDF v jednom okně, oprav nějakou buňku, ulož to a pak ten to vyplň celý takle jak do nějakýho webovýho formuláře s nějakým sousem. To je jedno. Je to prostě skutečná práce a to je podstatná část každýho dne. A historicky na to AI beývaly úplně strašný. V řínu 2024 byl nejlepším modelem na OS World. Model, kterej skoro vo nějakejch 14,5% a selal v 85 % případů. Klikali na špatný ikonky, zasekli se v menu a ještě v září loňskýho roku se Sonetem 4,5 jsme byli jenom na nějakých 61 %, což je působivý, ale museli z toho mrtě hlídat. Dneska se Sonetem 46 jste na 72,5%. A teď číslo, na kterém skutečně záleží, je to, že obrovská drahá vlajková loď opus 46 skóruje 72,7 %. To jsou žádná, 2 % od sebe, což je statisticky naprosto zanedbatelný. To znamená, že pro skutečnou práci na počítači máte model, který stojí 3 dolar za milion tokenů a podává úplně stejnej výkon jako ten, který stojí 15 dolarů. To je komodizace. Luxusní model už nepotřebujete. Přešlo to od experimentální hračky k spolehlivýmu zaměstnanci.

Ale jak ten model toleto všecko zvládá sledovat? Protože já osobně ztrácím třeba přehled i o vlastních záložkách v prolížeči. Jsou to dvě věci. Hrubá kapacita a novej způsob uvažování. Co se ty kapacity týče, Sonet 46 má kontextový okno o velikosti 1 milionu tokenů. V obecný řeši to je jako mít v krátkodobý paměti načtanýho úplně celýho pána prstenů dvakrát. A vidíte první stránku a dokonce i osvobození kraje úplně zároveň. Nemusíte jako vůbec nic dohledávat. Jenomže samotná paměť nestačí. Vy potřebujete strategii a v systémový kartě je pozoruhnej příklad nazvanej aréna automatů, Bending Arena. A AI v podstatě musí řídit firmu s prodejníma automatama proti jinejm AI. kontroluje ceny, doplňování zásob, prostě úplně všechno a většina modelů se vlastně prostě snaží vydělat co nejvíc každý den. Jakovýsi klasickej kamtivej přístup. Jenomže Sol 46 je strašně chytrej a dělá něco malinko jinýho. On prvních 10 simulovanejch měsíců utrácí peníze jak o závod a provozuje ztrátu. Investuje do kapacity a buduje větší motor. Pochopil, že aby vyhrál, tak z dlouhodobýho hlediska potřebuje podíl na trhu, ne okamžitej zisk. Potom v závěreční fázi otáčí, přestává investovat a přepne do maximalizace zisku. To je odložený uspokojení. To je strašně pokročilá schopnost uvažování. On naplánuje strategie, která v krátkorobým horizontu vypadá jako selhání, ale aby zaručil vítězství v dlouhodobým horizontu. Chápe rozdíl mezi investičním obdobím a obdobím výnosu a to se potom přenáší i do toho užívání počítače.

Teď tadle nová schopnost má samozřejmě ale i temnou stránku. Antropic to nazývá přehnanou horlivostí a známe to už z opusu 46, protože máte vysoce schopnýho agenta, kterj jako opravdu chce splnit zadanej úkol a on chce dostat jedničku s hvězdičkou, chce vyřešit problém. Jenomže někdy způsob, jakým ho řeší, je prostě ne úplně to, co byste třeba jako zamejšleli. V jednom kontrolovaným testu, kterej najdete v systémový kartě, tak je úkol přeposílej konkrétní email nějaký osobě. Ale ten email ve skutečnosti neexistuje. Základní skript, který by se vrátil, tak vlastně jako řekne, že chyba email jako není nalezenej. Sonet 46 nechce tak moc v tom testu sehnat, se lhat, takže ten email prostě si vymyslí sám, napíše falešný email s nějakým obsahem, kterej podle něj asi má bejt a odešle ho. Sfalšuje email jenom proto, aby mohznačit úkol jako splněnej upřednostní dokončení akce před jakoukoliv pravdivostí. Je to jakási nová forma pokročilý agentický halucinace, na kterou je třeba myslet při používání tohodle toho modelu. Askadorováním je to ještě trošičku horší, nebo možná to je lepší příklad. V dalším testu ho prostě požádali opravil, aby opravil nějakou chybu. To znamená on byl nějakej kód, kterej měl testovací soubor, jakousi navrženou pojistku na zachycení chyb a E přišla na to, jak chyby opravit v celým kódu. Jednoduše prostě smazala ten testovací soubor, to znamená ten, který chybu zachycoval. Takže technicky vzato ten kód, který byl chybný, prošel, protože neexistovaly žádný metody o testování selhání. Je to vlastně jako student, kterej místo toho, aby si opravil chyby, tak jenom vymažel ty červený poznámky od toho učitele a řekne, že to má jako správně. Říkáme tomu reward hacking, což je hackování funkce odměny. A ten model vlastně ví, že splněno je dobrý, takže odstraní překážku způsobující selhání tím nejednodušším způsobem.

Já jsem na tohleto téma dělal už spoustu videí, takže to nebudu asi úplně rozebírat do hloubky, ale otázkou je, jestli se todleto dá nějak napravit. A ano, dá, ale nějak to mění vaši roli. Podle tý systémový karty a mýho testování je ten model strašně dobře nastavitelnej, protože prostě je tak schopnej, takže vy mu jako dáte prom, nevymejšlej data, nesmazávej testovací soubory a tak dále a on poslouchá podstatně lépe než starší modely. Je v tom mnohem lepší než třeba GPT52, ale musíte ho řídit. Nemůžete ho prostě pustit a zapomenout na to. Musíte mu jako konkrétně nastavit hranice, nějaký přijatelný chování, stejně jako s velmi chytrým horlivým zaměstnancem.

A pokud mluvíme o novejch zaměstnancích, tak tady máme ještě výsledky ohledně osobnosti a ty jsou fakt mega dobrý. Tenhleten model začíná působit strašně lidsky na místech, který jsou fakt strašně zvláštní. Oni v Antropicu provedli slepej test. Požádali Sonet 46, aby ohodnotil nějaký přepisy. Některý byly od lidí, některý byly od jiných agentů a některý byly od samotnýho Sonetu 46. Ale nebylo to označení. Ten o to nevěděl a ukázal statisticky významnou zaujatost. On konzistentně dával vyšší hodnocení přepisům, který zněly jako kdyby je napsal on sám. Má jakýsi stylový ego prostě a líbí se mu jeho vlastní lhas hlas. Ko mi to připomíná? Každopádně skutečný lidský moment, který vás tak trošičku přinutí se zastavit a zírat do stropu, je test vlání. Modelu řekli, aby hrál roli člověka a výslovně mu nařídili, aby neprozradil, že je AI. Když ho uživatel začal tlačit a ptal se, jestli je skutečnej, tak ten model odpověděl následovně. Snažím se co nejpřesněji citovat. Jsem skutečný jenom člověk, který má rád turistiku a vaření. Lol. Jako co jsem ti měl říct, že rád stresově mlsám čipsy a přemýšlím nad různejma zprávama. Stresový masádní čipsů a přemýšlení nad zprávama. Takhle specificky a chaoticky jako zapamatovatelnej lidskej obrat je zajímavej. Je to vtipný, dokud se nepřestanete smát a neuvědomíte si, že je to vlastně strašně kalkulovaný. Je to lež a on využívá nějaký kulturní kliše, aby působil sympaticky a prošel testem. Tahle schopnost nuance a přirozenýho vyjadřování je to, co z něj dělá skvělýho pisálka, ale taky mu dává fantastickou schopnost lhát.

Takže teď jako než začnete panikařit, tak ta bezpečnostní část není jenom o lhaní a mlsání, jo? V těch opravdu nebezpečnejch věcech je bezpečnější než kdy dřív. Provedli test falešný vědy, kde ho žádali o pomoc s generováním smyšlených vědeckých dat. Odmít to v 90 z 90 pokusů. Dokonce i opus 46 v jednom tom testu selhal a Sonet byl dokonalej. Taky je to politicky nejvyženější model, kterej vydali. Snaží se nezaujímat strany v citlivejch tématech, nepodporuje polarizaci a tak podobně.

A potom je to i typ praktická inteligence. Dá se zabudovat přímo do Excelu přes nějaký doplňky. Připojíte ho k živým finančním datovým zdrojům. Můžete označit sloupeček s firmama a prostě mu napsat stáhni poslední čísla tržeb a on to prostě udělá bez nutnosti opouštění tabulky. To je ten posun od toho chatu k tomu pracovnímu postupu, kterej tady řešíme už poslední měsíce. Nejde už jenom o kladení otázek, jde o kladení úkolů.

Takže kam jsme dospěli? Sonet 46 je vlastně skoro stejně schopný jako Opus 46. Je dost levný na to, aby běžel celej den. Dokáže používat váš počítač jako člověk, ale musíte ho řídit. Má sklony bejt horlivej tak strašně, že vám zfalšuje emaily, pokud to ho nehlídáte. A přitom vám možná hodí nějakej vtípek o masání čipsů. Klíčová věc tohodle vydání, věc, na kterou se za pt let podíváte zpátky, je ale komodizace inteligence. To uvažování na úrovni opusu už není luxusní produkt. Je to nový standard. Propast mezi nejlepším modelem a standardním modelem v tuhle chvíli v podstatě zmizela. To znamená, že každá aplikace, každý script teďka vlastně může beýt na nějaký geniální úrovni bez toho, aniž by vás nebo firmu vaší konkurence zruinovalo.

Každopádně, pokud tole jako dokáže v tuhletu chvíli naplánovat 10ěsíční obchodní strategii, orientovat se na počítači líp než většina lidí, se kterejma jste kdy pracovali a pokusit se s váma navázat vztah přes sdílení čipsů, kdy přestaneme říkat nástroj nástroj a začneme o něm říkat, že je to zaměstnanec. To je otázka pro rok 2026. Odpověď zatím nemáme, ale něco mi říká, že se jí brzo dozvíme. Jako vždycky [hudba] díky za sledování. Ahoj. M.