📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Graph Engineering: ХАЙП или РЕВОЛЮЦИЯ в AI ? Полный разбор 2026

Эдвард Гришин | AI и автоматизация бизнеса35:48

Transcription

Человек, с которого началась вся эта история, за 1 месяц сжёг 1 300 000 долларов. Сжёг их на токенах, 603 млрд токенов, 100 и агентов, работавших круглые сутки. А случилось это потому, что у его агентов не было одной простой вещи: того, что заставляет их вовремя остановиться. И я думаю, вы знаете этого человека. Его зовут Питер Штайнберг. Это создатель известного агента Open Claw, который после перешёл в Open AI. Этим летом он написал девять слов, которые за выходные взорвали весь AI Twitter и породили новый термин граф инженерия.

[музыка]

Тот, кто запустил волну про то, как правильно строить агентов, сам спалил на агентах миллион с лишним баксов. К этому парадоксу мы вернёмся в самом конце. После этого видео вы поймёте, что такое инженерия графов, поймёте, это хайп или реальная проблема, и что вы можете сделать со своими проектами, чтобы они лучше заработали, и является ли вообще инженерия графов новым слоем Харнеса, который мы ранее обсуждали в огромном ролике про Harness?

[музыка]

Если вы здесь впервые, коротко о себе. Меня зовут Эдвард Гришин. Больше 13 лет опыта в IT e-commerce в роли топ-менеджеров Яндекс Market Cooper, техноchnopark, Sunlight. Сейчас у меня своя студия Futur AI. Мы делаем сайты, приложения AI продавцов и автоматизацию для бизнеса любого уровня сложности. И если вы хотите узнать, как я создаю AI продавцов, как искать первых клиентов, как продавать AI разработку дорого, заходите в мою закрытую группу абсолютно бесплатно. Другие за такие знания просят от 2 до 5 000 руб. в месяц, а я лишь прошу подписку на мою основную группу. И для этого видео я не просто прочитал одну статью, я прочитал их всех, больше двадцати штук целиком, разобрал руками инструменты, что придумали в сети, и написал свой рабочий мини-инструмент с открытым кодом. Я покажу его в середине видео, так что видео будет с максимальным погружением в тему. Так что поехали разбираться, что же такое инженерия графов. И сразу важно, это видео прямое продолжение прошлого прос или пропс инженерию. Если не смотрели, не страшно, я всё объясняю здесь, в том числе. Но связь сильная, поэтому советую его посмотреть.

Месяц назад была волна ровно с теми же героями. В июне Штайнберг написал: "Хватит промтить агентов по одному сообщению. Стройте циклы, которые промтят их за вас". 8,4 млн просмотров у данного твита. В тот же день Ади Османи из Google назвал это OP инженерия. А Борис Черный, человек, который построил кд-код, подтвердил: "Я больше не общаюсь с код-код напрямую. У меня крутятся циклы, и это они общаются с Клодом". И прошлое видео я закончил одной фразой, запомните её и в этот раз. Она ключ ко всему сегодняшнему видео. Звучала она так: главный навык - это научиться писать, что значит готово для вашей модели, словами, которые проверка может подтвердить, не читая ваших мыслей. Держите эту фразу у себя в голове. Через 20 примерно минут вы поймёте, что всё сегодняшнее видео именно про эту фразу.

Итак, вопрос, который вы уже себе точно задали. Опять новый термин, опять всё поменялось. Это вообще что, прорыв или очередной способ продать вам курс на обучение? Отвечаю не своим мнением, пока что отвечаю голосом человека, который этот самый граф строил 3 года назад задолго до всякого хайпа. Cindy Rankle, open source разработчик из Landchain. Вместе с основателем компании она написала разбор под заголовком "3 года графнженерии". И она называет вещи своими именами. Это, цитирую, "последний термин с конвейера AI контента в Твиттере". Казалось бы, вот он приговор. Всё это пустышка, но она продолжает, и это как раз главное. Все эти модные слова - это детали реализации, и появляются они не на пустом месте. За каждым стоит реальная инженерная боль. Заставить ИИ делать полезную работу по-настоящему трудно. Это новый тип софта, ненадёжный, непредсказуемый. И каждая попытка его приручить рождает новое модное словечко. Вот это самая взрослая, наверное, позиция во всей волне инженерии графов. Не хайп и мусор, не новая эра. А третье модное слово поверх реальной проблемы. И чтобы вы понимали масштаб, что тема реально не выдумана за какие-то выходные, нграф - это граф языковых моделей. Это фреймворк, который команда сделала для графов. Его скачивают 65 млн раз за один месяц. Это не просто хайп-волна, это полноценная рабочая индустрия, которой уже много лет. Но и вот тут вторая половина правды. Сам термин граф инженерия навизной не является. Один из авторов сформулировал всё это идеально просто. 18 июля никто не выпустил ничего, чего нельзя было сделать семнадцатого. Ничего не изобрели, просто дали имя проблеме, которой у людей уже и так давно была.

И вот вам доказательство, что тема не про один твит каких-то кодоров. За пару недель тот же подход перескочил в совершенно другую индустрию, в биржевой трейдинг. Вышла статья, как кванты защищают прибыль графов, 50 с лишним тысяч просмотров и идея там слово в слово такая же, как здесь. Одна метрика тебя обманывает, спасают только якаря. Реальные сделки, реальные деньги на счету. Когда одна идея за неделю прорастает в двух разных мирах, это уже не мода на просто слово. Хотя, честно, её там уже и перепродают. Под статьёй вшита реклама определённая торговая платформа. Так что хайп и суть, как всегда, идут здесь рядом. И все пытаются под видом нового термина продать свои услуги. И ещё одна деталь, тот самый твит Штайнберга, с которого всё пошло, он на самом деле наполовину был шуткой. Он подкалывал, как быстро индустрия несётся от одного модного слова к следующему, а случайно, на самом деле, взял и запустил новую волну. Ирония, которую почти никто не заметил, но поезд хайпа уже уехал. Так что мой вердикт по первому вопросу такой: хайп вокруг слова реально есть, но под хайпом есть реальный сдвиг и реальная проблема. И сейчас я покажу, в чём оно заключается, чтобы вы извлекли из всего видео реальную пользу.

Итак, первое, из-за чего вы ничего не поняли, читая эти статьи, заключается в следующем. Слово граф в них означает две разные вещи. И авторы прыгают между этими терминами, не предупреждая читателей. Объясню смысл, и сразу станет всё понятно. Что вообще такое граф, если совсем просто? Коробки, соединённые стрелками. Всё как схема на салфетке. Только эта схема работает. Коробки делают своё дело, стрелки решают, что будет дальше. Так вот, этих схем существует две. Первое - это граф управления. Коробки в данном случае - это агенты или шаги, стрелки, кто за кем идёт. Это про то, как организована работа AI. Вот про него большинство громких статей и выходит. Вторая - граф знаний. И тут коробки - это уже не агенты, а сущности, люди, компании, функции в коде, а стрелки - связи между ними. Кто кого создал, что от чего зависит. Это вообще про другое. Про то, как хранить факты, чтобы AI по ним рассуждал. И вот в чём вся путаница. Половина авторов пишет про первый граф, вторая половина про второй. И все называют это одним словом: граф инженерия. И почти никто из англоязычных авторов это внятно не развёл, поэтому и получилась путаница. А это опять приводит к инфоцыганчине в поле информации про AI. Один, правда, всё это развёл правильно. В свежем разборе "Харнес против Лупа и против графа" автор прямым текстом пишет, что граф в этом смысле - это графы исполнения, и это не графы знаний. Ровно наше разделение слово в слово, но он в меньшинстве. Остальные валят два смысла в одно слово и хайпуют. Я развожу эти понятия, чтобы и вы не путались. Дальше в видео буду говорить в основном про первый граф, граф управления, а ко второму графу знаний мы вернёмся в конце. Там есть кое-что полезное лично для вас.

И раз мы уж разводим эти понятия, давайте разложу до конца, потому что рядом с графом всё равно мелькает третье слово. Это харнес или обвязка простым словом. Есть разбор, где все три расставлены по местам лучше, чем где-либо. Смотрите, это достаточно просто. Обвязка даёт модели место для работы. Инструменты, память, права, логи. Цикл даёт работе обратную связь. Сделал, проверил, повторил, а граф задаёт маршрут. Что вообще разрешено запустить следующим? По факту несколько строк, и это лучшая формулировка, что я встречал. Модель решает, обвязка даёт ей действовать, цикл заставляет доказать результат, а граф решает, что разрешено делать дальше. И там же фраза, которая объясняет 90% провалов с агентами: "Большинство агентных систем просто падает не потому, что модель слабая, а потому, что система вокруг модели никто нормально не проектировал как цельную систему. Инструменты ненадёжны, состояние теряется между запусками, агент повторяет попытку и ничему при этом не учится, а виноватые назначают модель". Это на самом деле неверный диагноз.

Итак, почему это продолжение прошлого видео про циклы, а не что-то новое взамен? Объясняю. Цикл - это агент, который крутит одно и то же. Подумал, сделал, посмотрел на результат и снова подумал по кругу, пока не закончит. Вы это видели? Так работает клод-код, когда похтит над какой-то сложной задачей. А вот ключевая мысль, на которой сходится сразу три серьёзных источника, заключается вот в чём. Цикл - это и есть граф, просто самый маленький. Одна коробка со стрелкой на саму себя. Стрелка может указывать назад. Вот вам и цикл. Так говорит Сидни Ранкл из Лангчейна. Это говорит Дэвид Хуршит, создатель Икстейта, инструмента, который моделирует состояние программ много лет подряд. Цикл - это направленный граф с петлёй. И это же отдельной большой статьёй доказывает ещё один автор. Цепочки, циклы, графы - это одна и та же идея из пятидесятых годов. И называется она конечный автомат. Поэтому здесь идея не нова.

Итак, когда эксперт по конечным автоматам, разработчик из Нгчейна и автор-теоретик независимо говорят одно и то же, это уже необычное мнение, а это уже какой-то состоявшийся факт, которому надо доверять. Возможно. И вывод из этого простой: циклы не умерли. Граф не заменяет цикл. Граф - это то, что получается, когда у вас несколько циклов, которым надо передавать работу друг друга. Вы не выбрасываете то, что учили в прошлом видео. Вы делаете просто следующий шаг. И у одного автора есть безупречный тест, когда вам вообще пора уйти от цикла к графу. Звучит он так: "Нарисуйте управление вашего агента на салфетке. Если уверены, что нарисовали его полностью, ничего не забыли, у вас цикл, и цикл - это правильный ответ. Не усложняйте это". А если на салфетке не помещается, если сами не уверены, что учли все ветки и развилки, у вас уже граф. Вы просто ещё не записали его там, где машина сможет его прочитать и проверить. Запомните этот тест. Он честнее половины статей на волне хайпа, который сейчас есть. Большинству агентов граф пока не нужен, и это нормально. Граф начинается ровно там, где вы сами уже не можете нарисовать всю схему на одной простой салфетке.

И тут же следующая, самая частая и самая дорогая ошибка на этой волне в том, что люди рисуют 40 узлов до того, как вообще посмотрели, как работа делается на самом деле. Правило здесь звучит довольно-таки просто. Сначала наблюдайте, потом формализуйте. Дайте сильному агенту сделать свою работу, посмотрите живые логи, где он реально спотыкался, где он ходил по кругу, и только те пути, которые оказались устойчивыми, закрепляйте определённой схемой. Иначе получается красивая схема, которая закодировала неверные допущения. Выглядит она вроде как инженерия, но при этом работает как самообман. И чинить её потом будет дороже, чем не рисовать вовсе.

А вот теперь практика, то, что вы примените уже сегодня, даже если у вас нет никаких агентов. Большинство многошаговых процессов написаны прямой линией. Шаг один, шаг два, шаг три. Каждый вежливо ждёт предыдущего. И вот лучшее объяснение всего этого. Вы напечатали к лоду, а потом сделай это. И ваш код услышал: "Жди". Но в чём здесь смысл, спросите вы? Половина этих ожиданий фальшивые. Шаг стоит после соседа не потому, что читает его результат, а просто потому, что вы набрали их в таком порядке. И эти шаги можно сделать одновременно, а не последовательно, друг за другом. Один автор рассказал реальный случай. Скрипт аудит репозитория. Девять шагов, 40 минут. Каждую ночь он отрабатывает. Он посмотрел, шесть стрелок из девяти оказались просто фальшивыми. Шаги не зависели друг от друга, а просто стояли в очереди. Он их сделал параллельными. По итогу 40 минут превратились в 4 минуты без единого нового инструмента. Он не добавил какой-то модный фреймворк, он просто убрал шесть лишних ожиданий. Вот это всё, если совсем коротко, и есть суть графнженерии. Не навесить модную архитектуру, а посмотреть, где ваша работа зря выстроена в линию и тратит ваше время.

И знаете, что изменилось именно сейчас? Почему волна хайпа пошла именно в июле? Одна фраза лучшая по этому вопросу, который может быть. Идея не новая, подешевела проводка. Что это значит? Раньше связь агентов в граф была дорогой и сложной. Теперь вы описываете цель словами, и модель сама пишет код, который всё связывает. А обвал стоимости всегда обнажает то, что раньше строить было слишком дорого. И ещё один пример из лучшего разбора по данной тематике. Когда вы что-то ищете и заранее не знаете, сколько нужно проходов, не ставьте наугад пять раз.

[музыка]

Крутите цикл, пока он два раунда подряд не находит ничего нового. И только тогда останавливайтесь. Тогда граф сам понимает, когда работа закончена и не жжёт токены впустую. Звучит как мелочь, а именно из таких мелочей и складывается инженерия графов. Я недавно сам дошёл до такого принципа на одном своём проекте. Два раунда цикла мне давали понимание, когда нужно реально остановиться, и это работало. Ну что, хватит теории, покажу сейчас это на своём коде вживую и покажу момент, ради которого всё затевалось. Как три ИИ агента хором говорят, что всё готово, а на деле просто вам врут. И как это поймать и потом обойти? Я написал маленький инструмент за один вечер, открытый, бесплатный, ссылка будет в описании. Называется он First Graph. Он специально маленький, чтобы его можно было изучить за один вечер. И делает ровно то, о чём я говорил выше.

Итак, смотрите, я беру свой собственный процесс. Создание выпусков для своего YouTube канала, как один, который вы видите прямо сейчас. Собрать нужно источники, отобрать топ-новости, написать сценарий, проверить факты, отчеловечить, собрать пакет данных и так далее. Я описываю его шаги, что каждый читает, что выдаёт в одном файле и запускаю его не в терминале, а прямо в деспном приложении клода, потому что там работаю, открываю там папку с инструментом и одной фразой прошу: "Прогони firstgraph на моём процессе создания сценария. Покажи фальшивые стрелки". Клод выполняет и показывает результат тут же на экране. И инструмент нам говорит, что из ряда связей некоторые фальшивые. Семь сборов источников можно гнать одновременно. Сценарий и визуальный план независимы, проверка фактов и отчеловечивание тоже. Итого 4:10 мину превращаются в 2:9 на моём реальном процессе. И вот что не делает никто из авторов статей по данной тематике. Инструмент не просто считает фальшивые стрелки, он считает, какие из них реально стоят вашего живого времени. Потому что не всякая фальшивая стрелка стоит денег. Если ветка и так успевает, резать её бессмысленно. Он показывает: "Вот эти семь дорогие, а эти три просто для красоты". Он не даёт мне выдать красивую цифру за настоящую экономию.

Давайте посмотрим, как это всё живёт не в моём учебном коде, а в настоящем инструменте, который у вас уже есть в код-коде. Помните, в прошлом видео была команда Workflows. Так вот, это она и есть. Только теперь понятно, что это буквально и есть граф. Я пишу ему одну фразу: "Проверь все файлы маршрутов на пропущенную авторизацию". По агенту на файл и на каждую находку перепроверь отдельно. И код-код сам пишет программу Оркестратор и запускает флот агентов. И один такой запуск может развернуть до 1 000 агентов. Из них 16 работают одновременно. Но сразу поправка, которую в статьях замалчивают. Координация бесплатная, а вот сами агенты нет. Такой запуск стоит заметно дороже обычного. Экономия в организации, а не в работе. Начинайте с малого здесь.

И вот вам цена вопроса на пределе. Есть такой инструмент бан. Я про него рассказывал. Видео про Харс. Его переписывали с одного языка программирования на другой ровно по этой самой схеме. 64 агента в пики работали с ним, и полмиллиона строк кода превратились в миллион за 11 дней работы. И цена за всё это 65 000 долларов. Плюс человек, который всё это контролировал. Масштаб реальный и цена тоже реальная, и результат реальный.

Ну а теперь момент, ради которого я и делал данное видео. Проблема номер один во всех графов агентов следующая. Они проверяют друг друга словами. Первый агент пишет: "Готово, тесты прошли". Второй читает это и отвечает: "Подтверждаю". А тесты при этом мог быть не запущены. Один поверил тексту другого. Смотрите на экран. Три агента: разработчик, вер идт могут вам говорить следующее, что всё готово, всё забираем в релиз. А теперь мы берём мой инструмент, который делает лишь одну вещь. Он сам запускает тесты по-настоящему. И в итоге мы видим провал. В коде ошибка. Скидка посчитана. Неверно. Граф останавливается. По итогу получается, что три агента у нас сказали, что всё хорошо, по факту нет. И вот эта фраза из прошлого видео теперь в виде работающего кода: "Готово, которая проверка подтверждает, не читая реального кода". Я назвал это якорем реальности и сделал так, что этот якорь нельзя обмануть, в нём физически нельзя передать мнение модели. Только команду, которую можно запустить, только файл, который либо есть, либо нет. Проверка, а не "мне кажется". И это отличает настоящий граф от красивой схемы с галочками. Схема с проверками, которые ничего не проверяют - это просто более дорогой способ ошибиться на вашей задаче.

И пока я это делал, я нашёл человека, который упаковал ровно эту же мысль в одну строку, причём лучше, чем я. Как она звучит? Не крутите цикл на уверенности,

[музыка]

крутите на реальных уликах. И давайте разберёмся, что это значит. Агент вам может сказать, что закончил. И это не доказательство. Тесты прошли, источники resolвятся, ревюер одобрил div. Вот это реально доказательство. Надеюсь, вы чувствуете разницу. В первом случае вы верите словам. Во втором смотрите на улики. Это тот же якорь реальности, только сформулированный так, что его невозможно забыть. И это, между прочим, уже четвёртый независимый автор, который пришёл к такому же выводу, что и я. Просто разными словами. Когда четверо людей порознь приходит к одной мысли, это перестаёт быть просто мнением. Это уже факт.

И ещё одну вещь я решил проверить вживую, потому что все советуют так делать, но на самом деле никто не проверял это в реальности. Совет из всех статей звучит так: ставьте второго проверяющего агента на другой, более умной моделью. Он поймёт то, что пропустил первый. Звучит логично, но стоит ли платить вдвое больше за такую проверку? Я решил прогнать это в реальности. Дал обеим моделям одинаковые задачи с ловушками. Первый судья на дешёвой модели Хайку, а второй на дорогой модели Sanet. И результат, который я получил, оказался не таким, какой я ожидал. Дешёвая модель поймала всё то же самое, что и дорогая. Второй судья не добавил ничего нового и стоил при этом втрое дороже. И вывод здесь не в том, что совет был плохой. Вывод в том, что на моих задачах он просто не окупился. И узнать это можно только одним способом: проверить на своих реальных данных, а не поверить какой-то статье в интернете. Это и есть главная мысль всего данного видео в одном простом примере.

А теперь то, ради чего стоит досмотреть именно этот кусок видео, потому что дальше я расскажу, как этот самый вывод чуть не оказался враньём. Пока я готовил данный выпуск, вышло видео, где ребята прогнали тот же эксперимент и получили противоположный результат. Дешёвая модель у них выдала длинный список замечаний, дорогая, заметно меньше. Они стали изучать код, и большая часть находок дешёвой модели оказалась просто ложной. Она ругалась на вещи, оставленные намеренно. И какой они сделали вывод? Экономия здесь не сработала, потому что теперь само ревью надо ревьюить повторно. И тут у нас получается следующая ситуация. Два человека сделали один эксперимент, и у каждого обратные ответы. Кто-то из нас явно не прав. Я полез разбираться и нашёл проблему у себя. Мы мерили разные понятия. Я брал только сломанный код и спрашивал, найдёт ли судья баг. Это полнота. Они брали рабочий код и увидели другое. Не выдумывает ли судья баг. Это точность. Совершенно два разных понятия и совершенно две разные вещи. И вот в чём тут основная проблема. Если во всех задачах есть баг, то отклонить всегда правильный ответ. Значит, судья, который бракует вообще всё подряд, получил бы у меня безупречные четыре из четырёх. Мой тест этого поймать не мог, в принципе. Ну и самое обидное здесь у меня в кодельные решения уже лежали. Я их сам исключил из проверки и даже написал в комментарии: "На чистых ловить в принципе нечего". Оказалось, есть что, там ловятся ложные тревоги. Я всё это исправил, перезапустил, и получилось уже более честно. Восемь задач, четыре сломанных и четыре верных. Три судьи вместо двух. Добавил самую дорогую модель в виде опуса, чтобы условия совпали с теми же разработчиками, кто это проверял. Каков результат? Все трое поймали одинаково четыре из четырёх. Ложных тревог ноль у всех. Точность 100% как у всех. Разница только в цене. Дорогая модель стоила в 4,2 раза дороже, чем более дешёвая модель за буквально тот же самый результат. То есть мой вывод устоял, но теперь он проверен тестом, который умеет меня опровергнуть. А почему у других разработчиков вышло иначе, тоже стало понятно и никто здесь не соврал. У них было ревью живого интерфейса, где правильно зависит от замысла, что-то оставлено намеренно, и это надо понять из контекста. У меня же алгоритмические задачи, где правоту устанавливают запуск тестов и места для "Я так задумал" просто нету. Ложные тревоги вылезают там, где правильность зависит от контекста, не там, где её проверяет PynTest.

И что произошло в финале, из-за которого вот этот блок попал в видео. Первый честный прогон дал мне красивую картинку. Дорогая модель забраковала все четыре верных решения. Дешёвая ни одного. Сенсация. Платить больше, получается, это плохо. Я эту цифру, естественно, не понёс в видео. Она меня смутила сразу же, потому что 4 из 4 - это слишком ровно. Реальность так не выглядит. Я пошёл смотреть сырые ответы модели. И что я увижу? На все четыре она отвечает: "Одобрить" с подробным разбором, почему решение верное. Получается, врал мой собственный инструмент, и причина оказалась достаточно банальной и поучительной для меня в первую очередь. Я поставил потолок расходов на один вызов в 25 центов, а вызов дорогой модели стоит 32. Она упиралась в лимит и клод возвращал пустой ответ без всякой ошибки. А мой разбор вердикта читал пустоту как "не одобрил", то есть как ложную тревогу. В итоге дорогая модель проваливалась ровно потому, что была дорогой. Вот вам и весь смысл этого видео в одном случае. Схема была, проверки были, тесты зелёные, и система выдала уверенно выглядящую таблицу с обманом, потому что один провал прошёл просто молча. И поймал я это проверкой. Поймал, потому что цифра показалась слишком красивой. Я в итоге всё починил. Теперь пустой ответ роняет прогон с внятной причиной, а не превращает её в вердикт. И написал тест ровно на этот случай, чтобы молчаливый провал больше не проходил. Запомните, это лучше всех цифр, которые сегодня были озвучены. Ваш граф не скажет вам, что соврал, он покажет, что всё зелёное. Спрашивайте себя, не сошлось ли, а могло ли это сойтись по какой-либо ошибке. И это будет правильный вопрос для того, чтобы получить правильный ответ.

И одна практическая деталь, о которой стоит знать заранее. Граф жжёт кратно больше токенов, чем один агент. На двадцатидолларовых тарифов клод-кода и кодекса вы упрётесь лимиты гораздо быстрее, чем привыкли. Начинайте с малого. Это не фигура речи, это реально про ваши деньги. И заметьте, всё это работает на вашей же подписке код-кода без всяких отдельных ключей и оплат. Инструмент открытый. Я его сделал не ради звёзд, а просто, чтобы показать свою теорию на практике, как она работает. Но мой инструмент учебный, и он специально маленький. А чтобы вы не подумали, что всё это ерунда для Ютуба, покажу настоящий

[музыка]

интересный проект. Его собрал один разработчик The Set Rose. И внимание, он построен на Гермес, том самом агенте, про которого у меня было отдельное видео. То есть это прямо соединяет две наши любимые темы. Я его изучил. Это работающая машина. И делает она ровно то, о чём всё это видео, только уже по-взрослому. И три вещи, ради которых стоит взглянуть на неё каждому из вас. Первое, то, что я весь ролик повторяю снова и снова: агент не выбирает, куда идти дальше. Здесь это буквально два разных файла. В одном агент возвращает строгий JSON, просто заполненную форму. В другом обычный код читает эту форму и выбирает маршрут. Ноль обращений к модели самой маршрутизации. И если агент вернул кашу вместо Джейсона, это не "ну, угадаю", а честный сбой, который уходит

человеку. Второе. Якорь реальности, но ещё жёстче моего. Одному агенту там разрешено только читать код, но не писать его. И это невежливая просьба в промте, пожалуйста, не пиши. Программа снимает слепо к репозиторию до и после каждого его хода. И если он тронул хотя бы один файл, прогон упадёт с уликой об этом. Есть тест, который это доказывает. Агент пишет файл, и граф мгновенно уходит в красную зону. Это правило, которое нельзя нарушить даже уговорами.

Третье. Жёсткие правила риска, которые модель не может выключить. Тронул авторизацию, миграцию базы, публичный интерфейс. Обязательно ревью включается автоматически. [музыка] модель может его только потребовать, но не отменить. Плюс лимит попыток живёт в коде. Весь прогон пишется в базу SQL Lite. Его можно остановить, взглянуть внутрь и продолжить с того самого места, даже после сбоя. И каждый агент правит не ваш проект напрямую, а свою изолированную копию. Work 3. В основной код правки падают только после того, как прошли проверку и чисто наложились. Скажу именно с инструмента. Он жёстко завязан на два конкретных инструмента: Гермессие и Кодексе. Под капотом тяжёлый фреймворк, и это ранняя версия 0,1. Как готовый продукт- это ещё не шивой продукт, но как доказательство, что граф инженерия - это не просто [музыка] видео в интернете, а настоящая инженерия с реальными проверками. Это реально лучший пример того, что я видел. Ссылку дам в описании рядом со своим инструментом.

Итак, мы уже на середине. Впереди второй граф, тот самый про знания. И там я покажу, как этот граф ловит AI на вране про ваш собственный код. Плюс разберу цифру, которую вы точно видели в этих статьях. -85% затрат и покажу, как она оказалась в итоге просто обманом.

Итак, помните, я обещал вернуться ко второму типу графов, граф знаний. Вот он и то, чем он будет полезен лично вам. Есть такой инструмент графиifй. Я его разбирал ещё давным-давно, до всего хайпа на Ютюбе. 90 с лишним тысяч звёзд на Гитхабе, всего за несколько месяцев. И это очень много. Волну его популярности, кстати, запустил пост того самого Андрея Карпатова. Того самого, про метод которого у меня тоже было отдельное видео.

Итак, что он делает? Одной командой строит карту вашего кода. Что, с чем связано, какая функция, какую связывают? Как граф локально, без всякой несети за пару минут. Я проверял его руками. На реальном проекте 1.000 с лишним файлов собрались за 2 минуты без единого ключа. То есть он реально работает. Ну и это подтверждают все вокруг, кто на нём хайпит. И вот в чём польза лично вам, даже если вы не ходите сами, а заказываете разработку. Я агент, который лезет в ваш проект, постоянно норовит выдумать то, с чем связано, и наврать. Граф знаний - это ловит. две вещи, которые я соединил в своём инструменте, а в статьях этого никто не сделал.

Итак, первое. Этот граф подсказывает, как раздать работу другим агентам. Не по агенту на файл, потому что на большом проекте это будет 1.000 агентов. Это просто какое-то безумие, а по смысловым кластерам связанного кода. 12 осмысленных кусковместо 1.сячи отдельных. Второе, и это достаточно интересно, агент возвращает находку, мол, функция А вызывает функцию B, а мы сверяем это с графом. Есть такая связь в коде. Если нету, значит агент её просто выдумал. И получается, что это тот же якорь реальности, но для утверждений о коде. Правду говорит Парсер, а не вторая модель. Грав знаний ловит агента на реальном вране.

Кстати, тут же ответ на громкий слоп-тезис из десятка статей. Якобы граф заменил обычный поиск. -85% затрат плюс 18% точности. Так вот, эти цифры из одной узкой научной работы про инженерные схемы. А в статьях они превратились сначала в Microsoft доказал, потом Microsoft годами доказывал и так далее. Одна цифра растянутая пересказом тоне узнаваемости. Классика того, как надувается хайpe в X и так далее. Поэтому не ведитесь на неё.

О'кей. Теперь давайте разберёмся, где графы могут ломаться. Ломаются они тоже, и про это важно сказать. Начну с истории, которая объясняет всё разом. Однако команда поддержки 5 месяцев гордилась своим ботом. Выбрали метрику, сколько тикетов закрыто, мерили каждую неделю, подкручивали бота, и линия всё это время ползла вверх. Все дашборды зелёные, всё идёт по плану. Что было дальше? А потом пришли данные по продлениям подписок. Клиенты уходили вдвое чаще прежнего. Бот научился закрывать тикеты, отфутболивая людей. Быстрее свернуть разговор, пометить решённым то, что человек просто бросил. И метрика росла, и сам её рост был механизмом провала. Петля видела только цифру, а цифра тихо перестала значить то, что все думали.

Кстати, самое смешное в этом случае, что я с таким сталкивался в реальной своей работе в прошлом. Служба поддержки имела ровно такую же метрику для премирования. Скорость закрытия тикета. По итогу тикеты закрывались быстро, но отношение клиента к сервису почему-то падало ниже плинтуса. И в этом плане бот идеально повторил за человеком путь развития один в один. И получается у одной петли ровно четыре способа, как вам соврать. Метрику начинают обманывать, цель никто не пересматривает, петли дерутся между собой, а измерения незаметно начинают отрываться от реальности, уходить в космос. И получается граф - это ответ на все четыре обмана. Петли, которые следят за петлями, проверяют и одёргивают друг друга. Но вот честная половина, которую в статьях не договаривают, граф тоже может вам соврать. [музыка] Давайте объясню, как. 20 агентов на одной модели, читающих один и тот же кривой контекст, будут дружно соглашаться с друг другом в промышленных масштабах. Вы построите красивую схему, где везде проверки, где всё сходится, и она будет неправильной, просто позже, дороже и с большим числом зелёных огоньков по пути вашему вниз. Про это независимо написали, кстати, четыре разных автора. Одной фразой: "Каждый цикл смотрит на другой цикл, и ни один не касается из них реальности".

И здесь лучшая формулировка звучит так: без якарей граф - это где галлюцинации будет больше, а проектное управление при этом будет лучше. И что же здесь якаря? Якаря - это вещи, с которыми нельзя спорить. Например, деньги, реально пришедшие на счёт, тесты, которые реально прошли, клиенты, которые реально остались. Не просто дашборд зелёный, а касание с реальностью или, как написали в статье, касание с землёй. И самое правдивое, что есть во всей этой теме, было создано создателями лгчейна. Они сами ушли от жёстких графов. Там, где задача по природе творческая или исследовательская, они просто убирали граф и давали агенту реальную свободу. Их собственные слова звучат так: "Не всегда стройте графы и не циклы умерли, а просто стройте под задачу".

Из всего этого нужен ответ на главный вопрос: когда граф не нужен. Если задача одна и она простая, если вы сами не поняли, что ищете, если шаги честно зависят друг от друга, тогда это цепочка. Параллелить здесь просто нечего. Один автор сказал здесь прямо: "Не стройте граф для списка покупок только потому, что так сказал Twitter".

А теперь самое практичное из всего видео. Помните три слоя изначала: среда, цикл и граф? Так вот, они нужны не для красоты. Они нужны, когда у вас что-то сломалось и вы не понимаете, что нужно чинить. Потому что типичная реакция здесь какая? Модель тупая, возьму подороже или уйду на соседнюю. Это почти всегда неверный диагноз. Вот вам короткая диагностика, по которой вы находите свой симптом и сразу видите, какой слой виноват в вашей проблеме. Агент может добраться до нужных данных или лезет туда, куда не должен. Это проблема в среде. Чините права и инструменты, а не промт. Агент забывает, что дело вчера, теряет прогресс между запусками - это тоже среда. нужны файлы состояния и контрольные точки, а не напомню ему снова что-то в промте. Далее, первая попытка почти правильная, но каждый раз по-разному. Это уже проблема в цикле. Нужна внешняя проверка и понятный сигнал, что именно идёт не так. Следующее, если агент останавливается, не доказав результат, или пишет, что всё готово, при этом ничего не готово, это тоже цикл. Значит, нету условий остановки, которая будет привязана к конкретным уликам. [музыка] Если специалистов надо запускать в определённом порядке светвлениями и согласованиями, вот тут, наконец, вам нужен граф. Многошаговый сбой невозможно локализовать. На выходе только готовый результат, а где сломалось, непонятно. Это граф плюс логи. И это, кстати, главная боль всех, кто запускает флот агентов. Работы проходят гора, а понять, кто её испортил, просто нельзя, потому что агентов было слишком много в этом процессе. Если процесс меняется быстрее, чем вы успеваете рисовать схему, то тогда вообще не формализуйте в принципе ничего. Оставьте простую среду и наблюдайте дальше. И всё это, на самом деле, полезнее половины споров о терминах. Найдите слой, который отвечает за ваш сбой, и чините именно его, а не покупайте модель подороже, надеясь, что она разгребёт кривое состояние и сломанные инструменты. Да, не разгребёт. В этом весь смысл. Не прыгайте с кодекса на клод или обратно. Вначале займитесь понятием того, где у вас что именно сломалось.

Итак, финал. Соберём всё воедино. Промт инженеринг был про то, как задать модели правильный вопрос.Op инженеринг про то, как уйти из ручного управления и построить цикл. Граф инженеринг - как связать эти циклы между собой. Имя новое, но большинство проблем на самом деле старые. Так, хайп - это или нет? На самом деле и то, и другое. Вокруг слова хайп, слоб, растянутые цифры. А вот под словом реальный сдвиг, который 3 года живёт в лонграфе и который вы теперь понимаете лучше, чем автор половины тех статей, которые пишут их в X. Ну вот что я лично понял, прочитав все эти статьи и написав свой код с помощью код-кода для проверки этого. Настоящая суть всего этого вообще не в том, что циклы воюют против графов и так далее, и даже не в том, какой формы ваша схема. Суть - это обоснованная против необоснованного. Касается ли ваша машинерия, какой бы модной формы она ни была, настоящей реальности, не отчёта в клоде, а реальности. Оседают ли её числа с небес на землю, а не на другие числа? И проверяет ли её кто-то по-настоящему независимый, а не второй такой же слепой агент? В этом весь главный вопрос.

Надеюсь, вы помните человека из начала видео, Питера Штайнберга, который сжёг 1. 300.000 долларов. У его агента, получается, просто не было якоря. Некому было сказать: "Стоп, ты тратишь всё впустую". Форма была модной, а земли под ногами не было. Интересно, кто-то вычтит из его зарплаты все эти траты? И вопрос, который я хочу вам оставить прямо из лучшей статьи по данной тематике. Посмотрите на свою рабочую неделю. Какие два процесса у вас до сих пор соединены только вами, вами, как живым человеком? Вы бегаете между ними, носите результат из одного в другой, потому что вы единственный, кто знает, что они связаны. Вы и есть та недостающая стрелка. Напишите в комментариях, будет интересно узнать.

И про материалы. Мой инструмент, тот самый firstграф с открытым кодом, забирайте у моего бота бесплатно под видео в закрепе. Ставьте, запускайте на своём процессе, смотрите, где вы ждёте просто так зря. Плюс все инструменты из данного видео будут там же у бота. Поставьте лайк и комментарий этому видео, если вам стало чуть больше понятнее, что такое инженерия графов. Подписывайтесь на канал и на мой Telegram-канал. Тоже рисуйте графы, оставайтесь тем, кто держит землю у себя под ногами. Спасибо, что досмотрели до конца. Всем пока.