Transcription
Autoresearch от Андрея Карпати — это новый левел ИИ-автоматизации. Это буквально улучшение чего угодно с помощью AI-агентов. И это не выдумка и не очередной бесполезный AI-инструмент. Это реально ценный репозиторий.
Что такое Autoresearch? Это автоматическая оптимизация чего угодно с помощью AI. На самом деле, эту штуку сделал, как я уже сказал, Андрей Карпати. Выложил конкретный репозиторий на GitHub. Еще раз: это автоматическое улучшение почти чего угодно в цифровой среде. Я это сейчас не выдумываю.
На самом деле, Андрей Карпати сделал этот репозиторий для того, чтобы улучшать LLM. То есть, он сделал репозиторий, сделал систему, где AI-агент тренирует LLM. То есть, понимаете, LLM тренирует LLM, и LLM реально становится лучше.
Кто такой Андрей Карпати? Чтобы вы понимали, он сейчас активно популяризирует AI, рассказывает об этом, ходит на подкасты. Он один из основателей OpenAI, он отвечал за AI в компании Tesla и еще много что делал. Короче, очень крутой чувак, один из самых медийных персонажей сейчас в мире AI. А вот у него вот такой вот подкастик вышел, где он рассказал об этой идее. Собственно говоря, он с помощью LLM тренирует, и LLM становится лучше.
То есть, он говорит: зачем он тренирует GPT-2? Он говорит то, что многие не понимают, зачем он тренирует GPT-2 модели. Если вы не знаете, GPT-2 модели по нынешним меркам — это очень слабые модели. Но для него это песочница, для него это небольшой полигон для экспериментов с обучением LLM. Зачем он это делает? Потому что его интересует рекурсивное самоулучшение. Могут ли LLM улучшать LLM? То есть, сейчас, когда создают новый LLM, в этом процессе, в процессе обучения LLM участвуют люди. Именно поэтому он с этим экспериментирует.
И он сказал то, что результат его удивил. То, что он типа этим давно занимается, он один из основателей OpenAI, у него двадцатилетний опыт, тренировал модели тысячи раз, думал, что хорошо уже оптимизировал модель, но запустил Autoresearch на ночь, и тот нашел вещи, которые Карпати пропустил.
К чему я клоню, ребята? Я вот специально выписал: что такое сингулярность в мире AI? Это момент, когда AI начнет стремительно сам себя улучшать, и развитие его станет трудно контролировать. И проблема в том, то что, возможно, мы уже близки к этому состоянию. Потому что буквально сейчас многие компании, вот OpenAI и Anthropic, сейчас именно этим и занимаются. И в том числе Андрей Карпати с этим тоже экспериментирует.
Но смотрите, как интересно. Сначала был просто LLM, то есть чат-бот. Потом появился AI-агент, который уже что-то умеет делать. А теперь мы близки к самоулучшающемуся AI-агенту. Это понятно? Это круто.
Как это касается нас? Да, как-то нам применить? Как что из этого можно вынести? Как это применить на практике? Сейчас я об этом скажу. Но для начала я хочу вам сообщить о том, что очень много что выходит сейчас в мире AI — это шум. То есть, это интересно, но это не применимо. Интересно об этом разговаривать, но в моих действиях большинство новинок мало что меняют, честно говоря, в моей повседневной работе. Это понятно.
Где и как мы можем это использовать? Самый простой пример на практике, который буду сегодня показывать, — это скорость загрузки сайта. Как это работает? У нас есть код сайта. Сайт является этим кодом, файл index.html. И мы сделаем систему с помощью репозитория Карпати, на основе его репозитория. У него этот репозиторий создан, чтобы LLM сама улучшала LLM GPT-2. А мы этот репозиторий будем использовать, чтобы оптимизировать скорость загрузки сайта. Ну, скорость загрузки сайта становится быстрее, если код сайта более легкий и более грамотно написан. То есть, он может плохо быть написан и быть тяжелым. В целом, это может быть много бесполезного кода. LLM будет ставить гипотезы, проводить операцию за итерацией и делать таким образом, чтобы сайт загружался все быстрее и быстрее. И мы в этом никак участвовать не будем. Это все будет происходить автоматически. Мы просто зададим начальные правила и будем смотреть, как это работает.
И применимо это не только для сайтов. Это применимо, как я говорю, почти для чего угодно. Например, вы делаете холодные рассылки на почту. То есть, вы занимаетесь лидогенерацией таким образом. То есть, вы отправляете письма людям на почту, и там с определенным текстом письма, компании, скрипт рассылки с определенным текстом, и смотрите на процент отклика. Кто вам отвечает, кто соглашается назначить с вами звонок. Здесь это отлично применимо. То есть, у нас есть определенная схема письма, определенный текст письма, которым, ну, по сути, один и тот же шаблон отправляется всем. AI здесь отслеживает процент отклика. То есть, он ставит гипотезу, как-то меняя текст письма. Если эта гипотеза становится удачной, то есть процент отклика увеличивается, то он применяет это. Потом он ставит еще одну гипотезу, и так происходит сколько вы хотите времени. То есть, огромное количество раз это может происходить, вплоть до бесконечности, если она будет все время работать. То есть, это самоулучшающаяся штука.
Лендинги, как я говорю, скорой загрузки сайта, например, рекламные креативы Google Ads, Facebook Ads. Ну, я в этом, честно говоря, не особо шарю, но там есть показатели, те же CTR, процент отклика, одна цифра. Да, допустим, количество человек, которые заполнили заявку на сайте, перешли там через Facebook или Google Ads — это какая-то одна конкретная метрика, которую мы отслеживаем. Исходя из этой метрики, мы можем ставить гипотезы и улучшать здесь, получается, креатив и рекламный текст. YouTube заголовки можно тестировать. И мы можем skills Claude Code тоже улучшать, если сделаем конкретную метрику. Есть, конечно же, skill 2.0, но там требуется ручное вмешательство. А тут мы можем задать метрики, загрузить это куда-нибудь на сервер, например, и это будет работать автоматически и само улучшаться автоматически. Все, что мы сделаем, это зададим начальные правила. Ну, там пару раз проконтролируем, что она работает адекватно так, как нам надо, и все. И она будет сам улучшаться, сам улучшаться, сам улучшаться.
Вообще, эту систему можно разместить и локально. То есть, сейчас я на практике буду показывать локальный пример, где она локально на компьютере размещено. Но если вы хотите это полностью автоматизировать, вы загружаете эту систему на сервер, подключаете через API ключ, тот же Claude Opus 4.6, ну, то есть, денег это будет стоить определенных, естественно, и она будет там крутиться и работать, ставить гипотезы, проверять гипотезы, там, поощрять гипотезы, если она удачная, и продолжать этот цикл.
Система сама ставит гипотезы. Она видит показатель, то что сейчас сайт загружается за определенное количество времени. Есть конкретный числовой показатель, который нужно уменьшать. Потом она ставит гипотезу, меняет определенным образом код, который является сайтом, и проверяет, стало ли скорость загрузки сайта быстрее. Если да, сохраняет эту версию и ставит новую гипотезу. Это можно сделать по cron-триггеру, то есть каждый час, каждые API минут система запускается и постоянно автоматически самоулучшается.
Как работает вообще цикл? То есть, человек, мы ставим изначальное условие, что мы измеряем и какой у нас стартовый вариант. AI-агент генерирует новый вариант на основе знаний. Оба варианта тестируются, измеряется метрика. Победитель остается, проигравший отбрасывается, и цикл повторяется. То есть, вот так.
Сразу отмечу, где это не работает: где нет четкой числовой метрики. То есть, где мы не можем нормально измерить что-то числом. Например, обложки для YouTube. К сожалению, пока я не придумал, как измерить числом. Ну, на самом деле, можно измерить числом процент отклика. Но, допустим, меня визуально не устраивает, как выглядят обложки, которые генерируют там на на банана про. Но тут нету числовой метрики. То есть, меня не устраивает — это не числовая метрика. Здесь это не особо применимо, потому что, как, как здесь попасть в "вкус"? Никак. То есть, нету числовой метрики.
Если медленный фидбэк-луп, то есть цикл равен там неделя — это слишком мало. За это время не получится поставить много экспериментов. То есть, если у вас весь цикл от постановки гипотезы до получения результата — неделя, то это очень долго. И если нет способа автоматически менять параметр. Как это работает? Ну, что это значит? В случае оптимизации скорости загрузки лендинга, менять параметры — значит оптимизировать код. То есть, буквально менять код. В случае рекламных креативов или рекламного текста Facebook Ads, ну, господи... это Google Ads. А здесь есть способ это делать? У них есть API? Да, вы можете через API подключаться, менять текст у рекламной интеграции, как это называется, и менять креатив.
Три обязательных условия для того, чтобы это работало: это быстрый фидбэк-луп. Чем быстрее получаем фидбэк, тем короче цикл, тем больше траты, тем быстрее улучшается показатель. В случае загрузки сайта, ну, как я говорю, для демонстрации этого — это идеальный пример, потому что там очень быстрые итерации. То есть, AI-агент меняет код сайта, это и есть по сути скорости итерации, насколько быстро он его может изменить. А он быстро это делает. То есть, четкое числовая метрика. Вот в случае скорости загрузки сайта, ну, вот понятно, скорость загрузки сайта, мы ее отслеживаем. И API доступ для изменений, чтобы агент мог менять параметры, вносить туда изменения. Ну, в нашем случае API доступ не нужен, потому что мы напрямую редактируем код.
У Андрея Карпати есть вот такой вот репозиторий. Я оставлю на него ссылочку, естественно, в Telegram. Можете зайти, посмотреть. Ну, вот он, это весь репозиторий. То есть, здесь не такое большое количество файлов. Здесь, по сути, есть несколько важных файлов: это train.py, это prep.py и PROGRAM.md. Это вот основа. Остальное — это, ну, вот .gitignore, например, пайтон вершенс. То есть, это не такие важные файлы.
У нас схема будет такая же, просто мы оптимизируем ее под лендинг. Я ее тоже покажу на практике. В файле PROGRAM.md Андрей Карпати пишет инструкции для его агента. То есть, он задает рамки, в которых работает агент. То есть, что нужно менять, что нельзя трогать ни в коем случае. А здесь мы задаем, какую метрику отслеживать. Агент читает это один раз в начале и дальше работает автономно. То есть, мы тут задаем изначальные правила. Мы вот больше всего влияем на этот файл.
Потом второй важный пункт — файл, который агент модифицирует. Ну, здесь, в нашем случае, уже написан index.html. В случае Андрея Карпати — это train.py, то есть, это изменение самой языковой модели в его случае. То есть, это единственное, что агент может имеет право менять. Но здесь может быть несколько файлов, это зависит от задачи. Но суть одна: это то, что агент трогает и меняет в каждом эксперименте. Другой он не трогает.
И есть третий показатель — это скрипт-судья. Это скрипт, который оценивает результаты изменений. То есть, это штука, которая измеряет метрики. Стало лучше или стало хуже. Агент запускает его после каждой модификации, но не имеет права редактировать. Судья замеряет метрику и выдает число, на основе которого агент понимает решение: оставить изменения или откатить.
То есть, как цикл происходит? Агент меняет подопытный файл, делает коммит. Ну, это то, что касается Git. Если вы не знаете, что такое коммит, что такое Git, у меня есть ролик, как ускорить работу Claude Code в четыре раза. Посмотрите, отличный ролик, там есть информация про Git, вся необходимая. То есть, еще раз: агент меняет подопытный файл, коммитит. Судья оценивает. Если скор вырос, то есть показатель, ну, вот скорость загрузки сайта, если стала быстрее, меньше, то мы это оставляем. Если он там упал, то мы откатываем. И так бесконечно, пока мы не остановим.
И наконец-то переходим к практике. Смотрите, так как мы на практике говорим про скорость загрузки сайта, я попросил Claude накидать мне лендинг.