Transcription
Меня зовут Дэвид Андре, и это самое понятное объяснение автоисследований, которое вы найдете в интернете. Итак, что такое автоисследования? Это проект с открытым исходным кодом от Андре Карпати, который позволяет ИИ самостоятельно улучшать себя. У вас есть ИИ-агент, который автоматически проводит эксперименты, сохраняет то, что работает, и отбрасывает все, что не работает. Итак, в этом видео я объясню, как на самом деле работают автоисследования, как вы можете использовать их в своей жизни и бизнесе, потому что у них много последствий, и как вы можете построить свой первый цикл автоисследований. Так что, если вы действительно хотите быть на переднем крае ИИ, обязательно смотрите до конца. Прежде всего, кто такой Андре Карпати? Он один из самых легендарных исследователей ИИ всех времен. Он один из соучредителей OpenAI и главный человек, стоящий за автопилотом Tesla. Ах да. И он также парень, который изобрел термин VIP-кодирование. Кроме того, он внес большой вклад в сообщество с открытым исходным кодом, особенно в области ИИ. И да, самое главное, он родился в Чехословакии. Однако это видео посвящено одному из его вкладов, а именно автоисследованиям. У Карпати был скрипт обучения для модели GPD2, который он оптимизировал в течение многих месяцев. А затем он понял: зачем я это делаю? Почему бы просто не заставить ИИ-агента проводить разные эксперименты в цикле, чтобы выяснить, как лучше всего оптимизировать эту модель? И это основная идея. Дайте ИИ один файл, одну метрику и позвольте ему провести сотни, если не тысячи экспериментов самостоятельно, пока вы спите, и наблюдайте, как он улучшается. И да, в конце видео я покажу вам, как вы можете построить свой первый цикл автоисследований. И да, вы можете сделать это, даже если вы полный новичок. Теперь давайте поговорим о файле prepare.py, потому что это важно понять. Агент не может трогать prepare.py, чтобы он не мог обмануть установленную вами оценку. Без этого ограничения он мог бы переписать функцию оценки, чтобы подделать свои результаты. Так что, по сути, файл prepare.py определяет, что означает "лучше". Теперь, конечно, если вы установите неправильную метрику, вы получите неправильные результаты. Итак, вот приятная графика, которая визуализирует цикл. Сначала агент выдвигает гипотезу, верно? Теорию того, что он собирается улучшить, какой эксперимент он мог бы провести. Затем он модифицирует код. Вы обучаете его около 5 минут. Затем он проводит оценку, чтобы увидеть, хорош ли он или нет. Если он хочет сохранить его, он просто зафиксирует его в вашей истории git. Если он плох и ухудшает результаты, он выполнит git reset и повторит весь цикл снова и снова, сколько угодно раз, в зависимости от того, сколько долларов вы хотите потратить или токенов, и да, это автоисследования, по сути, в одном изображении. Так что, если вы запустите его прямо перед сном, он сможет провести около 100 экспериментов за ночь. Теперь, установив фиксированный бюджет времени, вы делаете каждый эксперимент напрямую сопоставимым, потому что, скажем, вы нанимаете на работу в свою компанию. Если у вас есть один кандидат, и вы даете ему семь дней на выполнение задачи, а другому — всего семь минут, то, очевидно, тот, кто будет работать семь дней, в среднем будет работать лучше. Так что вы хотите убедиться, что это одинаково для ИИ-агентов. Таким образом, агент не может обмануть, просто тренируясь дольше или придумывая лучшие идеи. Выигрывает только сырая идея при одинаковом выделенном времени. Но если вы думаете, что автоисследования применимы только к обучению ИИ-моделей, вы сильно ошибаетесь. Это имеет огромные последствия во всех сферах вашей жизни или бизнеса. Вы можете построить рекурсивный самосовершенствующийся цикл практически для всего, что можно измерить. Благодаря ИИ-агентам вскоре выполнение любой работы или задачи станет практически бесплатным. Однако ценным станет знание того, что измерять, выбор правильной метрики и установка правильных ограничений. Это навык, который сделает вас миллионерами в будущем. И кстати, это самый наглядный пример того, как на самом деле выглядят ИИ-агенты на практике. Не просто чат-боты, а настоящие автономные циклы, которые выполняют значимую работу для компаний или частных лиц. И если вы рассуждаете о состоянии ИИ с первых принципов, вы понимаете, что это всегда было конечной целью. Андре Карпати предсказывает, что все передовые лаборатории LLM будут делать это. Они будут проводить своего рода автоисследования. Это финальная битва с боссом. И если подумать, именно так будет выглядеть рекурсивное самосовершенствование. И самое смешное, что прямо сейчас ИИ-лаборатории, такие как OpenAI, Anthropic, Gemini, тратят десятки миллионов долларов на исследователей, которые все пытаются это создать. Однако Карпати сделал это полностью открытым исходным кодом. Теперь, чтобы понять автоисследования, вы должны понять их трехфайловую архитектуру. Во-первых, у вас есть program.md. Это самый важный файл. Это человек, устанавливающий цель, ограничения и правила для агента. Затем у вас есть train.py. Это единственный файл, который агент может фактически изменить. И это может быть что угодно, кстати. Код, какая-то конфигурация, подсказка, математическое уравнение, буквально все, что вы хотите оптимизировать. И затем у вас есть prepare.py. Это метрика и скрипт оценки. Агент не может трогать это. Абсолютно никогда. Потому что именно это измеряет результат. И кстати, есть несколько технологических миллиардеров, которые сходят с ума по этому поводу, таких как генеральный директор Shopify и генеральный директор Stripe, потому что эти парни понимают, что дело не только в обучении ИИ-моделей. И это, пожалуй, самое большое заблуждение об автоисследованиях. Люди думают, что это просто оптимизация машинного обучения, верно? Потому что именно это Карпати использовал в качестве примера. Но если вы действительно обратите внимание и немного подумаете, вы поймете, что до тех пор, пока у вас есть четкая метрика, и вы можете проводить эти эксперименты, это может быть использовано множеством различных способов в маркетинге, в бизнесе, в тестировании новых продуктов, в торговых стратегиях, в личной жизни, в прогнозе погоды, буквально сотни возможных областей. Вы можете создавать эти циклы автоисследований, в которых нет человека, а вместо этого рой ИИ-агентов проводит эксперименты, отбрасывая то, что не работает, и сохраняя то, что работает. И как говорит Кафати, мы можем находиться на ранних стадиях сингулярности. Теперь у каждого рабочего процесса ИИ есть одно и то же узкое место: получение свежих реальных данных. Вы можете создать самый сложный ИИ-агент, но если он не может видеть, что на самом деле происходит в интернете прямо сейчас, он действует вслепую. Вот где на помощь приходит Oxyabs. API веб-скрейпинга Oxyabs позволяет извлекать структурированные данные практически с любого веб-сайта. Это могут быть списки продуктов Amazon, результаты поиска Google, списки недвижимости, все через один вызов API. Он обрабатывает ротацию прокси, решение капчи и рендеринг JavaScript, так что вам не придется делать это самостоятельно. Но вот что делает его интересным для нас, разработчиков ИИ. У Oxyabs есть официальный MCP, который вы можете подключить напрямую к Cursor или Cloth Code за минуту, чтобы ваш ИИ-агент получил суперспособности для веб-скрейпинга в реальном времени. Скажем, вам нужно получить цены конкурентов, или собрать результаты поиска, или получить списки недвижимости. Просто спросите его на обычном английском. Агент вызывает OxyLabs, получает обратно структурированные данные и анализирует их. И даже если вы не разработчик, OxyLabs подключается прямо к NA10. Вы можете визуально построить рабочий процесс, который собирает цены Amazon, отправляет их ИИ и выдает аналитику без написания кода с вашей стороны. И самое приятное то, что Oxyabs предоставляет до 2000 результатов скрейпинга бесплатно, так что вы можете протестировать его самостоятельно. Так что перейдите на oxyabs.io/david для бесплатной пробной версии. Ах да, и кредитная карта не требуется. И если у вас закончатся кредиты, используйте мой код David для получения 20% скидки на все тарифы Oxyab. И спасибо OxyLabs за спонсорство этого видео. Опять же, я должен подчеркнуть, что автоисследования — это не только для машинного обучения. Этот шаблон работает везде, где вы можете измерить результат, четкий результат. И Кати сам это сказал. Любую метрику, которая вас волнует и которую достаточно эффективно оценивать, можно исследовать автоматически. Так что вам нужен один файл для редактирования, одна скалярная метрика и циклический процесс с ограничением по времени. Если вы можете оценить это, вы можете исследовать это автоматически. Теперь давайте посмотрим на некоторые практические ценные варианты использования. Прежде всего, трейдинг. Вы можете использовать тот же цикл автоисследований, но вместо улучшения ИИ-модели, вы можете направить его на торговую стратегию. Агент корректирует ваши правила покупки-продажи, пробует эксперименты на основе многолетних рыночных данных и оценивает каждый эксперимент по коэффициенту Шарпа, который, по сути, показывает, насколько хороши доходы по отношению к риску. И он может протестировать сотни различных торговых стратегий, чтобы увидеть, какая из них имеет наилучшую доходность. Вот еще один вариант использования, маркетинг. Теперь вы можете применять автоисследования к маркетингу с помощью электронных писем, рекламных креативов, целевых страниц, автоматизированных A/B-тестов, заголовков, миниатюр, заголовков YouTube, любого типа маркетинга. Эрик Су сказал это лучше всего. Большинство маркетинговых команд проводят 30 экспериментов в год. Следующее поколение проведет 36 000, то есть примерно 100 в день. Агент будет изменять текст и измерять конверсии, а затем решать, сохранять ли этот эксперимент или отбрасывать его. Точно такой же цикл, как и раньше. Теперь, прежде чем я покажу вам больше вариантов использования того, как автоисследования могут принести пользу вашей жизни, пожалуйста, подпишитесь. 25% из вас подписаны, что означает, что подавляющее большинство из вас, смотрящих прямо сейчас, не подписаны. Так что, если вы хотите видеть больше высококачественного контента по ИИ в своих рекомендациях YouTube, пожалуйста, уделите две секунды, перейдите под видео и нажмите кнопку подписки. Это помогает больше, чем вы думаете. Так что всем, кто только что подписался, спасибо. Следующий вариант использования для разработчиков. Вы можете направить автоисследования на любой кодовую базу и сказать: "Сделай ее быстрее". И люди также используют автоисследования для тонкой настройки моделей ИИ с открытым исходным кодом, чтобы они работали быстрее локально на вашем ноутбуке или телефоне. Так что ожидайте в ближайшие 6 месяцев безумных прорывов в том, что возможно запускать на телефоне. Я бы даже сказал, что у нас будут модели качества Sonet 4.6, работающие на iPhone за три или четыре месяца. Это прогноз. Посмотрим, будет ли он верным. Еще один вариант использования — инженерия подсказок. Автоисследования могут тонко настраивать системные инструкции для всех ваших ИИ-агентов. Так, Харрисон Чейз, основатель Langchain, компании стоимостью миллиард долларов, сказал, что агенты ошибаются, потому что у них нет правильного контекста, а системные подсказки являются частью этого контекста. Так что автоисследования могут находить новые способы формулировки вещей, лучший язык, возможно, даже другой язык, вы знаете, может быть, вместо английского, он может использовать польский или чешский или немецкий, что угодно. Он может пробовать разные уровни, такие как начальный, вы знаете, уровень колледжа, уровень PhD, чтобы увидеть, какая подсказка работает лучше всего для всех ваших ИИ-агентов. Итак, вот три условия, которые определяют, будет ли ваш цикл автоисследований успешным или провальным. Номер один: четкая метрика. Одно число, четкое направление, в котором вы хотите двигаться. И номер два: автоматизированная оценка, где нет человека. Верно? Если вы, человек, должны быть вовлечены, это будет очень медленно, и это не будут автоисследования. Конечно, это все еще может быть исследование, но это не будут автоисследования. Это не будет работать, пока вы спите. И номер три: есть один файл, который агент может изменить. Не два, не ноль, один файл. И вам нужны все эти три условия, чтобы автоисследования работали. Теперь, вот где автоисследования потерпят неудачу. Брендинг, UX, ценообразование, все, где "лучше" субъективно. Например, в ценообразовании вы могли бы добиться успеха, если у вас большой объем трафика на вашу страницу с ценами, и вы можете быстро A/B-тестировать различные цены, чтобы увидеть максимальный собранный доход. Но для большинства бизнесов это не будет эффективно, верно? Потому что качество того, что делает лучше, субъективно, или цикл слишком медленный. Циклу нужна объективная метрика. Если успех — это вопрос суждения или ощущения, агент не может сказать, что работает. Таким образом, он будет оптимизировать в случайном направлении. Также я хочу снова подчеркнуть: если вы дадите ему плохую метрику, он очень уверенно оптимизирует что-то не то. Итак, вот конечная цель Арджа Карпати. В начале 2000-х годов существовал проект SETI@home, который позволял любому желающему пожертвовать свою свободную вычислительную мощность для исследования внеземной жизни. И Ардж Карпати хочет сделать то же самое, ту же модель, ту же идею, но для исследований ИИ, где у нас есть миллионы ИИ-агентов, распределенных по тысячам компьютеров, и вы можете фактически распределять, куда идут эти исследования. Итак, теперь я покажу вам, как фактически построить свой собственный цикл автоисследований с нуля. Даже если вы полный новичок, просто оставайтесь со мной следующие пять минут, и вы будете впереди 99,9% людей в области ИИ, которые просто платят за подписку на GBT и думают, что они продвинуты. Они даже не могут мечтать о том, чтобы иметь свои собственные автоисследования. Но вы всего в нескольких шагах от этого. Итак, войдите. Прежде всего, это репозиторий GitHub. Я дам ссылку на него под видео. Это репозиторий автоисследований от Карпати. Я тоже его запущу, потому что это отличный проект. Теперь, если вы не знакомы с GitHub, вам не нужно паниковать. Вам не нужно много понимать. Это просто способ хранения кода. Хороший способ хранения кодовых проектов. Это все, что вам нужно понять. Вам не нужно быть экспертом по Git, ничего такого. Все, что нам нужно сделать, это нажать здесь на код и нажать копировать здесь. Вот и все. Далее вам понадобится IDE. Так что либо VS Code, либо Cursor. Я буду использовать Cursor. Просто установите IDE какого-нибудь типа. И мы будем использовать агент кодирования. Я буду использовать Cloth Code. Итак, я открою пустой проект здесь. Бум. Ничего здесь нет. Вы видите справа, никаких файлов. И я запущу Cloth Code, опасно пропустив разрешения. Бум. Введите. Итак, вот он. CL Code. Теперь я скажу: создай новую папку /original на корневом уровне нашего репозитория и в ней клонируй этот репозиторий GitHub. Бум. Вставьте его. И снова, Cloudcore будет точно знать, что делать. Так что он поймет, что все пусто, а затем он создал папку original и клонировал ее туда. Теперь, почему я хотел это сделать? Ну, потому что я хочу создать отдельную папку, где мы будем что-то строить с автоисследованиями для нас, но я также хочу сохранить оригинальный репозиторий здесь, чтобы мы могли использовать его в качестве справки. Далее я скажу: теперь создай папку /website на корневом уровне и в ней создай следующий проект XML текст бум проект. Итак, я описал четкое видение простого веб-приложения, и я хочу показать вам, как вы можете использовать автоисследования для оптимизации любого веб-сайта, который у вас есть, будь то личный веб-сайт, будь то ваш стартап в области ИИ, любой тип веб-сайта для оптимизации времени загрузки или чего-либо еще, что вы можете измерить, но время загрузки очень легко измерить, поэтому они являются отличным кандидатом для цикла автоисследований. Так что я просто использую Cloth Code с обходом всех разрешений, чтобы построить это, чтобы мы могли построить свой собственный цикл автоисследований, и на самом деле, пока это работает, позвольте мне запустить Codeex в режиме YOLO. Бум. Позвольте мне поставить его сюда. Итак, я переименую его, чтобы вам было понятно, что это такое. Codeex CLI. GBD 5.4 на самом деле очень хорош в исправлении и отладке, но Cloth Code с Opus 4.6 невероятен в работе, особенно в быстром режиме. Я знаю, что это стоит больших денег, если вы используете /fast, но я настоятельно рекомендую это. И я также настоятельно рекомендую это внутри Codex. И держите его на высоком уровне. Экстра высокий обычно избыточен. Итак, для Codex я скажу: создай файл benchmark.mjs внутри папки /original, где это имеет смысл. Я дам ему инструкции по оценке. Нажмите Enter. Хорошо. На самом деле, сначала я скажу: прочитай структуру на самом деле, это моя ошибка. Это должно быть в папке website, а не original, потому что он должен прочитать оригинал, который был оригинальным репозиторием от Карпати, чтобы понять, где должен быть скрипт оценки. Бум. Итак, это будет использовать Puppeteer для тестирования скорости этого веб-сайта локально. Мы должны запустить проект на локальном порту 3000. Позвольте мне посмотреть. По сути, я попросил его создать простой портфолио-веб-сайт с помощью Express и статических файлов. Так что давайте посмотрим, что он построил. Вот как это выглядит. Алекс Морган. Просто простой портфолио-веб-сайт. Как вы могли видеть это буквально 10-15 лет назад. Каждый веб-сайт выглядел так, верно? Все, кто новичок в HTML и CSS, имели бы такие вещи в старшей школе и думали бы, что они лучшие дизайнеры веб-сайтов. Я тоже виноват в этом. Но в любом случае, давайте посмотрим, закончил ли Codex это. Хорошо, он закончил. Итак, у нас есть настройка. Теперь давайте разберемся с репозиторием, верно? Помните, есть три основных файла: program.md, train.py и prepare.py. Итак, оригинальный program.md выглядит так от Карпати, и он написал это сам, и это очень полезная инструкция, кстати. Не стесняйтесь использовать этот промпт во многих ваших агентных проектах, где вы хотите, чтобы агент работал вечно или как можно ближе к вечности, но нам нужно написать свой собственный. Хорошо, давайте вернемся в Cloth Code, и я скажу ему, что делать: перейти в папку website, установить puppeteer и запустить этот базовый скрипт. Мы проведем бенчмаркинг нашего веб-сайта нашего эксперта Алекса Моргана, дизайнера портфолио, чтобы увидеть, насколько он быстрый или медленный, а затем мы запустим автоисследования, чтобы максимально его оптимизировать. Хорошо. Хорошо. Давайте посмотрим. Хорошо, у нас есть результаты. Итак, Puppeteer запустился и закрыл Chrome быстрее, чем я успел его увидеть, или запустил его в фоновом режиме. Но, по сути, у нас среднее время загрузки 50 мс, что не так уж плохо. Так что посмотрим, сможет ли автоисследование это оптимизировать. Хорошо. Теперь самая важная часть любого цикла автоисследований — это program.md. Итак, я перейду в нашу папку website, создам новый файл program.md, и это основной файл, и на самом деле мы можем использовать вдохновение от Карпати. Скажем, прочитайте program.md внутри /original, а затем создайте наш новый файл website/program.md на его основе, но применительно к нашей цели автоисследований по бенчмаркингу скорости веб-сайта. Итак, мы позаимствуем у Андре Карпати из инжиниринга, который он сильно оптимизировал для своего собственного проекта, и мы попросим clot code переписать это в наш собственный program.md, который будет актуален для нашего собственного проекта. Так что снова не стесняйтесь использовать это для чего угодно, для любого бизнес-кейса, для любого маркетингового кейса, для любого кейса "заработать деньги", где есть четкая метрика, вы можете создать свой собственный program.md, и бум, вот так, я использовал clot code для написания 128 строк инструкций и адаптации их к этому проекту. Так что теперь program.md очень актуален для этого конкретного проекта. Хорошо. Итак, я скажу сделать следующее. Дайте ему четкую инструкцию, что я хочу, чтобы Cloth Code сделал, чтобы зафиксировать это как базовую линию. Помните, если эксперимент успешен, он фиксирует результат в истории изменений. Если нет, он выполняет git reset и пробует что-то другое. Теперь я скажу: прочитай program.md, сначала запусти базовый бенчмарк. Запиши результаты в tsv, затем начни цикл экспериментов. Не останавливайся и не спрашивай меня ни о чем. Просто продолжай проводить эксперименты автономно. И вот, наш первый цикл автоисследований запущен. Возможно, я мог бы создать отдельного агента, знаете ли, отдельный Cloth Coder, Codex. И, очевидно, вы можете попробовать разных агентов и посмотреть, какой из них работает лучше. Но, как видите, это не так. Выглядит немного хуже. Похоже на шум. Позвольте мне перезапустить, чтобы подтвердить. Все еще хуже. Следуя протоколу, откатываемся. Хорошо. Потрясающе. Итак, он провел эксперимент, и скорость веб-сайта ухудшилась. Так что он попробует что-то другое. И в этом вся суть автоисследований. Я ничего не делаю. Мои руки вверх. И даже если бы я это делал, во-первых, мне нужно было бы быть солидным фронтенд-разработчиком. И во-вторых, я не смог бы сделать это так быстро, верно? Так что, даже если вы отличный фронтенд-разработчик и знаете, как оптимизировать веб-сайты, вы все равно... Хорошо, теперь он нашел улучшение. Вы все равно не сможете превзойти ИИ-агент, который может генерировать сотни токенов в секунду. Итак, он нашел улучшение. Посмотрите. 33 миллисекунды вместо 50. Так что мы уже снизили на 34% за менее чем минуту. Это сила автоисследований. Хорошо. И посмотрите на это. Еще одно. 28 миллисекунд. Еще 15% улучшение за две-три минуты, ребята. Да, автоисследования — это безумие, и у меня есть ощущение, что это не последнее видео, которое я сделаю об автоисследованиях. Так что, если вы хотите, чтобы я делал больше контента об автоисследованиях, обязательно подпишитесь. И если вы строите свой собственный стартап в области ИИ, вы хотите построить настоящий бизнес в области ИИ, тогда слушайте, потому что в нашем акселераторе мы тесно сотрудничаем с горсткой основателей в течение 6 месяцев, чтобы помочь им агрессивно масштабироваться. И на самом деле, до конца марта мы предлагаем бесплатные звонки по валидации идей. Так что, если у вас есть приложение на базе ИИ, которое вы хотите создать, и вы хотите превратить его в реальный прибыльный бизнес, то обязательно перейдите по второй ссылке в описании, которая приведет вас на целевую страницу, чтобы узнать, соответствуете ли вы требованиям для бесплатного звонка по валидации идей. Но опять же, это только для серьезных основателей, которые действительно хотят построить настоящий бизнес в области ИИ. С учетом сказанного, спасибо, ребята, за просмотр. Я позволю этому циклу автоисследований поработать немного. Мы уже на 25 миллисекундах. Это безумие. Уже вдвое меньше за четыре минуты. Посмотрим, к чему это приведет. И да, я обновлю вас в Твиттере, так что обязательно подпишитесь на меня в Твиттере и продуктивного вам дня.