Transcription
Привет, сообщество. Так здорово, что вы вернулись. Давайте поговорим о конфигурациях многонавыковых markdown. Да, у меня есть видео здесь для однонавыкового MD. Но давайте посмотрим, как мы это объединяем. Что мне действительно понравилось, так это эта публикация здесь от февраля 2026 года, где агентные навыки для LLM, где автошоу, и вместо кодирования всех проуральных знаний в весах модели, агентные навыки означают композитные пакеты инструкций, кода и ресурсов, которые агент загружает по требованию, обеспечивая динамическое расширение возможностей без какого-либо переобучения наших ИИ-моделей. Теперь вы знакомы здесь с нашим метадором уровня один, инструкциями уровня два, загруженными по триггеру, и ресурсами уровня три с динамическими скриптами загрузки, ссылками, шаблонами активов, мы видели это, и вы загружаете все в контекстное окно, отлично. Теперь, чтобы быть уверенным, где мы находимся, в моем последнем видео я говорил вам о обучении с подкреплением в контексте в агентном стиле, так что это не то, о чем мы говорим сегодня, это было вчера, это была совершенно другая сложность, сегодня мы просто говорим о том, о чем мы говорим, мы говорим о навыках MD. Это означает обучение в контексте. Отлично. Так что нет никакой генерализации этих навыков UI. Вы обучаетесь на конкретном навыке, это обучение в контексте, и вы не можете предположить, что UI, учитывая любой интеллект, который у него есть, не способен к генерализации или решению задач вне домена. Так что у вас есть контекстное окно. Допустим, у вас есть 200 000 токенов. вы загружаете навык A с некоторых торговых площадок, навык B, и тогда вы видите, ах, для навыка A есть гораздо лучшее решение или есть другая методология, так что если вы загрузите все эти навыки, и у вас нет представления о том, какое математическое решение или решатель стоит за этим, вы можете захотеть исключить некоторые навыки, которые уже находятся в контекстном окне, но разучивание в вашем контекстном окне — это довольно сложная задача, так что давайте посмотрим, сможем ли мы найти лучшее решение для этого. Поэтому я решил изменить свой взгляд на мир. Я говорю, обучение в контексте прекрасно, но вы знаете, мы всегда должны предоставлять несколько кратких примеров для нашего обучения в контексте, чтобы показать, эй, это именно то, что я хочу. Теперь мы просто расширяем это сейчас и добавляем сюда в ту же категорию описания навыков markdown, как я показал вам здесь в моем первом видео по однонавыковому MD, это в точности более или менее здесь продолжение теперь на более высоком уровне сложности и, конечно, вы знаете, у нас есть последовательность действий, последовательность MCP или, если вы идете классическими вызовами API, что бы там ни было необходимо для решения этого. Но вы помните, я показал вам только в моем видео здесь. Я надеюсь, это было вчера, когда агенты ИИ заблокировались. Они больше не могут это решить. Есть некоторые конфигурации, где агенты просто перестают выполнять работу. Так можем ли мы решить это дополнительно? [очищает горло] И как я вам говорил, навыки и MCP не являются конкурирующими стандартами, а скорее думайте об ортогональных слоях возникающего агентного стека. И здесь у вас есть агентные навыки, а здесь MCP, прекрасно. Так что навык может также инструктировать агента использовать конкретный сервер MCP, указывая, как интерпретировать его выходные данные, и даже определять стратегию отката, если соединение сбоит. Так что в целом мы можем сказать, что все эти навыки предоставляют процедурный интеллект, в то время как MCB обеспечивает связность, и я думаю, они очень хорошо сочетаются. Теперь у вас есть claw code, у вас есть навык, создайте мета-навык, из которого вы просто создаете свой новый навык, вы просто говорите с ним из описания на естественном языке, и тогда он сгенерирует для вас файл skillmd с некоторым пакетным скриптом, и все, надеюсь, сработает. Если у вас есть действительно простая проблема, но у нас также есть корпоративное развертывание, Atlassian, Canva, где бы я ни знал, где мы вешаем правильные рабочие процессы. Отлично. Теперь вы знаете из моего однонавыкового MD, нашего skill MD, нашего reference MD, нашего forms MD, все прекрасно. И вы помните, что нам пришлось посмотреть здесь на плагины финансовых услуг Entropic для конкурентного финансового анализа. Файл skillmd содержал прекрасные инструкции. Теперь, если в запросе перечислены семь конкурентов, включите все семь, а не пять или шесть, и если в запросе выбраны данные за период с 2015 по 2026 год, включите все годы, а не подмножество. Так что вы сразу почувствовали, эй, это будет весело, если мы теперь построим многонавыки. Так что мы действительно сталкиваемся с проблемой здесь, что люди пишут навыки, это приятно, нет, это прекрасно, хорошо, а затем у нас есть немного машин ИИ, таких как claw code, они пишут навыки, и это действительно приятно, но если у вас здесь доступ к сложности, и давайте скажем, вам нужно написать сложное промышленное решение, или вы работаете в науке, и вы работаете в нанотехнологиях, или в биотехнологиях, или для следующего дизайна чипа, у вас нет простых одиночных навыков, у вас есть, боже мой, сложность, о которой мы будем говорить в этом видео. Так что добро пожаловать, давайте начнем приобретение навыков и сложное обучение навыкам. Это совершенно отличается от всего, что вы думали о том, как мы можем использовать навыки сегодня, потому что помните, skillmd идет только в контекстные окна без генерализации LLM, и это не то, чего мы хотим. Мы хотим, чтобы наши системы ИИ действительно учились, чтобы они понимали, и мы можем увеличить сложность для более высоких сложностей в науке. Так что я действительно ценю это исследование, университет Висконсин-Мэдисон, AWS, 10 марта 2026 года. У нас есть самосовершенствующийся агент. Йиппи, и у нас есть библиотеки навыков. И вы говорите, фантастика. Так что наш агент теперь имеет доступ к библиотекам навыков и может самосовершенствоваться, и вы говорите, давайте сделаем это, а затем вы просто замечаете, эй, подождите минутку, есть обучение с подкреплением, так что мы обучаем этого агента, и агент становится более умным. Абсолютно. Разве это не круто? Так что давайте посмотрим. Они, конечно, представляют, поскольку мы занимаемся обучением с подкреплением. Да. Новая оптимизация политики, и, конечно, она основана на GPO, но это совершенно новый, гораздо более сложный GPO, дополненный навыками, для самоэволюции. Он называется Sage или как бы вы его ни произносили, и новая структура обучения с подкреплением, которая включает навыки в процесс обучения. И как вы это делаете? Легко. Они имеют последовательный вывод, итеративно развертывая агента по цепочке похожих задач для каждого вывода. Так что они просто пробуют, пробуют, делают немного сложнее, пробуют снова, и по мере того, как они перемещаются по цепочке текста, навыки, сгенерированные из предыдущей задачи, накапливаются теперь в библиотеке. Так что вы заполняете свою собственную библиотеку навыков, и она становится доступной для всех последующих задач вашего агента, который теперь будет пытаться самосовершенствоваться, проходя теперь через все больше и больше последовательных выводов. Теперь либо вы идете с библиотекой навыков, которая изначально равна нулю, тогда вы полагаетесь на ядро вашего агента, это ваш LLM или ваш VLM, или вы загружаете, я не знаю, 10 навыков или как вы хотите начать, это не имеет большого значения. Теперь вы помните, как я говорил об оптимизации политики только в одном из моих последних видео, когда мы говорили об агенте, заблокированном в системе. Я показал вам математическую методологию, как мы можем выбраться из этих потенциалов блокировки, и это было с минимальным введением. Мы собираемся сделать более или менее то же самое. Поэтому я просто скажу: эй, посмотрите на мое последнее видео. Я не собираюсь объяснять здесь более или менее ту же методологию во второй раз. Мы уже знаем это. Да, если вы хотите получить дату всего этого, это в настоящее время на GitHub Amazon science sage. Так что там вы найдете все для вашего репозитория GitHub. Так какова цель? Цель состоит в том, чтобы улучшить возможности самосовершенствования агента ИИ в вашей предметной области, скажем, медицина или физика или что-либо еще, посредством обучения с подкреплением. Так что нам нужно, я не знаю, что у вас есть. скажем, узел графических процессоров Blackwell с библиотекой навыков, и вы вдруг видите, что у нас есть самосовершенствование, и теперь не то, что у нас больше знаний, или что у нас больше информации, или что у нас есть несколько кратких примеров для обучения в контексте. Теперь мы идем сюда с библиотекой навыков, и эти навыки не являются, если хотите, базовыми элементами, как обрабатывать новые задачи, как находить решения. Теперь вы видите здесь, это последовательный вывод из статьи, последовательный вывод с интегрированным в награду навыком. У вас есть первый и второй, и вы добавляете в свою библиотеку навыков, вы обновляете свою библиотеку навыков. Прекрасно. Так что всякий раз, когда модель агента взаимодействует со средой, скажем, в простейшем случае API, что бы у вас ни было, она теперь генерирует программные функции, возможно, на Python, которые теперь могут быть поняты и сохранены как навыки в этой новой системе, и впоследствии вы можете вызывать их для выполнения вместо прямого использования нескольких API. Так что это приятно. Учитывая, что контекстное промптирование с трудом адаптирует модели с открытым исходным кодом к этой вновь предложенной библиотеке навыков агента, перед обучением с подкреплением применяется контролируемое тонкая настройка, идя сюда с нашей классической траекторией обучения после обучения. Нет, и, конечно, мы используем высококачественные траектории, собранные на основе экспертного опыта. Это означает обучающие данные, и теперь держитесь крепче, конечно, сгенерированные продвинутыми LMS. Так что, к сожалению, мы здесь зависим от огромных моделей, таких как Gemini mall или, я не знаю, облачная модель здесь, потому что у нас здесь более или менее имитационное обучение. Отлично. Так что для наших агентов библиотеки навыков основное внимание уделяется разработке высококачественных, повторно используемых навыков skill MD при одновременном повышении точности использования навыков из библиотеки для оптимизации задач. Поэтому, как я вам говорил, у них есть локатор GRO, скажем, отлично, давайте модифицируем GRPO, дополненный навыками, для самоэволюции, и как мы это делаем, мы оптимизируем здесь функцию вознаграждения, и, как я показал вам в моем последнем видео, у нас есть вознаграждения, интегрированные в навыки. Так что у нас есть несколько функций вознаграждения, которые наложены. Если вы хотите получить функцию вознаграждения немного подробнее, у нас есть окончательное вознаграждение, интегрированное в навыки, которое вычисляется просто как сумма двух компонентов. Так что у нас есть классическое вознаграждение, основанное на проверяемом результате, и теперь эта новая часть, дополнительное вознаграждение за высококачественную генерацию и использование навыков. Так что, если мы пойдем с классической целью, это просто основа, а затем у нас есть лишь минимальное расширение, которое мы можем кодировать сами. Прекрасно. Каковы результаты теперь? Это не выглядит так уж плохо. Посмотрите. Так что, если у нас здесь есть библиотека навыков и агент, контролируемая тонкая настройка, а теперь эта новая методология s, хорошо, для достижения цели задачи, она превосходит. Что такое достижение цели сценария. Она превосходит средний токен. Прекрасно. Так что эта методология кажется работает очень хорошо. И вы видите, если у вас есть, скажем, здесь с навыками в начале, у вас 72% производительности здесь для достижения цели задачи. И если вы идете без навыка, хорошо, вы немного меньше, 71,4%. Ну, не так быстро, потому что у меня есть второй репринт для вас. И следующий репринт фокусируется на чем-то очень похожем, но совершенно другом. Он фокусируется на синтезе навыков для их создания, для исследования неизвестного, как я вам показывал. Нет, реальная промышленная сложность, реальные биотехнологические сложности. Нет, вы не найдете эти навыки где-нибудь в Интернете. Возможно, некоторые базовые навыки, но в тот момент, когда вы переходите к более сложным навыкам, вам придется их создавать. И теперь мы говорим о новой методологии, как создавать или синтезировать эти навыки, как их создавать. Если мы перейдем к неизвестным областям, таким как биотехнология, действительно прекрасное исследование, которое я держал и ждал, пока не смогу показать вам. Оно было опубликовано в феврале 2026 года Али Бабелем и Шанхайским университетом Цзяо Тун. И у них есть эта прекрасная идея улучшения рассуждений LLM посредством композитного синтеза навыков. Так что они говорят, эй, наши LLM недостаточно умны. Наши LLM — это ядро наших агентов. Поэтому, если мы сможем увеличить вычислительную мощность наших LLM, наши агенты станут умнее, и поэтому они смогут решать более сложные задачи. Так что мы сделаем это сейчас не через классические лабиринты, а через навыки. У нас теперь нет нескольких кратких примеров здесь в наших окнах обучения в контексте, но давайте пойдем с определением навыка, которое у нас есть. Давайте пойдем с этим шаблоном, который мы должны открыть новые возможности, как решать задачи, и их главная идея — давайте не смотреть на задачи генерации текста, а давайте посмотрим на это как на композитное логическое проектирование. Так что у нас есть последовательный процесс принятия решений, где специализированный агент EI, который мы построим для обучения, теперь динамически выбирает и комбинирует атомные навыки рассуждения вместе в новой конфигурации, чтобы построить теперь задачи, которые одновременно очень трудно решить, но валидны и точно откалиброваны, учитывая их сложность. И, конечно, вы уже чувствуете, конечно, у нас будет обучение по учебному плану, прекрасно. Но опять же, хорошо, мы сейчас на третьем этапе сложности навыков, мы говорим о промышленных навыках или навыках автоматизации в промышленности или биотехнологических навыках. ээ, мы теперь должны их определить, и почему бы не использовать CNI и просто обучить ИИ делать это, и тогда он будет комбинировать все наши базовые атомные навыки рассуждения, и вместе они образуют что-то гораздо более прекрасное, просто чтобы показать вам, что это работает, здесь точность здесь с бенчмарка 25, и вы видите здесь на оси X здесь общие параметры, конечно, наши большие модели здесь около, я не знаю, 92% %. Но посмотрите сюда, на 30B. У нас теперь есть LRM, который почти на том же уровне производительности, что и наш кластер наших проприетарных облачных моделей. И это 30B модель с активной 3B. Как это возможно, что эта модель имеет такую же производительность? Ну, давайте посмотрим на ее обучение. Как оказалось, эта 30B модель, этот решатель, и это ваша специально обученная модель ИИ, которую я покажу вам через минуту, была обучена всего на 11 000 синтезированных траекторий рассуждений. И она достигает здесь 92% AM 2025, превосходя здесь передовые модели от GPD5 до Gemini Pro до чего угодно, cla 4.5 opus. Так что вы можете сказать, невероятно. Так как мы генерируем такие прекрасные мощные обучающие данные, и как происходит само обучение, это контролируемая тонкая настройка и обучение с подкреплением или что это теперь? Идея в том, чтобы сделать шаг назад, что мы обучаем наши LLM на наших новых навыках для улучшения здесь интеллекта наших моделей ИИ-рассуждений, нет, так что мы больше не зависим от этих интернет-данных, красивых, да, но теперь мы можем кодировать более сложные навыки, и мы можем открывать их комбинации, которые обеспечат более сложный интеллект рассуждений для наших систем ИИ следующего поколения. Так что прекрасно. Больше нет узкого места в ИИ, потому что люди не поднимаются до этих более высоких интеллектуальных проблем. Теперь у нас могут быть самообучающиеся системы ИИ, которые строят с помощью кодирования и математики эти наборы данных для обучения более сложной сложности, и они смотрят, почему мы потерпели неудачу в прошлом, я имею в виду вчерашние предыдущие системы ИИ были хороши в обучении генерации решений, но они были ужасны в генерации проверяемых сложных проблем, и было два основных режима отказа: либо вы шли с методами, ограниченными шаблонами, они производили валидные проблемы, учитывая ограничения шаблона, но это было слишком легко. Да, или у вас была свободная генерация. Они были непоследовательными или нерешаемыми, или галлюцинации просто сходили с ума. Так что теперь давайте обучим новую модель ИИ, которая генерирует эти сложные проблемы, и она [очищает горло] будет использовать композитные агентные навыки. Так что давайте посмотрим, что может сделать навык для обучения, чтобы сделать наши системы ИИ умнее. Это теперь здесь стадия один, стадия два и стадия три методологии обучения. И я, кстати, использовал здесь новую бесплатную мощь визуализации claw. И после 20 минут борьбы здесь с claude за правильную логику. Я почти справился. Да, вы видите немного, пространство не совсем идеальное. Но да, давайте. Это самый первый раз. Я просто хочу показать вам здесь, если вы используете claude, это бесплатная версия claude здесь, прекрасно. Она действительно способна создавать здесь визуализации, которые, да, вам придется немного побороться, но это возможно. Так что давайте посмотрим, это упрощение, и я покажу вам скриншот из оригинальной статьи, который намного сложнее, через минуту, но давайте просто пойдем здесь с очень простым первым. Так что у нас есть приобретение навыков, затем у нас есть наш классический агентный контролируемый тонкая настройка, у нас есть наше агентное обучение с подкреплением, и, конечно, мы разрабатываем новую оптимизацию политики, да. Конечно. Кстати, у меня есть база данных, где у меня есть все мои оптимизации политики. Это номер 109. У меня 109 оптимизаций политики. Так что добро пожаловать. И тогда, да, у нас есть пара вопрос-ответ. У нас здесь есть последующий решатель. И тогда мы строим здесь нашу модель, нашу модель mixture of expert active speedb, которая имеет прекрасную производительность. Так что давайте посмотрим, как мы это делаем. Да. Хорошо. Итак, сначала, конечно, вопрос в том, какова наша математическая основа, и, конечно, у нас есть только одно или два решения. Так что давайте пойдем с частично наблюдаемым процессом принятия решений марковским. Теперь в аргументе решаемость проблемы — это скрытая вероятность, которую нельзя увидеть только в тексте. Теперь я хочу быть ясным, это утверждение, с которым вы можете не согласиться. Вы можете сказать, хм, это, они делают это очень просто. Да. Так что, чтобы они могли применить известную математическую основу из частично наблюдаемого марковского процесса принятия решений. Но давайте пойдем с этим. Я говорю, хорошо, я принимаю это. И они говорят, хорошо. Так что агент теперь должен исследовать среду. И теперь, что происходит, и это также зависит здесь от частичной наблюдаемости. У нас теперь есть композитные агентные навыки, и они строят это очень особенным образом. У них есть модельные единицы, определенные как кортеж. И в этом кортеже у нас четыре элемента. Это намерение, методология, уровень сложности и подсказка к инструменту. Хм. Если это недействительно, то методология не будет работать. Так что это абсолютно необходимо, чтобы это было разрешено [очищает горло], и у них есть математическое приложение, где они пытаются показать нам это, и я отражу это в конце этого видео. И тогда, конечно, как я вам говорил, у них есть новая оптимизация политики. Да. Многогранная оптимизация политики. Новый алгоритм обучения с подкреплением, который предоставляет вознаграждение. Теперь два уровня. Какое совпадение. Мы никогда раньше этого не слышали. Так что на шагах к промежуточному размышлению при вызовах инструментов и окончательной траектории, окончательной валидности проблемы. Так что снова та же идея для продвижения оптимизации политики обучения с подкреплением. Так что теперь мы здесь, теперь мы слышим, что люди, приятные ИИ-машины, сейчас приятные, но мы действительно идем за сложными вещами в промышленных решениях для финансов, медицины, чего угодно. Теперь это здесь скриншот из оригинальной статьи, и это то, что я предоставил кла, как основное изображение, чтобы затем сделать эту визуализацию упрощением визуализации. Так что это данные, если вы хотите знать, что здесь произошло. Так что, как я вам говорил, стадия один, приобретение навыков, обучение, мы посмотрим на это, затем у нас есть наш классический контролируемый тонкая настройка, и затем у нас есть наше обучение с подкреплением с нашей оптимизацией политики, которая немного введена здесь в функцию вознаграждения на многошаговом уровне, и это все. Вы видите, мы всегда делаем одно и то же, просто теперь это немного более обширно, и давайте начнем с прекрасного приобретения навыков. Так что главная идея, и это действительно удивительно. Вы берете свой учебник по химии или что-нибудь еще, не все ваши книги, и теперь вы хотите извлечь навыки из ваших учебников по химии. Вы видите, прекрасно. Так что вы берете огромный реальный амии или кла, что угодно, и у вас здесь есть промпт в статье. Точно. Вы можете скопировать это, и это теперь извлечет навыки. И, конечно, вы хотите построить skill MD. Хорошо. Так что это извлечение, и здесь нам нужна модель-учитель. Так что здесь нам нужна эта огромная модель с триллионом параметров из нашего глобального сотрудничества, самая умная система, потому что это не простая задача. Нет, и, как я вам говорил, у нас есть четыре элемента. У нас есть структура, формальный каркас, действие, сотрудничество, эффект, целевой результат и все инструменты и все внешние утилиты, которые у нас есть от MCP до чего угодно API. Отлично. И тогда мы извлекли навыки. Нет. Так что навык, я не знаю, какая бы химическая методология вам ни понадобилась. И тогда у вас есть несколько из них. Нет, у вас есть небольшая база данных навыков или торговая площадка. И тогда, конечно, у нас есть не только модель-учитель, но и наша модель-предложения. Это наша 30B модель или 4B модель или что бы у вас ни было локально. Так что с этими агентными навыками мы просто возвращаемся к модели-учителю и говорим: "Эй, можешь еще раз взглянуть? Это правильно? Давайте отфильтруем". Мы берем только лучшее выше определенного порога, и эти квалифицированные агентные навыки мы подаем теперь в нашу модель-предложение. Прекрасно. И тогда контролируемая тонкая настройка. Вы понимаете. Так что для модели-учителя они используют набор данных Q3 235B, учебники, я использую теоретическую физику, это работает хорошо, веб-сайты и извлекают здесь атомные навыки в зависимости от интеллекта Q и трех, конечно, каждый формализован как четырех атрибутный кортеж K, снова намерение, то есть лежащий в основе принцип рассуждения, и, надеюсь, U понимает это и может это уловить. Во-вторых, метод. Так что это процедура построения. Как построить проблему, используя эти принципы. Затем сложность. У нас есть сложность от 0 до 10 или что-то еще. И тогда вам нужен указатель на исполняемый скрипт проверки, например, я не знаю, выполнение кода на суперкомпьютере для моей компьютерной симуляции. Прекрасно. Отфильтрованная библиотека навыков теперь построена путем выборки методом отбраковки. Как я вам показывал здесь, нет, только навыки, превышающие определенный порог качества, или сохраняются, и вы можете построить свою собственную библиотеку навыков по теоретической физике. Это оценивается, конечно, моделью-учителем, критически. Все эти навыки теперь хранятся в формате skill MD. Прекрасно, что означает, что предлагающий загружает здесь метаданные навыка дешево и только получает полные процедурные инструкции при составлении конкретной проблемы. Нет. Теперь к стадии два. Теперь это наша классическая контролируемая тонкая настройка, и она не совсем классическая. Потому что предлагаемая модель ИИ, которую мы имеем здесь сейчас, мы видим, что это та же самая здесь на шаге два u инициализируется, угадайте что, клонированием поведения экспертной траектории, сгенерированной моделью-учителем ИИ. Так что вы говорите, хорошо, мы просто клонируем здесь все, и, хорошо, мы учимся у больших моделей, у моделей старшего брата, хорошо, в каждой траектории содержится здесь три класса действий. Классы — это когнитивные действия, это вся внутренняя цепочка рассуждений, конечно, мы хотим понять логику, как строится логика, как структурирован процесс рассуждений, да, затем все вызовы инструментов, песочница, выполнение кода, и здесь это теперь довольно просто удалить навык из активного набора, mids synthesis, когда внутреннее размышление обнаруживает, что этот навык, когда внешний навык может вызвать логическую несогласованность. Так что теперь у нас есть прекрасная методология, чтобы убедиться, что у нас нет дублирующих навыков, которые не являются действительно логически последовательными и так далее. И тогда у нас есть структура наблюдения. Нет, это просто индикатор, который говорит системе, эй, это просто черновик. Это здесь проверка. Это здесь доработка. Так где мы здесь в цикле? Так что ключевая идея контролируемой тонкой настройки заключается в том, что только траектории, чьи конечные проблемы проверены как валидные. Теперь, как вы проверяете, что это валидно, и они идут здесь для трехэлементного комитета? У них есть Q13 235B, думающий, Deepse версия 3.2 специальная и GBT1 120B. Так что, если эти три модели, и они видят здесь загруженный навык, и они анализируют это, и они говорят, да, это выглядит хорошо, это проверенное валидное решение темы. Прекрасно. Так что мы берем это, делая это теперь, да, если у вас есть вентильные функции, неважно, у вас теперь есть ваш генетический набор вопросов и ответов. Прекрасно. Так что это означает, что у нас теперь есть обучающие данные для контролируемой тонкой настройки предлагающей модели, контролируемая тонкая настройка. И вы надеетесь, что эти три модели вместе сделают это правильно и действительно смогут провести проверку, является ли это правильным следом. Тогда, конечно, мы идем с классическим обучением с подкреплением, как я вам говорил, прекрасно. Почему бы не классический JBL? Вы спросили в прошлый раз о длинной цепочке синтеза AIC, у нас есть проблема разреженного вознаграждения. Это означает, что терминальный сигнал вознаграждения должен распространяться через десятки промежуточных шагов, большинство из которых получат нулевой градиентный сигнал. Так что проблема разреженного вознаграждения присуща этому. И поэтому, как я показал в моем последнем видео, у нас теперь есть новое стандартное решение, и то же самое здесь. У нас теперь есть многогранная оптимизация политики. Так что наше вознаграждение теперь эта формула, и я объясню ее через минуту. Так что это элегантно. Почему? Потому что у нас здесь бонус за сложность, этот член присуждается только тогда, когда проблема решаема. Наши три элемента говорят: "Эй, это сложная проблема, но мы можем ее решить", и она [очищает горло] сложна, и вы хотите, чтобы эта система строила здесь сложные проблемы. Нет, мы не хотим здесь легких проблем. Мы можем решить легкие проблемы. Нет, а проблемы, которые нерешаемы, которые все три модели говорят: "Нет, мы не можем их решить". мы недостаточно умны, получаем нулевое вознаграждение, а легкие тривиальные проблемы также получают нулевое вознаграждение за сложность. Так что это довольно простой способ, но вы можете иметь это здесь в виде текста. Так что у вас здесь, у вас здесь предлагающий, и он продолжается с черновиком, с анализом рассуждений, навыками, как их использовать и комбинировать. Затем у вас есть проверка рассуждений, чтобы проверить здесь черновик вопроса с инструментами. И тогда у вас есть доработка, доработка здесь ошибок, найденных. И тогда мы разделяемся здесь, потому что у нас есть несколько структур вознаграждения. Если вы продолжаете финализировать, предлагайте здесь окончательный хороший вопрос. У нас есть верификатор и проб. И мы определяем сложность, правильность окончательного вопроса. Как я вам говорил, прекрасно, и у нас есть вознаграждение за траекторию. Это наше первое вознаграждение. Но также, если мы идем от доработки, когда мы находим ошибки и хотим исправить ошибки и исправить их, мы идем шаг за шагом. Так что у нас теперь интегрированные пошаговые вознаграждения, и вы видите, если наш предлагающий говорит: "Эй, я могу пропустить обновление навыков или что-то еще", теперь у него есть несколько функций вознаграждения, которые идут вместе в оптимизации политики. Просто. Теперь представьте, что вы обучаете здесь предлагающего составлять проблемы из десятков категорий навыков, например, в теоретической физике, я сталкиваюсь здесь с моими типичными способами интегрирования контуров, комбинаторными доказательствами, дифференциальными уравнениями, теорией графов, алгоритмами кодирования, полной термодинамикой нашей системы и так далее. Так что вы видите, это довольно тяжелые блоки теоретической физики, и если я хочу извлечь свои навыки, это не так просто, потому что без какого-либо механизма учебного плана, начиная с простого и становясь все более и более сложным, агент будет случайным образом выбирать категории навыков с равной вероятностью. Он просто будет продолжать генерировать легкую комбинаторику, потому что, ну, вы знаете, у нас есть взлом вознаграждения и так далее, и агент пытается обмануть. Так что oresy этой статьи разработал механизм учебного плана, который прекрасен. Он автоматически сосредоточит время обучения, и я объясню это подробно через минуту, на таких категориях, как дифференциальные уравнения или термодинамика, где агент в настоящее время слабее всего. Он еще не выучил достаточно хорошие математические решения для этого, и сократит время на категории, которые он уже освоил. Так что мы указываем пальцем прямо на место, где болит. где у агента нет реальной способности решать это или не знает, как это делать, какой набор навыков использовать или как комбинировать три разных навыка для дифференциального уравнения, которое мне нужно в моей работе. Теперь, просто чтобы сказать вам, с какими параметрами мы работаем, у нас есть оценка владения MC для категории навыков C на итерации обучения T. Это одно число от нуля до одного, представляющее, эй, насколько хорошо агент в настоящее время генерирует валидные сложные проблемы в категории C. Оценка один означает, что агент освоил эту категорию, да, C — специфическая категория навыков, нет, как я вам показывал, комплексный анализ, комбинаторные доказательства, дифференциальные уравнения и так далее, а альфа — это сглаживающий фактор. Это, да, немного обмана, число от нуля до одного, и оно просто контролирует, насколько быстро система реагирует на новую информацию по сравнению с доверием к своей исторической оценке. Здесь вы можете поиграть с этим, сделать его более склонным принимать новую информацию или или другое, что угодно. И тогда у нас есть здесь классическая формула, и это приятно. Я снова играю с визуализацией claw, и вы видите здесь наш MC в t + 1. У нас теперь два члена. У нас здесь этот член. Это означает вес прошлого опыта, что мы уже считаем правдой, плюс теперь член, это вес нового сигнала, что только что произошло, коэффициент успеха, и классически это наш экспоненциальный скользящий средний, который вы знаете, прекрасно, но что он делает, это здесь, скажем, у нас здесь оценка владения после некоторого обучения, так что вы видите в комбинаторике, прекрасно, 87%, исчисление 65%, алгебра, хорошо, но мы явно слабы в интегралах контуров. Так что это означает, что система теперь анализирует это и имеет теперь результирующие вероятности выборки, и вы видите, да, здесь визуализация cloud имеет некоторые проблемы, но я не смог выяснить, как это решить, извините, после 10 минут я просто сдался, но вы понимаете, что происходит, интегралы контуров здесь, вероятности выборки, я говорю: "Эй, ты действительно плохо справляешься с решением интегралов контуров, так что тебе придется этому научиться, тебе нужно сосредоточить свое время обучения на этой конкретной теме, нет, и если ты уже преуспеваешь в комбинаторике. Да, у тебя низкая вероятность, потому что ты уже освоил это. Так что вы видите, это действительно здесь настраивается на лету, точно анализируя здесь способности и способности к решению здесь нашего агента, и это прекрасно, и снова визуализация cloud, у нас здесь саморегулирующийся учебный план, и мне нравится эта идея, почему у нас есть наш вектор владения, затем мы инвертируем его для выборки kodak, которую я только что показал, затем мы фокусируемся здесь, и мы говорим: "Хорошо, так что предлагающий ИИ генерирует проблемы в категории C. Мы подаем проблемы. Затем у нас есть верификатор, измеряем коэффициент успеха, и если это работает, у нас есть обновление здесь, и вы видите, эта система саморегулируется. Она понимает слабые места ИИ-агента и сильные стороны в решении здесь моей конкретной задачи по теоретической физике. Это прекрасно. Это саморегулируется по дизайну, и нет человека, которого нужно было бы интегрировать в это расписание учебного плана. Оно возникает здесь из самого цикла обратной связи. Конечно, это зависит от наших LLM-учителей. Теперь, если у вас есть галлюцинация в Gemini, или если у вас есть проблема в CLA, или если у вас есть что-то еще в других системах, нет, тогда наш LLM-учитель вызовет ошибки. Так что, возможно, нам нужно будет как-то проверить людей время от времени, но в остальном вы понимаете, и я думаю, это одно из самых близких вещей в литературе к реальной формальной реализации концепций автономного роста возможностей. Это действительно то, что я хотел бы попробовать подробно. Да, давайте посмотрим на результаты. Так что здесь у нас AM24, AM25, все наши бенчмарки, прекрасно, а затем у нас здесь наша базовая модель, Q& 4 миллиарда инструкций, вы видите, боже мой, так что вы видите AIM24 49%, AIM25 46%. Затем у вас есть все старые методологии, metermat и madsmith и что угодно. Прекрасно. А затем у вас есть модель, аннотированная человеком. Прекрасно. А затем агентное самовоспроизведение. Прекрасно. А затем у вас здесь действительно большая. GPT 5.2 high Gemini Pro Q3 Max Cloud 4.5 OPUS DeepS версия 3.2 два, и вы не поверите, последняя строка — это эта новая методология, и, как вы видите, последняя строка здесь абсолютно превосходит все остальное, что и ожидалось, но абсолютно странно, почему, черт возьми, GPT 5.2 два или все другие, все другие модели, посмотрите на это, имеют производительность ниже, чем у Q13 4B instruct. Если это модели, которые генерируют наши проблемы, если это модели-учителя, почему модель-учитель имеет, если мы затем запускаем эти модели-учителя на AM24, AM25, меньшую производительность? Посмотрите на эту полную меньшую производительность. Я знаю, это не очень много, три процентных пункта, один процентный пункт, но как это возможно, и объяснение, учитывая J-образное распределение сложности, я не думаю, что это действительно здесь, так что это здесь для меня своего рода открытый вопрос, так что если у вас есть какие-либо идеи, как это возможно, я действительно заинтересован, нет, потому что вы видите, предлагающая модель генетики здесь, последняя строка здесь только для aim 24, 3,88 процентных пункта, а Gemini 3 Pro теряет 4,3 процентных пункта. Так что, хм, что-то происходит. Я еще не совсем понимаю. Так что, если у вас есть четкое понимание, эй, просто напишите в комментариях. Я также нахожу интересным здесь, если у вас есть GBD 5.2 high, сырой промптинг, и давайте пойдем для среднего AIM 32,8. Где это? 32,8. сделал это здесь. Это чистый GBD 5.2 high. Отлично. А затем, если вы поместите библиотеку навыков с структурированными атрибутами, она увеличивается. И если вы пойдете, если вы добавите теперь агентный рабочий процесс от черновика, проверки и доработки и всего остального, вы получите 36%. Прекрасно. А затем у вас есть этот новый метод, агентный предлагающий, 4 миллиардная модель, которая превосходит ваш GPD 5.2 high на AIM. Мне это нравится. Так что это нам кое-что говорит. Это говорит нам, во-первых, что модели GBT и все остальные модели еще не идеально обучены. Мы можем ожидать много большего интеллекта в следующем поколении ИИ. И я думаю, этот эксперимент демонстрирует, что структурированное композитное составление навыков, как я вам показывал, и итеративная валидация абсолютно критичны для высококачественного синтеза проблем, превосходящего наши большие системы GPT. Так что, чтобы быть ясным, полный препринт и вся логика и вся методология зависят от этой единственной идеи, что вам разрешено делать это, и это касается композиции навыков, и они утверждают, что это основано на принципе возникающей композиционности, и они вводят эту лемму, лемму о возникающей композиционности навыков, и она довольно проста. Так что пусть F будет набором атомных навыков. И для композитной задачи H, если цель обучения с подкреплением предоставляет положительные вознаграждения только тогда, когда выход соответствует H, агент может научиться оркестрировать G и F для решения H с высокой вероятностью, даже если конкретная композиция не встречалась во время предварительного обучения системы ИИ. И на основе этого они смогли формализовать теперь каждый навык как структурированный атрибутный кортеж, который мы только что прошли, кодирующий его намерение рассуждения, метод построения, эффект сложности и подсказку к инструменту, а затем они определяют здесь отображающий оператор, который преобразует композицию из n выбранных навыков, многонавыков в естественный язык, ограничения в высокоразмерном пространстве инструкций. И генерация проблемы затем управляется политикой pya, параметризованной pya, нашими классическими системами. Теперь продолжайте. Но, как я вам говорил, если эта лемма 3.1 недействительна для данного конкретного случая, все исследование рухнет. Так что вы думаете? Лема 3.1 верна? Можем ли мы это сделать? Авторы правы? Нашли ли вы какие-либо математические контраргументы? Просто оставьте комментарий здесь. И это, если вы хотите, чтобы кортеж навыков здесь был грамматикой рассуждений. Намерение обеспечивает здесь проверку семантической совместимости. Перед композицией двух навыков агент может проверить, конфликтуют ли их намерения или намерения. Метод предоставляет фактические процедурные инструкции. Как. Сложность — это просто приближение сложности составленных проблем. И последнее, подсказка к инструменту, предоставляет исполняемый файл для проверки, тем самым замыкая цикл синтеза и проверки. Если вы хотите немного углубиться в приложение, у них есть тематическое исследование, логика агентного взаимодействия. Они показывают вам здесь точно агентный предлагающий 4B все шаги, и они фокусируются здесь на математике, комплексном обобщенном Коши, skill MD для Коши. Так что, если вы немного интересуетесь математикой, это прекрасное тематическое исследование, чтобы дать вам дальнейшее понимание. Но, конечно, это было только введение, потому что в моем следующем видео, надеюсь, завтра, я смогу показать вам другую методологию, которая просто [очищает горло] поразит вас. Но на сегодня я говорю спасибо и надеюсь увидеть вас в моем следующем.