Transcription
Привет, сообщество. Так здорово, что вы вернулись. Давайте поговорим о конфигурациях многонавыковых markdown. Да, у меня есть видео здесь для однонавыкового MD. Но давайте посмотрим, как мы это объединяем. Что мне действительно понравилось, так это эта публикация от февраля 2026 года, где агентные навыки для LLM, где автошоу, и вместо кодирования всех проуральных знаний в весах модели, агентные навыки означают компонуемые пакеты инструкций, кода и ресурсов, которые агент загружает по запросу, обеспечивая динамическое расширение возможностей без какого-либо переобучения наших ИИ-моделей. Теперь вы знакомы здесь с нашим метадором уровня один, инструкцией уровня два, загруженной по триггеру, и ресурсами уровня три с динамическими скриптами загрузки, ссылками, шаблонами активов, мы видели это, и вы загружаете все в контекстное окно, отлично. Теперь, чтобы быть уверенным, где мы находимся, в моем последнем видео я рассказывал вам о обучении с подкреплением в контексте в агентном стиле, так что это не то, о чем мы говорим сегодня, это было вчера, это была совершенно другая сложность, сегодня мы просто говорим о навыках MD. Это означает обучение в контексте. Отлично. Так что нет никакой генерализации этих навыков UI. Вы обучаетесь на конкретном навыке, это обучение в контексте, и вы не можете предположить, что UI, учитывая любой интеллект, который у него есть, не способен к генерализации или решению задач вне домена. Так что у вас есть контекстное окно. Допустим, у вас есть 200 000 токенов. Вы загружаете навык A с некоторых маркетплейсов, навык B, и тогда вы видите, ах, для навыка A есть гораздо лучшее решение или есть другая методология, так что если вы загрузите все эти навыки, и у вас нет представления о математическом решении или решателе, стоящем за этим, вы можете захотеть исключить некоторые навыки, которые уже находятся в контекстном окне, но разучивание в вашем контекстном окне — это довольно сложная задача, так что давайте посмотрим, сможем ли мы найти лучшее решение для этого. Поэтому я решил изменить свой взгляд на мир. Я говорю, обучение в контексте — прекрасно, но вы знаете, мы всегда должны предоставлять несколько кратких примеров для нашего обучения в контексте, чтобы показать, эй, это именно то, что я хочу. Теперь мы просто расширяем это и добавляем сюда в ту же категорию навыки markdown, эти описания, как я показал вам здесь в моем первом видео по однонавыковому MD, это именно более или менее продолжение здесь на более высоком уровне сложности и, конечно, вы знаете, у нас есть последовательность действий, последовательность MCP или, если вы идете по классическим вызовам API, все, что необходимо для решения этого. Но вы помните, я показал вам только в моем видео здесь. Я надеюсь, это было вчера, когда ИИ-агенты заблокировались. Они больше не могут это решить. Есть некоторые конфигурации, где агенты просто перестают выполнять работу. Так можем ли мы решить это дополнительно? [кашляет] И как я вам говорил, навыки и MCP не являются конкурирующими стандартами, а скорее думайте об ортогональных слоях возникающего агентного стека. И здесь у вас есть агентные навыки, а здесь MCP, прекрасно. Так что навык может также инструктировать агента использовать конкретный сервер MCP, указывая, как интерпретировать его выходные данные, и даже определять стратегию отката на случай сбоя соединения. Так что в целом мы можем сказать, что все эти навыки предоставляют процедурный интеллект, в то время как MCB предоставляет связь, и я думаю, они очень хорошо сочетаются. Теперь у вас есть claw code, у вас есть навык, создайте метанавык, из которого вы просто создаете свой новый навык, вы просто говорите с ним из описания на естественном языке, и тогда он сгенерирует для вас файл skillmd с некоторым пакетным скриптом, и все, надеюсь, будет работать. Если у вас есть действительно простая проблема, но у нас также есть корпоративное развертывание, Atlassian, Canva, везде, где я знаю, где мы вешаем правильные рабочие процессы. Отлично. Теперь вы знаете из моего однонавыкового MD, нашего skill MD, нашего reference MD, нашего forms MD, все прекрасно. И вы помните, что нам пришлось посмотреть здесь на плагины финансовых услуг Entropic для конкурентного финансового анализа. Файл skillmd содержал прекрасные инструкции. Теперь, если в запросе перечислены семь конкурентов, включите всех семь, а не пять или шесть, и если в запросе выбраны данные за период с 2015 по 2026 год, включите все годы, а не подмножество. Так что вы сразу почувствовали, эй, это будет весело, если мы построим многонавыки. Так что на самом деле мы сталкиваемся с проблемой, что люди пишут навыки, это хорошо, нет, это прекрасно, хорошо, а затем у нас есть немного ИИ-машин, таких как claw code, они пишут навыки, и это действительно хорошо, но если у вас здесь доступ к сложности, и скажем так, вам нужно написать сложное промышленное решение, или вы работаете в науке, и вы работаете в нанотехнологиях, или в биотехнологиях, или для следующего дизайна чипа, у вас нет простых одиночных навыков, у вас есть, боже мой, сложность, о которой мы будем говорить в этом видео. Итак, добро пожаловать, давайте начнем приобретение навыков и сложное обучение навыкам. Это совершенно отличается от того, что вы думали, как мы можем использовать навыки сегодня, потому что помните, skillmd идет только в контекстные окна без генерализации LLM, и это не то, что мы хотим. Мы хотим, чтобы наши ИИ-системы действительно учились, чтобы они понимали, и мы можем увеличить сложность для более высоких сложностей в науке. Так что я действительно ценю это исследование Университета Висконсин-Мэдисон AWS 10 марта 2026 года. У нас есть самосовершенствующийся агент. Йиппи, и у нас есть библиотеки навыков. И вы говорите, фантастика. Так что наш агент теперь имеет доступ к библиотекам навыков и может самосовершенствоваться, и вы говорите, давайте сделаем это, а затем вы просто замечаете, эй, подождите минутку, есть обучение с подкреплением, так что мы обучаем этого агента, и агент становится более умным. Абсолютно. Разве это не круто? Так что давайте посмотрим. Они, конечно, представляют, поскольку мы занимаемся обучением с подкреплением. Да. Новая оптимизация политики, и, конечно, она основана на GPO, но это совершенно новая, гораздо более сложная GPO, дополненная навыками, для самоэволюции. Она называется Sage или как бы вы ее ни произносили, и новая структура обучения с подкреплением, которая включает навыки в процесс обучения. И как вы это делаете? Легко. Они имеют последовательный прогон, итеративно развертывая агента по цепочке похожих задач для каждого прогона. Так что они просто пробуют, пробуют, делают немного сложнее, пробуют снова, и по мере того, как они перемещаются по цепочке текстов, навыки, сгенерированные из предыдущей задачи, накапливаются теперь в библиотеке. Так что вы заполняете свою собственную библиотеку навыков, и она становится доступной для всех последующих задач вашего агента, который теперь будет пытаться самосовершенствоваться, проходя теперь через все больше и больше последовательных прогонов. Теперь либо вы идете с библиотекой навыков, которая в самом начале равна нулю, тогда вы полагаетесь на ядро вашего агента, это ваш LLM или ваш VLM, или вы загружаете, я не знаю, 10 навыков или как вы хотите начать, это не имеет большого значения. Теперь вы помните, я говорил об оптимизации политики только в одном из моих последних видео, когда мы говорили о блокировке агента. Я показал вам математическую методологию, как мы можем выбраться из этих потенциальных блокировок, и это было с минимальным введением. Мы собираемся сделать более или менее то же самое. Поэтому я просто скажу, эй, посмотрите мое последнее видео. Я не собираюсь объяснять здесь более или менее ту же методологию во второй раз. Мы уже знаем это. Да, если вы хотите получить дату всего, это в настоящее время на GitHub Amazon science sage. Так что там вы найдете все для вашего репозитория GitHub. Так какова цель? Цель состоит в том, чтобы улучшить возможности самосовершенствования ИИ-агента в вашей предметной области, скажем, медицине или физике или чем-то еще, посредством обучения с подкреплением. Так что нам нужно, я не знаю, что у вас есть. скажем так, узел графических процессоров Blackwell с библиотекой навыков, и вы внезапно видите, что у нас есть самосовершенствование, и теперь не то, что у нас больше знаний, или что у нас больше информации, или что у нас есть несколько кратких примеров для обучения в контексте. Теперь мы идем сюда с библиотекой навыков, и эти навыки не являются, если хотите, базовыми элементами того, как обрабатывать новые задачи, как находить решения. Теперь вы видите здесь, это последовательный прогон из статьи с интегрированным вознаграждением навыков. У вас есть первый и второй, и вы добавляете в свою библиотеку навыков, вы обновляете свою библиотеку навыков. Прекрасно. Так что всякий раз, когда модель агента взаимодействует со средой, скажем, в простейшем случае API, что бы у вас ни было, она теперь генерирует программные функции, возможно, на Python, которые теперь могут быть поняты и сохранены как навыки в этой новой системе, и впоследствии вы можете вызывать их для выполнения вместо прямого использования нескольких API. Так что это хорошо. Учитывая, что контекстное промптирование с трудом адаптирует модели с открытым исходным кодом к этой вновь предложенной библиотеке навыков агента, перед обучением с подкреплением применяется контролируемое дообучение, идя сюда с нашей классической траекторией обучения после обучения. Нет, и, конечно, мы используем здесь высококачественные траектории, собранные благодаря опыту экспертов. Это означает обучающие данные, а теперь держитесь за носки, конечно, сгенерированные продвинутыми LMS. Так что, к сожалению, мы здесь зависим от огромных моделей, таких как Gemini mall или, я не знаю, облачная модель здесь, потому что у нас здесь более или менее имитационное обучение. Отлично. Так что для наших агентов библиотеки навыков основное внимание уделяется разработке высококачественных повторно используемых навыков skill MD при одновременном повышении точности использования навыков из библиотеки для оптимизации задач. Поэтому, как я вам говорил, у них есть локатор GRO, скажем так, давайте модифицируем GRPO, дополненное навыками, для самоэволюции, и как мы это делаем, мы оптимизируем здесь функцию вознаграждения, и, как я показал вам в моем последнем видео, у нас есть вознаграждения, интегрированные с навыками. Так что у нас есть несколько функций вознаграждения, которые наложены. Если вы хотите получить функцию вознаграждения немного более подробно, у нас есть финальное вознаграждение, интегрированное с навыками, которое вычисляется просто как сумма двух компонентов. Так что у нас есть классическое вознаграждение, основанное на проверяемом результате, и теперь эта новая часть и дополнительное вознаграждение за высококачественную генерацию и использование навыков. Так что, если мы пойдем с классической целью, это просто основа, а затем у нас есть лишь минимальное расширение, которое мы можем закодировать сами. Прекрасно. Каковы результаты теперь? Это не выглядит так уж плохо. Посмотрите. Так что, если у нас здесь есть библиотека навыков и агент, контролируемое дообучение, а теперь эта новая методология s, хорошо, для достижения цели задачи, она превосходит. Что такое достижение цели сценария. Она превосходит средний токен. Прекрасно. Так что эта методология работает очень хорошо. И вы видите, если у вас есть, скажем так, навыки в начале, у вас 72% производительности здесь для достижения цели задачи. И если вы идете без навыка, хорошо, вы немного меньше, 71,4%. Ну, не так быстро, потому что у меня есть второй репринт для вас. И следующий репринт фокусируется на чем-то очень похожем, но совершенно другом. Он фокусируется на синтезе навыков для их создания, для исследования неизвестного, как я вам показывал. Нет, реальная промышленная сложность, реальная биотехнологическая сложность. Нет, вы не найдете эти навыки где-то в интернете. Возможно, некоторые базовые навыки, но в тот момент, когда вы переходите к более сложным навыкам, вам придется их создавать. И теперь мы говорим о новой методологии, как создавать или синтезировать эти навыки, как их создавать. Если мы перейдем к неизвестным областям, таким как биотехнология, действительно прекрасное исследование, которое я держал и ждал, пока смогу показать вам. Оно было опубликовано в феврале 2026 года Али Бабелем и Шанхайским университетом Цзяотун. И у них есть эта прекрасная идея улучшения рассуждений LLM посредством композиционного синтеза навыков. Так что они говорят, эй, наши LLM недостаточно умны. Наши LLM — это ядро наших агентов. Поэтому, если мы сможем увеличить вычислительную мощность наших LLM, наши агенты станут умнее, и поэтому они смогут решать более сложные проблемы. Так что мы сделаем это сейчас не через классические лабиринты, а через навыки. У нас теперь нет нескольких кратких примеров здесь в наших окнах обучения в контексте, но давайте пойдем с определением навыка, которое у нас есть. Давайте пойдем с этим шаблоном, который мы должны открыть новые возможности решения задач, и их главная идея — давайте посмотрим не на задачи генерации текста, а давайте посмотрим на это как на композиционное логическое инжиниринг. Так что у нас есть последовательный процесс принятия решений, где специализированный ИИ-агент, который мы будем обучать, теперь динамически выбирает и комбинирует атомарные навыки рассуждений вместе в новой конфигурации, чтобы построить теперь проблемы, которые одновременно очень трудно решить, но валидны и точно откалиброваны, учитывая их сложность. И, конечно, вы уже чувствуете, конечно, у нас будет обучение по учебному плану, прекрасно. Но опять же, хорошо, мы сейчас на третьем этапе сложности навыков, мы говорим о промышленных навыках или навыках автоматизации в промышленности или биотехнологических навыках. ээ, нам теперь нужно их определить, и почему бы не использовать CNI и просто обучить ИИ делать это, и тогда он будет комбинировать все наши базовые атомарные навыки рассуждений, и вместе они образуют что-то гораздо более прекрасное, просто чтобы показать вам, что это работает, здесь точность здесь с бенчмарка 25, и вы видите здесь на оси X общее количество параметров, конечно, наши большие модели здесь около, я не знаю, 92% %. Но посмотрите сюда, на 30B. У нас теперь есть LRM, который почти на том же уровне производительности, что и наш кластер наших проприетарных облачных моделей. И это 30B модель с активной 3B. Как возможно, что эта модель имеет ту же производительность? Ну, давайте посмотрим на ее обучение. Как оказалось, эта 30B модель, этот решатель, и это ваша специально обученная модель ИИ, которую я покажу вам через минуту, была обучена всего на 11 000 синтезированных траекторий рассуждений. И она достигает здесь 92% AM 2025, превосходя здесь фронтальные модели от GPD5 до Gemini Pro до чего угодно, cla 4.5 opus. Так что вы можете сказать, невероятно. Так как мы генерируем такие прекрасные мощные обучающие данные, и как проходит само обучение, это контролируемое дообучение и обучение с подкреплением, или что это теперь? Идея в том, чтобы сделать шаг назад, что мы обучаем наши LLM на наших новых навыках, чтобы улучшить здесь интеллект наших моделей ИИ-рассуждений, нет, так что мы больше не зависим от этих интернет-данных, прекрасных, да, но теперь мы можем кодировать более сложные навыки, и мы можем открывать их комбинации, которые обеспечат более сложное рассуждение для наших систем ИИ следующего поколения. Так что прекрасно. Больше нет узкого места ИИ, потому что люди не поднимаются до этих более высоких интеллектуальных проблем. Теперь у нас могут быть самообучающиеся ИИ-системы, которые строят с помощью кодирования и математики эти наборы обучающих данных более высокой сложности, и они смотрят, почему мы потерпели неудачу в прошлом, я имею в виду вчерашние предыдущие ИИ-системы были хороши в обучении генерации решений, но они были ужасны в генерации проверяемых сложных проблем, и было два основных режима сбоя: либо вы шли с шаблонными ограниченными методами, они производили валидные проблемы, учитывая ограничения шаблона, но это было слишком легко. Да, или у вас была свободная генерация. Они были непоследовательными или нерешаемыми, или галлюцинации просто выходили из-под контроля. Так что теперь давайте обучим новую ИИ-модель, которая генерирует теперь эти сложные проблемы, и она [кашляет] будет использовать компонуемые агентные навыки. Так что давайте посмотрим, что навык может сделать для обучения, чтобы сделать наши ИИ-системы умнее. Это теперь здесь стадия один, стадия два и стадия три методологии обучения. И, кстати, я использовал здесь новую бесплатную визуализационную мощность claw. И после 20 минут борьбы здесь с claude за правильную логику, я почти справился. Да, вы видите немного, пространство не совсем идеальное. Но да, давайте. Это первый раз. Я просто хочу показать вам здесь, если вы используете claude, это бесплатная версия claude здесь, прекрасно. Она действительно способна создавать визуализации, которые, да, вам придется немного побороться, но это возможно. Так что давайте посмотрим, это упрощение, и я покажу вам скриншот из оригинальной статьи, который гораздо сложнее, через минуту, но давайте просто пройдемся по очень простому первому. Так что у нас есть приобретение навыков, затем у нас есть наше классическое агентное контролируемое дообучение, у нас есть наше агентное обучение с подкреплением, и, конечно, мы разрабатываем новую оптимизацию политики, да. Конечно. Вы знаете, кстати, у меня есть база данных, где у меня есть все мои оптимизации политики. Это номер 109. У меня 109 оптимизаций политики. Так что добро пожаловать. И тогда, да, у нас есть пара вопрос-ответ. У нас здесь есть последующий решатель. И тогда мы строим здесь нашу модель, нашу модель mixture of expert active speedb, которая имеет прекрасную производительность. Так что давайте посмотрим, как мы это делаем. Да. Хорошо. Итак, во-первых, конечно, вопрос в том, какова наша математическая структура, и, конечно, у нас есть только одно или два решения. Так что давайте пойдем с частично наблюдаемым процессом принятия решений марковским. Теперь в аргументе решаемость проблемы — это скрытая вероятность, которую нельзя увидеть только в тексте. Теперь я хочу быть ясным, это утверждение, с которым вы можете не согласиться. Вы можете сказать, хм, это, они делают это очень просто. Да. Так что, чтобы они могли применить известную математическую структуру из частично наблюдаемого процесса принятия решений марковским. Но давайте пойдем с этим. Я говорю, хорошо, я принимаю это. И они говорят, хорошо. Так что агент теперь должен исследовать среду. И теперь, что происходит, и это здесь также зависит от частичной наблюдаемости. У нас теперь есть компонуемые агентные навыки, и они строят их очень специфическим образом. У них есть модельные единицы, определенные как кортеж. И в этом кортеже у нас есть четыре элемента. Это намерение, методология, уровень сложности и подсказка к инструменту. Хм. Если это недействительно, то методология не сработает. Так что это абсолютно необходимо, чтобы это было разрешено [кашляет], и у них есть математическое приложение, где они пытаются показать нам это, и я отражу это в конце этого видео. И тогда, конечно, как я вам говорил, у них есть новая оптимизация политики. Да. Многогранная оптимизация политики. Новая новаторская алгоритм обучения с подкреплением, который предоставляет вознаграждение. Теперь два уровня. Какое совпадение. Мы никогда раньше этого не слышали. Так что на шагах к промежуточному отражению при вызовах инструментов и финальной траектории, финальной валидности проблемы. Так что снова та же идея для продвижения оптимизации политики обучения с подкреплением. Так что теперь мы здесь, теперь мы слышим, что люди, милые ИИ-машины, сейчас милые, но мы действительно идем за сложными вещами в промышленных решениях для финансов, медицины, чего угодно. Теперь это здесь скриншот из оригинальной статьи, и это то, что я предоставил cla здесь в качестве основного изображения, чтобы сделать эту визуализацию упрощением визуализации. Так что это данные, если вы хотите знать, что здесь произошло. Так что, как я вам говорил, стадия один, обучение приобретению навыков, мы посмотрим на это, затем у нас есть наше классическое контролируемое дообучение, а затем у нас есть наше обучение с подкреплением с нашей оптимизацией политики, которая немного введена здесь в функцию вознаграждения на многошаговом уровне, и это все. Вы видите, мы всегда делаем одно и то же, просто теперь это немного более обширно, и давайте начнем с прекрасного приобретения навыков. Так что главная идея, и это действительно удивительно. Вы берете свой учебник по химии или что-то еще, не все ваши книги, и теперь вы хотите извлечь навыки из своих учебников по химии. Вы видите, прекрасно. Так что вы берете огромный реальный амии или cl, или что-то еще, и у вас есть здесь промпт в статье. Точно. Вы можете скопировать это, и это извлечет теперь навыки. И, конечно, вы хотите построить skill MD. Хорошо. Так что это извлечение, и здесь нам нужна модель-учитель. Так что здесь нам нужна эта огромная модель с триллионом параметров из нашего глобального сотрудничества, самая интеллектуальная система, потому что это не простая задача. Нет, и, как я вам говорил, у нас есть четыре элемента. У нас есть структура, формальный каркас, действие, сотрудничество, эффект, целевой результат и все инструменты и все внешние утилиты, которые у нас есть от MCP до любого API. Отлично. И тогда мы извлекли навыки. Нет. Так что навык, я не знаю, какой бы химический метод вы ни хотели. И тогда у вас есть несколько из них. Нет, у вас есть небольшая база данных навыков или маркетплейс. И тогда, конечно, у нас есть не только модель-учитель, но и наша модель-предложение. Это наша 30B модель или 4B модель или что у вас есть локально. Так что с этими агентными навыками мы просто возвращаемся к модели-учителю и говорим: "Эй, можешь еще раз посмотреть? Это правильно? Давайте отфильтруем". Мы берем только лучшие выше определенного порога, и эти квалифицированные агентные навыки мы передаем в нашу модель-предложение. Прекрасно. И тогда контролируемое дообучение. Вы поняли. Так что для модели-учителя они используют набор данных Q3 235B, учебники, я использую теоретическую физику, это работает хорошо, веб-сайты и извлекают здесь атомарные навыки в зависимости от интеллекта Q и трех, конечно, каждый формализован как четырехкомпонентный кортеж K, снова намерение, то есть лежащий в основе принцип рассуждения, и, надеюсь, U понимает это и может уловить его. Во-вторых, метод. То есть процедура построения. Как построить проблему, используя эти принципы. Затем сложность. У нас есть сложность от 0 до 10 или что-то еще. И тогда вам нужен указатель на исполняемый скрипт проверки, такой как, я не знаю, выполнение кода на суперкомпьютере для моей компьютерной симуляции. Прекрасно. Отфильтрованная библиотека навыков теперь построена путем отбора по выборке. Как я вам показывал здесь, нет, только навыки, превышающие определенный порог качества, или сохраняются, и вы можете построить свою собственную библиотеку навыков по теоретической физике. Это оценивается, конечно, моделью-учителем, критически. Все эти навыки теперь хранятся в формате skill MD. Прекрасно, что означает, что предложение загружает здесь метаданные навыка дешево и только извлекает полные процедурные инструкции при составлении конкретной проблемы. Нет. Теперь к стадии два. Теперь это наше классическое контролируемое дообучение, и оно не совсем классическое. Потому что предлагаемая ИИ-модель, которую мы имеем здесь, теперь мы видим, что это та же самая здесь на шаге два u инициализируется, угадайте что, клонированием поведения экспертной траектории, сгенерированной моделью-учителем. Так что вы говорите, хорошо, мы просто клонируем здесь все, и хорошо, так что мы учимся у большой модели, у моделей старшего брата, хорошо, в каждой траектории содержатся здесь три класса действий. Классы — это когнитивные действия, это вся внутренняя цепочка рассуждений, конечно, мы хотим понять логику, как строится логика, как структурирован процесс рассуждений, да, затем все вызовы инструментов, песочница, выполнение кода, и здесь это теперь довольно просто удалить навык из активного набора, синтез, когда внутреннее отражение обнаруживает, что этот навык, когда внешний навык может вызвать логическую несогласованность. Так что теперь у нас есть здесь прекрасная методология, чтобы убедиться, что у нас нет дублирующих навыков, которые не являются действительно логически последовательными и так далее. И тогда у нас есть структура наблюдения. Нет, это просто индикатор, который говорит системе, эй, это просто черновик. Это здесь проверка. Это здесь доработка. Так где мы здесь в цикле? Так что ключевое понимание контролируемого дообучения заключается в том, что только траектории, чьи финальные проблемы проверены как валидные. Теперь, как вы проверяете, что это валидно, и они идут теперь сюда для трехэлементного комитета? У них есть Q13 235B, думающий, Deepse версия 3.2 специальная и GBT1 120B. Так что если эти три модели, и они видят здесь загруженный навык, и они анализируют это, и они говорят, да, это выглядит хорошо, это проверенное валидное решение темы. Прекрасно. Так что мы берем это, делаем это теперь, да, если у вас есть логические функции, неважно, у вас теперь есть ваш генетический набор вопросов и ответов. Прекрасно. Так что это означает, что у нас теперь есть обучающие данные для контролируемого дообучения модели-предложения, контролируемое дообучение. И вы надеетесь, что эти три модели вместе сделают это правильно и действительно смогут провести проверку, является ли это правильным следом. Тогда, конечно, мы идем с классическим обучением с подкреплением, как я вам говорил, прекрасно. Почему бы не классический JBL? Вы спрашивали в прошлый раз о длинной цепочке синтеза AIC, у нас есть проблема разреженного вознаграждения. Это означает, что терминальный сигнал вознаграждения должен распространяться через десятки промежуточных шагов, большинство из которых получит ноль в качестве градиентного сигнала. Так что проблема разреженного вознаграждения присуща этому. И поэтому, как я показал в моем последнем видео, у нас теперь есть новое стандартное решение, и то же самое здесь. У нас теперь есть многогранная оптимизация политики. Так что наше вознаграждение теперь эта формула, и я объясню ее через минуту. Так что это элегантно. Почему? Потому что у нас здесь бонус за сложность. Этот член присуждается только тогда, когда проблема решаема. Наши три элемента говорят, эй, это сложная проблема, но мы можем ее решить, и она [кашляет] сложна, и вы хотите, чтобы эта система строила здесь сложные проблемы. Нет, мы не хотим здесь легких проблем. Мы можем решать легкие проблемы. Нет, а проблемы, которые нерешаемы, которые все три модели говорят, эй, нет способа решить это. мы недостаточно умны, получаем нулевое вознаграждение, а легкие тривиальные проблемы также получают нулевое вознаграждение за сложность. Так что это довольно простой способ, но вы можете иметь это здесь в виде текста. Так что у вас здесь, у вас здесь предложение, и оно продолжается с черновиком, с анализом рассуждений, навыками, как их использовать и комбинировать. Затем у вас есть проверка рассуждений, чтобы проверить здесь черновик вопроса с инструментами. И тогда у вас есть доработка, доработка здесь ошибок, найденных. И тогда мы разделяемся здесь, потому что у нас есть множественная структура вознаграждения. Если вы продолжаете финализировать предложение, финальный хороший вопрос. У нас есть верификатор и проб. И мы определяем сложность, правильность финального вопроса. Как я вам говорил, прекрасно, и у нас есть вознаграждение за траекторию. Это наше первое вознаграждение. Но также, если мы переходим от доработки, когда мы находим ошибки и хотим доработать ошибки и исправить их, мы идем теперь шаг за шагом. Так что у нас теперь интегрированные пошаговые вознаграждения, и вы видите, если наш предложитель говорит, эй, я могу пропустить обновление навыков или что-то еще, теперь у него есть несколько функций вознаграждения, которые идут вместе теперь в оптимизации политики. Просто. Теперь представьте, что вы обучаете здесь предложения составлять проблемы из десятков категорий навыков, например, в теоретической физике, я сталкиваюсь здесь с моими типичными способами интегрирования контуров, комбинаторными доказательствами, дифференциальными уравнениями, теорией графов, алгоритмами кодирования, термодинамикой нашей системы и так далее. Так что вы видите, это довольно тяжелые блоки теоретической физики, и если я хочу извлечь свои навыки, это не так просто, потому что без какого-либо механизма учебного плана, начиная с простого и становясь все более и более сложным, агент будет случайным образом выбирать категории навыков с равной вероятностью. Он просто будет продолжать генерировать легкую комбинаторику, потому что, ну, вы знаете, у нас есть взлом вознаграждения и так далее, и агент пытается обмануть. Так что oresy этой статьи разработал механизм учебного плана, который прекрасен. Он автоматически фокусирует время обучения, и я объясню это подробно через минуту, на таких категориях, как дифференциальные уравнения или термодинамика, где агент в настоящее время слабее всего. Он еще не научился достаточно хорошим математическим решениям для этого, и сокращает время на категории, которые он уже освоил. Так что мы указываем пальцем прямо на место, где болит. где у агента нет реальной способности решать это или не знает, как это делать, какой набор навыков использовать или как комбинировать три разных навыка для дифференциального уравнения, которое мне нужно в моей работе. Теперь, просто чтобы сказать вам, с какими параметрами мы работаем, у нас есть показатель владения MC для категории навыков C в итерации обучения T. Это одно число от нуля до одного, представляющее, эй, насколько хорошо агент в настоящее время генерирует валидные сложные проблемы в категории C. Оценка один означает, что агент освоил эту категорию, да, C — конкретная категория навыков, нет, как я вам показывал, комплексный анализ, комбинаторные доказательства, дифференциальные уравнения и так далее, а альфа — это сглаживающий фактор. Это, да, немного обмана, число от нуля до одного, и оно просто контролирует, как быстро система реагирует на новую информацию по сравнению с доверием к своей исторической оценке. Это здесь, вы можете поиграть с этим, сделать его более склонным принимать новую информацию или или другое, что угодно. И тогда у нас есть здесь классическая формула, и это хорошо. Я снова играю с визуализацией claw, и вы видите здесь наш MC в t + 1. У нас теперь два члена. У нас здесь этот член. Это означает вес прошлого опыта, что мы уже считаем правдой, плюс теперь член, это вес нового сигнала, что только что произошло, частота успеха, и классически это наш экспоненциальный скользящий средний, который вы знаете, прекрасно, но что он делает? Это здесь, скажем так, у нас здесь показатель владения после некоторого обучения, так что вы видите в комбинаторике, прекрасно, 87%, исчисление 65%, алгебра, хорошо, но мы явно слабы в интегралах контуров. Так что это означает, что система теперь анализирует это и имеет теперь результирующие вероятности выборки, и вы видите, да, здесь визуализация cloud имеет некоторые проблемы, но я не смог выяснить, как это решить, извините, после 10 минут я просто сдался, но вы понимаете, что происходит, интегралы контуров здесь, вероятности выборки, я говорю, эй, вы действительно плохо справляетесь с решением интегралов контуров, так что вам придется этому научиться, вам придется сосредоточить свое время обучения теперь на этой конкретной теме, нет, и если вы уже преуспеваете в комбинаторике. Да, у вас низкая вероятность, потому что вы уже освоили это. Так что вы видите, это действительно здесь настраивается на лету, точно анализируя здесь мощности и мощности решения здесь нашего агента, и это прекрасно, и снова визуализация cloud, у нас здесь саморегулирующийся учебный план, и я люблю эту идею, почему у нас есть наш вектор владения, затем мы инвертируем его для выборки кода, которую я только что показал, затем мы фокусируемся здесь, и мы говорим, хорошо, так что предложение ИИ генерирует теперь проблемы в категории C. Мы отправляем проблемы. Затем у нас есть верификация, измерение частоты успеха, и если это работает, у нас есть обновление здесь, и вы видите, эта система саморегулируется. Она понимает слабые стороны ИИ-агента и сильные стороны в решении здесь моей конкретной задачи по теоретической физике. Это прекрасно. Это саморегулирование по дизайну, и нет человека, который должен быть интегрирован здесь в это расписание учебного плана. Оно возникает здесь из самого цикла обратной связи. Конечно, это зависит от наших LLM-учителей. Теперь, если у вас есть галлюцинация в Gemini, или если у вас есть проблема в CLA, или если у вас есть что-то еще в других системах, нет, тогда наш LLM-учитель вызовет ошибки. Поэтому, возможно, нам следует как-то проверить людей время от времени, но в остальном вы понимаете, и я думаю, это одно из самых близких к литературе реальных формальных реализаций концепций автономного роста возможностей. Это действительно то, что я хотел бы попробовать подробно. Да, давайте посмотрим на результаты. Так что здесь у нас AM24, AM25, все наши бенчмарки, прекрасно, а затем у нас здесь наша базовая модель, Q& 4 миллиарда инструкций, вы видите, боже мой, так что вы видите AIM24 49%, AIM25 46%. Затем у вас есть все старые методологии, metermat и madsmith и так далее. Прекрасно. А затем у вас есть модель, аннотированная человеком. Прекрасно. А затем самовоспроизведение на основе агента. Прекрасно. А затем у вас здесь настоящий большой. GPT 5.2 high, Gemini Pro, Q3 Max, Cloud 4.5 OPUS, DeepS версия 3.2 два, и вы не поверите, последняя строка — это эта новая методология, и, как вы видите, последняя строка здесь абсолютно превосходит все остальное, что и ожидалось, но абсолютно странно, почему, черт возьми, GPT 5.2 два или все другие, все другие модели, посмотрите на это, имеют производительность ниже, чем у Q13 4B instruct. Если это модели, которые генерируют наши проблемы, если это модели-учителя, почему модель-учитель имеет, когда мы запускаем эти модели-учителя на AM24, AM25, меньшую производительность? Посмотрите на это, совершенно меньшую производительность. Я знаю, это не очень много, три процентных пункта, один процентный пункт, но как это возможно, и объяснение, учитывая J-образное распределение сложности, я не думаю, что это действительно здесь, так что это здесь для меня своего рода открытый вопрос, так что если у вас есть какие-либо идеи, как это возможно, я действительно заинтересован, нет, потому что вы видите, предлагающая модель генетика здесь, последняя строка здесь только для aim 24, 3,88 процентных пункта, а Gemini 3 Pro теряет 4,3 процентных пункта. Так что, хм, что-то происходит. Я еще не совсем понимаю. Так что, если у вас есть четкое понимание, эй, просто напишите в комментариях. Мне также интересно здесь, если у вас есть GBD 5.2 high, сырой промптинг, и давайте перейдем к среднему значению aim 32,8. Где это? 32,8. сделал это здесь. Это чистый GBD 5.2 high. Отлично. А затем, если вы добавите библиотеку навыков со структурированными атрибутами, она увеличится. И если вы пойдете, если вы добавите теперь агентный рабочий процесс от черновика, проверки и доработки, и всего остального, вы дойдете до 36%. Прекрасно. А затем у вас есть этот новый метод, агентный предложитель, 4-миллиардная модель, которая превосходит ваш GPD 5.2 high на aim. Мне это нравится. Так что это нам кое-что говорит. Это говорит нам, во-первых, что модели GBT и все остальные модели еще не идеально обучены. Мы можем ожидать гораздо большего интеллекта в следующем поколении ИИ. И я думаю, этот эксперимент демонстрирует, что структурированная композиция навыков, как я вам показывал, и итеративная валидация абсолютно критичны для высококачественного синтеза проблем, превосходящего наши большие системы GPT. Так что просто чтобы быть ясным, полный препринт и вся логика и вся методология зависят от этой единственной идеи, что вам разрешено делать это, и это касается композиции навыков, и они утверждают, что это основано на принципе возникающей композиционности, и они вводят эту лемму, лемму о возникающей композиционности навыков, и она довольно проста. Так что пусть F будет набором атомарных навыков. И для композиционной задачи H, если цель обучения с подкреплением предоставляет положительные вознаграждения только тогда, когда выход соответствует H, агент может научиться оркестрировать G и F для решения H с высокой вероятностью, даже если конкретная композиция не встречалась во время предварительного обучения ИИ-системы. И на основе этого они смогли формализовать теперь каждый навык как структурированный атрибутный кортеж, который мы только что прошли, кодирующий его намерение рассуждения, метод построения, эффект сложности и подсказку к инструменту, а затем они определяют здесь отображающий оператор, который преобразует композицию n выбранных навыков, многонавыков в естественный язык ограничений в высокоразмерном пространстве инструкций. И генерация проблемы затем управляется политикой pya, параметризованной pya, нашими классическими системами. Теперь продолжайте. Но, как я вам говорил, если эта лемма 3.1 недействительна для данного конкретного случая, все исследование рухнет. Так что вы думаете? Лема 3.1 верна? Можем ли мы это сделать? Авторы правы? Нашли ли вы какие-либо математические контраргументы? Просто оставьте комментарий здесь. И это, если вы хотите, чтобы кортеж навыков здесь был грамматикой рассуждений. Намерение обеспечивает здесь проверку семантической совместимости. Перед композицией двух навыков агент может проверить, конфликтуют ли их намерения или намерения. Метод предоставляет фактическую процедурную инструкцию. Как. Сложность — это просто приближение сложности составленных проблем. И последнее, подсказка к инструменту, предоставляет исполняемый файл для проверки, тем самым замыкая цикл синтеза и проверки. Если вы хотите немного углубиться в приложение, у них есть пример исследования, логика агентного взаимодействия. Они показывают вам здесь точно агентный предложитель 4B все шаги, и они фокусируются здесь на математике, комплексном обобщенном Коши, skill MD для Коши. Так что, если вы немного интересуетесь математикой, это прекрасный пример, чтобы дать вам дальнейшее представление. Но, конечно, это было только введение, потому что в моем следующем видео, надеюсь, завтра, я смогу показать вам другую методологию, которая просто [кашляет] поразит вас. Но на сегодня я говорю спасибо и надеюсь увидеть вас в моем следующем.