📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Unbearable Lightness of Agent Optimization — Alberto Romero, Jointly

AI Engineer17:58

Transcription

Хорошо. Всем привет. Сегодня я представлю мета-адаптивное инжиниринговое контекстное решение, или мета-АИК для краткости, которое представляет собой новую структуру, разработанную для оптимизации ИИ-агентов за пределами одномерных подходов. Мы рассмотрим, как оркестровка множества адаптивных стратегий может преодолеть ограничения существующих методов инжиниринга контекста.

Теперь немного о себе. Я Альберто Ромеро. Я соучредитель и генеральный директор компании jointly. В jointly мы создаем основные специализированные агенты для регулируемых отраслей, где требования к соблюдению политики особенно строги. Большая часть нашей исследовательской работы сосредоточена в области самооптимизирующихся архитектур агентов с использованием систематических подходов.

Что касается меня, я провел более 20 лет на стыке ИИ и данных. Мой недавний опыт включает работу в качестве технического директора и соучредителя human AI, компании, занимающейся прогнозированием рисков на основе машинного обучения для мобильности, которая была приобретена AON в 2023 году. На предыдущей должности я возглавлял команду по инжинирингу генеративного ИИ в City Bank.

Вот наша повестка дня на сегодня. Мы начнем с мотивации и проблем, с которыми сталкиваются текущие системы. Затем мы рассмотрим структуру АИК и ее ограничения. После обзора последних исследовательских идей мы представим подход мета-АИК. Мы обсудим его архитектуру и набор стратегий, покажем некоторые результаты и закончим будущими направлениями и вызовами.

Структура инжиниринга агентного контекста, или АИК для краткости, для которой вы можете найти ссылку на статью на слайде. Это очень популярная структура, и статья вышла несколько месяцев назад. По сути, она организует пациента в три роли. Во-первых, есть генератор, который создает пути рассуждений. Затем есть рефлектор, который извлекает уроки. И, наконец, есть куратор, который синтезирует эти уроки в инкрементальные обновления. АИК использует инкрементальные дельта-обновления и механизм роста и уточнения для предотвращения коллапса контекста и поддержания релевантности. Важно отметить, что он может улучшаться без размеченных данных, обучаясь непосредственно на обратной связи от выполнения.

АИК был довольно успешен и достиг существенных улучшений на некоторых из самых популярных бенчмарков HM, таких как Upworld или finer, почти на 11% по сравнению с предыдущими передовыми подходами, такими как Japa или DC. Он также достиг 8,6% улучшения на задачах финансового рассуждения. Существуют четыре фундаментальных ограничения АИК, которые я рассмотрю и обсужу на следующем слайде. И именно они составляют основу для мета-АИК.

Как я уже говорил, несмотря на свои сильные стороны, АИК имеет четыре критических режима отказа. Во-первых, он сильно зависит от рефлектора. Поэтому, когда рефлексия терпит неудачу, контекст становится зашумленным и даже вредным. Во-вторых, существует хрупкость обратной связи, что означает, что когда сигналы истинности слабы или отсутствуют, АИК может усиливать некорректное поведение. В-третьих, слепота к сложности задачи, которая приводит к одинаковому отношению к простым и сложным задачам, что может быть пустой тратой ресурсов, а также упущенными возможностями для оптимизации. И, наконец, АИК оптимизирует только контекстную размерность, игнорируя вычисления, память и обновления параметров.

Исследовательский ландшафт 2024-2025 годов предлагает, на мой взгляд, четыре ключевых вывода. Во-первых, механизмы верификации, такие как самооценка, мультимодальный консенсус и проверки выполнения, действительно важны для надежности любого решения. Во-вторых, адаптивное распределение вычислительных ресурсов показывает, что небольшие модели могут превосходить гораздо более крупные, избирательно увеличивая шаги вывода. Третье — структурированные архитектуры памяти превосходят линейное накопление контекста, организуя факты в виде графов или многоуровневой памяти. Наконец, обучение во время тестирования связывает вывод и обучение и позволяет временным обновлениям параметров давать значительный прирост точности. Эти достижения предполагают, что нам нужна гибридная многомерная система.

Мета-АИК устраняет ограничения АИК, добавляя мета-контроллер, который учится оркестровать множество адаптивных стратегий на основе сложности задачи, неопределенности, проверяемости и ограничений ресурсов. Вместо применения одной и той же процедуры к каждой проблеме, мета-АИК профилирует каждую задачу и выделяет правильную комбинацию стратегий по измерениям контекста, вычислений, верификации, памяти и параметров. Эта адаптивная обученная координация позволяет ему превосходить одномерные методы.

Мета-структура состоит из четырех уровней. Переходя к архитектуре, первый уровень — это профилирование задачи, которое оценивает сложность, неопределенность, проверяемость и бюджеты ресурсов. Затем следует легкий мета-контроллер, который выбирает и распределяет адаптивные стратегии соответствующим образом. Следующий уровень — это выполнение стратегии, который осуществляет рефлексию, адаптивные вычисления, иерархическую верификацию, извлечение структурированной памяти и выборочное обучение во время тестирования. И, наконец, есть уровень агрегации обратной связи, который собирает результаты и обновляет политику мета-контроллера посредством мета-обучения. Такая структура позволяет системе учиться на своем опыте и постоянно совершенствовать принятие решений.

Что касается профилирования задачи, оцениваются четыре ключевых измерения. Первое — семантическая сложность. Это, по сути, сходство на основе встраивания с известными распределениями задач, которое генерируется. Второе — количественная оценка неопределенности. Думайте об этом как о относительной оценке softmax, которая предсказывает уверенность модели. Третье — оценка проверяемости. То есть, можем ли мы выполнить и проверить результат. И четвертое — доступность ресурсов. Мы учитываем контекстное окно, бюджет вычислений и даже другие ограничения, такие как время. Результатом этого уровня, уровня профилирования задачи, является 32-мерное встраивание задачи, которое поступает на вход мета-контроллера.

Что касается набора стратегий, мета-АИК использует шесть стратегий. Первая — минимальный контекст, который использует краткие подсказки для простых задач. Затем мы используем рефлексию АИК, которая сохраняет цикл генератор-рефлектор-куратор для инкрементального накопления знаний, как установлено стандартным АИК. Мы также используем адаптивные вычисления, которые масштабируют количество шагов рассуждений или выборок в зависимости от сложности задачи. Мы также используем иерархическую верификацию, которая объединяет самооценку, мультимодальный консенсус и проверки выполнения. Адаптивная память, которая извлекает релевантную информацию из структурированных многоуровневых памятей. И, наконец, мы используем выборочное обучение во время тестирования, которое применяет временные обновления параметров, такие как низкоуровневые адаптеры, для задач с высокими ставками. Мета-контроллер учится эффективно комбинировать эти инструменты со временем.

Формула вознаграждения, на основе которой выбирается стратегия обучения, учитывает следующие компоненты. Первое — правильность действия или предсказания, то есть точность. Затем у нас есть штраф, связанный с использованными ресурсами или негативными результатами. То есть, единица минус стоимость. И это надежность моделей, то есть самовыраженная уверенность. То есть, калибровка уверенности, с взвешенной важностью, определяемой гиперпараметрами альфа, бета и гамма.

В плане цикла мета-обучения у нас есть четыре источника сбора обратной связи. Во-первых, это результаты задач. Успех, неудача или правильность задачи. Затем у нас есть производительность стратегии. То есть, индивидуальный вклад каждой стратегии в общую производительность задачи. Затем у нас есть метрики эффективности, такие как вычисления, задержка, память. И, наконец, у нас есть калибровка уверенности. То есть, где предсказания точны.

Переходя к тому, как мы решаем ограничения АИК. Первое — проблема слабого рефлектора. Проблема АИК заключается в том, что наблюдается падение производительности на 50-60%, когда качество рефлектора ухудшается. С мета-АИК мы вводим три вещи. Во-первых, это ворота качества. Это обученный классификатор, который блокирует вредные дельты. Во-вторых, это мультисигнальный рефлектор или рефлексия, которая, по сути, является ансамблем специализированных моделей при наличии некоторого уровня неопределенности. И, в-третьих, это адаптивное распределение стратегий. Мета-контроллер учится, когда рефлексия терпит неудачу, и затем перенаправляется на верификацию или вычисления во время тестирования. Таким образом, мы можем ожидать поддержания производительности на уровне 80% и выше, даже когда рефлектор ухудшается примерно на 30%.

Второе ограничение, которое у нас было, — это хрупкость качества обратной связи. Мы наблюдаем, что с АИК может происходить значительная деградация без надежных сигналов истинности. С мета-АИК мы вводим каскад иерархической верификации, где мы можем ожидать снижения ошибок на 50-60% из-за плохой обратной связи, и это происходит через три уровня. Первый уровень — самопроверка, которая является просто быстрым фильтром. Мы принимаем, если уровень уверенности превышает определенное значение. Второй уровень — мультимодальный консенсус. Мы используем разнообразный набор моделей, таких как GBT4, Claude и Dips, и проводим взвешенное голосование по уверенности. И, наконец, третий уровень — верификация на основе выполнения, где мы используем песочницу кода, валидацию API и соответствие схеме.

Третье ограничение, которое у нас было, — несоответствие сложности задачи. В некотором смысле, тот факт, что АИК использует унифицированную обработку, в том числе для простых задач, может быть пустой тратой ресурсов. Поэтому мета-АИК динамически адаптирует распределение стратегий, вместо того чтобы использовать один и тот же тяжелый конвейер для всего. Альфа — это веса распределения для шести стратегий оптимизации, и они представляют собой объем вычислительного бюджета, выделяемый каждой стратегии для данной задачи. Таким образом, простые задачи требуют минимальной обработки и могут сэкономить около 90% вычислений по сравнению со стандартным АИК. Умеренные задачи — это более сбалансированный подход, который включает АИК плюс верификацию. А сложные задачи — это, по сути, интенсивные вычисления во время тестирования, множественные попытки и извлечение памяти.

Чтобы подвести итоги с некоторыми результатами, и это начальные результаты, мы наблюдали улучшение примерно на 8-11% на агентных бенчмарках. Мы также наблюдали улучшение на 6-8 пунктов на некоторых предметно-ориентированных задачах. Также снижение затрат на вычисления на 30-40% за счет распределения адаптивных стратегий. И в целом, наблюдается большая надежность, большая согласованность, и мы можем лучше обобщать, мы можем использовать структуру в широком спектре областей. Вывод заключается в том, что мета-АИК может оркестровать адаптацию контекста, вычислений, верификации, памяти и параметров и создать надежную структуру самосовершенствования для агентов. Будущая работа будет включать реализацию и оценку полной системы в более широком спектре областей, и мы продолжим исследовать мета-обучение, что также будет включать включение дополнительных стратегий.

Я также хотел бы упомянуть дополнительные применения мета-АИК, которые, на мой взгляд, весьма актуальны. Первое — для мультимодальных ИИ-систем. Например, решение о том, когда использовать зрение по сравнению с обработкой языка, снова может быть мета-адаптивным решением стратегии. Также, когда у нас есть составные ИИ-системы, которые требуют разных моделей для разных этапов, и сложность значительна, мы можем фактически мета-адаптивно выбирать наиболее эффективные стратегии для решения задачи от начала до конца. Также для человеческого сотрудничества, другими словами, чтобы определить, когда привлекать человека. И для систем непрерывного обучения, где мы балансируем между исследованием и эксплуатацией. Основной вывод заключается в том, что оптимизация требует мета-уровня интеллекта, и он должен быть обучен, и он требует много проб и ошибок, прежде чем он сможет действительно работать на должном уровне.

Что касается будущих направлений и вызовов, остается несколько проблем. Обучение мета-контроллера может быть нестабильным из-за редких вознаграждений, и это может быть смягчено с помощью обучения по учебному плану. Также надежная оценка преимуществ и регуляризация энтропии. Также вычислительные накладные расходы от профилирования и множества стратегий необходимо сократить с помощью эффективных моделей. Мы можем использовать такие вещи, как ленивое выполнение, пакетирование и кэширование. Также каскады верификации могут быть хрупкими, если все модели совершают одну и ту же ошибку. Поэтому нам нужны разнообразные модели с взвешиванием уверенности и человеческим надзором, а также активное обучение. Циклы мета-обучения требуют значительных данных. Генерация синтетических задач для обучения политик, перенос из связанных областей и эффективные по выборкам алгоритмы также могут помочь. И, наконец, решение этих проблем будет ключом к масштабированию мета-АИК и его применению в широком спектре областей.

На этом у меня все. Большое спасибо за внимание. И да, я ценю ваше присутствие. Спасибо.