Transcription
Всем привет. Сегодня у нас, ну, такая, знаете, очень интригующая тема на разборе. Мы погружаемся в материалы презентации от Armelli LLC и говорим про автономные приложения ИИ уровня три для предприятий.
Да, здравствуйте. Тема действительно горячая.
И вот сразу, когда слышишь про такую мощь, мне лично приходит на ум аналогию с джином из бутылки. Помните? Огромная сила может творить чудеса, но…
…но есть риск, что выйдет из-под контроля. Очень точная аналогия, на самом деле.
Вот именно. То есть, с одной стороны, и обещает бизнесу, ну, просто невероятные вещи: автоматизация, рутины, какая-то бешеная эффективность, может, даже новые бизнес-модели. Абсолютно потенциал огромен, но как и с любым действительно мощным инструментом, будь то джин или ядерная энергия, ключевой вопрос - это контроль, как этим управлять, да?
И вот наша задача сегодня, как я её вижу - это разобраться вот в этих системах уровня три, что это вообще такое, как они, так сказать, эволюционировали.
Угу.
Что они могут на самом деле? Мы посмотрим на примеры из демо Армли. Там было кое-что впечатляющее.
Да, демо очень показательная.
Но что не менее важно, надо честно посмотреть на их, ну, слабые места, ограничения и самое главное, как бизнесу этим всем хозяйством управлять. Как вот этого джина использовать с пользой, но не стать его заложником, рабом.
Совершенно верно. Это центральный вопрос. Как получить мощь, но сохранить управление? Будем разбираться.
Отлично. Ну давайте тогда по порядку. Эволюция. Чтобы было как-то понятнее, можно, наверное, вспомнить автомобили. Там же тоже уровни автономности есть, да?
Хорошая аналогия для старта.
Начинали с простого круиз-контроля. Это как бы уровень один, да? Потом появилось удержание полосы, адаптивный круиз - это уже что-то посложнее.
Уровень два, да?
А теперь вот говорят про уровень три, когда можно руки с руля убирать, хоть и следить надо. Путь, в общем-то, знакомый. Как это вот в мире бизнес-приложений и выглядит? Есть параллели?
Параллели есть и очень чёткие, хотя, конечно, со своей спецификой. Уровень один в приложениях - это самые-самые основы, жёстко закодированные правила.
Типа, если это, то…
Именно. Если клиент нажал кнопку X, отправь ему письмо Y. Чистый детерминизм. Никакой гибкости, никакого обучения. Простейшие скрипты - автоматизация самых базовых шагов. Система делает только то, что ей явно пошагово предписали.
Понятно? То есть никакой магии просто выполнения инструкции.
Никакой.
Уровень два. Вот тут уже становится интереснее. Сюда приходят технологии машинного обучения. Система начинают учиться на данных.
А что это значит на практике? Ну, например, система может анализировать тексты обращений клиентов и классифицировать их по темам или прогнозировать спрос на основе истории продаж. Здесь же появляются такие штуки, как RAG, Retrieval Augmented Generation.
Rag - это что такое?
Это когда большая языковая модель, ну, типа GPT, перед тем, как сгенерировать ответ, сначала ищет релевантную информацию в какой-то базе знаний, в документах компании, например.
А, то есть она не просто выдумывает ответ, а опирается на факты.
Да? Она как бы подкрепляет свою генерацию найденными данными. Это делает ответы гораздо более точными, фактическими, особенно в корпоративной среде, где важна достоверность. То есть системы уровня два уже анализируют, находят какие-то скрытые закономерности, могут генерировать контент, но…
…но они все ещё во многом следуют заданным алгоритмам, пусть и более сложным, и их способность к действию ограничена. Они могут подсказать, проанализировать, но не действовать самостоятельно в сложных сценариях. Элементы логики и обучения есть, но инициативы мало. Они как бы начинают понимать данные глубже, чем первый уровень, но действовать сами не спешат.
Можно и так сказать, хотя слово "понимать" тут, конечно, в кавычках. Это скорее очень продвинутое распознавание паттернов, статистических связей. До человеческого осознания там, мягко говоря, далеко.
Понятно.
Но настоящий скачок, вот то, о чём мы сегодня говорим - это уровень три. В материалах Армела его называют "восходом агентов". И это не просто красивое название.
"Восход агентов" звучит как название блокбастера.
Ну, в каком-то смысле для бизнеса это и есть блокбастер. Здесь и переходит от пассивного анализа и ответа к активному действию по собственному плану.
То есть он не просто говорит, что делать, а сам делает.
Именно. Он не просто обрабатывает информацию, которую ему дали, а сам решает, какие инструменты ему нужно использовать, в какой последовательности, чтобы достичь цели, которую поставил человек.
Например…
Например, цель: "найди мне лучшего кандидата на позицию X". Агент уровня три сам решает: "Окей. Сначала я посмотрю внутреннюю базу резюме, потом проверю LinkedIn, потом, может быть, ещё какой-то ресурс, потом отберу топ-три, составлю для них персонализированные письма и предложу пользователю их отправить".
То есть он сам выбирает инструменты, базу данных, LinkedIn, почту.
Да, он может взаимодействовать с различными системами через API. Это такие программные интерфейсы, мосты между приложениями. И он сам выстраивает эту цепочку действий. Часто, конечно, под наблюдением человека. Это важно, мы к этому вернёмся, но инициатива, планирования уже у машины.
И вот здесь, как вы сказали, начинается самое интересное. Вспомним демо Армелия по подбору персонала. Это же оно, да? Классический пример уровня три.
Да, это просто хрестоматийный пример. Агент получает задачу, ну, скажем, как я уже говорила, нужен Java разработчик, опыт 5 + лет, Финтех.
И что он делает? Прямо вот по шагам, если можно представить.
Он начинает действовать. Первое: "сенс" - воспринять задачу. Дальше "план" - спарсить. Так, где искать? Ага, внутренняя база ATS. Потом внешний поиск через API LinkedIn. Нужны ключевые слова: Java, Fintech, 5 Years Experience. Дальше "акт" - действия. Он реально идёт и сканирует эти системы. Находит, допустим, 10 потенциальных профилей.
Сам прямо сам лезет в LinkedIn?
Через API. Да, у него есть доступ, настроенный заранее. Он не лезет как человек. Он общается с LinkedIn на языке программ, находит профили, анализирует их на соответствие критериям, отбирает, скажем, троих наиболее подходящих.
Окей, нашёл. А дальше?
А дальше он может сделать следующий шаг в плане, например, составить проект письма для каждого. Он использует свои возможности генерации текста, чтобы написать персонализированное сообщение: "Уважаемый Иван, увидели ваш профиль. Впечатляет опыт финтехи. У нас есть вакансия..." и отправляет.
А вот тут как раз включается человек. Агент, скорее всего, не отправит сам. Он предложит: "Вот три кандидата, вот проекты писем. Отправляем?"
И уже рекрутер смотрит, может, корректирует текст, выбирает, кому отправить, и даёт команду: "Да, действуй".
Ага. То есть человек в цикле Human in the Loop?
Обязательно. На уровне три это критически важно для контроля. Но это ещё не всё. Если рекрутер одобрил, агент может пойти дальше, отправить письмо через интеграцию с почтовым сервисом, а потом, если кандидат ответил и согласился, залезть в календарь рекрутера, опять же через API, найти свободный слот и предложить время для собеседования.
Ого. То есть он и встречу может назначить?
Потенциально, да, предложить время, отправить приглашение, а потом ещё и внести всю информацию о кандидате и статуса в корпоративную базу данных в ATS или CRM.
И всё это инициируется через чат, как я понимаю. Просто пишешь боту: "Найди разработчика".
В идеальном сценарии, да, интерфейс может быть очень простым, как чат в Teams или Slack, а за кулисами вот такая сложная многошаговая работа агента. Это уже не пассивный помощник, который отвечает на вопросы. Это активный исполнитель довольно сложных рутинных задач.
Звучит, конечно, очень мощно, прямо футуристично, хотя вы говорите, это уже реальность. А что там дальше? Вы упоминали уровни четыре и пять. Что это такое, если кратко?
Это уже взгляд в будущее, горизонт развития. Уровень четыре - это ещё большая автономия. Системы смогут не просто выполнять задачи, поставленные человеком, но и, возможно, сами ставить себе какие-то подцели, адаптироваться к совершенно новым, непредвиденным ситуациям с минимальным вмешательством человека или вообще без него.
То есть он сам поймёт, что нужно сделать что-то, о чём его не просили?
В теории да. Например, если система управления цепочками поставок уровня четыре обнаружит серьёзный сбой у поставщика, она может не просто сигнализировать об этом, но и самостоятельно начать искать альтернативных поставщиков, проверять их надёжность, запрашивать цены и предлагать уже готовое решение человеку.
Да, это уже серьёзно. А уровень пять?
Уровень пять - это пока скорее теоретическая концепция. Общий искусственный интеллект, AGI (Artificial General Intelligence) - это гипотетический ИИ, который был бы способен понимать, обучаться и применять знания в широчайшем спектре задач, так же хорошо, как человек или даже лучше. Не узкая специализация, как сейчас, а именно общая разумность.
То есть как в кино Skynet или что-то такое?
Ну, давайте без крайности. Ну да, это и с универсальными когнитивными способностями. Пока мы от этого очень далеки. Важный момент, который подчёркивался в презентации Armlay по поводу этих уровней. Чем выше уровень автономности от одного до пяти, тем, с одной стороны, потенциально быстрее и гибче внедрение. Агенты уровня три или четыре могут быстрее адаптироваться к новым задачам, чем жёстко запрограммированные системы.
Логично.
Но с другой стороны, чем выше автономность, тем сложнее, острее становятся вопросы управления, контроля, предсказуемости, безопасности и этики. Та самая дилемма с джином. Чем он сильнее, тем страшнее, если он выйдет из-под контроля. Риски растут экспоненциально.
Да, это понятно. Хорошо, давайте тогда вернёмся к уровню три, который уже здесь, и попробуем глубже понять, как он работает под капотом. Вот эта магия планирования и действия. Я тут попробовал аналогию с готовкой ужина.
Да, давайте вашу аналогию. Интересно.
Ну вот, я хочу есть. Это как бы "сенс" - восприятие проблемы. Дальше я иду к холодильнику, смотрю, что там есть. Сбор данных. Потом решаю: "Ага, есть курица, овощи, рис, сделаю вот такое блюдо по такому-то рецепту". Это "план" - планирование. Затем я, собственно, готовлю, режу, жарю, варю. Это "акт" - действие. А потом пробую и думаю: "Вкусно, но в следующий раз добавлю больше специй или рис сварю по-другому". Это "рефлект" - рефлексия, обучение. У яагентов есть что-то похожее?
Аналогия просто отличная. Очень точно передаёт суть цикла. И да, у агентов уровня три есть похожий структурированный процесс. Вармеле для его описания используют фреймворк под названием S.P.A.R. Это как раз аббревиатура из четырёх этапов, очень похожих на ваши шаги с ужином.
S.P.A.R. Расскажите подробнее. S.P.A.R. Что это?
Да. S - Sense. Первое. Sense - восприятие. Агент получает входные данные. Это может быть прямой запрос пользователя в чате "найди мне Java разработчика" или какая-то информация из другой системы, например, уведомление о новом заказе или просто данные с датчиков, если речь об IoT. Он как бы осознаёт задачу или ситуацию.
О'кей. Почувствовал голод, так сказать. Дальше.
P - Plan. Планирование. Вот это ключевой этап, который отличает уровень три. Основываясь на том, что он воспринял (Sense) и на своих внутренних знаниях (это его обученные модели, доступ к базам данных, список доступных инструментов, API), агент формирует план действий. Он решает, чтобы выполнить этот запрос, мне нужно: шаг один - обратиться к базе данных X, шаг два - использовать API Y для поиска в LinkedIn, шаг три - применить модель Z для анализа текста резюме, шаг четыре - использовать инструмент W для генерации письма.
То есть он сам строит эту последовательность. Не просто выполняет один шаг, а именно видит всю цепочку.
Да, он пытается построить оптимальную, по его мнению, последовательность шагов и выбрать подходящие инструменты для каждого шага. Это может быть довольно сложный процесс, особенно если шагов много и есть разные варианты.
Понятно, спланировали. Дальше.
A - Act - действия. Агент приступает к выполнению своего плана. Он реально взаимодействует с внешним миром, обращается к базам данных, дёргает API других сервисов, почты, календаря, CRM, LinkedIn, запускает свои внутренние модели для обработки информации, генерирует текст, отправляет запросы, в общем, готовит ужин.
Работает по плану. И последний этап.
R - Reflect. Удалось ли достичь цели, поставленной на этапе Sense? Насколько эффективен был план (Plan)? Были ли ошибки на этапе Act? Эта информация используется для улучшения будущей работы.
Как именно используется?
Ну, например, если агент попробовал один API для поиска информации, а он не дал результата или работал слишком медленно, то в следующий раз при похожем запросе благодаря Reflect он может сразу выбрать другой, более эффективный API. Или если сгенерированный им текст письма не понравился пользователю, человек его сильно исправил, агент может зафиксировать это и скорректировать свой стиль генерации в будущем.
То есть он учится на своих успехах и ошибках.
Да, это попытка встроить механизм обратной связи и самосовершенствования. Если первый план провалился, этап Reflect может инициировать возврат к этапу Plan. Нужно придумать новый план действий. Это делает систему более гибкой и устойчивой. Получается, S.P.A.R. - это не просто линейная последовательность, а именно цикл Sense, Plan, Act, Reflect и снова Sense или Plan.
Совершенно верно. Это итеративный цикл, который позволяет агенту не просто тупо следовать инструкциям, а как бы думать, планировать, действовать и учиться. Это попытка смоделировать, пусть и упрощённо, процесс решения задач человеком.
Интересно. И вот если вернуться к тому демо с рекрутингом, который мы обсуждали, там ведь, наверное, не один какой-то суперагент всем этим занимался. Поиск по базе, поиск в LinkedIn, написание письма, работа с календарём, запись в ATS - это же очень разные задачи.
Абсолютное правильное наблюдение. И демо как раз иллюстрирует, скорее всего, работу не одного монолитного агента, а мультиагентной системы. Это ещё один важный концепт.
Мультиагентная система. То есть их там много.
Да? Вероятно, есть некий главный агент, его можно назвать оркестратором или координатором. В материалах Армоли упоминается их собственная разработка для этого - "Мела". Этот оркестратор получает общую высокоуровневую задачу от пользователя: "Найди разработчика".
И он её как бы раздаёт подчинённым.
Точно. Он декомпозирует эту большую задачу на более мелкие подзадачи и передаёт их выполнению специализированным агентам. У каждого такого агента есть своя зона ответственности и свои инструменты.
Ну, например…
Ну, может быть, один агент, который отлично умеет работать с внутренней базой резюме ATS, другой - мастер по взаимодействию с API LinkedIn, третий - специалист по генерации деловых писем и работе с почтовым сервером. Четвёртый - эксперт по API календаря. Пятый отвечает за запись данных в CRM или ATS.
Похожи на команду людей-специалистов. Ресорсер, копирайтер, администратор.
Отличная аналогия. Именно так. Оркестратор-менеджер получает задачу, разбирает её, раздаёт специалистам, координирует их работу, собирает результаты и представляет итоговый ответ пользователю. Эти агенты-специалисты обмениваются информацией между собой, передают данные по цепочке под управлением оркестратора.
А в чём преимущество такого подхода? Почему не сделать одного большого универсального агента?
Ну, во-первых, это проще в разработке и поддержке. Легче создать и обучить несколько небольших специализированных агентов, чем одного гигантского монстра. Во-вторых, это повышает надёжность и гибкость. Если один из специализированных агентов вдруг даст сбой или его API изменится…
…то это не обрушит всю систему.
Именно. Оркестратор может попытаться найти обходный путь, использовать другого агента или сообщить о проблеме. Это принцип модульности. В-третьих, это позволяет лучше контролировать процесс и обеспечивать валидацию. Например, оркестратор может настроить так, чтобы результаты работы одного агента, скажем, найденные профили, проверялись другим агентом, например, на соответствие каким-то внутренним политикам перед передачей на следующий этап.
То есть это ещё и механизм контроля качества, встроенный.
Потенциально, да. Мультиагентный подход даёт больше рычагов для управления сложными процессами. И вот тут мы снова возвращаемся к роли человека при такой сложной системе, где агенты сами планируют, выбирают инструменты, взаимодействуют. Неужели человек просто сидит и ждёт финального результата?
Да, вот это важный вопрос. Насколько он вовлечён?
На уровне три, как мы уже затрагивали, роль человека остаётся критически важной. Концепция Human in the loop, человек в цикле, здесь не просто желательно, она, по сути, обязательна для большинства реальных бизнес-сценариев.
Обязательно. Почему?
Потому что, как мы дальше обсудим, у ИИ есть свои ограничения. Здравый смысл, этика, понимание нюансов - это всё ещё прерогатива человека. Поэтому агент может сделать всю подготовительную работу, найти кандидатов, составить письма, предложить время встречи. Но финальное решение, особенно если оно важное или рискованное, должно оставаться за человеком.
Как в примере с отправкой письма кандидату - агент предлагает, человек утверждает.
Да, или, например, в другом демо, которое упоминалось у Армели, по онбордингу нового сотрудника, агент мог инициировать процесс создания учётных записей в корпоративных IT-системах.
О, это серьёзно? В Active Directory или Entra ID?
Да, это стандартные системы управления доступом в большинстве компаний. Агент может собрать нужную информацию: имя, должность, отдел и подготовить запрос на создание учётной записи. Но само создание, предоставление доступов - это же вопрос безопасности.
Конечно, однозначно.
Поэтому очевидно, что такой запрос должен уйти на утверждение к живому IT-специалисту или HR-менеджеру. Агент автоматизирует рутину подготовки запроса, но не принимает финальное решение о предоставлении доступа. Человек здесь выступает как контролёр, валидатор, носитель здравого смысла и ответственности.
Значит, человек не убирается из процесса полностью. Его роль трансформируется из исполнителя рутины в контролёра и принимающего решения.
Именно так. Это очень важный вывод. И уровня три - это не замена человека, это мощный инструмент. Второй пилот, который берёт на себя огромный объём рутинной, но трудоёмкой работы, освобождая человека для более сложных, творческих и ответственных задач, требующих суждения.
Понятно. Фокус смещается. Это позволяет использовать сильные стороны ИИ - скорость, обработку данных, неутомимость - и компенсировать его слабости человеческим интеллектом и этикой.
Совершенно верно. Идеальный симбиоз, по крайней мере, на текущем этапе развития технологии. Хорошо, с механикой и ролью человека вроде бы разобрались. А где ещё, помимо рекрутинга и онбординга, такие системы уровня 3 могут принести реальную пользу? В презентации упоминались и другие области: обслуживание клиентов, операционка, продажи, маркетинг.
Да, потенциал применения огромен, и важно донести до слушателей, что это не какая-то далёкая теория, это уже происходит или вот-вот произойдёт во многих сферах.
Давайте по примерам проймёмся. Вот клиентская поддержка. Как там может работать уровень три?
Смотрите, чатботы уровня два уже умеют отвечать на частые вопросы по базе знаний.
Да, ну да, это уже привычно.
А агент уровня три может пойти гораздо дальше. Клиент пишет: "Хочу вернуть товар". Агент не просто даст ссылку на инструкцию, он может запустить процесс. Sense: понял запрос. Plan: нужно проверить статус заказа, условия возврата, наличие товара на складе, инициировать заявку в системе X, уведомить логистику через систему Y. Act: он реально обращается к этим системам, получает данные, создаёт заявку. Reflect: если что-то не так, пробует иначе.
То есть он сам проводит всю операцию возврата.
Он может провести значительную её часть. Опять же, финальное подтверждение возврата денег, возможно, потребует участия человека. Но всю рутину сбора информации, проверки условий, создания заявок в разных системах агент может взять на себя. Или, например, клиент жалуется на сложную техническую проблему. Агент уровня три может не просто сказать: "Ждите специалиста", а сам проанализировать логи, попытаться диагностировать проблему по базе известных инцидентов и, если не нашёл решение, посмотреть расписание технических специалистов, найти свободного с нужной экспертизой и запланировать звонок, отправив приглашение и клиенту, и специалисту.
Ого, это уже совсем другой уровень сервиса.
Абсолютно. Переходим к операционной деятельности. Демо с рекрутингом - это как раз пример повышения операционной эффективности. Часы ручной работы рекрутера по поиску, первичной оценки, написанию писем, планированию. Всё это сжимается до минут утверждения предложенных агентом действий.
Колоссальная экономия времени.
Не только времени, но и повышение согласованности, стандартизации процессов, меньше ошибок из-за человеческого фактора - усталости, невнимательности. Агент будет действовать по заданному алгоритму в рамках своего плана каждый раз одинаково чётко. Это важно для соблюдения комплаенса, например.
Да, последовательность важна. А продажи и маркетинг там что?
Тоже масса возможностей. Например, агент может анализировать данные CRM, выявлять потенциальных клиентов, которые давно не контактировали, но подходят под профиль новой акции. Затем он может сам составить персонализированные предложения, используя информацию из профиля клиента, и предложить менеджеру по продажам их отправить.
То есть проактивная работа с базой.
Да? Или в маркетинге. В презентации упоминалось, что Армелии, кажется, используют похожие инструменты для ведения своих соцсетей. Можно представить агента, который мониторит новости отрасли, находит релевантные статьи, сам пишет краткое резюме или пост для соцсети, подбирает хэштеги и предлагает SMM-менеджеру на публикацию.
Создание контента, по сути.
Полуавтоматизированное создание и дистрибуция контента. Опять же, рутина автоматизируется, человек фокусируется на стратегии и креативе. И ещё важный момент - интеграция. Все эти агенты могут быть встроены в привычные рабочие инструменты, как Microsoft Teams, например.
Да, или Slack, или другие корпоративные платформы. Не нужно заходить в 10 разных систем. Взаимодействие с агентом происходит в знакомом интерфейсе чата, а он уже сам под капотом дёргает все нужные API и системы. Это делает использование таких технологий бесшовным и удобным для сотрудников. Звучит всё это, конечно, очень привлекательно. Эффективность, скорость, удобство. Но мы же помним про нашего джина. Такая мощь не может не иметь обратной стороны. Давайте теперь честно поговорим про ограничения и риски. Какие фундаментальные проблемы есть у ИИ уровня 3, судя по материалам Армыли и вообще по состоянию технологий?
Да, это абсолютно необходимо обсудить, чтобы не было иллюзий. И риски действительно серьёзные. Во-первых, и это самое главное, нужно постоянно помнить, то, что делает ИИ - это симуляция разумного поведения, а не подлинное сознание, понимание или мышление в человеческом смысле.
Симуляция, то есть он притворяется умным.
Можно сказать и так, он оперирует статистическими закономерностями, паттернами, которые он выучил на огромных массивах данных. Он может виртуозно имитировать осмысленный диалог, логичное планирование, но он не понимает суть вещей так, как понимаем мы. У него нет жизненного опыта, интуиции, реального знания о физическом мире.
И в презентации его поэтому назвали "вторым пилотом" (Co-pilot), а не автопилотом.
Именно. Это очень удачный термин. Он может помогать, подсказывать, выполнять команды, даже брать на себя управление на некоторых участках, но он не может заменить пилота человека, который несёт финальную ответственность и обладает общим видением ситуации. Он не умнее человека в широком смысле.
Понятно. Это фундаментальное ограничение. Что ещё?
Второе, напрямую связанное с первым: критическая зависимость от качества данных, на которых и обучался. Знаменитый принцип "Garbage in, garbage out" (мусор на входе, мусор на выходе).
То есть, если его учили на плохих данных, он и работать будет плохо.
Именно. Если данные были неполными, устаревшими, содержали ошибки, предвзятости (bias), например, гендерные или расовые стереотипы, то ИИ будет воспроизводить эти ошибки и предвзятости в своих решениях и действиях. И он даже не будет знать, что делает что-то не так. А предвзятость - это серьёзная проблема, особенно в рекрутинге, например.
Огромная. Если модель обучалась на данных, где исторически на какие-то позиции брали больше мужчин, она может неосознанно отдавать предпочтение мужским резюме, даже если формально все критерии равны. И это очень трудно отследить и исправить. Качество и репрезентативность данных - это Ахиллесова пята современного ИИ.
Да, это надо иметь в виду.
Третий пункт. Кажется, про здравый смысл говорили, да? Отсутствие здравого смысла или common sense. Та самая житейская мудрость, основанная на миллионах неявных знаниях о мире, которой мы пользуемся каждую секунду, не задумываясь. У ИИ этого нет.
Пример из презентации был про Даласлос.
Да, да, очень показательный. Жара +40°C. ИИ предлагает пойти в поход. Почему? Потому что он выучил паттерн: хорошая погода, солнечно, плюс выходной равно люди ходят в походы. Активный отдых равно хорошо. Но у него нет встроенного понимания, что +40°C - это опасно для здоровья, что в такую жару люди ищут прохладу, а не лезут в горы.
У него нет вот этого физического ощущения жары, дискомфорта?
Нет. Он оперирует абстрактными связями из данных, но не реальным физическим и социальным контекстом. Поэтому он может генерировать советы или планы, которые формально логичны, но абсолютно нелепые или даже опасны с точки зрения здравого смысла.
Понятно. А что насчёт креативности? Может ли ИИ придумать что-то действительно новое?
Смотря что называет новым. Если говорить о настоящей прорывной креативности - создании чего-то принципиально нового, оригинального, не основанного на комбинации существующих образцов, то нет, современный ИИ на это не способен.
А что же он тогда делает, когда пишет стихи или рисует картины?
Он занимается очень искусным ремиксом. Он анализирует гигантские объёмы текстов, изображений, музыки, созданных людьми, выявляет стили, структуры, закономерности и затем комбинирует их, создавая что-то, что выглядит новым. Это может быть впечатляюще, даже красиво, но это всё же пересборка существующего, а не рождение принципиально новой идеи изнутри. То есть он не напишет "Войну и мир" или не изобретёт теорию относительности.
Крайне маловероятно в его текущем виде. Для этого нужно не только знание паттернов, но и глубокое понимание мира, мотивация, воображение, способность задавать фундаментальные вопросы. У ИИ этого нет.
Хорошо. Следующий пункт - это то, о чём сейчас много говорят. Галлюцинации. Когда ИИ уверенно врёт.
Да, это очень серьёзная проблема текущего поколения больших языковых моделей. LLM-галлюцинации - это когда модель генерирует информацию, которая выглядит правдоподобно, но…
на самом деле является выдумкой, не соответствует фактам.
А почему это происходит?
Ну, упрощённо говоря, модель всегда пытается дать ответ. Если она не находит точной информации в своих данных или не может её правильно скомбинировать, она может начать додумывать, заполнять пробелы наиболее статистически вероятными, по её мнению, словами и фразами. И поскольку она обучена генерировать уверенный гладкий текст, эти выдумки могут звучать очень убедительно. Она может придумывать факты, цитаты, ссылки на несуществующие источники.
И это опасно, если люди начнут этому слепо доверять.
Чрезвычайно опасно, особенно в критически важных областях, медицине, юриспруденции, финансах. Поэтому верификация человеком результатов работы и проверка фактов - это абсолютная необходимость. Нельзя принимать на веру всё, что говорит машина, какой бы умной она ни казалась.
Есть надежда, что это исправит. Вот GPT5 ждут, может там не будет галлюцинации.
Разработчики, конечно, работают над этим. Новые модели, вероятно, будут иметь улучшенные механизмы проверки фактов, возможно, научатся лучше распознавать границы своих знаний и говорить, я не знаю, вместо того, чтобы выдумывать. Но полностью избавиться от риска галлюцинации, пока мы имеем дело со статистическими моделями, очень сложно. Так что бдительность терять нельзя.
Понятно? И последний, но не менее важный пункт - ограничения. Этика и эмпатия.
Да, их у ИИ нет и быть не может по определению, потому что он машина, алгоритм, у него нет морального компаса, совести, способности к сочувствию, пониманию человеческих эмоций и сложных этических дилемм.
Он просто следует правилам и данным. Именно он может быть запрограммирован следовать определённым этическим правилам, но это не делает его этичным в человеческом смысле. Он не понимает, почему одно действие хорошо, а другое плохо. Он просто выполняет инструкции или оптимизирует метрику.
Пример с отказом в импотеке с презентацией сюда подходит.
Да, очень хорошо иллюстрирует. И скоринг может чисто по формальным признакам: доход, кредитная история - отказать человеку в ипотеке. А человек-сотрудник банка мог бы учесть какие-то смягчающие обстоятельства, жизненную ситуацию, потенциал клиента, то есть применить не только правила, но и эмпатию, человеческое суждение. И на это он не способен.
И это поднимает очень серьёзные вопросы о том, где вообще можно и нельзя применять ИИ, особенно когда его решения напрямую влияют на жизнь и судьбу людей.
Абсолютно. Нужна очень чёткая грань, нужен контроль, нужна возможность апелляции к человеку. Нельзя отдавать такие решения полностью на откуп машине, лишённой эмпатии и этического понимания.
Да уж, картина рисков и ограничений вырисовывается внушительно. Мы видим огромную мощь этого джина уровня три, но и его явную опасность. Он неразумен, зависит от данных, лишён здравого смысла, креативности, этики и может галлюцинировать. Логичный вопрос: как тогда бизнесу со всем этим жить? Как безопасно использовать эту технологию? Какие стратегии контроля и снижения рисков предлагает тот же Армелий или вообще приняты в индустрии?
Подход должен быть комплексным, многоуровневым. Нельзя полагаться на что-то одно. И первое, о чём стоит говорить - это архитектура самой системы. Мы уже упоминали мультиагентные системы,
да, с оркестратором и специализированными агентами.
Вот это не только про эффективность и гибкость, но и про надёжность и контроль. Во-первых, как мы сказали, принцип "один агент - один инструмент" или "одна задача - один агент" повышает отказоустойчивость. Сбой одного компонента менее критичен для всей системы.
Не складывать все яйца в одну корзину, по сути,
именно. Во-вторых, такая архитектура позволяет встраивать механизмы валидации и перекрёстной проверки между агентами. Оркестратор, как у Армели, может быть настроен так, что результат работы одного агента, например, анализ резюме, передаётся другому агенту для независимой проверки, например, на соответствие политикам DEI (Diversity Equity Inclusion), перед тем, как показать результат человеку.
То есть агенты могут контролировать друг друга,
в каком-то смысле, да? Или, по крайней мере, их работа может быть структурирована так, чтобы были точки контроля и проверки на разных этапах сложного процесса. Это снижает риск того, что одна ошибка пройдёт незамеченной через всю цепочку.
Звучит разумно. Что ещё?
Второе, и мы об этом говорили уже не раз, но это нужно подчеркнуть снова и снова - незаменимая роль человека в цикле Human In the Loop (HITL). На текущем уровне развития технологий, уровня три и, вероятно, даже уровня четыре, полная автономия в сложных ответственных бизнес-процессах - это слишком большой риск.
То есть без человека никуда,
практически никуда. Если речь идёт о чём-то более серьёзном, чем автоматическая сортировка почты, человек должен оставаться в контуре принятия решений для: один - валидации, проверки результатов работы ИИ (адекватность, точность, отсутствие галлюцинаций); два - принятие критических решений, там, где цена ошибки высока или есть этические аспекты (найм, увольнение, диагноз, финансовые решения); три - применение здравого смысла, оценки ситуации, где формальная логика ИИ даёт сбой; четыре - обработка исключений, решение нестандартных задач, с которыми ИИ не справился; четыре - обработка исключений; пять - обеспечение этического надзора.
То есть человек - это как бы последняя инстанция. Страховка,
да, и не только последняя. В идеале точки контроля с участием человека должны быть встроены в процесс там, где это необходимо, а не только в самом конце.
Хорошо. Мультиагентность, человек в цикле. Что ещё помогает контролировать джина? Можно ли вообще понять, почему ИИ принял то или иное решение? Вот эта прозрачность, о которой говорят?
Безусловно, это третий критически важный элемент - прозрачность и объяснимость (Transparency and explainability). Очень плохо, если ИИ система - это чёрный ящик, который выдаёт результат, но непонятно, как он к нему пришёл.
Почему это плохо?
Ну, во-первых, как можно доверять системе, если ты не понимаешь её логику? Во-вторых, если система ошиблась, как найти и исправить причину ошибки, если процесс непрозрачен? В-третьих, для многих отраслей (финансы, медицина) существуют регуляторные требования по объяснимости решений, принимаемых алгоритмами. И что значит прозрачность на практике? Как её обеспечить?
Платформы для создания ИИ-агентов, как та, что описывает Армели, должны предоставлять инструменты для отслеживания и визуализации процесса работы агента. Пользователь или разработчик должен иметь возможность посмотреть, какой был первоначальный запрос (sense), какой план действий построил агент (plan), какие шаги он наметил, какие инструменты (API, модели) он использовал на каждом шаге, какие данные он получал и обрабатывал, почему он выбрал именно этот путь, а не другой. Если система может это объяснить, какие результаты были получены на промежуточных этапах? То есть видеть весь след работы агента,
да, иметь доступ к логам, к дереву решений, к аргументации, если она есть. Это помогает не только постфактум разбирать ошибки, но и заранее понимать, как система будет вести себя в той или иной ситуации и настраивать её более точно. Прозрачность - это фундамент доверия и контроля.
Логично. И остался ещё один момент, который упоминался в презентации. Контроль над стахастичностью. Слово такое. Что это значит?
Стахастичность - это, по сути, элемент случайности, непредсказуемости в работе ИИ, особенно больших языковых моделей.
Случайность, зачем она нужна в бизнес-приложениях? Там же вроде нужна предсказуемость.
Верно? Но есть нюанс. Небольшая доля стахастичности нужна, чтобы ответы ИИ не были слишком сухими, роботизированными, чтобы диалог казался более естественным, человечным. Если вы зададите один и тот же вопрос LLM дважды, она, скорее всего, ответит немного по-разному. Это и есть проявление стахастичности. Это делает взаимодействие менее монотонным.
Ага, понятно. Чтобы не было ощущения, что говоришь со скриптом. Да, но в бизнес-приложениях, особенно там, где важна точность, последовательность, повторяемость результата, эту случайность нужно строго контролировать. Нельзя, чтобы агент сегодня находил одних кандидатов по запросу, а завтра по тому же запросу совершенно других, просто из-за случайных флуктуаций в модели.
И как это контролируется?
Есть несколько механизмов. Основной - это настройка параметра, который обычно называется "температура" (temperature) модели. Низкая температура, близкая к нулю, модель становится очень детерминированной. Она выбирает наиболее вероятные слова и последовательности. Ответы будут более предсказуемыми, консервативными, но могут быть сухими и повторяющимися. Высокая температура, модель становится более творческой, исследует менее вероятные варианты, генерирует более разнообразные и неожиданные ответы, но при этом растёт риск ухода от темы, появления неточностей, фактических ошибок и тех самых галлюцинаций.
То есть нужно найти золотую середину.
Именно. Для каждого конкретного применения нужно подбирать оптимальную температуру, балансируя между предсказуемостью и естественностью. Для задач, где важна точность, например, извлечения данных, температуру ставят низкой. Для задач, где нужна вариативность, например, генерация маркетинговых слоганов, её можно повысить, но под контролем.
А есть ещё что-то кроме температуры?
Да, используются так называемые "защитные барьеры" (guardrails). Это явные правила и ограничения, которые накладываются на поведение агента. Например, запрет обсуждать определённые темы (политику, религию), запрет использовать оскорбительную лексику, запрет выполнять определённые действия без подтверждения человека.
То есть такие красные линии, за которые нельзя заходить.
Точно. И ещё один мощный инструмент - это точность и детальность инструкции (prompts), которые даются агенту. Чем чётче, подробнее и однозначнее сформулирована задача, роль агента, шаги, которые он должен предпринять, ограничения, которым он должен следовать, тем меньше у него пространства для нежелательной самодеятельности и стахастичности. Хороший промпт - это тоже форма контроля.
Получается, укрощение этого джина уровня три - это такая комплексная работа. Правильная архитектура, мультиагентность, обязательный надзор человека, обеспечение прозрачности процессов и ещё тонкая настройка самого поведения ИИ через температуру, барьеры и инструкции. Не просто,
да? Это именно комплексный инженерный подход. Никакой волшебной кнопки "сделать ИИ безопасным" не существует. Это постоянная работа по проектированию, мониторингу, настройке и контролю. ИИ уровня три - это не волшебная палочка, которую можно просто купить, и она всё сделает сама. Это сложный, мощный инструмент, который требует очень грамотного, ответственного и внимательного обращения.
Отлично. Мне кажется, мы довольно глубоко погрузились. Давайте попробуем подвести черту, собрать всё воедино. Сегодня мы, опираясь на материалы Армели, разобрали концепцию ИИ-агентов уровня три для предприятий. Да, начали с эволюции от простых правил уровня один через ML и R уровня 2 к вот этому восходу агентов уровня 3, способных самостоятельно планировать и действовать.
Вспомнили их внутреннюю логику работы через фреймворк SPARK: Sense - восприятие, Plan - планирование, Act - действие, Reflect - рефлексия. Этот цикл позволяет им не просто реагировать, но и как бы думать и учиться. Увидели, как это работает на практике, на примерах демо по рекрутингу и онбордингу, как мультиагентные системы с оркестратором могут автоматизировать сложные многошаговые процессы, взаимодействуя с разными инструментами API, и как это может экономить часы ручного труда.
Но что очень важно, мы не обошли стороной и ограничения, обратную сторону Джина, поняли, что это всё ещё второй пилот, а не автопилот. Он симулирует интеллект, но лишён реального понимания, здравого смысла, креативности и эмпатии.
Да. И что он критически зависит от качества данных, склонен к галлюцинациям и не имеет стройной этики. Это риски, которые нельзя игнорировать.
И наконец мы обсудили, как этими рисками управлять. Ключевые стратегии: продуманная мультиагентная архитектура для надёжности и валидации, обязательное участие человека в цикле HITL для контроля и здравого смысла, обеспечение прозрачности и объяснимости процессов и тонкая настройка поведения ИИ через управление стахастичностью (температура, guardrails, промты).
Да, и главный вывод, который можно сделать: ИИ уровня три - это уже не просто инструмент в руках человека, вроде молотка или калькулятора. Это скорее активный напарник. Вот этот самый второй пилот. Он может взять на себя огромную часть нагрузки, но требует постоянного внимания, управления и чёткого распределения ролей со стороны первого пилота - человека. Баланс, контроль и сотрудничество - вот ключевые слова для этой новой эры.
Отлично сказано. И вот в завершении, возвращаясь к нашей исходной метафоре с джином, хочется задать такой, может быть, немного философский вопрос, но подумать нашим слушателям. В сказке, как мы помним, Аладдину или кому-то там ещё удалось хитростью заманить Джина обратно в бутылку, когда он стал слишком опасен.
Угу.
А вот сможем ли мы сделать то же самое с ИИ, особенно по мере его движения к уровням 4 и 5, когда он станет ещё более автономным, ещё более мощным, ещё глубже интегрированным во все сферы нашей жизни и бизнеса? Реально ли будет загнать его обратно в бутылку, если что-то пойдёт не так?
Хороший вопрос и очень сложный.
Или, может быть, задача уже не в том, чтобы его как-то запереть или остановить. Может, это уже невозможно. И задача в другом: в том, чтобы научиться с ним сосуществовать, совместно эволюционировать, постоянно, непрерывно, очень тщательно выстраивая механизмы контроля, этические рамки, системы сдержек и противовесов, и постоянно переопределяя правильную роль для человека-пилота рядом с этим всё более сильным вторым пилотом.
То есть не пытаться его контролировать силой, а скорее направлять, ограничивать, выстраивать безопасное взаимодействие,
да. Какие гарантии безопасности? Какие системы управления нам нужно создать прямо сейчас, пока этот джин ещё, так сказать, не полностью покинул свою условную бутылку уровня три? Пока мы ещё можем влиять на траекторию его развития.
Это, пожалуй, один из самых фундаментальных вызовов, который стоит перед человечеством в XXI веке: как развивать невероятно мощную технологию, использовать её во благо, но при этом сохранить контроль и обеспечить безопасность. И универсального ответа здесь пока нет.
Да, ответа нет, но думать об этом нужно уже сегодня.
Однозначно. И искать этот ответ нам предстоит всем вместе: разработчикам, бизнесу, регуляторам, обществу.