Transcription
Это взгляд на учет данных. Вы можете получить безумную ценность, просто делая это. И это та часть, которую все пропускают. Я собираюсь использовать электронную таблицу, чтобы подчеркнуть тот факт, что этот процесс может быть чрезвычайно простым, и вы можете получить от него огромную ценность. Когда вы видите средний балл 3,2 против 3,7, никто на самом деле не знает, что это черт возьми значит. Это не очень действенно, честно говоря. Они говорят: «О, это как бы становится лучше». Честно говоря, никто на самом деле не знает, становится ли лучше или нет. Поэтому, как менеджер по продукту, если вы когда-либо увидите слово «соглашение», вам нужно остановиться и подумать: «Хм, позвольте мне покопаться в этом, пожалуйста». Если люди не доверяют вашим оценкам, они не будут доверять и вам. Вам конец.
Хорошо, добро пожаловать всем. Мой сегодняшний гость — Хамил. Хамил обучил более 2000 менеджеров по продукту и инженеров из таких компаний, как OpenAI, Anthropic и Google, тому, как проводить оценки ИИ. Он преподает самый популярный курс по этой теме в Mayheaven. Так что я очень рад углубиться в эти лучшие практики, и я чувствую, что совершил много ошибок, которые вы знаете, и у меня есть много предположений, с которыми Хамил может помочь. Так что добро пожаловать.
>> Я очень рад быть здесь. Рад поговорить об оценках.
>> Хорошо. Итак, вы знаете, было много онлайн-споров о том, можно ли оценивать или нет, типа, бла-бла-бла в Твиттере, и давайте сделаем это действительно практичным. Например, давайте поговорим об оценках для реального продукта, например, есть ли у вас пример продукта, о котором вы хотите поговорить? У меня есть. Да. Так вот, есть компания, с которой я работал. Позвольте мне поделиться своим экраном.
>> Конечно.
>> Итак, чтобы задать тон, Nurture Boss — это помощник по управлению недвижимостью на базе ИИ. И это действительно интересный вариант использования, потому что это один из лучших примеров для обучения, и мне нравится его использовать, потому что он грязный и достаточно сложный, чтобы быть реалистичным. И тогда возникает вопрос: «О, хорошо, как вы делаете оценки?» Так что часто, когда мы говорим об оценках, мы можем показывать игрушечные примеры, но иногда они слишком упрощены, и людям трудно обобщить, как я собираюсь сделать это для своего приложения? Мое приложение сложное, знаете ли, у меня есть другие дела. Ну, вот что мы покажем сегодня: мы вместе посмотрим на данные Nurture Boss, и мы проведем минимальный набор оценок, и мы сделаем это очень быстро.
Да, это будет здорово. Итак, я знаю, что на вашем подкасте уже был Аман. Он, возможно, говорил об Arise. Существует множество различных решений. Те, с которыми я чаще всего сталкиваюсь на практике, это Arise, Brain Trust, Langmith. Это как бы три популярных.
Ммм.
>> Одной из платформ наблюдения, которую Nurture Boss использовал в начале, был Brain Trust. Они фактически создали свой собственный, но я покажу вам их данные в Brain Trust, потому что именно там у нас есть анонимизированные данные.
>> Трассы — это, по сути, как чат-переписка с Nerbos.
>> Хорошо. Я покажу вам, что такое трасса. Лучший способ — просто посмотреть на нее, а не пытаться ее определить. Так что я просто открою одну. Итак, трасса — это журнал всей истории конкретного взаимодействия, которое ваш пользователь может иметь с ИИ, включая все внутренние вещи, которые могут происходить, и которые пользователь не видит.
Хорошо. Вот пример трассы. И вот что мы здесь видим: у нас есть системное сообщение. Итак, вы — ИИ-помощник, работающий в команде по аренде в Arrow и имеющий различные инструкции о том, как взаимодействовать с жильцом или потенциальным жильцом. Вы знаете, например, как обрабатывать запросы на техническое обслуживание или, знаете ли, что делать с потенциальными жильцами и планированием туров, и всевозможные вещи, такие как заявки.
>> Ага.
>> И вы знаете, здесь много инструкций. Нам не нужно читать их все. Мы можем прокрутить вниз и увидеть здесь, где находится здание — это один из вопросов, который задает пользователь.
>> Ммм.
>> И вот сделан вызов инструмента. Получить информацию о сообществах. Мы можем развернуть его, и он возвращает некоторую информацию. Он делает вызов инструмента. Инструмент возвращает некоторую информацию, которую мы можем увидеть здесь. Эм, а затем помощник дает ответ. Вы знаете, Arrow находится по этому адресу, а затем пользователь говорит: «Меня интересует двухкомнатная квартира, что доступно», и на самом деле затем он останавливается. Он просто заходит в тупик, и там есть какая-то ошибка, она просто не была показана пользователю, так что это не обязательно самая интересная ошибка.
>> Это просто что-то, что вы увидите в реальном мире. Теперь это пример трассы. Итак, когда Джейкоб пришел ко мне, я сказал: «Хорошо, Джейкоб, вот что мы сделаем. Мы посмотрим на трассы». И он такой: «Что значит, мы будем смотреть на трассы? Кажется, мы идем в неправильном направлении». Типа: «Это займет вечность, Хамил».
>> Типа, это должно быть что-то вроде того, что ты делаешь? Он сказал: «Просто доверься мне. Мы посмотрим около 100 трасс и просто запишем заметки о том, что идет не так. Первая может быть болезненной, но мы станем очень хороши в этом. К тому времени, когда мы дойдем до десятой, мы будем очень быстрыми». Итак, мы дошли до этой. Мы такие: «О, здесь что-то произошло». Эм, разговор оборвался. Эм, произошла ошибка. Нам пришлось провести расследование, чтобы выяснить, что произошло. Но мы просто написали заметку. И вот, в этом случае, мы можем сделать аннотацию. Так что я напишу заметку, говорящую, например: «Эй, произошла ошибка, которая не была показана пользователю». Хорошо? Просто напишите заметку. Эм.
>> Знаете, разговор закончился тупиком. Цель не в том, чтобы провести полный анализ первопричин. Просто наблюдайте, что не так. Хорошо? И это все, что вам нужно сделать.
>> Сделайте это около 100 раз.
>> Да. Сделайте это 100 раз. Теперь Джейкоб такой: «Что мы, черт возьми, делаем? Зачем мы это делаем?» Типа, я нанял тебя, Хамил, для оценок, а ты как обезьяна смотришь на эти данные, и я не понимаю, что происходит. Типа, какова цель этого, Хамил? Это очень дорогое консультационное соглашение, и мы смотрим на данные. Я сказал: «Нет, доверься мне, мы собираемся, это приведет куда-то».
>> Ну, я имею в виду, вы, по сути, размечаете эти данные вручную, верно? Вы, по сути, говорите.
>> Я, по сути, размечаю эти данные вручную.
>> Итак, давайте посмотрим на еще пару, например, эм, я думаю, станет ясно, почему это ценно, очень быстро. Хорошо. Итак, это еще одна трасса. Вы — сотрудник отдела аренды в Meadow Brick Gardens, и вас зовут Тейлор. Так что дайте ему имя. Эм, ваши цели — отвечать на вопросы. Хорошо, так что это, по сути, то же самое. У вас есть, знаете ли, эм, вы отвечаете на звонки от жильцов, на самом деле потенциальных жильцов, потому что это похоже на режим воронки продаж, где вы поощряете клиентов планировать туры. Эм, так что давайте перейдем к первому сообщению пользователя. Итак, мы убрали системное сообщение.
>> Ассистент говорит: «Этот звонок, так что это теперь по голосу. Хорошо, этот звонок может быть записан, бла-бла-бла». И единственное, что говорит пользователь, это «предварительная программа». Я понятия не имею, что это такое. Возможно, это что-то в системной подсказке, но я лично не помню, что это такое. Ассистент говорит: «Похоже, вы можете быть заинтересованы в том, чтобы узнать больше о сообществе и, возможно, запланировать тур. Хотите запланировать тур?» Пользователь говорит: «Нет». Ассистент говорит: «Похоже, у вас может быть конкретный вопрос или вам нужна помощь с чем-то, связанным с нашими квартирами. Чем я могу помочь? Могу ли я связать вас с представителем?» Очевидно, они пытаются поговорить с человеком. Эм, конечно, я могу связать вас с представителем. Эм, хотите, чтобы я сделал это сейчас? Да, отлично. Я свяжу вас с представителем. Минутку. Хотите, чтобы я связал вас? Я уже раздражен. Типа, да, свяжите человека с человеком уже, столько вопросов, типа: «Вы уверены? Вы уверены? Бла-бла-бла». Эм, так что, хорошо, типа ADU, он хочет поговорить об ADU. Похоже, вы можете быть заинтересованы. Да. Можете ли вы уточнить свой запрос? Я просто хочу поговорить. Мы все имели этот опыт в тот или иной момент нашей жизни.
>> Да. Каждый раз, чувак, я звоню. Да.
>> Да. Это не, знаете ли, я хочу выкинуть телефон в окно, когда у меня такое взаимодействие с ИИ. Эм, так что, хорошо, я понимаю. Я свяжу вас. И наконец, сделан вызов инструмента. Мы переводим звонок. Хорошо. Так что мы чувствуем боль пользователя. Мы, честно говоря, чувствуем. Эм, и довольно ясно, типа: «Эй, мы». Так что это явная ошибка в данном случае. Я напишу заметку здесь, как и в другом случае.
>> И вы не пытаетесь писать решения. Вы просто пытаетесь написать заметку о проблеме.
>> Да. Я не пытаюсь отладить это. Я не пытаюсь сказать, почему это произошло. Я не пытаюсь найти первопричину решения. Я просто записываю, почему это происходит. Так что вы делаете это. Честно говоря, это заняло у нас около часа, чтобы сделать 100 трасс. Это не заняло у нас много времени вообще.
>> Хорошо. Но к концу мы много знали. Типа, мы многому научились, и мы узнали гораздо больше, чем вы могли бы узнать, пытаясь применить какое-либо автоматизированное решение к этой проблеме. Так что, если бы вы попытались подойти к Nurture Boss и применить оценку галлюцинаций, оценку токсичности, оценку связности, что бы вы ни называли, это не дало бы нам и близко такого понимания, которое у нас есть сейчас. Вы знаете, мы выявили очень специфические сбои и вещи, которые болезненны, верно? Глядя на данные, мы сразу же могли увидеть, что.
>> Вы использовали какой-нибудь ИИ для обобщения данных трассировки, которые вы разметили, или?
>> Ага, очень хороший вопрос. Так что, хотя вы не должны использовать ИИ для, вы определенно должны смотреть на данные, прикоснуться к данным, вы можете использовать ИИ, чтобы помочь вам анализировать их. Так что происходит, я экспортировал все эти журналы плюс заметки в электронную таблицу. Хорошо. Хорошо.
>> Эм, и вам не обязательно использовать электронную таблицу. Я собираюсь использовать электронную таблицу, чтобы подчеркнуть тот факт, что этот процесс может быть чрезвычайно простым, и вы можете получить от него огромную ценность. Так что я сделал, я экспортировал все заметки. Так что в этой колонке, колонке А, у вас есть все заметки, которые я сделал.
>> Да.
>> Хорошо. Так что, например, одна заметка: «Пользователь, вероятно, спрашивал об условиях аренды или, возможно, о депозите, а не о специальных предложениях, а ИИ говорил о специальных предложениях, или другая заметка: «ИИ предлагал виртуальные туры, но виртуального тура нет».
>> Эм,
>> Хорошо.
>> Знаете, так что все эти разные, и есть это разрозненное сообщение, которое мы только что видели. Хорошо. И так все эти разные заметки, которые он сделал. Так что вы можете сделать, вы можете взять эти заметки и сделать что-то действительно глупое и простое, вы можете загрузить их в Claude или ChatGPT или что-то еще, и я скажу: «Пожалуйста, проанализируйте следующий CSV-файл. Есть поле метаданных, которое является вложенным полем под названием zenote, которое содержит открытые коды». Так что это некоторая терминология здесь. Открытые коды — это просто модное слово для тех комментариев, которые я сделал. Просто заметки для анализа журналов LLM, которые мы проводим. Пожалуйста, извлеките все различные открытые коды из поля zenote. Предложите пять-шесть категорий, из которых мы можем создать осевые коды. Так что осевой код — это еще один термин, который означает, что мы просто хотим сгруппировать их в категории. Мы хотим сгруппировать эти заметки. Мы просто хотим их классифицировать.
>> Хорошо, эта штука с открытыми кодами и осевыми кодами на самом деле является очень старой техникой из социальных наук, и она также используется в машинном обучении десятилетиями. И поэтому мы используем эту терминологию в качестве ярлыка для LLM, потому что LLM точно знает, что это значит. Они такие: «О, я точно знаю, что вы делаете. Вы пытаетесь использовать эту технику».
>> Понял. Хорошо. Так что это лучше, чем просто сказать, что это лучше, чем просто сказать «классифицируй вещи». Это просто техника ярлыков. Да.
>> Да. Это дает ему некоторую специфичность. Это как бы, говоря «открытый код, осевой код», он знает, какова моя цель, потому что есть много контекста, когда я использую эту терминологию в этой технике. Вы также можете сказать «классифицируй», я имею в виду, нет, вы можете начать где угодно. Так что, если вы хотите сказать «классифицируй», начните с «классифицируй», это совершенно нормально. Цель — добиться прогресса и получить ценность как можно быстрее. Я не хочу быть слишком предписывающим, но суть в том, что вы можете как бы. Так что, например, он как бы много итерировал по тому, как открыть CSV. Так что мы можем пропустить это. Но он дал мне, он дал мне, эм, знаете ли, некоторые категории, и мне не все из них понравились, и я мог бы, я немного туда-сюда, чтобы уточнить категории, которые имели для меня смысл. Эм, и я просто записал некоторые категории. Эм, и вот некоторые категории здесь. Так что я сказал: «Хорошо, планирование тура, перенос тура, проблема с передачей человеку или передачей, ошибка форматирования с выводом». У них были некоторые ошибки форматирования, например, вставка markdown в текстовые сообщения. Проблемы с разговорным потоком. Так что это как бы текстовая штука, где просто внезапно, знаете ли, поток. Совершение обещаний, которые не были выполнены, например, перенос и тому подобное, или не перенос, а другие виды обещаний. И тогда есть еще одно поле, которое я обычно называю «ничего из вышеперечисленного», но я не делал этого здесь, просто для простоты.
>> Хорошо.
>> И так вы можете вернуться и сделать это, и я сделал это, знаете ли, в электронной таблице, вы можете использовать ИИ. Так что есть ИИ в этой Google таблице, Google Sheets имеют ИИ. Вы можете использовать формулу ИИ, которая очень полезна, чтобы показать вам что-то. Так что я говорю: «Хорошо, классифицируйте следующую заметку по одной из категорий». Так что вы просто используете LM, чтобы классифицировать ее.
>> И вы можете видеть, что я просто классифицирую эти заметки, которые я сделал, проблемы, которые я нашел. Я просто помещаю их в категории.
>> Ну, я знал, что Google Sheets уже имеет эту функцию ИИ. Хорошо. Они обычно очень медленные.
>> Это круто. Это круто. Это может быть немного коряво, но это нормально. Это легкий вес, и никто не может понять, как это сделать. Это демистифицирует весь процесс того, что я делаю, потому что, если я открою какой-нибудь код, вы можете подумать: «О, вам нужно быть инженером-программистом, чтобы сделать это, или что-то в этом роде», и типа, нет, вам не нужно. Мы можем использовать английский язык до конца. Так что теперь у вас есть все эти вещи, классифицированные, и теперь мы можем использовать один из моих любимых инструментов — сводные таблицы. Так что сводные таблицы, знаете ли, если вы никогда их не видели, очень полезны в электронных таблицах, так что вы можете просто подсчитать, сколько раз каждая из этих категорий встречалась. Хорошо.
>> И мы можем увидеть просто на высоком уровне, эй, хорошо, у нас есть такая проблема с разговорным потоком, которая происходит довольно часто. Знаете ли, у нас также есть эта проблема с передачей человеку, передачей, и вы можете сразу же получить представление о том, в чем проблема. Теперь, скорее всего, еще до того, как вы дойдете до этого подсчета, вы уже знаете, вы посмотрели 100 трасс. Вы знаете, в глубине души, вы такие: «Хорошо, я знаю, что мне нужно исправить эту штуку с передачей человеку прямо сейчас».
>> Вы такие: «Мне даже не нужно делать анализ данных, но это быстро, это занимает буквально несколько минут, честно говоря».
>> И это просто дает вам некоторую основу, и это позволяет вам увидеть, как вы переходите от этого беспорядка «Я не знаю, что происходит» к «Хорошо, у меня есть некоторое представление о проблемах, которые у меня есть».
>> И у вас есть отправная точка. Это имеет смысл?
>> Да. Да. Это блестяще, чувак. Но позвольте мне задать вам этот вопрос.
>> Итак, эм, в данном случае агент уже работал в продакшене до того, как вы начали делать все это, верно? Типа, типа, эм, но это не идеальный подход, верно? В идеале вы хотите сделать что-то из этого заранее или, возможно, сначала протестировать это со своей командой или получить некоторых пользователей, чтобы попробовать.
>> Абсолютно.
>> Как вы? Да. Так что лучший сценарий — это протестировать это с, знаете ли, с некоторыми дружелюбными клиентами, протестировать это самостоятельно. Это будет очень хорошо. Вы также можете синтетически генерировать входные данные в вашу систему.
>> Так что, по сути, что вы можете сделать, это.
>> Подумайте о правдоподобных пользовательских вопросах, которые они могут иметь, и знаете ли, и попытайтесь выдвинуть гипотезы о том, где ваша система сломается.
>> Да.
>> Но есть определенный способ сделать это. Вы не хотите просто спросить LLM: «Эй, придумай правдоподобные вопросы для потенциального арендатора, который может искать квартиру». Правильный способ сделать это — придумать некоторые категории. Так что это придумать некоторые измерения. И что я имею в виду, это давайте, скажем, эм, давайте подумаем, какими могут быть хорошие измерения для Nurture Boss. Так что для Nurture Boss, эм, вы можете иметь, например, жильца, вы можете иметь, хорошо, типа, тип клиента, может быть.
>> Класс квартиры, может быть.
>> Так что, например, роскошный стандарт, что-то еще, я не знаю, что это такое, я не настолько креативен, чтобы думать на лету, но что вы предложили?
>> Просто тип клиента, верно? Вы можете получить менеджера арендатора против фактического жильца, верно, в зависимости от того, с кем вы говорите.
>> Да. Эм, жилец, менеджер.
>> Да.
>> И вы можете подумать, надеть свою продукторую шляпу. Так что, кстати, весь этот процесс очень ориентирован на продукт. Так что, знаете ли, когда вы читаете трассу, это не столько об инженерии, сколько о том, чтобы надеть свою продукторую шляпу и спросить: «Это тот опыт, который вы хотите, чтобы ваш пользователь получил? Имеет ли это на самом деле смысл?» Когда дело доходит до этих измерений, о которых я говорю, вы как бы надеваете свою продукторую шляпу и говорите: «Хорошо, каковы различные персоны? Каковы различные категории, различные измерения, которые вы можете захотеть рассмотреть?» И тогда вы хотите сделать, например, знаете ли, вы возьмете, эм, комбинацию этих, эм, знаете ли, так что, например, роскошный жилец, роскошный, роскошный для жильца, роскошный для менеджера, стандартный для жильца, стандартный для менеджера, и вы передадите эти, мы называем это измерениями, в LLM, скажем: «Хорошо, это различные измерения для этого, для каждого из этих измерений сгенерируйте правдоподобные пользовательские запросы».
>> Понял. Это намного лучше, чем просто спрашивать LLM. Да, просто потому, что, эм, если вы просто спросите LLM, это будет более однородно, и вы не хотите быть однородными, вы не хотите иметь однородные входные данные. Вы хотите исследовать пространство входных данных, и эти мозговые штурмы измерений помогают вам убедиться, что вы исследуете пространство, продумывая исследование пространства. Это имеет смысл?
>> Понял. Да. Вы хотите найти все крайние случаи и, знаете ли, да.
>> И это только поверхностное знакомство с этим. Есть гораздо больше в генерации синтетических данных, которые мы могли бы, вероятно, обсудить здесь, но есть более продвинутые способы генерации синтетических данных или вещи, о которых стоит подумать с точки зрения большей враждебности, как, знаете ли, выдвигать гипотезы, которые помогут вам сломать вашу систему, и так далее. Но короткий ответ: используйте нашу систему, и вы можете использовать LLM, чтобы помочь вам, по сути, притворяться синтетическими пользователями.
Это имеет смысл. Хорошо, давайте вернемся к категориям, которые у вас слева. Так что, эм, так что теперь у вас есть эти, я имею в виду, они не, они, по сути, проблемы, верно, проблемы с продуктом, и, эм, теперь что мы собираемся делать с этим? Это то, как мы приходим к нашим критериям, или мы должны просто начать исправлять проблемы?
>> Очень хороший вопрос, следующий очень хороший вопрос.
>> Так что, эм, когда мы впервые сделали это, главной проблемой была обработка дат. Это было очень ясно, знаете ли, пользователь хотел назначить встречу. Да.
>> И дата всегда была неправильной. И было очень ясно: «О, это так глупо». Типа, LLM не знает сегодняшнюю дату. Мы просто.
>> Хорошо.
>> Мы просто забыли. Они типа: «Да, они забыли добавить это в подсказку». Это типа: «Тебе действительно нужна оценка для этого?»
>> Может быть, нет. Типа, знаете ли, вы не хотите оценивать. Вы не обязательно хотите оценивать, потому что это приятно. Вся цель чего-либо — сделать ваш продукт лучше и итерировать и, знаете ли, двигаться быстро. Эм, и поэтому для этого мы были такие: «Ну, давайте посмотрим, давайте просто дадим ей сегодняшнюю дату», и эта проблема, как ни удивительно, исчезла. Так что нам действительно не нужна была оценка для этого. Эм, другие вещи, которые более субъективны или, знаете ли, так что это компромисс между затратами и выгодой. Так что есть два типа оценок. Один — это LLM как судья, который мы собираемся построить вместе. Другой — это оценка на основе кода, где вам действительно не нужен LLM как судья. Это какое-то утверждение, которое вы можете сделать, и это очень дешево по сравнению с LLM как судьей. И поэтому, эм, для даты мы фактически сделали, мы сделали, эм, оценку на основе кода, которая, как у нас были тестовые случаи, и мы смогли протестировать, например, равна ли дата, которая выходит, ожидаемой дате. И это было очень дешево. Нам не пришлось использовать LLM как судью.
Понял.
>> Знаете, но это было очень легко исправить. Теперь что-то вроде того, что вы должны передавать человеку, хорошо, вот это, мы не знаем точно, как мы имели правила для этого уже, но LLM испытывает трудности, и мы не знаем, как мы собираемся это сделать. Это кажется действительно хорошим вариантом использования для LLM-судьи. И также оценка предоставит тонны ценности, даже если она дорогая, более дорогая, потому что мы будем много итерировать против нее, чтобы добиться прогресса.
>> И поэтому мы сказали: «Хорошо, типа, эм, хорошо, нам нужен LLM-судья для передачи человеку, давайте сделаем это, это важная проблема, также».
>> Да. Да. Основная проблема, с которой сталкиваются люди при использовании LLM в качестве судьи, заключается в том, что они просто дают подсказку другому LLM, чтобы тот судил, что сделал ваш LLM, и говорят: «Хорошо ли это?» Теперь это должно вызывать подозрения, верно? Почему это нормально? Почему вы просто собираетесь сказать другому LLM, чтобы он сказал мне, хорошо ли это? Я не знаю. И вы будете правы, будучи очень подозрительным к этому. И есть ответ. И ответ заключается в том, что вы можете измерить судью. Так что это мета-оценочная проблема, вам нужно измерить, хорош ли судья. Это очень важно. Вы не хотите пропускать этот шаг, потому что, если у вас есть куча судей, LLM-судей, и ваши заинтересованные стороны смотрят на вас на панели, и все говорят: «О, судья, знаете ли, никто не поймет, что вы используете LLM-судью в любом случае». Они просто посмотрят на вашу метрику, и когда возникнет значительный разрыв между реальностью и вашими метриками, никто больше вам не поверит. Вы хотите избежать этого. Вы хотите.
>> И.
>> Потому что, если люди не доверяют вашим оценкам, они не будут доверять и вам.
>> Вам конец.
>> Да. Точно. Да. Вы не можете заставить его иметь идеальные оценки для чего-то, но на самом деле это совершенно неправильно, верно? То, как вы этим управляете.
>> Да. Да.
>> И так. Хорошо. Так как же вы к этому подходите? Ну, к счастью, когда вы занимаетесь этим аксиальным кодированием, верно, вы на самом деле определили действительно хорошие тестовые случаи или некоторые разумные тестовые случаи, которые вы можете использовать, которые размечены. Вы уже разметили их как человек. Так что у вас есть некоторая истинная основа.
>> И это то, что вы можете использовать для калибровки LLM-судьи, чтобы увидеть, можете ли вы создать достаточно хорошего судью. Хорошо.
>> Достаточно зеленый — это просто достаточно зеленый — насколько близко он соответствует человеческим меткам, верно? Это вроде как.
>> Насколько близко соответствует человеческой метке.
>> Да.
>> Так что вот что мы собираемся сделать дальше: мы собираемся подумать, сначала мы напишем подсказку, и это вроде как самая глупая подсказка. Я не говорю, что это хорошая подсказка. Это просто подсказка.
>> И цель не в том, чтобы иметь рецепт подсказки или какую-то волшебную вещь, это просто итерация. Хорошо. И вы хотите просто указать требования, например, в данном случае, что такое хорошая передача или когда следует проводить передачу и когда она должна происходить, и поэтому, знаете ли, вы оцениваете ассистента по аренде, чтобы определить, была ли ошибка передачи, должна быть передача, если произойдет любое из этих вещей. Знаете ли, или, скорее, произойдет ошибка передачи, если произойдет любое из этих вещей, например, если человек запросил передачу, но вы просто проигнорировали его или зациклились на нем слишком много раз. Это ошибка.
>> Понял. Да.
>> И есть список этих семи ошибок. Вам не нужно читать их все, но вы поняли. И мы также говорим, когда ошибки нет, просто для полноты. И мы говорим, что мы хотим вернуть ровно истину или ложь, бинарно. Так что стоит задержаться на этом на мгновение. Так что для LLM-судьи очень важно, чтобы вы выводили бинарную оценку. В 99% случаев вы не хотите импортировать, экспортировать шкалу или оценку от одного до пяти, или какую-то оценку, потому что это вносит огромную сложность.
>> Да.
>> Знаете ли, LLM не хороши в непрерывных оценках, во-первых. Во-вторых, вывод не будет ясным. Когда вы видите средний балл 3,2 против 3,7. Никто на самом деле не знает, что это черт возьми значит.
>> 3.7.
>> Да. Да. Никто.
>> И это не очень действенно, честно говоря. Они такие: «О, это как бы становится лучше». Честно говоря, никто на самом деле не знает, становится ли лучше или нет. Я обнаружил, что когда вы пытаетесь спрятаться за оценкой, вы на самом деле не принимаете решения. И типа, то, что вы пытаетесь, кадр здесь, это достаточно ли хороша эта функция, чтобы выпустить ее? Да или нет? Примите решение.
>> Знаете что? Где линия? Где-то есть линия, и поэтому должна быть, верно? И поэтому мы не хотим оценивать. Где это возможно, вы хотите упростить. Оценка просто делает это слишком сложным.
>> Да. Это вроде как фальшивая наука, знаете ли, вроде как ложная точность, верно? Кто знает?
>> Да, это может быть. Да, это может быть. Есть некоторые оценки, где вам нужна оценка, когда вы очень узко углубляетесь в определенные аспекты вещей, например, знаете ли, когда вы пытаетесь получить оценки для поиска, извлечения и различных компонентов, тогда оценки имеют смысл, но для этого, как в случае судьи, в общем смысле, нет.
>> И почему, почему без объяснений, почему вы не хотите объяснять, почему я отметил.
>> Так что объяснения на самом деле обычно хороши.
>> Эм, так что вы, знаете ли, что мы преподаем, это то, что вам нужны объяснения, а затем оценка, но это вроде как электронная таблица.
>> И так.
>> Мы просто хотим, чтобы это было управляемо. Если я попытаюсь дать объяснение, то это будет. И знаете ли, модель здесь в электронной таблице не самая мощная, которую они дают вам. Так что, эм, она шла повсюду. Так что я просто пытался упростить здесь. Но да, объяснение может быть хорошим. Оно может помочь вам отладить модель ИИ. И вы хотите предоставить структурированный вывод. Вы хотите, например, поле. Вы обычно хотите вывести два поля, например, вы хотите, чтобы оно выводило, например, объяснение и бинарную оценку. И тогда вы можете использовать объяснение, чтобы помочь вам отладить, что пошло не так с мышлением LLM. О, так вы собираетесь сделать эту LLM-коррекцию, используя модель ИИ Google Sheets?
>> Да, я останусь в Google Sheets, потому что наша цель — демистифицировать все и сделать очень ясно, что на самом деле происходит.
>> Хорошо.
>> Используя электронную таблицу до конца. Так что, эм, хорошо, так что у нас есть эта подсказка для судьи LLM, и теперь мы можем вернуться к этим трассам. Так что у нас есть, это оригинальная трасса в колонке А. Это просто в формате JSON. Эм, а затем у нас есть своего рода LLM как судья. Так что это для одной ошибки. Так что вы хотите, чтобы они были сгруппированы обычно. Так что у нас есть этот LLM как судья только для ошибки передачи.
>> И у нас есть формула, оценивающая эту трассу LLM в соответствии с этими правилами.
>> Хорошо. И затем это подсказка для судьи LLM, которую я только что показал вам. Это все.
>> И затем она дает нам истину или ложь. Хорошо. Так что у нас есть истина или ложь здесь. И затем эта колонка H — это судья LLM, передача, эм, вроде как то, что он сказал, бинарная оценка истина или ложь, есть ли ошибка, и затем это человеческая метка в колонке G, есть ли ошибка.
>> Хорошо, так что у нас есть эти две метки, и мы уже сделали колонку G раньше, это произошло бесплатно благодаря аксиальному кодированию в открытом кодировании процесса.
>> О, так у вас есть еще один ИИ? Нет, человеческая метка — это вроде как заметки, так что. Так что у вас есть.
>> Да, это вроде как результаты заметок. Эм.
>> Знаете.
>> Например, я сказал: «Эй, если осевой код — это проблема передачи человеку или передачи, я просто сказал, что это истина, иначе это ложь».
>> Понял. Понял. Хорошо.
>> И так вы можете увидеть, насколько согласован LLM с человеком. Это главное, что вы хотите протестировать. Теперь есть одна вещь, которой вы хотите избегать. Так что многие люди просто рассчитывают соглашение. Интуитивно это имеет смысл, верно? Позвольте мне рассчитать согласие между LLM и человеком. Это кажется правдоподобной метрикой. Это звучит разумно. Хорошо, согласие, конечно.
>> Да.
>> Проблема с согласием заключается в том, что большинство ошибок, надеюсь, если ваша система не корявая, большинство ошибок не происходят, как бы, на краю. Так что эта ошибка передачи человеку не происходит каждый раз, она происходит, возможно, 15% времени или 10% времени, верно?
>> Понял.
>> И поэтому, если что-то происходит 10% времени, как вы можете согласиться с этим? Так что, если что-то, если система говорит, что что-то выходит из строя 10% времени, вы можете согласиться с этим в 90% случаев, просто сказав, что это никогда не выходит из строя.
>> У вас будет 90% согласия.
>> И 90% согласия кажется действительно хорошим на бумаге. Вы идете на встречу с заинтересованными сторонами, типа: «Да, у меня есть судья, 90% согласия, это звучит хорошо». Нет, это звучит действительно плохо, на самом деле, потенциально вам нужно действительно покопаться в этом. Так что как менеджер по продукту.
>> Если вы когда-нибудь увидите слово «согласие», вам нужно остановиться и подумать: «Хм, действительно?»
>> Давайте. Позвольте мне покопаться в этом, пожалуйста. Как и вам нужно измерить два количества: одно — и есть разные способы, есть разные термины, но истинно положительный коэффициент и истинно отрицательный коэффициент. Так что это просто, и есть разные слова для этого: чувствительность, специфичность, точность, полнота, есть разные слова, но я истинно положительный коэффициент, истинно отрицательный коэффициент.
>> И так, истинно положительный коэффициент — это ваша способность успешно выявлять ошибки, когда ошибки действительно происходят, и ваша способность успешно выявлять, когда ошибки не происходят. И это лучше, эти два количества лучше, чем согласие, потому что они покажут вам, когда что-то не так, знаете ли, и поэтому, чтобы сделать это более конкретным, потому что это может быть много в вашей голове, о чем я говорю прямо сейчас, почему это не так.
>> Да.
>> И так, давайте перейдем к этой путанице. Это называется матрица ошибок.
>> Забавно, что это называется матрица ошибок, иногда она вызывает путаницу, но, надеюсь, сегодня она не вызовет путаницы. Что у вас здесь есть, это вроде как, хорошо, в этой колонке у вас есть человеческая метка. Хорошо. Истина или ложь. Ложь и истина. А затем, идя поперек здесь, у вас есть метка судьи LLM, где зеленая диагональ — это там, где они оба согласны.
>> Да.
>> Хорошо. Потому что это вроде как 100 трасс. У нас есть 70. Так что, когда человек говорит, что это ложь, судья LLM соглашается с этим. Хорошо. Типа, из, знаете ли, 73 раз, но затем, когда человек говорит, что это ложь, судья LLM думает, что это ошибка 18 раз. Интересно.
>> Есть разные виды ошибок, и вот о чем я говорю. Вы не хотите просто идти на согласие. Вы хотите знать, каков истинно положительный коэффициент, истинно отрицательный коэффициент. Теперь, откуда вы знаете, каков хороший истинно положительный, истинно отрицательный коэффициент? Нет волшебной палочки. Это бизнес-решение. Типа, какой уровень судьи является для вас приемлемым? В самом базовом случае вам просто нужно провести проверку здравого смысла. Типа, имеет ли это смысл? Хорошо. Типа, знаете ли, кажется ли это нормальным? Рассчитайте истинно положительный коэффициент, рассчитайте истинно отрицательный коэффициент. Один из них действительно плохой? Хорошо, тогда, возможно, вы не хотите его использовать. Эм, он действительно низкий. Эм, или, знаете ли, просто посмотрите на матрицу ошибок, сделайте что-нибудь, знаете ли, и вы можете использовать электронную таблицу и сказать: «Хм, это нормально?» Типа, я в порядке с таким родом ошибок? Эм, знаете ли, дайте себе интуицию. Часто я бы сказал, что для большинства людей, которые не привыкли к истинно положительному коэффициенту, истинно отрицательному коэффициенту, требуется некоторое время, чтобы это щелкнуло.
>> Даже мне иногда приходится об этом думать, честно говоря, даже я занимаюсь этим годами, просто чтобы заземлиться.
>> Я имею в виду, я думаю, что матрица ошибок на самом деле гораздо яснее, чем проценты. Я имею в виду.
>> Да. 18, где это помечено как истина, когда это ложь.
>> Да. Да. Так что есть проблема, когда это ложь, когда есть, знаете ли, из этих 91 раза, есть 18 из этих 91 раза, есть эта конкретная ошибка. Это нормально?
>> Так что, по сути, так что, по сути, 18 раз он фактически успешно передал человеку, человеку, под поддержкой, но LLM думает, что он этого не сделал, или там слишком много поворотов, или что-то еще.
>> Да. Да. Типа, 18 раз LLM думает, что есть ошибка, когда ее нет, верно? Это нормально? И поэтому, знаете ли, разные ситуации, вы можете быть, типа, ложные срабатывания не так дороги, как ложные отрицания, знаете ли. Так что вы можете быть в порядке с тем, чтобы ловить вещи, ловить больше ошибок, которых на самом деле не существует. Вы просто хотите убедиться, что вы ловите их все.
>> Так что тогда вы делаете с этими 18, вы смотрите обратно на трассы, видите, что произошло, а затем пытаетесь изменить подсказку.
>> Да. Да. Так что вы делаете, вы можете посмотреть на эти, вроде как 18.
>> Эм, и вы можете, знаете ли, вы можете сказать: «Хорошо, типа, что здесь произошло», и вы можете итерировать, и вы продолжаете итерировать немного по подсказке.
>> Да.
>> Эм, и часто это довольно просто. Эм, иногда не так много, но одна вещь, которую я оставил здесь, это то, что часто в LLM-судье вам нужны примеры. Я не ставил примеры здесь, потому что я просто хотел сохранить простоту. Как только вы начнете вставлять примеры в подсказку, вам придется, эм, разделить набор данных немного. Типа, вы не можете, вы можете начать переобучаться на своих данных.
>> Так что, типа.
>> Если я вставлю все эти трассы в свою подсказку,
>> он получит 100%. Потому что он будет знать точный ответ, верно? Так что, типа, вы не хотите этого делать, и, эм, вы хотите отложить некоторые данные, чтобы убедиться, что вы не обманываете себя, и, знаете ли, так что мы не должны вдаваться во все это. С точки зрения менеджера по продукту, лучшее, что вы можете сделать, это просто знать, просто иметь триггер в своем уме о согласии и просто не задавать уточняющие вопросы. Например, «Согласие составляет 90%». Каков базовый уровень ошибок, если они говорят 10%? Да, вы знаете, что согласие 90%, вы такие: «Это действительно плохо, что-то пошло не так».
>> И это довольно распространенное явное явление для команд, проводящих оценки. У них просто есть, у них просто есть магазин согласия. У них нет этой штуки TPR.
>> Эм, чрезвычайно распространенное явление, это, это причина, по которой я придаю этому большое значение, потому что мы видим это так часто, что это стоит того, чтобы упомянуть.
>> Хорошо, понял. Хорошо. Итак, теперь у нас есть несколько судей в продакшене, и, эм, типа, какой следующий шаг? Вы хотите поместить этих судей в продакшен, чтобы они работали все время.
>> Так что теперь у вас есть этот действительно, эм, скажем, у вас есть судья, как этот судья передачи человеку.
>> Правильно.
>> И вам это нравится достаточно. Так что теперь у вас есть этот мощный инструмент, который вы можете использовать. Номер один, вы можете, знаете ли, вы можете отложить некоторые данные. Вы можете, эм, поместить его в CI. Вы можете иметь тест каждый раз, когда вы вносите изменения в код или что-то еще. Вы можете протестировать, насколько хорошо вы справляетесь с этой проблемой передачи человеку. Но также вы можете запускать своего судью в продакшене. Вы можете запускать его на выборке или большой части ваших производственных трасс, и вы можете видеть, где происходит эта ошибка передачи, и вы можете отладить ее еще больше. Вы можете сказать: «Я хочу найти все места, где происходит ошибка передачи». Я хочу найти гораздо больше ситуаций, где она происходит. Эм, и вы можете поместить, вы можете сделать производственный мониторинг этого, эм, проблем. Вы можете использовать этих судей для, знаете ли, запуска на выборке трафика. Вы можете знать, эй, происходят ли проблемы с передачей, знаете ли, и так далее. И вы можете создавать этот набор оценок со временем.
>> Хорошо.
>> В большинстве случаев люди спрашивают меня, сколько у меня оценок. Обычно у меня их меньше дюжины. У меня их не так много, потому что я довольно экономно отношусь к оценкам, которые мне нужны. Это зависит, иногда у меня их больше, если, это зависит от того, насколько они дороги. Эм, поддержание этих вещей тоже требует некоторой работы. Эм, знаете ли, для LLM-судьи, основанных на коде, не так много. Потому что вам не нужно делать все это, знаете ли, потому что мне не нужно делать слишком много человеческих, вроде как, человеческих меток, потому что, знаете ли, в кодовых вещах есть правильный ответ.
>> Да. Да. И это называется эталонная оценка. А это оценка без эталона. Так что в зависимости от того, какой тип оценки, эм, это будет, знаете ли, есть, эм, общий бюджет, скажем так, примерно в моем уме, сколько. Так что, скажем, у вас есть, знаете ли, пять или шесть судейских оценок в продакшене, и вы просто, так что, по сути, в продакшене это просто означает, что, знаете ли, этот судья передачи человеку, он просто случайным образом выбирает из 100 разговоров, смотрит на пять или около того, и затем дает проход или провал.
>> Да, это зависит от того, сколько у вас есть. Знаете ли, это зависит от того, насколько вы масштабируетесь. Знаете ли, если вы обслуживаете миллиарды пользователей в день или что-то в этом роде, тогда вы, вероятно, не хотите запускать LLM-судью на всем. Эм, знаете ли, это действительно зависит от того, сколько данных вы можете получить просто из выборки. Но если у вас очень мало данных, знаете ли, вы обслуживаете только тысячи пользователей в день, тогда просто запустите все, я не знаю, просто оцените все.
>> Да. Я имею в виду, это, вероятно, не так дорого.
>> Так что это действительно зависит. И тогда у вас есть панель, которая, по сути, имеет TPR и TNR для каждого судьи или что-то в этом роде.
>> Да. И так, что вы можете сделать, это фактически, вы можете встроить это в оценку. Есть способы объединить эти TPR, TNR. Есть, например, F1-оценка и тому подобное, которые взвешивают их одинаково или что-то еще. Вы можете углубиться в это. Обычно я делаю отчет по одной оценке. Это, вероятно, выходит за рамки того, что я должен углубиться в много науки о данных, чтобы.
>> Поговорить о том, как это сделать.
>> Да. Эм, но обычно есть одна оценка, которую я отчитываю, и на самом деле есть все эти оценщики, и я стараюсь иметь одну агрегированную оценку.
>> И.
>> Которая агрегирована по всем ним, просто чтобы дать мне представление, а затем я могу углубиться и увидеть, хорошо, что происходит.
>> И когда вы делаете, например, человеческие метки, знаете ли, потому что вы делали это в начале, глядя на 100 трасс, но когда, когда вы снова делаете человеческие метки? О, так всегда делайте их все время. Я делаю это, пересматриваю. Это зависит от динамики системы. Так что зависит, например, когда есть большие изменения, я определенно сделаю это снова.
>> И я также делаю это по регулярному графику. Скажем, раз в неделю, раз в месяц. Это зависит от того, насколько быстро меняются системы и каков масштаб системы. Но я делаю это как по графику, так и затем. И вы становитесь лучше каждый раз. Но также вы можете создавать инструменты, которые помогают вам делать это. Так что одна из вещей, о которых мы говорим на нашем курсе, это хорошо, мы используем, например, Brain Trust. Мы сделали это здесь. Мы сделали это в электронной таблице или что-то в этом роде. Для Nurture Boss, что они в итоге сделали, и я сделал несколько скриншотов и поместил их в свой блог. Так что, позвольте мне просто поделиться этим с вами.
>> Эм, так что они фактически построили свой собственный инструмент аннотации, потому что это настолько ценный процесс. Вероятно, самый ценный процесс оценки — это это.
>> Это аннотация.
>> Это аннотация и подсчет. Даже если это все, что вы делаете, вы не строите судью, вы не делаете оценку, вы не делаете ничего, вы можете получить безумную ценность, просто делая это. И это та часть, которую все пропускают. Они пытаются перейти напрямую к чему-то.
>> Да.
>> Эм, и так, эм, знаете ли, это скриншот того, что они, вроде как, инструмент, который они построили для себя, и они построили это менее чем за четыре часа. Потому что это то, в чем ИИ действительно хорош.
>> Да. Помогает вам строить. Так что это вроде как, хорошо, знаете ли, вы можете видеть, что это просмотрщик трасс, у вас есть эти селекторы для разных каналов. У вас есть, эм, это их интерфейс. Системная подсказка скрыта по умолчанию. Они могли просто создать, добавить заметки здесь, а затем они встроили это в свою.
инструмент, где они просто делали осевое кодирование для них. Вы видите, как он просто пытался сделать это для них и дал им подсчет. Понял. >> Им это понравилось. В этом посте в блоге есть видео. Это Джейкоб, и он очень счастлив. Э-э >> да, он выглядит счастливым сейчас. Да, >> он рассказывает о том, как он это сделал и какое влияние это оказало на его э-э на nurture boss. Так что, >> хорошо.
Эм >> да, вы можете получить очень быстро. Так что, вы знаете, с такими вашими собственными инструментами это становится до смешного быстро и совсем не больно. Эм, >> да. Но в основном, да, >> Я имею в виду, но в основном, вы все равно должны, ну, вручную, например, прежде чем я сделаю крупное обновление подсказки или что-то в этом роде, я все равно должен вручную просмотреть, ну, трассировки и просто убедиться, что э-э все имеет смысл, верно, прежде чем я что-либо отправлю.
Да. Я имею в виду, вам не нужно делать это при каждом обновлении подсказки. Вам не нужно смотреть, вам не нужно вручную просматривать трассировки. Вы можете просто запустить свои оценки, которые у вас есть, э-э, и сделать это таким образом. Просто убедитесь, что вы просматриваете свои трассировки время от времени.
Да. потому что это как >> это может быть загадочно, типа, о, как часто и сколько трассировок. Поэтому мы говорим людям просматривать минимум 100 трассировок.
И причина, по которой мы говорим это, в том, что это не магическое число. Мы всегда обнаруживаем, что если мы не даем число, люди не начинают. И затем, когда мы даем число, когда люди доходят, скажем, до 20 или 30 трассировок, они они они продолжают, э-э, пока не... Поэтому мы говорим людям, что этот термин называется теоретическим насыщением, и это просто означает, что вы продолжаете выполнять действие, пока вы... это как возвращение измерения. Да.
Когда Да. пока вы не узнаете ничего нового.
Понял. Поэтому мы обнаруживаем, что люди, начав это, как бы привыкают к этому и находят это настолько ценным, что просто делают это. Так что просто имейте в виду 100 трассировок как цель.
Хорошо, это на самом деле отличный разговор, возможно, мне придется удалить видео Амана, потому что, но это на самом деле отличный разговор, потому что, э-э, во-первых, TRDR заключается в том, что трассировка, просмотр фактических разговоров любого продукта ИИ, который у вас есть, является самой ценной вещью, и как бы рассчитывать на маркировку этого, верно.
Да. и как бы хорошо, так что давайте просто закончим, развеяв некоторые мифы, хорошо, так что я собираюсь высказать кое-что, я собираюсь сделать заявление, и, возможно, вы сможете сказать мне, почему это правильно или неправильно, хорошо.
так что, э-э, одна вещь, которую я считал правильной, это как бы, вы знаете, вы хотите провести оценку для нового продукта, а затем вы собираете свою команду и говорите: о, вы знаете, типа, должны ли мы оценивать полезность или должны ли мы оценивать токсичность, или должны ли мы делать что-то еще, что мы должны делать, и каковы правильные критерии, что такое хорошая токсичность и плохая токсичность, но это, кажется, не так. Основываясь на том, о чем мы только что говорили.
Да, это верно. Итак, многие люди сразу переходят к оценке полезности и токсичности.
Да,
это очень привлекательная идея. Многие поставщики продают это. Они говорят: "Эй, не беспокойтесь об оценках. Вы просто подключаете и используете этот инструмент. Мы вас прикрыли. Вам не нужно об этом беспокоиться. Просто нажмите эту кнопку, и мы дадим вам панель управления. Не беспокойтесь." Фундаментальная проблема заключается в том, что общие подсказки в этих общих вещах обычно не соответствуют наиболее важным проблемам, которые фактически возникают в вашем приложении. Они просто супер общие
и они сбивают вас с толку и на самом деле тратят ваше время впустую, потому что вы тратите много умственной энергии, глядя на эти метрики, и глядя на панели управления, и говоря о панелях управления, и придавая значение панели управления, и все это могло быть направлено на реальные проблемы, которые на самом деле происходят. Теперь есть правильный способ использования общих метрик. Есть такой продвинутый трюк джедая, который >> вы можете сделать, как только освоите анализ ошибок.
Это будет иметь смысл. И что вы можете сделать, это взять ваш показатель галлюцинаций. Вы можете оценить этот общий показатель галлюцинаций по всем вашим трассировкам и отсортировать трассировки по показателю галлюцинаций.
Хорошо? И вы можете увидеть, вы можете провести анализ ошибок и посмотреть, соответствует ли наивысший показатель галлюцинаций, например, хорошо, вы можете начать делать умную выборку с этими различными общими показателями. Вы можете использовать эти общие показатели, как все эти общие показатели, в качестве механизма выборки, чтобы увидеть, есть ли там что-то интересное. И вы обнаружите, что иногда там есть интересные вещи. Иногда это не совсем галлюцинация, а что-то другое. И вы можете как бы увидеть, полезны ли какие-либо из этих показателей, но вы не должны просто сообщать о показателях. Никогда не следует сообщать о показателях как есть. Вероятно, не следует использовать показатели, но вы можете использовать их как мета-инструменты.
Понял. Хорошо. Но, но как бы гораздо важнее выявлять проблемы с вашим продуктом.
Да.
Хорошо. Тогда еще одна вещь, это как бы, э-э, и, возможно, это больше вопрос, сколько из того, что мы только что рассмотрели, мы должны сделать, прежде чем мы даже запустим продукт? вы знаете, типа, должны ли мы попытаться собрать кучу судей и, вы знаете, сделать кучу синтетических вещей, типа, сколько, потому что как только вы запускаете, вы на самом деле получаете реальный сигнал, верно? Я имею в виду, да. Сколько из этого мы должны сделать?
Да, я бы не стал увлекаться оценками, особенно в начале. Я бы, я бы определенно посмотрел на много данных. Эм, и просмотр данных включает использование их самостоятельно.
Хорошо. Я имею в виду, если это, как говорится, если вы создаете инструмент для себя, то вы являетесь пользователем n равно один. Так что вам не нужно просто использовать его самостоятельно, и вы знаете, что вы делаете анализ ошибок, просто будучи живым и используя свой инструмент, если вы действительно его используете, это нормально. Вам не нужно делать все это. Это как когда это выходит за рамки вашего понимания, когда начинает, вы знаете, быть много пользователей или много всего происходит в разных случаях использования. Да. Тогда вы можете подумать, хорошо, тогда вы можете увидеть, где эти данные могут быть полезны >> или, возможно, вы знаете, вы можете развернуть для 5% пользователей, и, вы знаете, возможно, они получат плохой опыт, но затем вы можете начать получать реальные данные для улучшения.
Да, тогда ничто не сравнится с реальными данными.
Понял. И как бы, эти вещи с лайками, это просто полностью вы, сестра, или, или, вы догматичны в этом, от одного до пяти, стоит ли вам держаться подальше от этого? Я бы сказал, что я не видел, чтобы вы были чрезвычайно дисциплинированы, чтобы использовать это правильно.
Хорошо.
Эм, у вас должны быть очень четкие критерии. Вы должны убедиться, что все откалиброваны по этим критериям. Эм, и это обычно не идет хорошо, и для большинства компаний это добавляет массу сложности. Я бы сказал, что это экспоненциальная сложность по сравнению с бинарными оценками. И поэтому я просто не видел, чтобы это делалось в большинстве случаев правильно. Есть некоторые редкие исключения, когда это нормально, но обычно это, вы знаете, и я давлю на команды, чтобы они сказали: эй, можем ли мы просто сделать это бинарной оценкой? Например, есть ли точка, где это достаточно хорошо против недостаточно хорошо? Мы можем это сделать.
Но, чувак, тогда откуда это берется? Например, почему команды продолжают делать это?
Да, потому что это своего рода привлекательная идея, верно? типа, нас всех оценивали, у нас есть система оценок в школе от А до F, типа, вы знаете, ничего не бывает черно-белым, типа, мы хотим иметь такую высокоточную оценку, но проблема в том, что что, что вы вообще будете делать с этой высокоточной оценкой, типа.
да, это просто создает ощущение ложной точности, верно, это как, вы знаете, я получил три против четырех, что это вообще значит, типа, да, типа, люди даже не могут отличить три от четырех.
да, да, да, большинство, большинство людей не могут, и это просто теряется в соусе, и уже, вы знаете, это уже достаточно сложно. Вам нужно действительно уменьшить сложность во всем этом и быть прагматичным в этом.
Хорошо, чувак. Это, это супер потрясающий разговор. Итак, так что, я думаю, давайте вернемся к дебатам в Твиттере. Имеют ли значение оценки? Это имеет значение, если вы правильно решаете проблему, если вы на самом деле решаете реальные проблемы.
Да, это очень хороший вопрос. Имеют ли значение оценки? Да, я бы сказал, что оценки не существуют в изоляции. Если вы просто попытаетесь сделать, если вы попытаетесь оценить и увлечетесь оценками, это, вероятно, навредит вам. Что вы хотите сделать, это определенно заземлиться в анализе данных, в части просмотра данных.
И как бы, вы знаете, все говорят, посмотрите на свои данные, но я, я думаю, э-э, трудно понять, что это значит. То, что мы прошли сегодня, на самом деле показывает вам, что это значит, и, надеюсь, развеет мифы о том, что такое смотреть на данные. Но это должно быть, это как очень тесно связано с оценками, и я, я говорю, что это оценка, как эти данные, этот просмотр данных, подсчет, я просто говорю вам, вам, потому что вы не можете делать оценки без этого.
Да. Это не самая супер-сексуальная часть этого, но да, это самая важная часть этого.
Да.
Да. Понял. Имеет смысл. Хорошо, чувак. Хорошо, мужик. Я, я, я думаю, вы убедили меня пройти ваш основной курс сейчас. Так что, э-э, можете ли вы рассказать о своем курсе и, э-э, когда вы его преподаете, и есть ли у вас скидка для людей?
Мы преподаем курс по оценкам, где мы проводим вас через сквозной подробный процесс того, как правильно проводить оценки. Мы углубляемся в такие темы, как, хорошо, как вы оцениваете свои RAG-системы? Как вы оцениваете извлечение? Как вы оцениваете агентов? Эм, как вы справляетесь со всеми видами крайних случаев, с которыми вы можете столкнуться? Как вы делаете это эффективно? Например, как вы на самом деле читаете трассировку, чтобы, вы знаете, спасти себя от всех сложностей, которые могут возникнуть? и как вы справляетесь с этим усилием? И мы, мы обучили более 2000 студентов, включая многих людей из Google, Open AAI и тому подобное. Эм, вы знаете, крупные лаборатории действительно заинтересованы в этом, потому что, вы знаете, они сосредоточились на бенчмарках базовых моделей, но мы говорим о оценках, специфичных для приложений, например, если вы создаете приложение, что это такое? И эта оценка очень отличается.
Да. Да.
И так, э-э, я преподаю курс Шри Шанкара. Шри Шанкар также пишет об оценках уже много лет и проводит много исследований в этой области. Так что у нас обоих есть опыт в машинном обучении и науке о данных, а также в разработке программного обеспечения. Вы знаете, курс длится четыре недели. Мы предоставляем студентам много ресурсов. Так что у нас более девяти часов консультаций.
Да.
Э-э, мы даем студентам э-э помощника по оценкам ИИ. Так что это как все, что мы когда-либо говорили об оценках публично в курсе, сообщениях в блогах, выступлениях, статьях, что угодно. Э-э, мы поместили это в ИИ и даем это вам в качестве помощника. Так что, вы знаете, это современный курс.
и вы должны иметь оценки вдобавок к этому тоже, вы знаете.
Да. И мы делаем электронные письма. Да, мы делаем оценки вдобавок к этому. Это первый раз, это первая когорта, для которой мы это делаем. Э-э, так что следующий будет в октябре. И поэтому мы также даем людям 160-страничную книгу по оценкам, которую они могут взять с собой. Так что там много ресурсов, это хорошее сообщество, и мы предлагаем сообществу Питера скидку 35%.
Отлично, чувак.
Так что, пожалуйста, смотрите ссылку в описании.
Отлично. Да, чувак. Я, я лично многому научился из этого. Мне нужно пересмотреть, как я провожу оценки. Так что, так что да, я, я надеюсь увидеть э-э людей там. Определенно хочу пройти курс в октябре. Большое спасибо, Хэл, за то, что поделился своими знаниями, и э-э, продолжай выкладывать не-знание коробка, чувак, типа, в социальных сетях.
Да, большое спасибо. Спасибо, что пригласили меня.