Transcription
Многие люди пытаются изучать ИИ с помощью руководств. Но внутри индустрии настоящие эксперты учатся, читая статьи. Я узнал это в 2017 году, когда был менеджером по инженерии в Meta. Вышла статья под названием "Attention Is All You Need". И эта статья изменила всё. Поэтому сегодня я проведу вас через пять статей, которые дадут вам прочную основу, как их эффективно читать и где находить больше статей, не теряясь. И кстати, это видео спонсируется Warp, но о них позже. Давайте начнем с того, как на самом деле читать статьи. Вот что делают большинство людей. Они находят статью, а затем пытаются читать ее как роман, пытаясь понять каждое слово в статье. И это не сработает. Итак, позвольте мне дать вам пять советов, которые действительно работают при чтении статей. Совет первый: ставьте цели, которые действительно имеют смысл. Эндрю Янг, он соучредитель Coursera. Он также известен тем, что преподавал множество лучших курсов по машинному обучению. И он говорит: "Если вы хотите получить базовое понимание темы, прочитайте от 15 до 20 статей. А если вы хотите более глубокой экспертизы, прочитайте от 50 до 100". И это хорошая цель, если вы стремитесь к исследовательским ролям экспертного уровня в конкретной области. Но честно говоря, это довольно высокая планка. И если вы только начинаете и еще не определились, на чем хотите сосредоточиться, я бы начал примерно с пяти статей. Когда вы их закончите, отпразднуйте, потому что читать эти статьи непросто. Затем спросите себя, хочу ли я продолжать заниматься этой темой, или я хочу узнать что-то другое? Главное — не выгореть, использовать короткие циклы, пять-десять статей, рефлексировать, повторять и менять направление. Выберите тему и составьте список. Например, если вы хотите изучить обработку естественного языка или Азиатские языки, или построить лучшую основу в ИИ, тогда составьте список из пяти статей. Итак, если ваша цель — получить хорошее понимание основ, я бы начал со статьи "Attention Is All You Need". Эта статья представила трансформеры, которые сделали возможными современные большие языковые модели, и я расскажу о четырех других подобных. Но сначала позвольте мне дать вам метод, который я использовал для чтения, чтобы вы не застряли при их чтении. Теперь, когда у вас есть список статей, которые вы хотите просмотреть, просмотрите заголовки, аннотации, рисунки и графики. Потратьте около 10% своего времени на каждую статью, чтобы решить, стоит ли она более глубокого чтения. Это больше похоже на сортировку, а не на изучение. Если статья кажется вам не по теме, отложите ее. Никакого чувства вины. Найдите другую статью, которая подходит лучше. Затем для статей, которые прошли ваш тест на просмотр, не начинайте с первой страницы и не продирайтесь через них. Сначала прочитайте введение и заключение. Эти разделы расскажут вам, что пытается сделать статья и чего, по утверждению авторов, они достигли. Затем просмотрите раздел "связанные работы", чтобы увидеть, вписывается ли она в область. Если все это имеет смысл, погрузитесь в основной метод или результаты. Если это тоже звучит хорошо, тогда вы действительно начинаете читать остальную часть статьи. Но не стесняйтесь пропускать любые части, которые сразу не имеют смысла. Даже эксперты делают это, когда читают. Просто двигайтесь дальше и вернитесь к любому разделу, если он вам понадобится позже. И единственный способ стать лучше в этом — это практика. Со временем вы научитесь распознавать общие закономерности. Вы будете знать, куда смотреть в первую очередь, будете быстрее читать рисунки, быстрее понимать, и будете знать, какие разделы для вас важнее. Так что дайте себе время. Это долгосрочная инвестиция, а не спринт на одну неделю. Теперь, когда у вас есть стратегия чтения, давайте применим ее. Статья номер один представила трансформер. Вот аннотация, в которой в основном говорится о том, как до этого большинство языковых моделей использовали рекуррентные нейронные сети, которые обрабатывали текст по одному слову за раз. Трансформер отказался от этого. Вместо этого он использует нечто под названием самовнимание. По сути, когда модель смотрит на любое слово в предложении, она может мгновенно взвесить важность всех других слов одновременно. Это сделало обучение намного быстрее, и это позволяет моделям обрабатывать гораздо более длинный и сложный контекст. Эта статья сделала возможными большие языковые модели, что является нашей следующей темой. Следующая — статья GPT3 от 2020 года, которая показала, что если масштабировать модель, GPT3, например, имела 175 миллиардов параметров, модель может развить эмерджентные способности, что означает, что она начала проявлять новые способности, на которые она не была напрямую обучена. Более конкретно, обучение в контексте, что означает, что модель может выполнять новые задачи без какой-либо донастройки. Если вы просто дадите ей несколько примеров в подсказке, и она разберется — перевод, суммаризация, что угодно, что вы хотите сделать. Это сместило фокус с того, как мы обучаем модель делать все, на то, как мы даем подсказки модели. Таким образом, качество ваших инструкций контролирует качество вывода. И именно поэтому инженерия подсказок стала такой большой проблемой. И если вы больше занимаетесь подсказками, чем кодированием, ознакомьтесь с Warp. Среды кодирования, управляемые подсказками, такие как Warp, станут новым способом создания готовых к производству продуктов с их новым выпуском. Warp — это место, где IDE и CLI наконец сливаются в единую бесшовную среду для кодирования с ИИ-агентами. Вот что это означает на практике. Warp объединяет три вещи в одном. Вы начинаете с подсказки на естественном языке, чтобы описать, что вы хотите построить. Warp генерирует код, и вы можете перейти непосредственно в его встроенный редактор для проверки и доработки. Затем вы развертываете в продакшн непосредственно из встроенного терминала — все в одном рабочем процессе. Он работает на протяжении всего жизненного цикла разработки, бесшовно управляет несколькими долгосрочными агентами и имеет встроенное редактирование, поэтому вам не нужно постоянно переключаться между инструментами. Warp активно используется более чем 700 000 инженеров, специалистов по данным и менеджеров по продуктам, включая команды в 56% инженерных организаций из списка Fortune 500. Warp бесплатен для использования, и вы можете попробовать их премиум-функции всего за 1 доллар в первый месяц с кодом GAN. Ссылка в описании. Теперь вернемся к статьям. Синтетические данные становятся решающим фактором для обучения больших языковых моделей, потому что этим моделям требуется огромное количество высококачественных данных для обучения. Из реального мира можно получить лишь ограниченное количество данных. Поэтому эта статья посвящена искусственной генерации обучающих данных, обычно создаваемых моделями, такими как GPT4, для помощи в обучении или донастройке других моделей. Согласно этому исследованию DeepMind, есть три ключевых урока. Синтетические данные определенно нужны, но они лучше всего работают в сочетании с реальными данными. Обучение только на синтетических данных может привести к деградации качества со временем. Поэтому нам нужно проводить проверки, чтобы убедиться, что данные точны. Следующая — статья RAG от 2020 года. RAG означает Retrieval Augmented Generation (генерация с дополненным поиском). Это современное решение для устранения самых больших слабостей больших языковых моделей, таких как галлюцинации, устаревшие обучающие данные и проблема "черного ящика", когда мы не понимаем, откуда берется ответ. RAG работает, получая свежую релевантную информацию из внешней базы данных перед тем, как модель ответит на ваш вопрос, поэтому она не ограничена тем, на чем она изначально была обучена. Этот обзор разбивает, как RAG развивался со временем через три фазы. Native RAG — это оригинальная версия, которая просто извлекает документы и передает их модели. Advanced RAG более оптимизирован с более умными шагами предварительного и последующего извлечения. Затем есть Modular RAG, наиболее настраиваемый подход, где каждый компонент может быть заменен или настроен для использования в конкретных областях. Эта техника делает ответы более точными, актуальными и проверяемыми, что помогает повысить общую надежность систем ИИ. Эта последняя статья — более недавняя статья о MCP, что означает Model Context Protocol (протокол контекста модели). До MCP, если вы хотели, чтобы ваши ИИ-модели взаимодействовали с внешними инструментами, такими как API, базы данных или корпоративное программное обеспечение, вам приходилось вручную создавать пользовательские коннекторы для каждого инструмента и каждой модели. MCP — это слой, который дает им возможность выполнять более сложные многошаговые действия. ИИ может получать данные из одной системы, обрабатывать их и отправлять запрос в другую систему. Это важно, потому что RAG дает моделям реальную информацию, а MCP позволяет им предпринимать реальные действия. Таким образом, вместе они соединяют ИИ с реальным миром. Это направление, в котором движется ИИ сегодня. Хорошо, вы готовы начать читать. Допустим, вы закончили пять рекомендованных мной статей и хотите найти больше. Где их найти? Ну, вот четыре источника, которые мне нравятся, и как их использовать. Первый — Hugging Face. Этот сайт организует статьи с моделями, наборами данных, популярными статьями по многим областям, таким как генерация изображений, генерация видео и многое другое. Его также очень легко просматривать. Этот ИИ имеет список статей, начиная с 2010 года. Они организованы по темам и эпохам, поэтому полезно, если вы хотите проследить, как развивалась область со временем. И если вы хотите увидеть историю от ранних идей до текущего состояния, вам следует начать здесь. Deep Learning Monitor показывает горячие и свежие статьи, или вы можете добавить любую интересующую вас тему, чтобы отслеживать их. Вы также можете фильтровать по неделям или месяцам, потому что новые статьи выходят почти каждый день. Таким образом, вы можете настроить мониторы с ключевыми словами для интересующих вас областей. Так вы получите небольшой сфокусированный поток для проверки архива. Archive — стандартное место, где исследователи публикуют статьи. Он не всегда организован самым удобным способом. Поэтому полезно, если вы уже знаете, что ищете. Используя функцию поиска, вы можете искать интересующие вас ключевые слова. Я также веду короткий список на своем веб-сайте с этими ссылками, а также другими бесплатными ресурсами, такими как книги и новостные рассылки. Ссылка в описании. Теперь YouTube думает, что вам следует посмотреть это видео следующим. Так что я увижусь