Transcription
Как грамотно и максимально чётко конвертировать различные файлы из различных форматов, таких как PDF, doc, HTML, аудиофайлы и многое другое, максимально чётко сохранив всю структуру, все таблицы, все колонки, все абзацы, все параграфы, скажем, в Markown файл для того, чтобы с ним дальше вам было удобнее работать, привести всё в один в одну, так скажем, структуру, либо же использовать данный Mardown файл в последующем, чтобы построить код той рак, который будет максимально чётким.
И это всё можно сделать с помощью Dockling. Это открытая Open Source библиотека от IBM Research. И сегодня я покажу вам, что она может и как она работает. Так что оставайтесь, будет очень интересно.
Смотрите, у меня есть такой вот research paper с Deep Neral Network для определения точек захвата на rigs, то есть на твёрдых предметах. В общем, есть вот такой вот resarch. Он в PDF-формате. Я хочу сохранить всю структуру, все эти таблицы, все эти формулы, полностью сохранив всё. Главная табличка для меня с этими результатами перевести всё это в Mordown формат, чтобы я мог с этим работать. И в дальнейшем данный Mardдау файл я хочу засунуть в rec. То есть сначала мне нужно будет его нарезать на чанке. С помощью embeding model я переведу всё это в vector embedings и положу всё это в векторную базу данных и в последующем построю adentic rec. В общем, такой вот resarch.
Давайте я покажу вам, как это можно сделать с помощью доклинка. Покажу вам, как это всё может работать, и потом мы перейдём к теория и поподробнее рассмотрим, что же такое доклинг. Для этого у меня уже с помощью доклинка прописан скрипт, который из PDF-формата трансформирует, соответственно, файл в Markфайл. Давайте просто его запустим. Я покажу, на что вам вообще способен данный DocL. Это очень интересная вещь с множеством нейронных сетей, которые ранятся локально на вашем железе.
Итак, скрипт в моём случае называется conv pdf.pie. Давайте просто его запустим, и я покажу вам, как, соответственно, Docking работает и как он хорошо трансформирует PDF-файлы в maram файлы. Ну, в принципе, и другие любые aудиок, HTML и всё-всё в этом роде. Он отлично конвертирует.
Так, у нас уже готов Mordownфайл. И давайте рассмотрим подробнее данный Mardownайл. Скажу сразу, конечно же, данный инструмент работает не на 100% идеально, но если сравнивать его с другими инструментами, такие как PDF, например, а то в случае, если мы рассматриваем более сложные PDF-файлы и вообще другие файлы с таблицами там и тому подобное, главная таблица меня очень интересует, думаю, что многих тоже, с сохранением структуры, с абзацами, параграфами, то, конечно, данный доклинг работает лучше, чем его, так скажем, конкуренты, как минимум, потому Потому что здесь есть нейронные сети, которые очень сильно помогают в этом вопросе.
Как видим, у нас всё очень неплохо конвертировалось в Mardown Файл. Всё чётко, всё есть. Конечно, не на 100%, вы должны это понимать, что не прямо 100% good, но реально очень-очень неплохо это всё работает. Давайте найдём просто таблицу, я вам покажу. Бам. Смотрите, табличка. Запоминайте данную табличку. У нас здесь есть методы input, grasp accuracy, speed, и мы можем сравнить её с табличкой, которая, соответственно, в PD-формате. Запоминаем цифры 98 и 263. Внизу 98,263. А верхний первый ролл у нас 97,7 и спид, а, соответственно, 9,9. Всё чётко.
Как видим, структура таблицы у нас полностью сохранилась. И это реально одна из самых главных фишек Доклинка. Он при, соответственно, форматировании из ПДФА, из Doc, xк, из HT, почти из любых форматов в, в принципе, тоже во многие форматы, но самый распространённый - это MarkDФай сохраняет практически на 100% всю структуру документа. Это очень круто. Как видите, структура документа здесь не такая уж и лёгкая. Здесь есть таблички, формулы всякие и тому подобное, абзацы, параграфы, как бы это всё не так просто сделать, как вы могли понять.
Следующая табличка. Как видим, всё чётко, всё круто. Здесь тоже есть прочерки, как бы здесь всё, всё сохранено. Как видите, я вам показываю на наглядном примере, как это работает. Всё чётко, как бы все таблицы сохранены, и это очень круто. Все параграфы, все абзацы.
О'кей, я пошёл дальше. Я начинковал данный мордан файл. Я сделал, а, вектором бединги из чанков и сделал свой agent crack, то есть agent Crack. И там у меня сейчас лежит, соответственно, данный как бы файл, и по нему я могу задавать вопросы модели.
Смотрите, давайте перейдём обратно сюда. Например, меня интересуют, а, тренинглоссы в данном фреймворке. И здесь у нас есть три тренингса. Первое - это, а, grass detection loss, потом, а, semantic segmentation loss и grasp refinement loss. Я хочу спросить, соответственно, у Анти Крега, какие вообще лосу есть у данного фреймворка, и посмотрим, что он нам ответит. Для этого я сделал, конечно же, свою векторную базу данных, всё заченьковал Vector Embedings и написал свой agentic. Давайте его запущу и посмотрим, как хорошо он работает в связке с доклингом.
Супер. Database connected. Напомню, сейчас в данной датабазе лежит, соответственно, данный PDF просто в другом формате, в векторном формате. И давайте зададим вопрос. Так. И вот мой вопрос: which losses does this deep naral network have? Что означает, какие loss у данной Deep Neral Network есть? Давайте нажмём Enter. Ждём, когда проработает. Конечно же, это Crack, это всё не так быстро происходит, но, как видим, это не заняло много времени.
Так, и у нас есть отличный ответ на вопрос. Данная глубокая нейронная сеть имеет, а, последующие лосы. Первое, grass detection loss, как я и говорил, learning the grass detection task. Дальше semantic segmentation loss aited. В общем, дают описание, кстати, чёткое описание. И игра loss и тоже чёткое описание. Эти loss is combine in composite loss function, как мы видели функцию и by specific hyper parameter lлямда. Как видим, так оно и есть. Всё чётко. То есть мы можем уже с помощью лмки чатиться по данному документу. Она также указывает source на случай, если у нас будет множество сорсов.
Как видите, doклин - это супер мощный инструмент. С ним можно делать реально множество очень крутых вещей. Я им пользуюсь, в принципе, уже на постоянной основе. Мне он очень нравится. В общем, если вы хотите более подробно углубиться в доклинг на практике, это всё будет в Rцверity. Ссылочка будет в описании под этим видео. Обязательно переходите, там будет куча практики по доклингу. Также мы рассморим там Creck и тому подобное. А сейчас мы переходим к теоретической части. Я вам расскажу более подробно про доклинг. и мы рассмотрим, как он работает в теории, какие там есть нейронные сети и тому подобное. Так что поехали дальше.
Итак, Docling. Ещё раз. Dockling - это Open source библиотека от IBM Research. Я думаю, многие из вас знают данную компанию. И в общем их IBM Research создал такую Open source библиотеку для того, чтобы трансформировать файлы из различных форматов в тот же, например, Mark, при этом полностью понимая структуру. То есть Doclling не только не просто текст, а он именно понимает структуру документа с помощью опять же нейронных сетей. И самое крутое, что данные нейронные сети ранятся полностью у вас локально. То есть вы можете работать с, так скажем, приватной датой, потому что данная дата, она не покидает в пределы вашего железа. То есть всё происходит у вас локально, никуда ничего не сливается, всё может работать без интернета, и это супер круто. Это очень-очень крутая фишка.
Давайте рассмотрим, как работает Docklingн более подробно на примере PDF-файла. Опять же, как я говорил ранее, он может работать с разными форматами, даже аудиоформатами, что тоже супер круто. Я его тестил, он отлично с ними работает. Ну давайте рассмотрим именно а PDF-файл. Допустим, у нас какой-то PDF-файл, какой-то resarch, там есть какие-то таблицы, картинки, да, множество всего.
Итак, первое. Скрипт просто получает PDF-файл. Дальше, второй этап. Данный PDF-файл идёт в нейронную сеть, которая у них называется Layout Model. Что делает данный layаout моде, который, опять подчёркиваю, ранится локально, что суперважно, что вы можете работать с приватной даной. А данная layout model находит таблицы, она их просто находит. Она создаёт такие, знаете, bounding а boxes, находят таблицы, заголовки, параграфы, находят изображения, а и всё в этом роде. Она создаёт такие bounding боксы вокруг, так скажем, каких-то вещей. Допустим, вот у нас есть параграф Bounding Box, потом у нас таблица есть, да, это layаout моду создаёт просто какие bounding box вокруг, так скажем, а вещей.
После данной layout model у нас идёт специальная модель под названием Table Former. И она уже извлекает таблицы. То есть, допустим, данный layout model находит какую-либо таблицу, обозначает её в bouting box. И дальше table model уже извлекает данную таблицу. извлекая данные с сохранением структуры, что суперважно. Всё это, конечно же, а доступно с помощью нейронных сетей.
Дальше опционально у них есть ещё OCR модель. Давайте здесь напишем вот так вот такую стрелочку, а OCR, которая, соответственно, тоже работает опционально. Она, в общем, в основном там для отсканированных, а, PDF используется Easy allir для распознавания текста и изображения на PDF файлах. Ну, это тоже очень опционально, она не всегда используется, но, кстати, у них неплохая OCR модель, которая ранится тоже полностью локально, что супер круто.
Дальше всё это объединяется. Всё это объединяется в один, так скажем, файл, порядок чтения, там все таблицы, вся структура, все абзацы, а, извлекаются метаданные и тому подобное. В общем, всё это, так скажем, а, формируется в один такой формат. Собирается формат под названием Dockling а Doc, да?
Дальше, что с этим Dockлингдоком можно делать? Это всё можно настроить в скрипте. У них очень крутая библиотека, и с ней работать, кстати, не супер сложно. То есть всё супер понятно, в принципе. Там, условно говоря, в пару строчек можно реально конвертировать PDF в Mark. В общем, дальше это Doc Link doc можно преобразовать, допустим, в Markфайл тоже JSON файл можно, да, преобразовать. Также данный docling doc можно использовать для findтюнинга, да? То есть у вас, допустим, куча пдфок с какой-то важной информацией, которая поможет натренировать вашу лэмку или другую нейронку. Вы с помощью доклинга всё это, так скажем, собираете в один единый формат и потом используете эти данные для фантюнинга, что тоже очень круто.
Дальше, конечно же, можно использовать драга, что я и сделал. В общем, ребята, если вы искали способ конвертировать различные файлы Markда, Jon для фантюнинга, для рега, я знаю, что многие с этим сталкивались, с этой проблемой. В общем, ваше решение - это Docling. Это отличная open source библиотека.
Также, ребята, кто хочет получить практические знания, рассмотреть на практике, как работают данные скрипты, как это всё работает, как это всё можно интегрировать, как это всё, а, соответственно, положить в векторную базу. У них есть отличная тема с hybrid chunking. Я про неё тоже очень подробно рассказываю. Также, кто хочет углубиться в Agenticy Crack, получить реальные workflow, которые серьёзно работают, которые вы можете применять своей работе, своих проектах сразу же. Про всё это я рассказываю в RНИ University, так что обязательно переходите. Это будет первая ссылка в описании под данным видео. Там мы более подробно рассмотрим доклинг именно на практике. То есть там будет чистая практика, то, что многим реально не хватает, закроя много ваших болей, и вы сможете на практике использовать доклинг в ваших проектах, в вашей работе, в ваших задачах. Так что я благодарю вас за просмотр. Увидимся в RНЕ University. M.