📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Как нейросети дали компьютерам "зрение"?

ПостНаука3:19

Transcription

Человеческое зрение начинается с глаз, который преобразует свет в электрические сигналы и отправляет их в мозг. Там сигналы обрабатываются: сначала распознаются базовые элементы, такие как цвет и контуры, затем более сложные и мелкие детали. Нейронные сети работают схожим образом. Как нейросети дали компьютерам зрение? Нейросети научили компьютеры видеть, то есть распознавать и интерпретировать визуальную информацию. Работа человеческого мозга – так же.

Ещё в 2014 году разработчики Яндекс внедрили нейросети в поиск по картинкам. Алгоритм стал находить не только точные копии изображений, но и схожие по смыслу. Главным прорывом стали свёрточные нейросети (convolutional neural networks, CNN), специально созданные для обработки изображений. Вместо анализа всей картинки сразу, сеть использует маленькие фильтры. Они же свёртки, которые сканируют её по частям, выделяя контуры, текстуры и формы. Каждый последующий слой свёрток опирается на предыдущий, что позволяет ему собирать из простых свойств более сложные – например, лица, дома или котиков. В процессе обучения сеть определяет, какие участки и признаки изображения важнее, и точность распознавания объектов становится всё выше.

Для обучения нейросетей нужны большие объёмы меченых данных – миллионы изображений с подписями, что же именно на них изображено. Такие массивы данных называют датасетами. Этот процесс обучения включает анализ и исправление ошибок на каждом этапе, благодаря чему зрение сети становится всё острее. До нейросетей компьютеры анализировали изображения по жёстко запрограммированным алгоритмам. Они работали, но были существенно ограничены в гибкости.

Сегодня же появилось множество новых возможностей, таких как автоматизация распознавания объектов (лиц, автомобилей, предметов или жестов), обработка сложных сцен (производят, например, камеры автономных автомобилей), распознавание текста (OCR) из изображений. В поиске с Яндекс.Нейро используется мультимодальная VLM нейросеть. Пользователи могут задавать вопросы, комбинируя текст и картинку, и получать точные результаты.

Нейросети дали компьютерам возможность анализировать визуальные данные, повторяя некоторые принципы человеческого зрения. Однако, в отличие от нас, машины не видят в прямом смысле этого слова – они лишь вычисляют и выявляют паттерны. Это стало возможным благодаря комбинации архитектуры, мощных вычислительных ресурсов и огромных массивов данных. Но главная особенность нейросети – это способность обучаться и адаптироваться к новым задачам. Именно такое самообучение позволило дать компьютерам пусть пока и несовершенное, но зрение. И кто знает, быть может однажды андроиды смогут увидеть электронных овец. [музыка]