Transcription
Если мы не обновляли свои знания в последние 5 лет, мы все больше не умеем гуглить. Нужно принять как данность. Пока поиск работал нормально. Это была базовая техника для хакеров. А теперь я поздравляю всех нас. Теперь это необходимая базовая техника просто найти нормальную информацию. Мы привыкли видеть гигантов и за ними мы не видим всего остального интернета. Не давайте ваши данные, не отдавайте, не кормите ими чат GPT.
Привет, меня зовут Самат Галимов, и это подкаст Запуск завтра. Здесь я пытаюсь разобраться, как устроены технологии, которые меняют нашу жизнь. А помогают мне в этом профессионалы, с которым можно поговорить простым человеческим языком. Это наш первый видеосезон подкаста Запус завтра. Раньше мы выходили только в аудио. Наш YouTube канал совсем новый. И чтобы алгоритмы нас заметили, нам очень нужна ваша поддержка. Пожалуйста, подпишитесь на наш канал, поставьте лайк этому видео и напишите в комментариях, как вам видеоформат, ну или любой комментарий вообще. Это нам очень поможет найти новую аудиторию и продолжить делать видеоэпизоды. А если вы нас сейчас не смотрите, а слушаете на аудиоплатформах, то можете найти видео по ссылке в описании к этому эпизоду.
Сегодняшний эпизод о поиске в интернете. Если вам последнее время кажется, что получать полезные ответы в сети стало ужасно сложно, то не переживайте, проблемы не в вас. В этом выпуске мы разберёмся, почему испортился Google поиск и как искать эффективно. Заново нас гуглить научит Павел Банников. Человек, чья работа - это находить и проверять информацию.
Партнёр этого сезона провайдер IT-инфраструктуры Select. В середине выпуска вы услышите нашу партнёрскую рубрику. В ней мы рассказываем истории стартапов на заре интернета. Их опыт - это огромная база знаний для решения современных бизнес-задач.
Привет. Скажи, пожалуйста, как тебя зовут и чем ты занимаешься?
Привет. Меня зовут Павел Банников. Занимаюсь тем, что ищу и верифицирую информацию. То есть я профессиональный фактчекер и занимаюсь факчеком с 2005 года. Э, вот я вот в факчеке получается уже 21 год работаю на факчекинговую редакцию Проверено и параллельно развиваю свой расследовательский стартап, э, который, я надеюсь, будет очень полезным в будущем для журналистов-расследователей и не только.
Я часто слышу, что пояс в интернете испортился. Что обычно имеет в виду?
Ну, что обычно имеет в виду? что искать информацию стало сложнее, а что выдача замусорена. И это действительно так. Это правда. За последние 5-6 лет поиск в основных глобальных поисковых машинах действительно испортился. Он испортился в Гугле, он испортился в Яндексе, чуть поменьше испортился в БНГе. Ну вот три основных машины. Основная, мы понимаем Google, то есть 70-80% пользователей в зависимости от страны используют Google Chrome как браузер и, соответственно, Google как поисковую машину. И вот этот поиск испортился. Связано это с рядом целым причин. Факт остаётся фактом. то, что 7 лет назад ты мог найти с лёгкостью, просто вбив а простой запрос в поисковую строку. Теперь для того, чтобы эту информацию найти, придётся либо потратить довольно большое количество времени, и то не факт, что ты что-то найдёшь, а либо, и это, на мой взглядать, единственный выход, переучиваться и учиться работать с поисковыми машинами заново. То есть всё, мы все больше, если мы не обновляли свои знания в последние 5 лет, мы все больше не умеем гуглить. Нужно принять как данность.
Не буду с этим спорить, но такой может быть немножко глупый вопрос. А что, разве не всегда было так? Недавно в Инстаграме был тренд. Я в 2016. Можешь, пожалуйста, рассказать, как ты искал в интернете 10 лет назад? Может, даже не не только ты, вот в целом как мы искали в интернете 10 лет назад и что мы находили?
10 лет назад. 2016 год. Да, верните мне мой 2016. А если в 2016 году ты искал информацию в интернете, во-первых, первые несколько страниц выдачи, сконцентрируемся на Гугле, они были гораздо более релевантны. В них было меньше, а, засошенных ссылок, в них было меньше рекламы, реклама очень чётко, а отделялась от основной поисковой выдачи, её легко было отсекать. ты находил буквально там считанные минуты то, что тебе нужно с помощью достаточно простых запросов, не вдаваясь в глубокий поиск, в то, что такое операторы поиска и так далее, и так далее. Ты просто получал нужную выдачу на первой, максимум второй странице и в Гугле, и в Яндексе эти системы были заточены на то, чтобы быть тебе полезными. Но, как мы понимаем, деньги часто всё портят, несмотря на то, что там Google глобальная корпорация, огромная, у неё много других продуктов, на которых она зарабатывает. В 2019 году корпорация решила, что нужно зарабатывать и на поиске, и зарабатывать больше. То есть основной задачей стало теперь не дать пользователю то, что ему нужно быстро, а максимально удержать пользователя внутри поиска, чтобы он посмотрел как можно больше рекламы, да? То есть нужно ухудшить поиск, но ухудшить его ровно до той степени, чтобы пользователь не ушёл в другую поисковую машину. То есть он по-прежнему может что-то найти, но теперь у него на это уйдёт больше времени. Он посмотрит больше рекламных ссылок, он принесёт больше денег.
Слушай, ты сказал, что много засиошенных ссылок. Во-первых, что это такое? Во-вторых, мне казалось, что SEO всегда был, что измени прямо как-то радикально изменилось.
Ну, не то чтобы радикально изменилось. А что такое SEO? А, Search Engine Optimization, то есть оптимизация страниц под поисковым машину. У Google есть некоторые правила ранжирования страниц, мм, то есть на каком месте в поиске страница вылезет, да? Там там в первые десятки там или где-то, в зависимости от того, а насколько хорошо она оптимизирована. То есть, э, это ключевое слово, которое должно содержаться в заголовке, в метаописании, в вступлении к статье, это определённая длина материала. Это тоже как бы 10 лет назад было по-другому. Сейчас как бы длина материала влияет. То есть там не менее, если я не ошибаюсь, должно быть не менее 300 что ли слов, да? А или 500 слов, точно не помню, но вот какой-тото такой и куча ещё всего разного. Эти правила меняются, и они достаточно понятны. Google об этом публикует каждые полгода. Там как какие-то изменения, отчёты, как теперь ранжируются. То есть в какой-то момент там вспомним тоже 2016, например, стали выше ранжироваться сайты, у которых которые используют защищённые соединения https протокол, а не HTTP, да, а сайты с HTTP стали занижаться в выдаче в поисковой в итоге и так далее, и так далее. И люди пытаются определённые, значит, страницы вывести в топ, переоптимизируя их, э, то есть пытаясь ещё и обмануть алгоритм, то есть оформить страницы так, чтобы они там вылезали в первом а в первой десятке, да. Ну, особенно когда это видно на конкурентных платформах, да, таких, как, например, интернет-магазины, а, сайты, которые что-то продают, какие-то товары, которые делают, которые не уникальны, которые делает кто-то ещё. И вот эти ссылки довольно часто вылезают в топе, а, но они довольно редко релевантны запросу пользователя, потому что там получается это маркетинговые страницы, которые чего-то хвалят, а пользователю нужен обзор вполне себе реальный, адекватный от ээ живого человека. Но этот обзор, скорее всего, оказывается где-нибудь на второй, третьей странице. Полезная информация оказывается где-нибудь в заднице. А на первой странице реклама, которую за которую Google заплатили, да? Соответственно, там видно и переоптимизированные страницы, да, которые заточены на то, чтобы вылезать в поиске. Глобально всё это, как замечательный Cри Doctor, а говорит, что можно перевести на русский как деремофикация. И он говорит глобально обification of services, да, то есть дерьмофикации всех больших сервисов. То есть вот Facebook был, значит, вот таким, да, а и как только он вырос до определённого предела, он вступает в фазуfication. И так происходит со с любым большим сервисом, потому что начинают вступать в конфликт желание пользователя, производителя и рекламодателя. Этот конфликт становится неразрешимым. Вот, собственно говоря, видимо, а Google и Яндекс доросли до этого. Ну, как бы это вот то, что как бы касается, да, самой рекламной модели. Но дальше что пошло? У нас появился и AI. И теперь вот эти AI overview, да, AI ответы, они просто тотальны, что в Google, что в Яндексе. То есть, если до этого, помнишь, были такие плашечки, которые там выводились в либо вверху в Яндексе, либо сбоку в Google, такое краткое описание твоего поискового запроса, что по нему найдено. Раньше они формировались более-менее алгоритмически, без использования генеративных моделей. Теперь эти снипеты формируются с помощью генеративных моделей, с помощью больших языковых моделей. А что это такое? Это, ну, не то, чтобы совсем чёрный ящик, но отчасти, да, потому что модель не понимает, она, ээ, у неё разбиты, значит, слова на токены, она эти токены как-то пересобирает. И как она тебе их пересоберёт в очередной раз, а чёрт его знает. То есть, буквально на один и тот же вопрос, на один и тот же запрос два пользователя из двух разных стран, пользующиеся двумя разными машинами, могут получить диаметрально противоположный ответ. То есть условно я из Казахстана зайду, спрошу, какую книгу в мире крадут чаще всего. Там кто-то зайдёт из России и задаст тот же вопрос. Или кто-то зайдёт из Испании и задаст тот же вопрос. Только я буду использовать MacBook, пользователь в России будет использовать iPhone, а пользователь из Испании смартфон на Андроиде. Мы получим три разных результата. А ещё мы можем получить три разных результата в этих AI снипетах, которые нам выйдут. И, скажем, мне в Казахстане Google ответит, что самая воруемая книга в мире - это Библия. Пользователю в Испании Google скажет, что самая воруемая книга в мире - это Книга рекордов Гиннесса. А пользователю из России Google даст честный прямой ответ. Говорят, что это Библия, но на самом деле это не так. И даст ссылку на мою статью, в которой я исследовал этот вопрос. Вот. И вопрос ещё в том, на каком языке Лэмка обучена. И мы понимаем, что гугловская машина обучена в первую очередь на англоязычном материале. И когда ты спрашиваешь у неё что-то на каком-то другом языке, могут возникать непредвиденные галлюцинации, потому что на этом языке, например, по этой теме информации недостаточно. То есть её просто мало и она плохо проиндексирована. Вот к этому мы пришли в итоге, да? А мозг-то ленивый. И твой мозг, и мой мозг ленивый. Так эволюционно получилось, что мозг самый энергозатратный орган в организме. Он хочет быстро получить конфетку, как бы, и успокоиться. А этот снипет красивый AI Snipт он же он замечательно, он тебе дал быстрый ответ на конфетку, кушай, хороший мой. И ты такой: "О, всё Google дал мне ответ. Ты даже не переходишь по ссылкам". Да большинство не переходит по ссылкам, чтобы понять, из чего этот ответ сложился. Это ссылки там есть. И по ссылкам может оказаться написано совершенно противоположное тому, что было в Инипете. Это тоже часть проблемы с этими и ответами, потому что они могут опираться на достоверную информацию, но выдавать недостоверный результат. И самое страшное, что это не баг, а фича, они так устроены. Ещё одна вещь, геолокация, да, то есть твой IP-адрес, да, где ты находишься, в какой сети. Раньше это обходилось достаточно легко, потому что были национальные домены для Google, например, google.co.uk, google.ru, google.kz. Google.brilлия. Да. И если ты хотел искать в определённом сегменте интернета, ты шёл в национальный домен Google и понимал, что с национального домена тебе, скорее всего, выдаст информацию, связанную, собственно говоря, с той страной, в которой ты хочешь искать. Всё, национальных доменов больше нет. В конце прошлого года их закрыли, теперь один домен Google.com, и ваша выдача определяется тем с которого вы зашли. Вот вы зашли с испанского IP, и у вас будут будет выдача, условно говоря, связанная с Испанией. То есть и прямо внизу там написано, что выдача основано на вашей геолокации, на на вашем расположении. Заходите из другой страны, будет другая выдача и так далее, и так далее. То есть у вас вроде бы настройки, например, там русский язык, да, но IP испанский, и будет куча информации на испанском, которая вам не нужна, например. И геолокация IP - это только один из параметров, который отслеживает алгоритм Google. А там куча параметров. История, да, запросов. Если её не чистить, как бы она влияет. А история передвижений, местоположений, это фиксируется, история пользования другими сервисами Google, какое устройство, какое у него разрешение. И из всего этого машина, а, предполагает, какая выдача вас заинтересует более всего и, возможно, задержит вас больше всего, чтобы вы посмотрели больше рекламных ссылок, но это не точно. Вот. А плюс самое радикальное нововведение, которое ужасное совершенно, это был, если не ошибаюсь, ноябрь 2024 года Google стал ограничивать поисковую выдачу до 300-400 результатов. То есть даже если по твоему запросу в интернете существует >> 50.000 релевантных страниц, но из этих 50.000 ты получишь только 300, каким образом они были машиной отобраны, а чёрт его знает. И попадут ли в эти 300 результатов те результаты, которые нужны именно тебе, теперь ты не уверен, ты не знаешь, мы не знаем, как устроен детально алгоритм, который отвечает за поисковую выдачу. Google, естественно, этого не раскрывает полностью. Одно из исследований, которое проводили в 2025 году, показало, что полезной информации в среднем на страницах выдачи крупных поисковиков не более 25%. 75% занимает рекламная и заоптимизированная, значит, туфта и, собственно говоря, вот эти снипеты AI overview. То есть вот, а, 25% того, что ты видишь на странице, оно может оказаться действительно полезным. Прибавляем к этому всё остальное 300-400, а результатов выдачи и получаем, ну, довольно-таки ужасающую картинку, неприятную. Искать становится действительно сложнее, если ты не владеешь определёнными техниками. А вот если ты этими техниками стремишься овладеть, тогда, в общем-то, ты, конечно, эту всю ерунду видишь, плюёшься, но потом используешь нормальные, значит, ходы и получаешь ээ в итоге то, что тебе нужно. Тут же на первой странице, иногда в первых ээ трёх строчках поисковой выдачи.
Спасибо тебе огромное. Это просто идеальный обзор. Я сейчас подведу коротко, попробую самаризировать это и погоним дальше уже про то, что с этим всем делать. Значит, стало много рекламы, и многие, большинство из первых ссылок, они засишенные, а не реально полезные. Пришёл дурацкий искусственный интеллект, которому пока ещё нельзя доверять. Есть жуткая кастомизация поиска, то есть результаты поиска зависят от того, что я искал раньше и того, какой я, а не от того, какая реальная информация.
Алгоритмизация, я бы так сказал, да, алгоритмизация поиска. Алгоритм управляет твоей поисковой выдачей. Это ещё называется filtering bubbles, то есть такие пузыри, в которых ты которых сидишь и не можешь вылезти, информационные пузыри. Ну и, наконец, количество результатов поиска стало ограниченным. Если раньше нам давали десятки тысяч страниц, теперь только 400.
Партнёр этого сезона компания SelectЛ. В нашей совместной рубрике мы вспоминаем истории стартапов на заре интернета, успешных и не очень. Я часто консультирую стартапы и замечаю, что технические проблемы, с которыми они сталкиваются, не новые. Их переживали IT-предприниматели и 30 лет назад, поэтому можем посмотреть на их опыт и сделать выводы для себя. Сегодняшняя история про масштабирование. Ноябрь 1998 года. Интернет только набирает популярность. Дома он есть меньше, чем у 20% американцев. Google компания в гараже, а за покупками люди ходят в обычные магазины. И тут один предприниматель из долины, Грег Маклемор, решает продавать товары для домашних животных онлайн. Магазин открывается на сайте суперадресом pets.com, то есть питомцы.com. Домен у Маклемера был уже давно. Он чувствовал приближение интернетбума и дальновидно десятками регистрировал сайты с простыми и привлекательными адресами, чтобы потом их выгодно продавать. А PETs.com он захотел сделать своим собственным онлайн-бизнесом и принёс идею венчерным инвесторам. Вместе с инвестициями стартап приходит профессиональное руководство. и очень-очень много денег. Вложился в него, кстати, и Джефф Безс, тот самый, который тогда ещё только запустил магазин amazon.com. Компания начинает расти безудержными темпами. ПЦМ строит огромные склады по всей стране и вкладывает десятки миллионов долларов в рекламу. Их ролик на Супербоуле, главном спортивном соревновании США, запомнила вся страна, а персонаж, носок с пуговицы вместо глаз стал национальным любимцем. После размещения акций PETSCs оценивают в 300 млн долларов. Это 600 млн в текущих деньгах. Казалось бы, успех. На самом деле взрывной рост был иллюзией. Компания не получала прибыли от продаж. Основной товар, корм для животных, довольно дешёвый, но при этом габаритный и тяжёлый. Доставка выходила ужасно дорогой. На каждом заказе PTC теряли деньги. Экономика не сходилась. На рекламу тратили больше, чем зарабатывали. В итоге компания сожгла все деньги и закрылась через 268 дней после IPO. Основной проблемой PETCOM была заведома рабочая бизнес-модель. Продумать на старте, как ваша компания будет зарабатывать, расти и масштабироваться - это предпринимательская база. А пока вы решаете вопросы стратегии, построить устойчивую технологическую основу для онлайн-бизнеса и подготовиться к росту вам поможет SelectTEL. Вместе с Select вы можете создать IT-инфраструктуру под свой запрос. Например, развернуть проект в облаке, гибко адаптировать мощности под задачи бизнеса и подключить видеокарты для работы с искусственным интеллектом и графикой. Сервисы и, кстати, больше пятидесяти удобно настраивать под себя в панели управления. Ссылка в описании.
Довольно страшная картинка. Что делать-то, если я хочу продолжать пользоваться Гуглом? Есть ли какие-то приёмы, чтобы он стал более полезным?
Да, всё старое, тёплое, ламповое. В первую очередь то, что называется операторы поиска. Самое смешное, они называются операторы расширенного поиска. И ирония в том здесь, что они выз призваны не расширить твой поиск, а наоборот его сузить. Вот для того, чтобы получить максимально узкие результаты, да. Например, самый простой оператор в кавычке. Тебе нужно найти точное словосочетание. Ты заключаешь его просто в кавычке. Важно кавычки лапки, не ёлочки. Кавычки ёлочки не работают. Заключаешь это словосочетание любое, в общем-тохо. Два слова хоть одно слово можно заключить, как бы если ты понимаешь, что тебе нужно слово именно в этом написании, да? Заключаешь это слово и словосочетание в кавычке, и тебе ищутся страницы с конкретно с этим словосочетанием. Без кавычек как работает алгоритм? Он берёт все слова, которые есть в твоём запросе, и ищет их везде на странице, то есть в названии, в тексте, в рекламной ссылке, которая сбоку или в подвале там, да? И будут ли это эти слова сочетаться? Ну, как бы, скорее всего, да, что-то будет, как бы, но нет, это не так работает. Если ты заключил что-то в кавычке, условно говоря, какую-нибудь цитату из песни или из стихотворения или какой-то конкретно там, условно говоря, там ну давай что-нибудь, я помню чудное мгновение, да, там кто написал стихотворение, я написал стихотворение, то ты получишь на первой странице в топе выдачи именно страницы, где это словосочетание достаточно просто заключить в кавычке. Это самый простой оператор. Далее тоже простой оператор, минус слово. То есть ты понимаешь, что определённые слова засоряют твою поисковую выдачу, >> и ты можешь убрать страницы с этими словами через минус. Минус и минус слово. Минус слово. То есть можно там 5-10 слов добавить, которые заминусить. И ты постепенно как бы фильтруешь выдачу, и в неё не попадают страницы вот с этими конкретными словами. Условно нам нужен нужны страницы, на которых упоминается Касым Джамарт Кимелевич Токаев. А, но нам не нужно, чтобы там упоминался Владимир Владимирович Путин. Мы, э, ём такаев минус Владимир, минус Владимирович, минус Путин, да, и минус президент РФ в кавычках и и так далее. И как бы убираем всё это, очищаем себе выдачу. Я сейчас о самых таких вот ходовых операторах расскажу, которыми я пользуюсь каждый день. Оператор сайт. сайт, твои точи и, собственно говоря, домен.
Этот оператор позволяет искать на конкретном сайте. То есть ты точно знаешь, что информация была на сайте BBC, но на сайте BBC, на сайте русской службы BBC, по-моему, вообще нет поиска по сайту. То есть просто оф, невозможно. Мы знаем, что что-то выходило на сайте BBC или на сайте The Guardian или на сайте какого-то другого издания. Мы это точно помним, но это был давно. Мы помним, о чём статья, но найти её через поиск просто как бы по сайту невозможно, потому что либо поиск не работает, либо поиска там нет. Тогда мы вбиваем, значит, ключевые слова, по которым мы эту статью можем найти. И оператор наш сайт двоеточие и bbc там tco.uk, да, bbc.com. И, пожалуйста, мы ищем только на этом сайте. Очень хорошо помогает, э, если ты помнишь, где искать информацию. То же самое касается, например, сайтов со статистикой, на которых поисковые движки есть внутренне встроенные, но они работают на всех абсолютно. Из рук вам плохо. Ещё один оператор тип файла файл typйe. То есть можно искать по файлам исключительно файлам PDF, можно файлы Excel, можно doc, можно самые разные файлы, включая, наверное, помню, там ещё и XML-файлы и так далее, и так далее. То есть ты понимаешь, что информация лежит в определённом типе файла, да, и ты вбиваешь свой запрос и тип файла, и тебе выходят только страницы, где есть эта информация в определённом типе файлов. Эти операторы можно комбинировать, можно искать на определённом сайте с определённым типом файла. И тогда ты вообще можешь сузить поисковую выдачу, результаты вплоть до одного результата. То есть, например, можно попробовать так вот найти там документ, единственный документ, которым в котором упоминается, значит, Юрий Михайлович Лушков на сайте Кремля. Вбиваем Лужков сайт двоеточие.ruфа type двоеточие PDF. И мы находим ровно одну страницу, ровно один документ об увековечивании памяти ЮМ Лушкова. Вместо как бы огромного списка мы получили ровно один результат, тот, который нам был нужен. Это касается любого другого сайта. Ну, и, конечно, важные вещи ещё это операторы Inurl, inтек, а, и in title. То есть, понятно, по названию, in URL. Этот оператор позволяет нам искать определённое слово в урле, в адресе. То есть, например, мы видим, есть сайт какой-то большой, а в нём нету очевидной страницы контактов, но мы понимаем, что она там должна быть, да? Мы можем попробовать на этом сайте поискать страницу, в названии которой в в адресе которой содержится словоs или слово about или слово отчёт, например, да, тоже можно поискать в урле, да? А интек, понятное дело, это в теле текста. Intitle - это в заголовке, то есть можем искать только по заголовкам или только по тексту. Плюс опять же, да, всё это мы можно можем комбинировать кавычки, искать в тексте, искать на определённом сайте, искать в определённом типе файлов. А это то, что хакеры называют Google Dorking, да? То есть вот эти запросы называются Dorks, Google Dorkss. А с их помощью можно на самом деле довольно много информации собирать, в том числе информации чувствительной, которая на самом деле лежит в незащищённых директориях сайта. Пока поиск работал нормально, это была базовая техника для хакеров. А теперь я поздравляю всех нас. Теперь это необходимая базовая техника просто чтобы найти нормальную информацию. То есть без этого теперь уже с ограничением в 300 запросов. Некоторую информацию просто невозможно найти. И, пожалуйста, пользуйтесь. Всё это хорошо описано в документации Google, как это работает. Есть по этому поводу мануалы, в том числе написаны мной. Пожалуйста, на сайте Проверено, можно почитать, что такое Google Docs и как это работает.
Друзья, небольшое объявление. Студия Либо-либо, которая выпускает этот подкаст, ещё делает подкасты для компаний и брендов. Либо-либо создают самые популярные аудиопроекты на русском языке, и студии точно знают, как с помощью подкаста решать имиджевые, маркетинговые или HR задачи. Если у вас есть бюджет на подкасты, вам нужен качественный продакшн и вы хотите, чтобы вам помогли лучшие профессионалы, пишите в студию по адресу подкастлиiboliba. Адрес есть в описании.
Смотри, когда я набираю кроссовки в Гугле, вот прямо сейчас Google мне подсказывает магазины в Риге. Ты уже сказал, что результаты поиска на самом деле сильно разные в зависимости от города. Так вот, могу ли я выбрать себе другой город?
Да, можешь. Есть, э, проекты, которые позволяют эту штуку обойти. А, например, один из них называется isearch from, то есть isearchom.net. Ты заходишь туда и можешь выбрать из какой страны ты проводишь поиск, с какого устройства. И в случае с рядом стран даже можешь выбрать город конкретный, из которого ты якобы сидишь. И эта информация отправляется в Google, и ты получаешь результаты, как если бы ты находился там, а не там, где ты сейчас находишься. А это не единственный инструмент, но вот он как бы самый такой простой. Я сам часто ищу сайт двоеточия reddit.com, чтобы находить то, что пишут живые люди, а не какие-то там оплаченныешники. Какие ещё форумы остались? Есть ли какие-то другие способы найти живых людей в интернете? Точ то, что написали живые люди в интернете?
Ну, как бы если ты знаешь места, где живые люди водятся, то вот, собственно, через оператор сайт как бы и искать. Ну, как на Редите, локальный форум, например, форум города, не знаю, Энергодара. И ты понимаешь, что в поисковой выдаче в обычной его не будет просто вообще никогда. Но если че оператор сайт, ты увидишь выдачу.
именно с этого маленького форума. А, и таких закутков человечности, назовём их так ээ поэтично, значит, их на самом деле много, потому что интернет же огромный. Мы привыкли видеть гигантов, э, и за ними мы не видим всего остального интернета. Facebook, все эти продукты мета. Вот у нас есть там условный Twitter, а, который сильно поменьше, там LinkedIn для чего-то. Тот же LinkedIn, например, да, а это же не значит, что исчезли сайты, на которых люди размещают объявления о найме или своей CV, да? А есть куча огромная локальных проектов, локальных сайтов, на которых теперь, вероятно, сильно больше полезной информации, чем на сайтах гигантов. В особенности теперь, когда гиганты такие как Мета поощряют использование AI. И мы видим, что в 2025 году, э, больше 40% всех больших текстов, а также медиаматериалов в Фейсбуке было создано с помощью и просто сгенерировано, да, и этот процент только будет расти. То есть теория мёртвого интернета, над которой мы смеялись 5 лет назад, оказывается не так глупа, да? Теперь как бы можно генерить огромное количество контента. и даже не париться с тем, чтобы его размещать, то есть настроить машину так, что она будет и генерировать, и размещать на сайте, и раскидывать ссылки по социальным сетям. А человеческое участие там нужно только на этапе настройки и на этапе поддержки, чтобы эта система как бы работала, как бы и починить её, если она сломалась в какой-то момент, затормозилась где-то. Да. Дело в том, что и поисковую оптимизацию можно производить без участия человека. И эти как бы статьи оказываются засиошенными хорошо. и попадают в топвыдачи. То есть получается, что в топвыдаче ты ещё рискуешь нарваться на статью, которая в подготовке которой не принимал участие человек вообще. Ужасно, да. Но тем не менее нужно помнить, что локальные живые человеческие проекты остались, они никуда не делись. Нужно просто их найти искать информацию в таком случае на них.
>> Угу. Ты очень классно рассказал про операторы и про то, как можно комбинировать, но забивать это каждый раз довольно неудобно. Естьли какой-то способ сделать для себя, не знаю, какие-то шорткаты, чтобы можно было искать всегда, ну, там, короче, как как-то это дело из этого сделать инструмент, >> да?
Есть несколько проектов. В первую очередь это Search Whisperer. Searchwhisperer.com, если не ошибаюсь. Это проект, который разработал очень известный мм специалист по открытым расследованиям на основе открытых данных Хэнк One. Он из Голландии, из Нидерландов. Он разработал за последние 10 с лишним лет кучу полезнейших инструментов для журналистов, для улучшения поиска. И вот Search Whisperer - это как раз инструмент, который позволяет вбить простой запрос, а потом его машина, он, по-моему, на на основе клода его сделал, клод, получается, обрабатывает этот запрос и генерирует вам дорк запросы. Во-первых, оценивает качество запроса. Ты говоришь: "Refine me", да, этот запрос. И он говорит: "Хорошо, мы сделаем вот такое вот уточнение, как бы, да, и ты выбери, где ты хочешь искать. Ты хочешь искать на официальных сайтах? Ты хочешь искать по медиа, ты хочешь искать за актуальный период или ты хочешь за какой-то период в прошлом искать или ты, может быть, хочешь искать в файлах или где-то ещё, и ты вот тыкаешь на эти кнопочки, а, и тебе как бы генерируется запрос, чтобы тебе не вбивать его, а потом такой пынк на кнопочку, и открывается Google со всем вот этим вот огромным, значит, э, доргзапросом, который ты не набирал вручную, а просто как бы в в интуитивном режиме, общаясь с этой моделью, созданной хэнком, просто сделал это один вариант. Аэ, есть вариант, он называется, по-моему, Dorген Dorгенераator. Там ещё проще. Значит, мм, это система, которая работает на основе опять же взаимодействия с И на естественном языке. Ты пишешь просто вот на своём языке, что тебе нужно найти. То есть я хочу найти файлы, в которых содержится файлы в формате PDF, в которых содержится вот такая-то информация на таком-то сайте или в такой-то доменной зоне. А, и там три кнопочки. Сгенерировать запрос для Google. для DAGD Go и для Bing. И тебе генерируются подходящие запросы. Значит, уже дорк запросы со всеми операторами. Ты просто их копируешь и вставляешь в поисковую строку нужного тебе поисковика.
>> Есть ли какие-то альтернативы Гуглу?
Предостаточно. А начнём, наверное, с просто альтернативного поиска. Пока без Ии, но в смысле Ии тоже о нём поговорим. Во-первых, есть, э, ну, бин, да, он похуже индексирует, но за последние годы он стал чуть получше. То есть альтернатива альтернатива. А в смысле поиска по картинкам, например, альтернатива Гуглу - это Яндекс. У Яндекса по-прежнему очень приличный поиск по картинкам, гораздо лучше, чем у Гугла. в смысле поиска вообще информации, то, конечно, в первую очередь стоит назвать DAGD GO. Dagdag Go - это система поиска альтернативная Гуглу, в которой при этом работают операторы Google большая часть, то есть помимо всего прочего, что делает Dagda Go, помимо своего собственного поиска и индекса, они используют индекс Google, но они отправляют туда ваш запрос анонимно, то есть без отпечатка вашего устройства, без сведений о вашей истории поиска. То есть в Dagd Go вы используете поиск Google, индекс Google, но используете его анонимно. DAGD Go ваши данные не собирает и не передаёт в Google. Это хорошо. А более радикальный проект - это поиск Braй. А Braй вообще отказались от взаимодействия с Google. Они не используют индекс Google, они создают собственный индекс. А поэтому какие-то вещи там могут не находиться, которые в Google находятся. Но тем не менее проект растёт. Э, это такая как бы инфраструктура вокруг и браузер Braй, да, и поиск Braй, и Брей Leo - это I assistent, и эта инфраструктура растёт, и поиск становится всё лучше. В брей есть совсем альтернативные вещи. Вот у меня тут списочек. У меня в отдельной папке просто, да, лежит это в в браузере есть поиск, например, Start Page, да, это приватный поисковый движок, опять же, который данных не собирает. А есть квант - это поиск по европейскому индексу, то есть ты выбираешь, по каким странам Европы тебе искать. Кстати, в DAGD Dag Go тоже есть выбор страны. Сразу по умолчанию в интерфейсе можно выбрать, в какой стране вы будете искать. Есть нашпигованный вообще Sir X. Это, а, поиск, который полезен, например, для поиска по Китаю. И там тоже можно выбрать страну и прочее. Ну и ГБРУ ещё, да, поиск вот тоже как бы опять же альтернативный, который не собирает данные и немножко по-другому выстраивает логику. То есть вот если не нравится, что Google собирает данные, не нравится какая поисковая выдача у Гугла, можно пользоваться этими альтернативными сервисами. Ну, самый, наверное, удобный для того, кто пересаживается с Google, наверное, самый удобный всё-таки Dagd DG Go. В принципе, можно безболезненно мигрировать в DAG Dag Go из хрома, а сохранив все удобные функции и избавившись от назойливой слежки от алгоритмов Google. Разумный способ или брей, то есть вот DGAGO или Braй. У других альтернативных поисковых систем своих браузеров нет. Ну, а понятно, что как бы если хочешь мигрировать от Google поиска, то и от Хрома нужно мигрировать в сторону чего-то другого.
>> Я сам, честно говоря, грешу тем, что теперь уже не иду в поисковик, когда мне что-то нужно найти, а сразу спрашиваю нейросеть. И тут у меня на самом деле очень много вопросов. Какой неросетью вообще пользуешься ты сам для поиска информации в интернете?
Я пользуюсь многими нейросетями, больше, наверное, десятка разных. Вот. А если для поиска конкретно я использую инфраструктуру Perplexity по одной простой причине, потому что Perplexity в прорежиме, понятное дело, я плачу за подписку, позволяет использовать несколько разных больших языковых моделей, а для решения одной и той же задачи. У Перплексе есть, а свои модели, есть Sonar, Sonar Depressarch и Sonar Pro. Также да подключен всегда самый новый чат GPT и предпоследний клод. Там всегда последние Gemini Pro и Gemini. А, и время от времени там это меняется, запускают какую-нибудь открытую китайскую модель на американских серверах. То есть сейчас там, по-моему, ми стоит. До этого там был deep псик, ами для кодинга как раз полезная штука. То есть если вайбкодить что-то, да, то есть и вот получается, что за там 20 баксов в месяц я получаю возможность взаимодействовать со всеми этими моделями. И это для меня очень комфортно. Поэтому перплекси. Ну, а также есть бесплатный чат GPT. Если мне нужно прямо вот с GPT поработать внутри есть, наверное, четыре лидера, которые неоспоримые лидеры. Это Antropic, это Clot, это Google Gemini, это Open AI и это Chat GPT, и это Perplexity и их Sonar. Все эти модели по-разному немножко работают для разных задач их использовать. Что важно понимать, когда мы говорим о поиске с помощью, а больших языковых моделей? Голые модели не работают на поиск. Что я имею в виду, когда говорю голая модель? Это вот модель as it is по умолчанию, которую вот вы вот вам выкатили в доступ, там чат GPT 52, да, она выкачана так, чтобы её можно было использовать под огромное число задач. И вот если вы не понимаете, как с этим взаимодействовать, как сузить это поле, то, скорее всего, результаты будут плохие. То есть есть несколько способов взаимодействия с большими дисковыми моделями. Первое, очевидное - это как бы так называемый промт инженеринг, да, когда мы общаемся с помощью, а определённых, значит, техник с моделью. Мы ставим роль, контекст, формат вывода, а ограничение знаний и прочее. Вот тогда оно начинает работать хорошо. Что можно использовать для того, чтобы не настраивать самостоятельно? Да, опять же, HS мой любимый, а, разработал AI resarchilot. Это система, по-моему, опять же, на базе Клода она сделана, в которой есть ряд типов исследований, да? Это может быть простой поиск, это может быть поиск стейкхолдеров, это могут быть, может быть поиск мнений, может быть сводлизы, что-то. Ты вбиваешь туда, опять же, на естественном языке, что тебе нужно, и система генерирует тебе промт, запрос под разные модели, под Perplexity, подча GPT, под UCOM, под, по-моему, там есть подмистраль даже, да? То есть вот удобно. То есть, ну, и ты можешь как бы параллельно видеть, как эта система генерирует промты, и понимать, как тебе строить эти задачи, да? То есть вот как тебе самому в дальнейшем свои промты создавать. А что важно, да, то есть при использовании моделей нужно, а разделять роли. То есть вот в Perplexity, например, есть такая штука, как Perplexity Spaces, пространство Perplexity. Это как отдельные маленькие модельки, которым ты можешь задать узкие задачи и использовать их под, собственно говоря, специализированные задачи. Например, у меня есть research assistant. Значит, я ему поставил: "Твоя роль ассистент, значит, исследователя. У тебя есть экспертиза вот в таких-то областях, в научной методологии. Ты всегда, значит, когда ищешь, обращаешься, значит, вот к таким-то источникам. И там можно добавить ссылки на источники, которые будут всегда первичными, можно добавить файлы, в которых будет более подробно описана деятельность, методология исследования, а, список, например, э дополнительных источников, по которым нужно искать. И, значит, у тебя вот такие-то границы знаний, ты за них не вылезаешь, а вот такие-то ограничения, в частности, ограничения. Не выдумывай фактов, если ты чего-то не нашёл, просто и ясно скажи: "Я не нашёл этой информации". И определённый формат вывода: всё, это пространство настроено. Теперь я могу с ним взаимодействовать. Дальше можно задавать, собственно, вопросы по теме. И таких пространств можно создать довольно большое количество под разные задачи. У меня, например, есть пространство для вайбко-кодинга. То же самое в chatча GPT вы можете создавать custom GPTS, то есть вы им прописываете инструкцию, создаёте некоторую базу знаний и, пожалуйста, общайтесь со своими custom GPTs, если у вас платное GPT, а или используйте чужие customм GPTs, которые кто-то уже создал. Они там доступны по поиску, да? То же самое в Gemini - это гемботы, так называемые. Точно таким же образом они программируются, сдаётся роль, а и вы взаимодействуете с пространством. Если вы не хотите или не можете купить себе платный GPT, как бы, но при этом GPT пользуетесь, сделайте этот системный промт на уровне настроек своего аккаунта. Зайдите в настройки, и там есть, значит, такая штука, а, называется персонализация. И там, где, а, значит, выбрать нужно стиль тон, э, использовать, не использовать, есть там такая custom instructions. И туда можно прописать вот эту роль. Например, ты ассистент фактчекера. Вот у меня в бесплатном GPT так прописано: "Ты ассистент фактчекера". Твоя задача, значит, фактчекать информацию, значит, и опираться на достоверные релевантные источники, когда я задаю какой-то вопрос, а у тебя есть вот такие-то corresponsibilities, у тебя есть вот такой-то формат ответа и запрещённые активности, в частности, запрещённая активность выдавать мнение за факты, да? Вот с такими настройками он у меня работает. Довольно неплохо. На самом деле, если у вас задача узкая, если вам не нужно много всего делать чет GPT, то вам бесплатной версии с таким промтом хватит для того, чтобы получать достоверную информацию. А, ну и нужно понимать, что там, условно говоря, там чат GPT использует большей частью Bing, да, это Open AI, как бы они связаны связаны с Microsoft. И понятно, что там поиск идёт через Bing. Если мы говорим про Perplex, то через свою систему BН гугловские результаты тоже могут попадать. Gemini, понятное дело, это Google. Это всегда будет поиск Google. Спрашивают часто: "А что лучше? Лучше то, что удобно для вашего окружения. Если у вас окружение Microsoft, то вам нужен Microsoft Copilot и Chat GPT. Если у вас окружение Google, то пожалуйста Gmin, как бы Google Workspace, документы Google, вот это вот всё. Если вам нужна мультизадачность, подключать коннекторы разные, типа подключить notion, например, к этому всему, да, или подключить что-то ещё, да, то есть сделать базу данных в Ntion, чтобы с этой базой данных ваш чатбот работал. Тогда это Perplexity. И не знаю, есть ли учар вот к Google у него точно есть, да, коннектор, да, и у Perpxy тоже есть коннектор Google Drive там и так далее. Если у вас задача максимально точные исследования, но при этом не не новостные, вам не нужно искать в интернете, то это ноутбук LM от Google. Опять же, это машина, которая не подключена к интернету. Она работает исключительно с теми файлами, которые вы в неё залили. Очень полезно при анализе больших массивов документов, например, там, не знаю, там финансовые отчёты за 10 лет по какой-нибудь крупной компании. Всегда от задачи нужно плясать. Ну вот универсальные, да, универсальные - это, пожалуй, как бы более-менее универсальные perplexity, chat GPT и Gemini за счёт того, что в них можно создавать вот эти костомные пространства под разные задачки. Вот у меня есть там отдельный бот пространство для фандрейзинга. Там я он у меня он профессиональный фандрейзер и с ним я общаюсь, да. И вот это второй способ взаимодействия с ботом. не просто давать инструкцию и задачу найти то-то, сделай то-то, а использовать его как спаринг партнёра, например, да? То есть вот у меня есть такая идея: "Рассмотри эту идею, какие ты видишь в ней плюсы и минусы". Он говорит: "Вот так вот это вот здесь сильные стороны, здесь слабые. Что я могу сделать как бы, чтобы вот это? Сделай, вот это". А если я сделаю вот так? Да. То есть э использовать для обмена идеями - это, наверное, более продуктивный способ, чем просто надеяться, что шайтанмашина тебе выдаст готовый ответ. Нет, не выдаст. Удивительным образом мне это кажется очень похоже на то, что когда ты вот настраивал поисковые движки под себя, теперь ты делаешь то же самое, только для нейросетей. Ты им объясняешь, как именно им нужно работать, сужаешь для них ээ пространству поиска.
>> Очень важную вещь хочу сказать всем. Каким бы ботом вы не пользовались, зайдите в настройки и там есть кнопочка, которая в чат GPT по умолчанию, по-моему, включена. Использовать ваши данные для дообучения моделей. Отключите её. Не давайте ваши данные. Не отдавайте. Не кормите ими чат GPT, потому что неизвестно, что из ваших данных в итоге вылезет в э следующей версии. То же самое с перплексти. Не использовать мои данные для обучения моделей. Это важно.
Наверное, у меня ещё такое наблюдение есть, что некоторые люди ищут в голосовом режиме, то есть они общаются с неросетью голосом. И это большая ошибка. Так делать не стоит. Если ты не просто не хочешь поболтать, если ты хочешь хоть что-то осмысленное, нужно выключать голосовой режим и писать текстом или говорить голосом, чтобы вот этот speech tox, что ты говоришь, а он дальше текст генерирует из твоего из твоей речи. Вот это о'кей. Но если ты просто голосом говоришь, то голосовая модель университе она самая быстрая и с самым низким качеством, потому что неростим нужно успеть ответить за там полсекунды, иначе тебе кажется, что что-то тормозит. И вот такая нейросеть никогда не сделает нормального поиска и никогда нормально твою информацию не обработает. Это просто болталка. Если хочешь что-то сделать нормальное, используй текст. Это, мне кажется, такое важное. То, что ты рассказываешь, это какие-то более крутые штуки, более сложные, но вот на самом-самом первом уровне. Как бы не стоит самому стрелять в ногу и использовать голосовые модели. Про неросити плюс-минус понятно. Можно сделать так, чтобы они меньше галлюционировали и давали более проверенные ответы. Погнали про языки. Есть ли разница на каком языке искать в поисковых движках?
>> В поисковых движках или в лалэмках?
Давай сначала про поисковые движки, а потом пролмки.
>> Да, всё ещё есть. Просто потому что количество контента на разных языках разное. И количество контента, условно на, а, английском, португальском, испанском, э, французском, оно будет сильно больше, чем на русском или на немецком, не говоря уже про албанский, да? То есть, а, албанцы страдали, у них даже своей версии там в 2017 году не было своей версии как бы эogзыковой, да, он просто не поддерживал кучу инструментов на албанском, да, так что разница есть. Всё зависит от того, насколько этот язык является языком производителей контента, самого разнообразного, от развлекательного до научного. Да. Вот, чем больше контента производится разного на определённом языке, тем вероятнее, что поиск закончится удачно и не зафейлится. С большими языковыми моделями немножко другая ситуация.
>> Как язык запроса влияет на ответ в случае неросити?
Судя по всему, я склонен считать, что это исследование достаточно точное. А было проведено исследование серьёзное по тому, как взаимодействуют, значит, чатботы с разными языками. И лучшим языком для взаимодействия оказался польский. Вот не английский, не французский, а не испанский, а польский. Причины, вероятно две. Первое, как бы всё мы понимаем, что основной массив, значит, а документов, которые на которых ЛLM обучаются, он м написан на латинице, да? То есть, а польская использует латиницу. То есть с одной стороны, а, но есть и другая сторона. Сколько информации может содержаться в одном слове в разных языках? Дело в том, что в славянских языках в одном слове содержится гораздо больше информации, чем в английском. А потому что у нас есть падеж, есть склонение, есть рот, да, и вся эта информация в минимальном количестве токенов упакована. То есть славянские языки позволяют чуть больше информации. Вообще флективные языки, да, в целом, не только славянские, да, это не только славянские языки флективные, но вот флективные языки, у которых есть падеж, склонение, спряжение, они оказываются более эффективными для взаимодействия с большими языковыми моделями. за счёт того, что в одном слове, э, содержится больше информации. То есть ваш запрос, э, ну, как бы, ну, не сказать, что они как бы суперсильно опережают, да? То есть это какие-то там небольшие проценты, да? А, но вот так это работает. Пользуйтесь чатом GPT и перплекс на русском. Всё, всё нормально, всё, всё вам не не обязательно все промты писать на английском, если вы не создаёте англоязычный продукт.
>> Мне кажется, многих это вот этот совет он многих успокоит и хорошо. Помнишь, раньше русскоязычный поиск работал лучше всего в Яндексе? Как сейчас дела у Яндекс-поиска? Для чего он полезен сегодня?
Ну, всё ещё всё ещё полезен для поиска по м странам бывшего СССР. Полезен для поиска на таджикском, например, да, полезнее, чем Google. лучше индексирует пяческий или на узбекском, или на кыргызском, а, или на казахском, например, потому что модель м Яндекса, которая вот как раз работает с казахским языком, она сильно лучше сделана, чем угла, да? То есть в казахском интернете Яндекс может оказаться полезнее. Яндекс по-прежнему полезнее для поиска по картинкам особенности в этих регионах, да, которые он покрывает. То есть русскоязычные регионы, страны Центральной Азии, вот у них движок для поиска по картинкам всё ещё лучше, чем у Google. И менее замусорена сама выдача и поиск полицам всё ещё отчасти работает. А в остальном всё. То есть для глубокого поиска Яндекс больше не годится. Там были когда-то операторы, как в Google, похожие. Просто вместо сайт был оператор host, а вместо кавычек использовались восклицательные знаки. А что-то из этого сейчас всё ещё работает, но, э-э, уже всё, как бы, то есть эпоха операторов в Яндекс закончилась. А, ну и сами там настройки, как бы всё это тоже как бы коммерциализировано, это внедрена Алиса, а, и прочее, и прочее. Это тоже, конечно, замусоривает очень сильно поиск и делает его крайне неудобным для пользователя. Вот. Так что вот для каких-то задачей Яндекс ещё работает, но как в качестве основного поискового движка его рекомендовать было бы очень странно. В качестве дополнительного, да, если у вас есть определённые задачи.
>> Спасибо большое, Паша. Очень классный разговор, очень много практических советов.
Спасибо, что позвал. Берегите себя.
Это подкаст студии Либо-либо. Над эпизодом работали редакторка Маша Агличева, продюсеры Данил Остапов и Аня Коваленко, монтажёр Сергей Христолюбов. За джингл спасибо Алексею Зеленскому. Мы будем очень благодарны, если вы поддержите наш YouTube канал. Пожалуйста, подписывайтесь, ставьте лайк этому ролику и оставьте какой-нибудь комментарий. Например, поделитесь своей историей про поиск в интернете. До встречи в следующий четверг. Пока.