×

Как работает поиск нейросети смысл и мультимодальность

Вы когда-нибудь вводили в поиск «фильм про робота, который полюбил девушку» и получали «Ва-банк» или «Она»? Я — да. И каждый раз удивляюсь: как поиск догадался? Ведь в описании этих фильмов нет ни слова про робота или любовь. Раньше поиск работал как тупой картотечный каталог: есть слово «кот» — показываем все страницы со словом «кот». В 2026 году поиск научился думать. Он понимает смысл, контекст и даже содержание видео. Рассказываю, как это работает и куда движется дальше.

От слов к смыслам: эра векторных моделей

Лет 15 назад поиск был прост: обратный индекс. Как картотека в библиотеке: на карточке «кот» — список всех книг, где есть слово «кот». Вводите «рецепт пасты» — ищутся страницы, где есть оба слова. Но если вы напишете «как приготовить итальянскую лапшу с соусом» — результат мог быть плохим, потому что нет слова «паста». Теперь всё иначе. Каждый запрос и каждый документ превращаются в набор чисел — эмбеддинг, который описывает смысл. Нейросети вроде BERT, RoBERTa и российского RuModernBERT обучены на миллиардах текстов. Они знают, что «врач» и «доктор» — одно и то же. А «яблоко» в зависимости от контекста может быть фруктом или компьютером. Поиск сравнивает не слова, а смыслы.

Семантический поиск
Векторные модели превращают текст в числа и сравнивают смыслы. Источник: VK

Как система решает, что показать первым

Сначала работает «грубый фильтр» — ретривер. Он за доли секунды отсеивает тысячи вариантов по ключевым словам, популярности, свежести. А потом вступает в дело «тонкий настройщик» — ререйнкер. Это нейросеть, которая выбирает из сотен вариантов самые релевантные для вас лично. Она учитывает историю ваших поисков, время суток, даже настроение. Утром в понедельник вы, скорее всего, ищете новости, а вечером в пятницу — развлечения. И поиск это понимает.

Поиск картинок и видео: когда слова не нужны

Самое крутое — мультимодальный поиск. Система обрабатывает одновременно текст, видео, картинки и звук. Чтобы найти нужный ролик на YouTube, алгоритм расшифровывает речь (ASR), анализирует превью, описание, комментарии, даже то, как зрители реагируют — досматривают до конца или переключаются. Мультимодальные модели (VLM) видят картинку и понимают связь между объектами. Например, «кошка на диване» — не просто кошка и диван, а то, что кошка лежит на диване. Это позволяет искать по смыслу, а не по тегам.

Мультимодальный поиск
Нейросеть понимает, что на картинке, даже без подписей. Источник: VK

Большие языковые модели (LLM): не панацея, но помощник

Вы наверняка слышали про ChatGPT и подобные модели. В поиске их нельзя запустить на каждый запрос в реальном времени — это безумно дорого и медленно. Поэтому LLM используют на этапе подготовки данных: они автоматически размечают контент, генерируют описания для видео, создают обучающие примеры. А ещё есть гибридный подход RAG (Retrieval-Augmented Generation). Сначала классический поиск ищет документы, а потом LLM на их основе генерирует ответ. Например, вы спрашиваете «как ухаживать за фикусом?», а сервис не даёт ссылки, а пишет краткую инструкцию, собранную из статей. Удобно.

Будущее: ИИ-браузеры и поиск как диалог

В 2025 году компания Perplexity сделала общедоступным браузер Comet. Встроенный ИИ-ассистент не просто ищет информацию, а действует: переходит по сайтам, собирает корзину в магазине, бронирует билеты по голосовой команде. Поиск превращается из пассивного инструмента в проактивного помощника. Вместо «найди мне информацию» — «сделай это за меня». Полная мультимодальность, диалоговый поиск, персонализация на уровне «погода и настроение» — это уже не фантастика, а реальность 2026 года. Поисковые системы становятся настолько умными, что иногда кажется, будто они читают мысли. На самом деле они просто очень хорошо нас изучили.

Возможно, вы пропустили