Объединение изображений и текста: как мультимодальный поиск преобразует поиск
Рост мультимодальных моделей
Оглядываясь на стремительный прогресс больших языковых моделей (LLMs) в 2024 году, становится ясно, что ИИ продолжает развиваться благодаря усилению инноваций и инвестиций. Хотя доступно огромное количество текстовых данных, исследователи признали, что люди понимают мир через несколько органов чувств, что подтолкнуло к переходу к использованию других типов данных, таких как изображения, аудио и видео. Этот сдвиг способствовал росту моделей мультимодального ИИ, которые могут обрабатывать и понимать данные из нескольких источников, обеспечивая более богатые и сложные интерпретации информации.
В первой половине 2024 года мы увидели значимые релизы мультимодальных моделей, такие как GPT-4o от OpenAI, Claude 3 от Anthropic, Gemini 1.5 Pro от Google и Ferret-UI от Apple. Эти модели расширяют возможности ИИ за пределы текста, открывая новые области применения в креативных индустриях, инструментах продуктивности и более интерактивных системах. То, что когда-то было нишевой академической концепцией, теперь стало мейнстримом: разработчики используют эти API для создания приложений, которые интегрируют ИИ с разнообразными медиа, открывая новые возможности для инноваций.
Ученые OpenAI демонстрируют мультимодальные возможности недавно выпущенной GPT-40.png
Рисунок: ученые OpenAI демонстрируют мультимодальные возможности недавно выпущенной GPT-40
Мультимодальный поиск и составной поиск изображений (CIR)
По мере развития мультимодальных моделей мультимодальный поиск — который объединяет входные данные из нескольких модальностей, обычно текста и изображений, — становится все более популярным. Этот подход обеспечивает более нюансированный и точный способ улавливать поисковые намерения пользователей, используя сильные стороны обеих модальностей.
Одна из самых распространенных задач в мультимодальном поиске — составной поиск изображений (Composed Image Retrieval, CIR), при котором пользователи предоставляют запрос, включающий референсное изображение вместе с описательной подписью. Такой подход с двумя входами позволяет находить конкретные изображения, объединяя визуальный контент с текстовыми инструкциями и создавая более подробный и точный запрос.
Традиционный поиск изображений в основном опирается на визуальные метрики сходства, которые эффективны для многих запросов общего назначения. Однако в случаях, когда одно референсное изображение не полностью выражает намерение пользователя, текстовый ввод становится важным дополнением. Текст добавляет контекст и точность, которых может не хватать одному изображению, позволяя пользователям уточнять свои поисковые запросы. Такое объединение модальностей позволяет разработчикам создавать более надежные и гибкие поисковые системы, давая пользователям возможность естественно выражать сложные запросы с более высокой точностью.
В следующих разделах мы рассмотрим ведущие модели и методы составного поиска изображений, их методологии и производительность в различных областях, оцениваемые с использованием популярных наборов данных, таких как FashionIQ, CIRR и CIRCO. Эти оценки подчеркнут сильные стороны и ограничения различных подходов CIR в реальных приложениях.
Обзор популярных методов составного поиска изображений
В последние годы методы мультимодального поиска продвинулись в сторону универсальности zero-shot, особенно благодаря моделям вроде CLIP, которая обеспечивает мощный поиск «текст-в-изображение» с использованием общего пространства эмбеддингов для обеих модальностей. Эти методы используют либо предварительно обученные эмбеддинги , либо дообученные аннотированные наборы данных в зависимости от доступных ресурсов, что приводит к значительным улучшениям качества поиска и данных.
В следующей таблице представлен обзор популярных техник composed image retrieval (CIR), их основных методологий, а также типов эмбеддингов, которые они генерируют и используют для поиска:
| Техника | Описание | Генерируемый эмбеддинг | Поисковый эмбеддинг |
| Pic2Word | Преобразует изображение в токен, встроенный в текст, обеспечивая гибкий поиск от изображения к тексту. | Текстовый эмбеддинг CLIP | Визуальный эмбеддинг CLIP |
| CompoDiff | Добавляет шум к визуальному эмбеддингу CLIP, затем использует текст в процессе удаления шума для реконструкции условного визуального эмбеддинга CLIP. | Визуальный эмбеддинг CLIP | Визуальный эмбеддинг CLIP |
| CIReVL | Преобразует изображение в описательный текст, изменяет описание так, чтобы оно соответствовало целевому объекту, и генерирует новое представление. | Текстовый эмбеддинг CLIP | Визуальный эмбеддинг CLIP |
| MagicLens | Использует модель Transformer, которая одновременно обрабатывает данные изображения и текста, генерируя единый векторный эмбеддинг. | Эмбеддинг MagicLens | Эмбеддинг MagicLens |
Pic2Word: сопоставление изображений со словами для zero-shot composed image retrieval
Pic2Word — это метод zero-shot composed image retrieval (ZS-CIR), предназначенный для поиска изображений с использованием изображения и текста в качестве входных запросов без необходимости в больших размеченных наборах данных. Используя предварительно обученную модель CLIP, Pic2Word сопоставляет визуальные эмбеддинги изображений с псевдословными токенами, представляющими изображение в текстовом пространстве. Это позволяет модели комбинировать признаки изображения с текстовыми описаниями для поиска целевых изображений на основе модификаций, указанных в тексте (например, изменения атрибутов изображения, таких как цвет объекта).
Слева — процесс обучения сети сопоставления Pic2word; справа — процесс composed image retrieval..png
Рисунок: слева: процесс обучения сети сопоставления Pic2word; справа: процесс composed image retrieval.
Как работает Pic2Word
Изображение выше показывает обучение сети сопоставления Pic2Word и процесс composed image retrieval. Во время процесса обучения изображение (например, изображение кошки) пропускается через замороженный Visual Encoder, который генерирует визуальный эмбеддинг . Одновременно токенизированная текстовая подсказка вроде "A photo of" пропускается через Text Encoder, который создает соответствующий текстовый эмбеддинг . Цель сети сопоставления — отобразить эмбеддинг изображения в псевдотокен , который можно включить в текстовую подсказку, сформировав фразу "A photo of [s]."
Этот сопоставленный токен, будучи пропущенным через замороженный Text Encoder, должен генерировать текстовый эмбеддинг , который тесно согласуется с исходным эмбеддингом изображения . Сеть обучается с использованием функции contrastive loss, которая минимизирует расстояние между визуальным эмбеддингом и текстовым эмбеддингом , гарантируя, что изображение точно представлено в виде словоподобного токена.
После обучения сети сопоставления её можно использовать для задач составного поиска изображений. На этом этапе пользователь вводит изображение (например, собаку) и текстовый запрос (например, "in a pool"). Изображение обрабатывается через Visual Encoder, а текст — через Text Encoder. Изученный псевдотокен усиливает запрос, позволяя системе понимать композицию изображения и текста.
query feature, объединяющий представления изображения и текста, сравнивается с базой данных изображений-кандидатов. Затем система извлекает наиболее подходящее изображение (например, собаку, плавающую в бассейне), эффективно изменяя входное изображение на основе предоставленного текстового описания.
CompoDiff: Универсальный составной поиск изображений с латентной диффузией
CompoDiff — это модель на основе диффузии, предназначенная для составного поиска изображений без предварительного обучения на целевых примерах (ZS-CIR). Она использует диффузионные модели, метод в генерации текста в изображение, чтобы значительно повысить гибкость и точность редактирования и поиска изображений. Эти модели не ограничиваются простыми ссылками на текст; они обеспечивают соответствие сгенерированных изображений шаблонам, наблюдавшимся во время обучения. Используя диффузионные модели, CompoDiff создаёт эмбеддинги, которые объединяют входной текст, референсные изображения и маски, генерируя векторы, соответствующие распределению визуальных эмбеддингов CLIP.
Тогда как понять механику диффузионных моделей? Представьте фотографию, которая со временем становится всё более зашумлённой. Вообразите, что вы начинаете с ясного, резкого изображения, а затем постепенно добавляете к нему случайный шум, похожий на помехи на старом телевизоре. Изображение становится всё более и более скрытым, пока не становится почти неузнаваемым, превращаясь в нечто похожее на чистый шум. Это прямой процесс диффузии.
Однако более увлекательная часть — это обратный процесс. В диффузионных моделях цель состоит в том, чтобы начать с этого зашумлённого изображения и постепенно, шаг за шагом, "очищать" его от шума. По мере того как модель удаляет шум, она реконструирует исходное изображение (или создаёт новые изображения на основе текстовых подсказок). Этот процесс позволяет модели генерировать высококачественные изображения, которые соответствуют определённым условиям — например, конкретному текстовому описанию или референсному изображению.
При встраивании текста это работает так же. CompoDiff постепенно очищает от шума гауссовский шумовой эмбеддинг, повышая его отношение сигнал/шум до тех пор, пока оно не совпадёт с отношением визуального эмбеддинга CLIP. Текст и изображения управляют этим преобразованием, а маски дают дополнительные указания о том, какие области изображения изменять.
How CompoDiff Works.png
Рисунок: как работает CompoDiff
Процесс инференса CompoDiff
На этапе инференса CompoDiff, как показано на диаграмме, процесс начинается с входного изображения (например, Эйфелевой башни), которое кодируется в латентное пространство через CLIP Image Encoder, создавая начальный визуальный эмбеддинг . Этот эмбеддинг проходит прямой процесс диффузии, в ходе которого к нему добавляется шум, преобразующий его в более зашумлённую версию , представляющую ухудшенную версию исходного изображения.
Далее применяется Denoising Transformer, который постепенно удаляет шум за несколько шагов (повторяемых раз), чтобы восстановить более чистый эмбеддинг изображения. Процесс удаления шума направляется условиями, влияющими на то, как должно быть реконструировано изображение. Эти условия включают:
Текстовое условие : В этом случае текстовая подсказка "Balloon" кодируется через Text Encoder (CLIP или другие текстовые модели, такие как T5), создавая текстовый эмбеддинг . Этот эмбеддинг добавляет контекстную направляющую к процессу удаления шума, обеспечивая соответствие финального изображения описанию "Balloon."
Условие маски : Если предоставлена маска, она обрабатывается через многослойный перцептрон (MLP) для генерации эмбеддинга маски , который направляет денойзинг на определенные области изображения, например для изменения или добавления элементов вроде воздушного шара в определенных регионах.
Текстовые условия и условия маски конкатенируются с зашумленным визуальным эмбеддингом и передаются через денойзинг-трансформер, который использует Classifier-Free Guidance (CFG) для регулировки силы этих условий. Если маска или условие не предоставлены, используются нулевые векторы по умолчанию, чтобы обеспечить плавную работу.
Примечательно, что в ходе этого процесса также вводятся негативные текстовые условия для уточнения результата. Например, негативное условие вроде "multiple balloons" может быть применено, чтобы избежать генерации более чем одного воздушного шара, гарантируя, что итоговое изображение отражает один воздушный шар рядом с Эйфелевой башней.
После нескольких итераций денойзинга результирующий эмбеддинг изображения выравнивается с визуальными признаками CLIP, а затем сравнивается с базой данных для поиска, чтобы найти или сгенерировать наиболее подходящее изображение, которым в данном случае будет Эйфелева башня с воздушным шаром в небе.
Процесс обучения CompoDiff
Обучение проходит поэтапно в две фазы:
Процесс обучения CompoDiff.png
Рисунок: Процесс обучения CompoDiff
****
Этап 1: Обучение с LAION-2B
На первом этапе модель обучается на наборе данных LAION-2B, который содержит большую коллекцию пар «изображение-текст». Основная цель этого этапа — научиться генерировать визуальные эмбеддинги CLIP из зашумленных входных данных, используя текстовые описания в качестве ориентира.
Процесс начинается с кодирования изображения (например, птицы) в визуальный эмбеддинг CLIP . Этот эмбеддинг проходит через диффузионный процесс, при котором шум постепенно добавляется за несколько шагов, в результате чего получается сильно зашумленная версия , содержащая мало или вовсе не содержащая распознаваемой информации. Одновременно соответствующее текстовое описание, например "A chickadee sitting on a wooden surface next to flowers," кодируется в текстовый эмбеддинг CLIP . Затем зашумленный визуальный эмбеддинг и текстовый эмбеддинг подаются в денойзинг-трансформер, который поэтапно удаляет шум, руководствуясь текстом. Трансформер стремится постепенно восстановить чистый визуальный эмбеддинг изображения. Цель на этом этапе — минимизировать разницу между зашумленным визуальным эмбеддингом и восстановленным эмбеддингом, используя текст в качестве направляющего ориентира. Это учит модель согласовывать визуальную и текстовую информацию, гарантируя, что сгенерированные признаки изображения соответствуют текстовому описанию.
Этап 2: Дообучение на наборе данных SynthTriplets18M
На этапе 2 модель дообучается как на LAION-2B, так и на синтетическом наборе данных SynthTriplet18M, что повышает ее способность работать с более сложными сценариями.
На этой фазе модель учится генерировать конкретные изображения не только по текстовым описаниям, но и с включением референсных изображений и условий маски, указывающих области для изменения. Обучение начинается с кодирования входного изображения, как и на этапе 1, но теперь также предоставляется референсное изображение, которое кодируется в собственный визуальный эмбеддинг. Референсное изображение направляет модель при изменении входного изображения. Также вводится условие маски, выделяющее конкретные регионы изображения, нуждающиеся в изменении. Маска преобразуется в эмбеддинг с помощью MLP (многослойного перцептрона), и она работает совместно с текстовым эмбеддингом (например, "Change the chickadee to a rooster"), чтобы направлять процесс денойзинга.
Модель чередует две цели: одну, в рамках которой она учится скрывать определенные области целевого изображения на основе текста и условий маски, и другую, в рамках которой она совершенствует свою способность преобразовывать входное изображение в целевое на основе предоставленных референса, маски и текста. Благодаря этому чередующемуся процессу обучения модель учится объединять визуальную и текстовую информацию, чтобы точно и гибко изменять изображения. К концу этих двух этапов CompoDiff становится способной справляться со сложными задачами композитного поиска изображений, обеспечивая точный контроль над тем, как изображения генерируются и изменяются на основе нескольких условий. Это позволяет модели генерировать изображения, которые соответствуют подробным текстовым инструкциям, включают признаки из референсных изображений и выборочно изменяют определенные области.
CIReVL: Vision-by-Language для композитного поиска изображений без обучения
Большинство моделей композитного поиска изображений (CIR) опираются на аннотированные наборы данных и обучение моделей под конкретные задачи, что дорого и подвержено переобучению. Это означает, что модели, как правило, плохо работают при обработке изображений, которые отличаются от их обучающего распределения. Эта проблема становится особенно серьезной в реальных приложениях, где разнообразие входных данных может быть огромным и непредсказуемым. С развитием крупномасштабных моделей, таких как большие языковые модели (LLMs) и визуально-языковые модели (VLMs), парадигма zero-shot learning — когда модели выполняют задачи, на которых они не были явно обучены, — привлекла значительное внимание. CIReVL является ярким примером zero-shot CIR-модели, которая не требует дополнительного обучения, но при этом демонстрирует устойчивую производительность.
How CIReVL works.png
Рисунок: Как работает CIReVL
Если говорить точнее, CIReVL (Compositional Image Retrieval through Vision-by-Language) — это подход к композитному поиску изображений без обучения, который использует существующие предварительно обученные модели, такие как VLMs и LLMs. Его цель — извлекать целевые изображения из базы данных, комбинируя изображение-запрос и текстовый модификатор (например, "Эйфелева башня без людей и ночью"). CIReVL выделяется тем, что способен полностью обходиться без необходимости контролируемого обучения, предлагая более гибкое и эффективное решение для задач CIR.
Метод построен на трех ключевых компонентах, каждый из которых обладает сильными способностями к обобщению. Во-первых, визуально-языковая модель (например, BLIP2) генерирует описательную подпись для входного изображения. Во-вторых, большая языковая модель (например, GPT-3.5 или GPT-4) изменяет подпись на основе предоставленных текстовых инструкций (например, "убрать людей, изменить время на ночь"). Наконец, измененная подпись преобразуется в текстовое вложение с помощью текстово-изобразительного энкодера, такого как CLIP, который затем выполняет фактический поиск изображений в базе данных. Этот процесс является высокомодульным и работает исключительно в языковой области, обеспечивая более интуитивное управление и возможность вмешательства пользователя. Такая простая цепочка также делает CIReVL масштабируемым и адаптируемым.
MagicLens: самоконтролируемый поиск изображений с открытыми инструкциями
Оглядываясь на предыдущие методы, можно увидеть, что одна из самых больших проблем в Composed Image Retrieval (CIR) — это сбор и аннотирование высококачественных реальных данных для обучения моделей, которые хорошо обобщаются в различных контекстах. Моделям необходимо понимать сложные связи между изображениями, но данные, требуемые для такого обучения, часто дороги и трудны для получения. Чтобы решить эту проблему, исследователи DeepMind и Ohio State University представили MagicLens — самоконтролируемую модель поиска изображений с открытыми инструкциями. Ее ключевая инновация заключается в способности выходить за рамки традиционного визуального сходства и извлекать изображения на основе более тонких семантических связей.
MagicLens строится на предварительно обученных vision-language models (VLMs), таких как CLIP или CoCa, наряду с large language models (LLMs), такими как PaLM2. Эта комбинация позволяет MagicLens обрабатывать сложные поисковые запросы, позволяя пользователям вводить изображение и гибкую текстовую подсказку (например, "с другого ракурса" или "вид интерьера"), чтобы получать изображения, соответствующие как визуальному содержанию, так и семантическим отношениям.
Модель использует наблюдение о том, что изображения с одних и тех же веб-страниц часто имеют неявные связи, такие как разные виды объекта или взаимодействия между объектами. MagicLens извлекает эти пары изображений с веб-страниц и использует их для создания обширного набора обучающих триплетов — каждый из которых состоит из изображения-запроса, текстовой инструкции и целевого изображения. Эти триплеты служат основой для процесса самообучения MagicLens, в ходе которого модель учится связывать изображения на основе предоставленных инструкций.
How Magiclends works.png
Рисунок: Как работает Magiclends
Для сбора и подготовки этих триплетов MagicLens использует сложный конвейер данных:
Веб-страницы: Изображения собираются с одного и того же URL, исходя из предположения, что они, вероятно, связаны. Это позволяет модели собирать огромный объем данных из Common Crawl.
Группировка и очистка: Собранные изображения группируются по URL, затем фильтруются для удаления изображений с низким разрешением, дубликатов или нерелевантных (например, рекламных) изображений.
Расширение метаданных: Для улучшения понимания для каждого изображения генерируются метаданные. Эти метаданные включают:
ICA-метки (сгенерированные через Google Vision API) для базовой идентификации объектов.
Alt-text (альтернативные текстовые описания с веб-страниц).
Подписи, сгенерированные с использованием модели Google PaLI.
Оценка и фильтрация: Используя оценку CLIP для image-to-image и text-to-text, MagicLens дополнительно отфильтровывает слабо связанные пары изображений, гарантируя, что остаются только пары высокого качества.
Генерация инструкций: На основе метаданных парных изображений Google PaLM2 генерирует открытые текстовые инструкции, которые объясняют связь между изображением-запросом и целевым изображением.
data pipeline.png
Рисунок: конвейер данных
С помощью этого конвейера MagicLens генерирует набор данных из 36,7 миллиона триплетов (эталонное изображение, текстовая инструкция и целевое изображение), который служит основой для обучения модели. Этот массивный набор данных позволяет MagicLens эффективно обучаться без необходимости ручной разметки, что приводит к созданию надежной модели для различных задач поиска.
Оценка моделей Composed Image Retrieval (CIR)
Для оценки производительности моделей Composed Image Retrieval (CIR) обычно используются несколько эталонных наборов данных, включая FashionIQ, CIRR и CIRCO. Эти наборы данных охватывают различные задачи поиска, от поиска изображений моды до поиска естественных изображений, что делает их идеальными для оценки разных моделей в различных областях.
FashionIQ ориентирован на тонкозернистый поиск изображений моды, с задачами, связанными с конкретными предметами одежды (например, платьями, рубашками и т. д.). Он включает 2005 запросов и 5179 индексных изображений.
CIRR делает акцент на реальных изображениях и охватывает широкий спектр отношений между изображениями (например, пространственные или композиционные изменения). Он содержит 4148 запросов и 2316 индексных изображений.
CIRCO — это крупномасштабный набор данных с более чем 120 000 естественных изображений, где каждый запрос может иметь несколько правильных целевых изображений.
Производительность модели на бенчмарках CIR
В следующей таблице показана производительность нескольких ведущих моделей CIR на этих наборах данных. Модели оцениваются с использованием различных метрик, таких как Recall@10 (R@10) для FashionIQ и CIRR, а также Mean Average Precision at 5 (mAP@5) для CIRCO. Эти метрики оценивают, насколько хорошо модели могут извлекать релевантные изображения на основе комбинации визуального ввода и текстовых инструкций.
| Публикация | Параметры | Fashion IQ R@10 | CIRR R@1 | CIRCO mAP@5 | |
| Pic2Word | CVPR 2023 | 429M | 24.7 | 23.9 | 8.7 |
| CompoDiff | CVPRW 2024 | 568M | 36.0 | 18.2 | 12.6 |
| CIReVL | ICLR 2024 | 12.5B | 28.6 | 24.6 | 18.6 |
| MagicLens-L | ICML 2024 | 613M | 38.0 | 33.3 | 34.1 |
Ключевые выводы:
Производительность FashionIQ: MagicLens-L превосходит другие модели с Recall@10, равным 38.0, демонстрируя свою эффективность в задачах поиска модных товаров. CompoDiff следует сразу за ней с 36.0, показывая свою силу в CIR, связанном с модой.
Производительность CIRR: MagicLens-L также лидирует в CIRR, достигая Recall@1, равного 33.3, что значительно выше, чем у других моделей. CIReVL показывает устойчивый результат 24.6, демонстрируя свою способность к поиску изображений в реальных условиях.
Производительность CIRCO: MagicLens-L также превосходно показывает себя в задачах крупномасштабного поиска естественных изображений, со средним значением Average Precision at 5 (mAP@5), равным 34.1, значительно опережая другие модели. Это демонстрирует её силу в работе со сложными крупными наборами данных с несколькими правильными целями.
В целом, MagicLens-L показывает лучшую общую производительность по всем наборам данных, особенно успешно справляясь как с задачами поиска в модной сфере, так и с крупномасштабным поиском естественных изображений, несмотря на меньшее количество параметров по сравнению с CIReVL.
Резюме
В этой статье мы рассмотрели растущее распространение мультимодальных методов поиска, которые объединяют поиск по тексту, изображениям и многим другим типам данных, чтобы предоставлять более гибкие и точные способы фиксации поискового намерения. Распространённой задачей в этой области является composed image retrieval (CIR), где пользователи уточняют поиск изображений с помощью текстовых описаний в сочетании с референсными изображениями.
Мы рассмотрели ключевые модели и техники, лежащие в основе CIR, включая Pic2Word, CompoDiff, CIReVL и MagicLens. Каждая из них опирается на базовые возможности CLIP, применяя при этом разные подходы для улучшения поиска:
Pic2Word преобразует изображения в текстовые токены, встроенные в текстовый поиск, используя текстовые эмбеддинги CLIP для очень универсального, управляемого текстом поиска изображений.
CompoDiff использует направленное текстом шумоподавление, уточняя зашумлённые визуальные эмбеддинги с помощью текстового ввода для условной реконструкции эмбеддингов изображений, повышая точность поиска.
CIReVL изменяет текстовые описания, чтобы лучше соответствовать целевому изображению, и заново генерирует новые визуальные эмбеддинги, обеспечивая более точные результаты поиска за счёт согласования текстовых модификаций с референсным изображением.
MagicLens использует модели Transformer для параллельной обработки текста и изображений, генерируя единый эмбеддинг, который охватывает обе модальности и повышает эффективность поиска.
Изучите нашу демонстрацию мультимодального поиска!
Мы разработали онлайн-демонстрацию мультимодального поиска на базе векторной базы данных Milvus. В этой демонстрации вы можете загрузить изображение и ввести текстовые инструкции, которые обрабатываются моделью composed image retrieval для поиска совпадающих изображений на основе как визуального, так и текстового ввода.
В основе этой демонстрации лежит модель эмбеддингов MagicLens, которая работает совместно с системой повторного ранжирования на базе GPT-4o, чтобы уточнять результаты поиска в соответствии с намерением пользователя. Такое сочетание показывает, как мультимодальные модели могут преобразовать современные системы поиска, обеспечивая более точный и интуитивно понятный поисковый опыт.
Мы приглашаем вас изучить и лично опробовать будущее мультимодального поиска!
Searching results from the multimodal search model.png
Рисунок: Результаты поиска из мультимодальной поисковой модели
Попробуйте демонстрацию: Multimodal Image Search
Ознакомьтесь с исходным кодом: Multimodal RAG with Milvus | Milvus Documentation
Дополнительные ресурсы
Страница MagicLens на GitHub: https://open-vision-language.github.io/MagicLens/
Страница CIReVL на GitHub: https://github.com/ExplainableML/Vision_by_Language
Страница CompoDiff на GitHub: https://github.com/navervision/CompoDiff
Демонстрация Milvus: https://milvus.io/milvus-demos
Читать далее

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Why Context Engineering Is Becoming the Full Stack of AI Agents
Discover how context engineering unifies prompts, RAG, and tools to build smarter, production-ready AI agents powered by Milvus.



