Улучшение экспериментов в области науки о поведении с помощью LLM и Milvus
Нажимая и «отжимая» кнопки — можем ли мы переосмыслить свои эмоции?
Безусловно. Д-р Дэймон Абрахам, поведенческий ученый с докторской степенью по психологии, ведет исследовательский проект, демонстрирующий, как переоценка изображения может смещать наши эмоции по валентности и возбуждению. Таким образом, задача состоит в том, чтобы выяснить, что именно в изображении позволяет совершить этот сдвиг и как это искать. Именно здесь в игру вступают многомерные эмбеддинги изображений и векторные базы данных.
В своем выступлении 'From Images to Meanings to Vector Databases’' на Zilliz Unstructured Data Meetup в Сиэтле 13 февраля 2024 года д-р Дэймон Абрахам рассказывает о своем инновационном исследовательском проекте, направленном на создание репозитория стимулов для экспериментальной психологии с использованием технологий LLM и векторных баз данных. Эта междисциплинарная инициатива предполагает сотрудничество с University of Denver и исследователями из Institute of Love and Time и Institute of Noetic Sciences. Ее цель — разработать нормативную базу данных изображений с открытым исходным кодом и методы измерения динамической психологической дистанции между изображениями и их потенциала для успешной переоценки.
Посмотрите выступление д-ра Дэймона Абрахама
Психологический проект
Тысячи людей-оценщиков оценили 2 500 изображений из нормативной базы данных, измеряя для каждого эмоциональную интенсивность (возбуждение) и валентность (позитивная или негативная) в 18 различных классах стимулов. Цель — лучше понять эмоциональное значение этих изображений, создав нормальное распределение ответов для выбора конкретных изображений, способных вызывать точные эмоциональные реакции в поведенческих исследованиях.
В центре работы д-ра Абрахама находится техника регуляции эмоций — когнитивная переоценка, которая предполагает переосмысление значения стимула, чтобы изменить его эмоциональное воздействие.
Согласно_ National Library of Medicine_, переоценка — это широко используемая и хорошо изученная стратегия регуляции эмоций, которая предполагает переосмысление значения ситуации для изменения ее эмоционального воздействия (Gross, 1998).
Эта техника когнитивной переоценки демонстрирует, что изображения могут вызывать определенные когнитивные и эмоциональные реакции, что делает ее ценным механизмом в психологических экспериментах. Это исследование эффективно показывает, как различные контекстуальные интерпретации изображений могут менять наши чувства, предоставляя глубокие инсайты о регуляции эмоций.
Когнитивная переоценка исследует сдвиги эмоциональной реакции относительно ее естественного развития. Возьмем в качестве примера следующее изображение автомобильной аварии. На первый взгляд зритель может испытать шок и счесть его жутким. При повторном анализе могут быть восприняты положительные аспекты, например то, что на изображении никто не пострадал, или даже интерпретация его как постановочного изображения, а не реальной трагедии. Итак, изменив то, как вы думаете, вы можете изменить то, что чувствуете.
Такси, поврежденное в аварии.
Такси, поврежденное в аварии.
Если изображения могут вызывать когнитивные и эмоциональные реакции, то нормативная база данных изображений, в которой можно выполнять поиск на основе сходства стимулов, была бы бесценна для психологических экспериментов.
Измерение психологической дистанции
Ключевой вывод из этого проекта состоит в том, что психологическую дистанцию не следует рассматривать как фиксированную меру, поскольку контекст оказывает на нее сильное влияние. Наличие динамических управляющих параметров может открыть возможности для продвинутых сценариев обработки изображений.
Исследовательская группа использовала теорию уровней конструирования (Construal Level Theory, CLT) в качестве основы для понимания и измерения психологической дистанции.
Согласно Wikipedia, «Теория уровней конструирования (CLT) — это теория в социальной психологии, которая описывает связь между психологической дистанцией и степенью, в которой мышление людей (например, об объектах и событиях) является абстрактным или конкретным_. Основная идея CLT заключается в том, что чем более отдалён объект от индивида, тем более абстрактно он будет осмысляться, тогда как чем ближе объект, тем более конкретно он будет осмысляться».
Проект подчёркивает, что ментальные репрезентации колеблются от проксимальных, здесь и сейчас (например, непосредственный сенсорный опыт), до более удалённого сценария во времени, пространстве или даже фактичности (например, вымышленный образ из прошлого). По сути, по мере перехода от конкретности (конструирование низкого уровня) к абстракции (конструирование высокого уровня) контекстуальная сеть связанных понятий расширяется, повышая сложность когнитивной обработки, задействованной при оценке изображения.
Конструирования служат когнитивными механизмами, которые модулируют нашу перспективу психологической дистанции. Когда мы концептуализируем события или сценарии, удалённые во времени или пространстве, мы склонны использовать более абстрактное рассуждение, сосредотачиваясь на «почему» — более широких причинах, идеалах или принципах. По мере приближения этих событий наше мышление смещается к более непосредственному и практическому «как» — конкретным действиям, необходимым для работы с ситуацией.
Этот переход от абстрактного к конкретному мышлению помогает в планировании и управлении будущими сценариями, повышая нашу способность более эффективно справляться с потенциальными возражениями или вызовами.
Получение правильных данных
Психологическая дистанция определяется по нескольким измерениям, при этом временная, пространственная, социальная и гипотетическая дистанции считаются наиболее важными.
Как было отмечено в презентации, инструменты вроде Google Vision могут классифицировать изображения. Он отлично справляется с определением того, что находится на изображении. Однако он не улавливает его более глубокого смысла — он может сообщить вам объекты в сцене, но мало что сказать о том, как человек может отреагировать на это изображение. Переход от «что» к исследованию «как» лежит в основе проектного предложения.
В исследовании тысячи участников из University of Denver и Amazon Mechanical Turk попросили оценить каждое изображение по 18 отдельным психологическим измерениям, таким как эмоциональная дистанция, движение, воплощённость, социальная и физическая дистанция, что в результате дало более 760 000 уникальных оценок.
Этот богатый набор данных предоставляет полное распределение оценок, выступая ценным ресурсом в рамках теории уровней конструирования и других психологических исследований. Он предлагает надёжные данные, которые можно анализировать и интерпретировать через призму этих теорий, позволяя исследователям получать представления о различных измерениях изображений и их психологических последствиях.
Оценка обеспечила каждое изображение измерениями, которые дают дополнительную перцептивную информацию.
Использование возможностей LLM и векторных баз данных
Команда начала с извлечения визуальных эмбеддингов с помощью модели EfficientNet-B4 model, чтобы зафиксировать семантическое содержание и общую композицию изображений.
Они дополнительно обогатили данные с помощью мультимодальной модели LLaVA, чтобы генерировать подробные описания (до 256 токенов) каждого изображения. Затем эти описания были преобразованы в векторные эмбеддинги с использованием модели OpenAI text-embedding-ada-002.
Следующий шаг — перенести эмбеддинги в векторную базу данных, такую как Milvus и Zilliz Cloud (полностью управляемый Milvus), чтобы лучше обрабатывать и анализировать их многомерность в масштабе.
Такой подход позволяет команде измерять и выполнять поиск по семантическому и визуальному сходству информации, встроенной в каждое изображение, расширяя возможности находить изображения с похожим эмоциональным воздействием или когнитивной привлекательностью.
Благодаря эмбеддингам изображений, обогащенным дополнительной информацией и доступным в векторной базе данных для быстрого анализа, их можно использовать в поведенческой науке, с широкими применениями в терапевтике, безопасности, дизайне продуктов и маркетинговой стратегии, среди прочих сценариев использования.
Разбираемся с возможностями переоценки
Исследование заложило основу для понимания эмоциональных сдвигов, вызванных переоценкой. Участникам было предложено посмотреть на изображение, оценить его, а затем переосмыслить его, чтобы увидеть, как изменятся их эмоциональные реакции. Результаты показали, что люди реагируют более негативно, когда позволяют своим эмоциям развиваться естественным образом.
Однако, помимо оценки валентности и возбуждения, вызываемых изображениями, интересно изучить, что запускает эти эмоциональные сдвиги и что позволяет людям менять свои реакции на изображение. Это исследование рассматривает, как разные изображения «предоставляют» или «ограничивают» возможности для когнитивной reinterpretation, называемые «возможностями переоценки».
Концепция affordances, введенная Гибсоном, описывает, как характеристики объектов предполагают их возможные способы использования, тем самым влияя на наши взаимодействия. В психологическом смысле присущие изображению семантические свойства и спектр ассоциаций, которые оно вызывает, могут влиять на его способность к переоценке.
Исследование стремится определить, как эти свойства коррелируют с восприимчивостью изображения к когнитивной переоценке, потенциально расширяя наше понимание того, как контекст и восприятие влияют на эмоциональную регуляцию. Например, рычащая собака предоставляет меньше возможностей для переоценки из-за низкоуровневой интерпретации и ограниченного контекстуального охвата. Напротив, изображение нациста, находящееся в рамках высокоуровневой интерпретации и встроенное в более широкую семантическую сеть, предоставляет больше возможностей для переосмысления.
Подводя итоги
Доктор Деймон Абрахам проводит новаторское исследование эмоционального резонанса изображений, их способности вызывать когнитивную переоценку и того, как инструментировать это с помощью LLMs и векторной базы данных, такой как Milvus и Zilliz Cloud. Его исследование выявляет ключевые компоненты внутри классов изображений, которые могут надежно прогнозировать их способность способствовать эмоциональным сдвигам, тем самым проливая свет на тонкие механизмы, лежащие в основе наших реакций на визуальные стимулы. Его работа открывает обширный горизонт приложений и сценариев использования, которые опираются на то, как изображения вызывают эмоциональные реакции и влияют на процессы принятия решений.
Захватывающе, не правда ли? Есть идеи для приложения? Начните прямо сейчас!
Если вы хотите узнать больше или начать свой проект по созданию многомерной векторной базы данных изображений для поиска сходства стимулов, например, приглашаем присоединиться к нашему Discord channel. Мы предоставляем множество ресурсов и поддерживающее сообщество, которые помогут вам начать.
Читать далее

Creating Collections in Zilliz Cloud Just Got Way Easier
We've enhanced the entire collection creation experience to bring advanced capabilities directly into the interface, making it faster and easier to build production-ready schemas without switching tools.

Milvus WebUI: A Visual Management Tool for Your Vector Database
Explore Milvus WebUI to monitor, manage, and optimize your vector database with real-time insights, performance tracking, and system health monitoring.

DeepSeek Always Busy? Deploy It Locally with Milvus in Just 10 Minutes—No More Waiting!
Learn how to set up DeepSeek-R1 on your local machine using Ollama, AnythingLLM, and Milvus in just 10 minutes. Bypass busy servers and enhance AI responses with custom data.



