Mejorando los experimentos de ciencias del comportamiento con LLMs y Milvus
Presionar y soltar “botones”: ¿podemos replantear nuestras emociones?
Por supuesto. Dr. Damon Abraham, un científico del comportamiento con un doctorado en Psicología, tiene un proyecto de investigación que demuestra cómo reevaluar una imagen puede cambiar nuestras emociones de valencia y activación. Por lo tanto, la búsqueda consiste en descubrir qué hay en una imagen que permite ese cambio y cómo buscarlo. Aquí es donde entran en juego los embeddings de imágenes multidimensionales y las bases de datos vectoriales.
En su presentación 'From Images to Meanings to Vector Databases’' en el Zilliz Unstructured Data Meetup en Seattle el 13 de febrero de 2024, el Dr. Damon Abraham habla sobre su innovador proyecto de investigación orientado a crear un repositorio de estímulos para la psicología experimental utilizando tecnologías de LLM y bases de datos vectoriales. Esta iniciativa interdisciplinaria implica la colaboración con la Universidad de Denver y con investigadores del Institute of Love and Time y el Institute of Noetic Sciences. Busca desarrollar una base de datos normativa de imágenes de código abierto y técnicas para medir la distancia psicológica dinámica entre las imágenes y su potencial para una reevaluación exitosa.
Ver la charla del Dr. Damon Abraham
El proyecto de psicología
Miles de evaluadores humanos valoraron 2.500 imágenes de una base de datos normativa, midiendo cada una según su intensidad emocional (activación) y valencia (positiva vs. negativa) en 18 clases distintas de estímulos. El objetivo es comprender mejor el significado emocional de estas imágenes mediante la creación de una distribución normal de respuestas para seleccionar imágenes específicas que desencadenen reacciones emocionales precisas en estudios del comportamiento.
Un aspecto central del trabajo del Dr. Abraham es la técnica de regulación emocional de la reevaluación cognitiva, que implica replantear el significado de un estímulo para cambiar su impacto emocional.
Según la_ National Library of Medicine_, la reevaluación es una estrategia de regulación emocional comúnmente utilizada y ampliamente estudiada que implica replantear el significado de una situación para alterar su impacto emocional (Gross, 1998).
Esta técnica de reevaluación cognitiva demuestra que las imágenes pueden evocar respuestas cognitivas y emocionales particulares, lo que la convierte en un mecanismo valioso en los experimentos psicológicos. Esta investigación muestra de manera efectiva cómo diferentes interpretaciones contextuales de las imágenes pueden cambiar nuestros sentimientos, proporcionando perspectivas profundas sobre la regulación emocional.
La reevaluación cognitiva explora los cambios en la respuesta emocional a partir del desarrollo natural. Tomemos como ejemplo la siguiente imagen de un accidente automovilístico. A primera vista, el espectador podría quedar impactado y encontrarla espantosa. En un segundo análisis, podrían percibirse aspectos positivos, como que nadie aparece herido en la imagen o incluso la interpretación de que se trata de una imagen fabricada en lugar de una tragedia real. Así que, al cambiar cómo piensas, puedes cambiar cómo te sientes.
Taxi car damaged in a crash.
Taxi dañado en un choque.
Si las imágenes pueden desencadenar reacciones cognitivas y emocionales, entonces una base de datos normativa de imágenes en la que podamos buscar según la similitud de estímulos sería invaluable en los experimentos psicológicos.
Medir la distancia psicológica
Una idea clave de este proyecto es que la distancia psicológica no debe tratarse como una medida fija porque el contexto influye mucho en ella. Tener controles dinámicos puede liberar casos de uso avanzados de procesamiento de imágenes.
El equipo de investigación empleó la Teoría del Nivel de Construal (CLT) como marco para comprender y medir la distancia psicológica.
Según Wikipedia, “La teoría del nivel de construal (CLT) es una teoría de la psicología social que describe la relación entre la distancia psicológica y el grado en que el pensamiento de las personas (por ejemplo, sobre objetos y acontecimientos) es abstracto o concreto_. La idea central de la CLT es que cuanto más distante esté un objeto del individuo, más abstractamente se pensará en él, mientras que cuanto más cercano esté el objeto, más concretamente se pensará en él.”
El proyecto destaca que las representaciones mentales fluctúan desde lo proximal, aquí y ahora (por ejemplo, la experiencia sensorial directa), hasta un escenario más alejado en el tiempo, el espacio o incluso la factualidad (por ejemplo, una imagen ficticia del pasado). Esencialmente, a medida que transitamos de la concreción (construal de bajo nivel) a la abstracción (construal de alto nivel), la red contextual de conceptos relacionados aumenta, incrementando la complejidad del procesamiento cognitivo implicado al evaluar una imagen.
Los construals sirven como mecanismos cognitivos que modulan nuestra perspectiva sobre la distancia psicológica. Al conceptualizar acontecimientos o escenarios que están temporal o espacialmente distantes, tendemos a emplear un razonamiento más abstracto, centrándonos en el 'por qué': las razones, ideales o principios más amplios involucrados. A medida que estos acontecimientos se acercan, nuestro pensamiento se desplaza hacia el 'cómo' más inmediato y práctico: las acciones específicas necesarias para afrontar la situación.
Este cambio del pensamiento abstracto al concreto ayuda a planificar y gestionar escenarios futuros, mejorando nuestra capacidad para sortear posibles objeciones o desafíos de manera más eficaz.
Obtener los datos adecuados
La distancia psicológica se define a lo largo de varias dimensiones, y las distancias temporal, espacial, social e hipotética se consideran las más importantes.
Como se señaló en la presentación, herramientas como Google Vision pueden clasificar imágenes. Hace un gran trabajo identificando lo que hay en la imagen. Sin embargo, no capta su significado más profundo: puede decirte los objetos que hay en la escena, pero no mucho sobre cómo una persona podría reaccionar ante esa imagen. Pasar del "qué" a explorar el "cómo" es fundamental para la propuesta del proyecto.
En el estudio, se pidió a miles de participantes de la University of Denver y Amazon Mechanical Turk que calificaran cada imagen en 18 dimensiones psicológicas distintas, como distancia emocional, movimiento, encarnación, social y física, lo que dio lugar a más de 760.000 calificaciones únicas.
Este rico conjunto de datos proporciona una distribución completa de calificaciones, sirviendo como un recurso valioso dentro del marco de la Teoría del Nivel de Construal y de otras investigaciones psicológicas. Ofrece datos robustos que pueden analizarse e interpretarse a través de la lente de estas teorías, lo que permite a los investigadores obtener conocimientos sobre diversas dimensiones de las imágenes y sus implicaciones psicológicas.
La calificación proporcionó a cada imagen dimensiones que ofrecen información perceptiva adicional.
Aprovechar el poder de los LLMs y las bases de datos vectoriales
El equipo comenzó extrayendo embeddings visuales utilizando el modelo EfficientNet-B4 para capturar el contenido semántico y la composición general de las imágenes.
Además, enriquecieron los datos utilizando un modelo multimodal, LLaVA, para generar descripciones detalladas (de hasta 256 tokens) de cada imagen. Luego, estas descripciones se convirtieron en embeddings vectoriales utilizando el modelo text-embedding-ada-002 de OpenAI.
El siguiente paso es transferir los embeddings a una base de datos vectorial, como Milvus y Zilliz Cloud (el Milvus totalmente gestionado), para manejar y procesar mejor su multidimensionalidad a escala.
Este enfoque permite al equipo medir y realizar búsquedas de similitud semántica y visual en la información integrada en cada imagen, mejorando la capacidad de encontrar imágenes con impactos emocionales o apelaciones cognitivas similares.
Con los embeddings de imágenes enriquecidos con información adicional y disponibles en una base de datos vectorial para un análisis rápido, pueden utilizarse en la ciencia del comportamiento, con amplias aplicaciones en terapéutica, seguridad, diseño de productos y estrategia de marketing, entre otros casos de uso.
Entendiendo las posibilidades de reappraisal
El estudio sentó las bases para comprender los cambios emocionales causados por las reevaluaciones. Se indicó a los participantes que vieran una imagen, la calificaran y luego la reevaluaran para ver cómo cambiaban sus respuestas emocionales. Los hallazgos revelaron que las personas responden de manera más negativa cuando permiten que sus emociones se desarrollen de forma natural.
Sin embargo, más allá de evaluar la valencia y la activación de las imágenes, resulta intrigante explorar qué desencadena estos cambios emocionales y qué permite a las personas cambiar sus reacciones ante una imagen. Esta exploración examina cómo diferentes imágenes "ofrecen" o "restringen" oportunidades para la reinterpretación cognitiva, denominadas 'posibilidades de reappraisal.'
El concepto de posibilidades, introducido por Gibson, describe cómo las características de los objetos sugieren sus posibles usos, influyendo así en nuestras interacciones. En términos psicológicos, las propiedades semánticas inherentes de una imagen y el rango de asociaciones que invoca pueden afectar su capacidad de reappraisal.
La investigación busca determinar cómo estas propiedades se correlacionan con la susceptibilidad de una imagen a la reevaluación cognitiva, ampliando potencialmente nuestra comprensión de cómo el contexto y la percepción afectan la regulación emocional. Por ejemplo, un perro gruñendo presenta menos oportunidades de reappraisal debido a su nivel bajo de construcción y su alcance contextual limitado. En contraste, una imagen de un nazi, situada dentro de una construcción de alto nivel e integrada en una red semántica más amplia, ofrece mayores posibilidades de reinterpretación.
Conclusión
El Dr. Damon Abraham está impulsando una exploración sobre la resonancia emocional de las imágenes, su capacidad para evocar la reevaluación cognitiva y cómo instrumentarla con LLMs y una base de datos vectorial como Milvus y Zilliz Cloud. Su investigación descubre los componentes clave dentro de las clases de imágenes que pueden predecir de manera fiable su capacidad para facilitar cambios emocionales, arrojando así luz sobre los mecanismos matizados que subyacen a nuestras respuestas a los estímulos visuales. Su trabajo abre un vasto horizonte de aplicaciones y casos de uso que aprovechan cómo las imágenes evocan respuestas emocionales e influyen en los procesos de toma de decisiones.
Emocionante, ¿verdad? ¿Tienes ideas para una aplicación? ¡Comienza!
Si deseas obtener más información o iniciar tu proyecto para construir una base de datos vectorial multidimensional de imágenes para la búsqueda de similitud de estímulos, por ejemplo, te invitamos a unirte a nuestro canal de Discord. Ofrecemos una gran cantidad de recursos y una comunidad de apoyo para ayudarte a comenzar.
Sigue leyendo

Data Deduplication at Trillion Scale: How to Solve the Biggest Bottleneck of LLM Training
Explore how MinHash LSH and Milvus handle data deduplication at the trillion-scale level, solving key bottlenecks in LLM training for improved AI model performance.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.

Building RAG Pipelines for Real-Time Data with Cloudera and Milvus
explore how Cloudera can be integrated with Milvus to effectively implement some of the key functionalities of RAG pipelines.



