La ricerca di similarità vettoriale si nasconde in bella vista
L'intelligenza artificiale (AI) ha il potenziale per cambiare il modo in cui vengono svolte anche le cose più oscure. Ad esempio, ogni anno (prima del COVID, comunque) oltre 73.000 persone si riuniscono per competere nella Maratona di Hong Kong. Per rilevare e registrare correttamente i tempi di arrivo di tutti i partecipanti alla gara, gli organizzatori distribuiscono 73.000 timer con chip RFID da attaccare a ciascun corridore. Il cronometraggio con chip è un'operazione complessa con evidenti svantaggi. I materiali (chip e dispositivi elettronici di lettura) devono essere acquistati o noleggiati da società di cronometraggio, e un'area di registrazione deve essere presidiata affinché i corridori possano ritirare i chip il giorno della gara. Inoltre, se i sensori sono installati solo alle linee di partenza e di arrivo, è possibile che corridori senza scrupoli taglino il percorso.
Cronometrare i maratoneti è una sfida logistica a cui pochi pensano.
Ora immagina un'applicazione di video AI in grado di identificare automaticamente i singoli corridori da filmati ripresi al traguardo usando una singola foto. Invece di attaccare chip di cronometraggio a ciascun partecipante, i corridori caricano semplicemente una propria foto tramite un'app dopo aver tagliato il traguardo. All'istante, vengono forniti un video personalizzato dei momenti salienti, statistiche della gara e altre informazioni rilevanti. Le telecamere installate in vari punti lungo la gara possono acquisire ulteriori filmati dei partecipanti e garantire che ogni corridore percorra l'intero tracciato. Quale soluzione sembra più facile e più conveniente da implementare?
Sebbene la Maratona di Hong Kong non sfrutti (ancora) il machine learning per sostituire i chip di cronometraggio, questo esempio illustra il potenziale dell'AI di alterare drasticamente tutto ciò che ci circonda. Per il cronometraggio delle gare, riduce decine di migliaia di chip a poche telecamere abbinate ad algoritmi di machine learning. Ma la video AI è solo una delle molte applicazioni della ricerca di similarità vettoriale, un processo che utilizza l'intelligenza artificiale per analizzare enormi dataset non strutturati su scala di trilioni. Questo articolo fornisce una panoramica della tecnologia di ricerca vettoriale, compreso che cos'è, come può essere utilizzata, nonché il software open-source e le risorse che la rendono più accessibile che mai.
Vai a:
Quali sono alcune applicazioni della ricerca di similarità vettoriale?
Software e risorse open-source per la ricerca di similarità vettoriale.
Che cos'è la ricerca di similarità vettoriale?
I dati video sono incredibilmente dettagliati e sempre più comuni, quindi logicamente sembra che sarebbero un ottimo segnale di apprendimento non supervisionato per costruire video AI. In realtà, non è così. Elaborare e analizzare dati video, soprattutto in grandi volumi, rimane una sfida per l'intelligenza artificiale. I recenti progressi in questo campo, come gran parte dei progressi compiuti nell'analisi dei dati non strutturati, sono dovuti in larga misura alla ricerca di similarità vettoriale.
Il problema dei video, come di tutti i dati non strutturati, è che non seguono un modello predefinito o una struttura organizzativa, rendendoli difficili da elaborare e analizzare su larga scala. I dati non strutturati includono elementi come immagini, audio, comportamento sui social media e documenti, che complessivamente rappresentano una stima dell'80-90%+ di tutti i dati. Le aziende sono sempre più consapevoli degli insight critici per il business sepolti in enormi ed enigmatici dataset non strutturati, alimentando la domanda di applicazioni AI in grado di attingere a questo potenziale non realizzato.
Utilizzando reti neurali come CNN, RNN e BERT, i dati non strutturati possono essere convertiti in vettori di caratteristiche (noti anche come embedding), un formato di dati numerici leggibile da una macchina. Gli algoritmi vengono quindi utilizzati per calcolare la somiglianza tra vettori usando misure come la similarità coseno o la distanza euclidea. L’incorporamento vettoriale e la ricerca per somiglianza rendono possibile analizzare e creare applicazioni di machine learning utilizzando dataset precedentemente indistinguibili.
La somiglianza vettoriale viene calcolata utilizzando algoritmi consolidati; tuttavia, i dataset non strutturati sono in genere enormi. Ciò significa che una ricerca efficiente e accurata richiede enormi capacità di archiviazione e potenza di calcolo. Per accelerare la ricerca per somiglianza e ridurre i requisiti di risorse, vengono utilizzati algoritmi di ricerca dei vicini più prossimi approssimati (ANN). Raggruppando vettori simili, gli algoritmi ANN rendono possibile inviare query ai cluster di vettori con maggiore probabilità di contenere vettori simili, invece di cercare nell’intero dataset. Sebbene questo approccio sia più veloce, sacrifica un certo grado di accuratezza. Sfruttare gli algoritmi ANN consente alla ricerca vettoriale di scandagliare miliardi di insight di modelli di deep learning in millisecondi.
Quali sono alcune applicazioni della ricerca per somiglianza vettoriale?
La ricerca per somiglianza vettoriale ha applicazioni che spaziano in un’ampia varietà di scenari di intelligenza artificiale, deep learning e calcolo vettoriale tradizionale. Di seguito viene fornita una panoramica generale di varie applicazioni della ricerca per somiglianza vettoriale:
E-commerce: La ricerca per somiglianza vettoriale ha un’ampia applicabilità nell’e-commerce, inclusi i motori di ricerca inversa per immagini che consentono agli acquirenti di cercare prodotti utilizzando un’immagine acquisita con il proprio smartphone o trovata online. Inoltre, raccomandazioni personalizzate basate sul comportamento degli utenti, sugli interessi, sulla cronologia degli acquisti e altro ancora possono essere fornite da sistemi di raccomandazione specializzati che si basano sulla ricerca vettoriale.
Sicurezza fisica e informatica: La video AI è solo una delle molte applicazioni della ricerca per somiglianza vettoriale nel campo della sicurezza. Altri scenari includono riconoscimento facciale, tracciamento del comportamento, autenticazione dell’identità, controllo degli accessi intelligente e altro ancora. Inoltre, la ricerca per somiglianza vettoriale svolge un ruolo importante nel contrastare attacchi informatici sempre più comuni e sofisticati. Ad esempio, la ricerca per somiglianza del codice può essere utilizzata per identificare rischi per la sicurezza confrontando un componente software con un database di vulnerabilità note o malware.
Motori di raccomandazione: I motori di raccomandazione sono sistemi che utilizzano il machine learning e l’analisi dei dati per suggerire prodotti, servizi, contenuti e informazioni agli utenti. Il comportamento dell’utente, il comportamento di utenti simili e altri dati vengono elaborati utilizzando metodi di deep learning per generare raccomandazioni. Con dati sufficienti, gli algoritmi possono essere addestrati a comprendere le relazioni tra entità e a inventare modi per rappresentarle autonomamente. I sistemi di raccomandazione hanno un’ampia applicabilità e sono qualcosa con cui le persone interagiscono già ogni giorno, incluse le raccomandazioni di contenuti su Netflix, i suggerimenti di acquisto su Amazon e i feed di notizie su Facebook.
Chatbot: Tradizionalmente, i chatbot vengono costruiti utilizzando un normale grafo della conoscenza che richiede un ampio dataset di addestramento. Tuttavia, i chatbot costruiti utilizzando modelli di deep learning non hanno bisogno di pre-elaborare i dati: viene invece creata una mappa tra domande frequenti e risposte. Utilizzando un modello di elaborazione del linguaggio naturale (NLP) pre-addestrato, i vettori di caratteristiche possono essere estratti dalle domande e quindi archiviati e interrogati utilizzando una piattaforma di gestione dei dati vettoriali.
Ricerca di immagini o video: Le reti di deep learning sono state utilizzate per riconoscere pattern visivi fin dalla fine degli anni ’70, e le tendenze tecnologiche moderne hanno reso la ricerca di immagini e video più potente e accessibile che mai.
Ricerca di similarità chimica: La similarità chimica è fondamentale per prevedere le proprietà dei composti chimici e trovare sostanze chimiche con attributi specifici, rendendola indispensabile per lo sviluppo di nuovi farmaci. Per ogni molecola vengono create impronte digitali rappresentate da vettori di caratteristiche, quindi le distanze tra i vettori vengono utilizzate per misurare la similarità. L’utilizzo dell’IA per la scoperta di nuovi farmaci sta guadagnando slancio nel settore tecnologico, con ByteDance (la società madre cinese di TikTok) che ha iniziato ad assumere talenti nel campo.
Software e risorse open-source per la ricerca di similarità vettoriale.
La legge di Moore, il cloud computing e il calo dei costi delle risorse sono tendenze macro che hanno reso l’intelligenza artificiale più accessibile che mai. Grazie al software open-source e ad altre risorse disponibili pubblicamente, creare applicazioni di IA/ML non è più solo per le grandi aziende tecnologiche. Di seguito forniamo una breve panoramica di Milvus, una piattaforma open-source per la gestione di dati vettoriali, e segnaliamo anche alcuni dataset disponibili pubblicamente che contribuiscono a rendere l’IA alla portata di tutti.
Milvus, una piattaforma open-source per la gestione di dati vettoriali
Milvus è una piattaforma open-source per la gestione di dati vettoriali (nota anche come database vettoriale costruita specificamente per dati vettoriali su scala massiva. Alimentata da Facebook AI Similarity Search (Faiss), Non-Metric Space Library (NMSLIB) e Annoy, Milvus riunisce una varietà di strumenti potenti in un’unica piattaforma, estendendone al contempo la funzionalità autonoma. Il sistema è stato progettato appositamente per archiviare, elaborare e analizzare grandi dataset vettoriali, e può essere utilizzato per creare tutte le applicazioni di IA (e altre ancora) menzionate sopra.
Ulteriori informazioni su Milvus sono disponibili sul suo sito web. Tutorial, istruzioni per configurare Milvus, benchmark testing e informazioni sulla creazione di una varietà di applicazioni diverse sono disponibili nel Milvus bootcamp. Gli sviluppatori interessati a contribuire al progetto possono unirsi alla community open-source di Milvus su GitHub.
Dataset pubblici per l’intelligenza artificiale e il machine learning
Non è un segreto che giganti tecnologici come Google e Facebook abbiano un vantaggio in termini di dati rispetto agli attori più piccoli, con alcuni opinionisti che arrivano persino a sostenere un “mandato progressivo di condivisione dei dati” che costringerebbe le aziende che superano una certa dimensione a condividere alcuni dati anonimizzati con concorrenti più piccoli. Fortunatamente, esistono migliaia di dataset disponibili pubblicamente che possono essere utilizzati per progetti di IA/ML:
The People’s Speech Dataset: Questo dataset di ML Commons offre il più grande dataset vocale al mondo, con oltre 87.000 ore di parlato trascritto in 59 lingue diverse.
UC Irvine Machine Learning Repository: La University of California di Irvine mantiene centinaia di dataset pubblici nel tentativo di aiutare la comunità del machine learning.
Data.gov: Il governo degli Stati Uniti offre centinaia di migliaia di dataset aperti che coprono istruzione, clima, COVID-19 e altro.
Eurostat: L’ufficio statistico dell’Unione Europea fornisce dataset aperti che coprono una varietà di settori, dall’economia e finanza alla popolazione e alle condizioni sociali.
Harvard Dataverse: The Harvard Dataverse Repository è un repository di dati gratuito aperto ai ricercatori di tutte le discipline. Molti dataset sono pubblici, mentre altri prevedono termini di utilizzo più restrittivi.
Sebbene questo elenco non sia affatto esaustivo, è un buon punto di partenza per scoprire la sorprendente ampia varietà di dataset aperti. Per maggiori informazioni sui dataset pubblici, nonché sulla scelta dei dati giusti per il tuo prossimo progetto di ML o data science, consulta questo post su Medium.
Per saperne di più sulla ricerca di similarità vettoriale, consulta le seguenti risorse:
Continua a leggere

Why Teams Are Migrating from Weaviate to Zilliz Cloud — and How to Do It Seamlessly
Explore how Milvus scales for large datasets and complex queries with advanced features, and discover how to migrate from Weaviate to Zilliz Cloud.

Vector Databases vs. Document Databases
Use a vector database for similarity search and AI-powered applications; use a document database for flexible schema and JSON-like data storage.

Bringing AI to Legal Tech: The Role of Vector Databases in Enhancing LLM Guardrails
Discover how vector databases enhance AI reliability in legal tech, ensuring accurate, compliant, and trustworthy AI-powered legal solutions.



