Vektorähnlichkeitssuche verbirgt sich direkt vor unseren Augen
Künstliche Intelligenz (KI) hat das Potenzial, die Art und Weise zu verändern, wie selbst die ungewöhnlichsten Dinge erledigt werden. Zum Beispiel versammeln sich jedes Jahr (jedenfalls vor COVID) über 73.000 Menschen, um beim Hong Kong Marathon anzutreten. Um die Zielzeiten aller Rennteilnehmer korrekt zu erfassen und aufzuzeichnen, verteilen die Organisatoren 73.000 RFID-Chip-Timer, die an jedem Läufer befestigt werden. Chip-Timing ist ein komplexes Unterfangen mit offensichtlichen Nachteilen. Materialien (Chips und elektronische Lesegeräte) müssen von Zeitnahmeunternehmen gekauft oder gemietet werden, und ein Registrierungsbereich muss mit Personal besetzt werden, damit Läufer am Renntag Chips abholen können. Wenn Sensoren außerdem nur an Start- und Ziellinie installiert sind, ist es möglich, dass skrupellose Läufer die Strecke abkürzen.
Die Zeitnahme bei Marathonläufern ist eine logistische Herausforderung, über die nur wenige nachdenken.
Stellen Sie sich nun eine Video-KI-Anwendung vor, die in der Lage ist, einzelne Läufer anhand von am Ziel aufgenommenem Filmmaterial mithilfe eines einzigen Fotos automatisch zu identifizieren. Anstatt an jedem Teilnehmer Timing-Chips zu befestigen, laden Läufer einfach ein Foto von sich über eine App hoch, nachdem sie die Ziellinie überquert haben. Sofort werden ein personalisiertes Highlight-Video, Rennstatistiken und andere relevante Informationen bereitgestellt. Kameras, die an verschiedenen Punkten entlang des Rennens installiert sind, können zusätzliches Filmmaterial von Teilnehmern aufnehmen und sicherstellen, dass jeder Läufer die gesamte Strecke zurücklegt. Welche Lösung scheint einfacher und kostengünstiger umzusetzen?
Obwohl der Hong Kong Marathon maschinelles Lernen (noch) nicht nutzt, um Timing-Chips zu ersetzen, veranschaulicht dieses Beispiel das Potenzial von KI, alles um uns herum drastisch zu verändern. Für die Rennzeitnahme reduziert es Zehntausende von Chips auf einige wenige Kameras in Kombination mit Algorithmen des maschinellen Lernens. Doch Video-KI ist nur eine von vielen Anwendungen für die Vektorähnlichkeitssuche, einen Prozess, der künstliche Intelligenz nutzt, um riesige, unstrukturierte Datensätze im Billionenmaßstab zu analysieren. Dieser Artikel bietet einen Überblick über die Vektorsuchtechnologie, einschließlich dessen, was sie ist, wie sie genutzt werden kann, sowie über die Open-Source-Software und Ressourcen, die sie zugänglicher machen als je zuvor.
Direkt zu:
Was ist Vektorähnlichkeitssuche?
Videodaten sind unglaublich detailliert und zunehmend verbreitet, daher scheint es logisch, dass sie ein großartiges unüberwachtes Lernsignal für den Aufbau von Video-KI sein könnten. In Wirklichkeit ist dies nicht der Fall. Die Verarbeitung und Analyse von Videodaten, insbesondere in großen Mengen, bleibt eine Herausforderung für künstliche Intelligenz. Die jüngsten Fortschritte in diesem Bereich sind, wie ein Großteil der Fortschritte in der Analyse unstrukturierter Daten, zu einem großen Teil der Vektorähnlichkeitssuche zu verdanken.
Das Problem mit Video, wie bei allen unstrukturierten Daten, besteht darin, dass es keinem vordefinierten Modell oder keiner organisatorischen Struktur folgt, was die Verarbeitung und Analyse in großem Maßstab erschwert. Unstrukturierte Daten umfassen Dinge wie Bilder, Audio, Verhalten in sozialen Medien und Dokumente, die zusammen schätzungsweise 80–90 % und mehr aller Daten ausmachen. Unternehmen sind sich zunehmend der geschäftskritischen Erkenntnisse bewusst, die in riesigen, rätselhaften unstrukturierten Datensätzen verborgen sind, was die Nachfrage nach KI-Anwendungen antreibt, die dieses ungenutzte Potenzial erschließen können.
Mithilfe von neuronalen Netzen wie CNN, RNN und BERT können unstrukturierte Daten in Merkmalsvektoren (auch Embeddings genannt), ein maschinenlesbares numerisches Datenformat, umgewandelt werden. Anschließend werden Algorithmen verwendet, um die Ähnlichkeit zwischen Vektoren anhand von Maßen wie Kosinus-Ähnlichkeit oder euklidischer Distanz zu berechnen. Vektoreinbettung und Ähnlichkeitssuche ermöglichen es, Machine-Learning-Anwendungen mithilfe zuvor nicht erkennbarer Datensätze zu analysieren und zu erstellen.
Die Vektorähnlichkeit wird mit etablierten Algorithmen berechnet, allerdings sind unstrukturierte Datensätze typischerweise riesig. Das bedeutet, dass eine effiziente und genaue Suche enorme Speicher- und Rechenleistung erfordert. Um die Ähnlichkeitssuche zu beschleunigen und den Ressourcenbedarf zu reduzieren, werden Suchalgorithmen für approximative nächste Nachbarn (ANN) verwendet. Durch das Clustern ähnlicher Vektoren ermöglichen es ANN-Algorithmen, Abfragen an die Cluster von Vektoren zu senden, die am wahrscheinlichsten ähnliche Vektoren enthalten, anstatt den gesamten Datensatz zu durchsuchen. Obwohl dieser Ansatz schneller ist, opfert er einen gewissen Grad an Genauigkeit. Die Nutzung von ANN-Algorithmen ermöglicht es der Vektorsuche, Milliarden von Erkenntnissen aus Deep-Learning-Modellen in Millisekunden zu durchsuchen.
Was sind einige Anwendungen der Vektorähnlichkeitssuche?
Die Vektorähnlichkeitssuche findet Anwendung in einer Vielzahl von Szenarien der künstlichen Intelligenz, des Deep Learning und der traditionellen Vektorberechnung. Im Folgenden finden Sie einen allgemeinen Überblick über verschiedene Anwendungen der Vektorähnlichkeitssuche:
E-Commerce: Die Vektorähnlichkeitssuche ist im E-Commerce breit einsetzbar, einschließlich Reverse-Image-Search-Engines, die es Käufern ermöglichen, mithilfe eines auf ihrem Smartphone aufgenommenen oder online gefundenen Bildes nach Produkten zu suchen. Darüber hinaus können personalisierte Empfehlungen auf Grundlage des Nutzerverhaltens, der Interessen, der Kaufhistorie und weiterer Faktoren von spezialisierten Empfehlungssystemen bereitgestellt werden, die auf Vektorsuche basieren.
Physische Sicherheit & Cybersicherheit: Video-KI ist nur eine von vielen Anwendungen für die Vektorähnlichkeitssuche im Sicherheitsbereich. Weitere Szenarien umfassen Gesichtserkennung, Verhaltensverfolgung, Identitätsauthentifizierung, intelligente Zutrittskontrolle und mehr. Darüber hinaus spielt die Vektorähnlichkeitssuche eine wichtige Rolle bei der Abwehr zunehmend häufiger und ausgefeilter Cyberangriffe. Beispielsweise kann die Code-Ähnlichkeitssuche verwendet werden, um Sicherheitsrisiken zu identifizieren, indem ein Softwarebestandteil mit einer Datenbank bekannter Schwachstellen oder Malware verglichen wird.
Recommendation Engines: Recommendation Engines sind Systeme, die Machine Learning und Datenanalyse nutzen, um Nutzern Produkte, Dienste, Inhalte und Informationen vorzuschlagen. Das Nutzerverhalten, das Verhalten ähnlicher Nutzer und andere Daten werden mit Deep-Learning-Methoden verarbeitet, um Empfehlungen zu generieren. Mit ausreichend Daten können Algorithmen darauf trainiert werden, Beziehungen zwischen Entitäten zu verstehen und Wege zu entwickeln, sie autonom darzustellen. Empfehlungssysteme sind breit einsetzbar und etwas, womit Menschen bereits täglich interagieren, einschließlich Inhaltsempfehlungen auf Netflix, Einkaufsempfehlungen auf Amazon und Newsfeeds auf Facebook.
Chatbots: Traditionell werden Chatbots mithilfe eines regulären Wissensgraphen erstellt, der einen großen Trainingsdatensatz erfordert. Chatbots, die mit Deep-Learning-Modellen erstellt werden, müssen Daten jedoch nicht vorverarbeiten – stattdessen wird eine Zuordnung zwischen häufigen Fragen und Antworten erstellt. Mithilfe eines vortrainierten Modells für Natural Language Processing (NLP) können Merkmalsvektoren aus den Fragen extrahiert und anschließend über eine Vektordatenverwaltungsplattform gespeichert und abgefragt werden.
Bild- oder Videosuche: Deep-Learning-Netzwerke werden seit den späten 1970er-Jahren zur Erkennung visueller Muster eingesetzt, und moderne Technologietrends haben die Bild- und Videosuche leistungsfähiger und zugänglicher gemacht als je zuvor.
Suche nach chemischer Ähnlichkeit: Chemische Ähnlichkeit ist entscheidend für die Vorhersage der Eigenschaften chemischer Verbindungen und das Auffinden von Chemikalien mit bestimmten Merkmalen, was sie für die Entwicklung neuer Medikamente unverzichtbar macht. Für jedes Molekül werden Fingerprints erstellt, die durch Merkmalsvektoren dargestellt werden, und anschließend werden die Abstände zwischen den Vektoren verwendet, um die Ähnlichkeit zu messen. Der Einsatz von KI für die Entdeckung neuer Medikamente gewinnt in der Tech-Branche an Dynamik, wobei ByteDance (die chinesische Muttergesellschaft von TikTok) begonnen hat, Talente in diesem Bereich einzustellen.
Open-Source-Software und Ressourcen für die Vektorähnlichkeitssuche.
Das Mooresche Gesetz, Cloud Computing und sinkende Ressourcenkosten sind Makrotrends, die künstliche Intelligenz zugänglicher gemacht haben als je zuvor. Dank Open-Source-Software und anderen öffentlich verfügbaren Ressourcen ist die Entwicklung von KI/ML-Anwendungen nicht mehr nur großen Tech-Unternehmen vorbehalten. Im Folgenden geben wir einen kurzen Überblick über Milvus, eine Open-Source-Plattform für Vektordatenmanagement, und heben außerdem einige öffentlich verfügbare Datensätze hervor, die dazu beitragen, KI für alle zugänglich zu machen.
Milvus, eine Open-Source-Plattform für Vektordatenmanagement
Milvus ist eine Open-Source-Plattform für Vektordatenmanagement (auch bekannt als Vektordatenbank, die speziell für Vektordaten in massivem Umfang entwickelt wurde. Angetrieben von Facebook AI Similarity Search (Faiss), Non-Metric Space Library (NMSLIB) und Annoy vereint Milvus eine Vielzahl leistungsstarker Tools auf einer einzigen Plattform und erweitert zugleich deren eigenständige Funktionalität. Das System wurde speziell für das Speichern, Verarbeiten und Analysieren großer Vektordatensätze entwickelt und kann zum Erstellen aller oben genannten KI-Anwendungen (und mehr) verwendet werden.
Weitere Informationen zu Milvus finden Sie auf seiner Website. Tutorials, Anleitungen zur Einrichtung von Milvus, Benchmark-Tests und Informationen zum Erstellen einer Vielzahl unterschiedlicher Anwendungen sind im Milvus-Bootcamp verfügbar. Entwickler, die daran interessiert sind, Beiträge zum Projekt zu leisten, können der Open-Source-Community von Milvus auf GitHub beitreten.
Öffentliche Datensätze für künstliche Intelligenz und maschinelles Lernen
Es ist kein Geheimnis, dass Technologieriesen wie Google und Facebook gegenüber den kleineren Akteuren einen Datenvorteil haben, wobei einige Experten sogar ein „progressives Mandat zur Datenweitergabe“ befürworten, das Unternehmen, die eine bestimmte Größe überschreiten, dazu verpflichten würde, einige anonymisierte Daten mit kleineren Wettbewerbern zu teilen. Glücklicherweise gibt es Tausende öffentlich verfügbarer Datensätze, die für KI/ML-Projekte verwendet werden können:
The People’s Speech Dataset: Dieser Datensatz von ML Commons bietet den größten Sprachdatensatz der Welt mit über 87.000 Stunden transkribierter Sprache in 59 verschiedenen Sprachen.
UC Irvine Machine Learning Repository: Die University of California at Irvine pflegt Hunderte öffentlicher Datensätze, um die Machine-Learning-Community zu unterstützen.
Data.gov: Die US-Regierung bietet Hunderttausende offener Datensätze an, die Bildung, Klima, COVID-19 und mehr abdecken.
Eurostat: Das statistische Amt der Europäischen Union stellt offene Datensätze bereit, die eine Vielzahl von Branchen abdecken, von Wirtschaft und Finanzen bis hin zu Bevölkerung und sozialen Bedingungen.
Harvard Dataverse: Das Harvard Dataverse Repository ist ein kostenloses Datenrepository, das Forschenden verschiedener Disziplinen offensteht. Viele Datensätze sind öffentlich, während andere mit stärker eingeschränkten Nutzungsbedingungen versehen sind.
Obwohl diese Liste keineswegs vollständig ist, ist sie ein guter Ausgangspunkt, um die überraschend große Vielfalt offener Datensätze zu entdecken. Weitere Informationen zu öffentlichen Datensätzen sowie zur Auswahl der richtigen Daten für dein nächstes ML- oder Data-Science-Projekt findest du in diesem Medium-Beitrag.
Um mehr über die Vektorähnlichkeitssuche zu erfahren, sieh dir die folgenden Ressourcen an:
Weiterlesen

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.

Why Teams Are Migrating from Weaviate to Zilliz Cloud — and How to Do It Seamlessly
Explore how Milvus scales for large datasets and complex queries with advanced features, and discover how to migrate from Weaviate to Zilliz Cloud.

What is the K-Nearest Neighbors (KNN) Algorithm in Machine Learning?
KNN is a supervised machine learning technique and algorithm for classification and regression. This post is the ultimate guide to KNN.



