Tim Spann: Warum ich zu Zilliz gekommen bin
Einführung
Mein Name ist Tim Spann und ich arbeite bei Zilliz im Bereich Developer Advocacy für das großartige Open-Source-Projekt Milvus. Open Source und die Unterstützung von Entwicklern, Engineers und coolen Projekten sind seit einigen Jahren meine Leidenschaft und umfassen Themen wie Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive und Spring.
Meine Medium-Beiträge: https://medium.com/@tspann
Mein YouTube-Kanal: https://www.youtube.com/@FLaNK-Stack
Neue Herausforderungen
In den letzten zwei Jahren habe ich an der Schnittstelle von Streaming und KI gearbeitet, und hier habe ich zum ersten Mal erkannt, wie wichtig eine Datenbank für KI ist, die jede Art von Daten in jedem benötigten Modus speichern und abfragen kann.
Ich habe mit generativer KI gearbeitet, aber ich musste dorthin, wohin die Zukunft führt und wo die neue Datenverarbeitung stattfindet. Die Verarbeitung unstrukturierter Daten wird jetzt benötigt, und ich muss die Botschaft verbreiten. Dies ist der richtige Ort. Mit Milvus, Towhee, Attu und Integrationen mit Kafka sowie all den coolen LlamaX-Frameworks lässt sich das umsetzen. Wir müssen eine globale Gruppe von Engineers für unstrukturierte Daten und Daten-Superstars aufbauen. Ich freue mich sehr, diese beschleunigte Reise fortzusetzen. Ich interessiere mich seit fast einem Jahrzehnt für Machine Learning, Natural Language Processing und Edge AI.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Mehr als Vektordatenbanken
Milvus allein ist ein leistungsstarker Datenspeicher und ein Grund, bei Zilliz arbeiten zu wollen. Dies ist erst der Beginn eines neuen Paradigmenwechsels für die nächste durch generative KI angetriebene Datenrevolution. Der Bedarf an leistungsstarken, schnellen Möglichkeiten zur Verarbeitung unstrukturierter Daten und an Vector ETL ist bereits offensichtlich und wächst weiter. In den nächsten Jahren werden wir einen Aufstieg von Engineering und Verarbeitung unstrukturierter Daten erleben, ähnlich wie wir es mit Spark, Flink und Kafka für strukturierte und semistrukturierte Daten gesehen haben.
Der Bedarf, Logs, E-Mails, Dokumente, Slack-Nachrichten, Fotos, Bilder, Videos, Audiodateien und noch mehr binäre Formate zu laden, wird Branchen verändern. Als ich mit Big Data begann, mussten wir viele JSON-, CSV-, XML-, relationale Tabellen- und strukturierte Daten bewegen. Diese Dateien haben wir immer noch, und wir streamen sie auch, aber wir benötigen unsere Daten für die Ähnlichkeitssuche verfügbar und vektorisiert für schnellen Zugriff.
Wir werden ebenso viele Prompts erstellen wie SQL-Anweisungen. Viele dieser Datenformate müssen für dieselben Anwendungen verwendet werden. Wir können JSON-Metadaten zusammen mit unseren Vektoren für zusätzliche Sucharten hinzufügen, während die Grenzen zwischen unstrukturierten Daten und strukturierten Daten verschwimmen, da Modelle und Prompts eine föderierte Sicht auf Daten erfordern, insbesondere für Live-Anwendungsfälle.
Ich habe dies bereits bei Anwendungen im öffentlichen Nahverkehr gesehen, und es wird in alle Unternehmensanwendungen einziehen, einschließlich IoT und Betrugsanalysen.
Die Zukunft bringt deutlich mehr Daten, einen enormen Bedarf an Verarbeitung unstrukturierter Daten, eine skalierbare Open-Source-KI-Datenbank, die die neuen Daten verarbeiten kann, und eine ständig wachsende Vielfalt an KI-Modellen.
Es braucht ein Team
Ich hatte das große Glück, bereits zuvor mit einigen meiner Kollegen zusammengearbeitet zu haben, und war gespannt darauf, wieder mit ihnen zu arbeiten. Außerdem war ich unglaublich beeindruckt von allen, mit denen ich vor meinem Einstieg gesprochen habe. Dies ist ein unglaublich kompetentes, intelligentes Team mit fundierter Erfahrung darin, innovative Technologie in den Mainstream zu bringen. Die Zukunft beginnt jetzt, lasst uns eintauchen.
Community
Begleiten Sie mich im Raum New York City zu Meetups und anderen Veranstaltungen.
Ich unterstütze außerdem viele der KI-Veranstaltungen in Princeton und arbeite mit StartupGrind Princeton und Trenton, Applied Generative AI und dem NJ GAI Meetup zusammen.
Weiterlesen

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.

Optimizing Embedding Model Selection with TDA Clustering: A Strategic Guide for Vector Databases
Discover how Topological Data Analysis (TDA) reveals hidden embedding model weaknesses and helps optimize vector database performance.



