Tim Spann: Warum ich zu Zilliz gekommen bin
Einführung
Mein Name ist Tim Spann und ich arbeite bei Zilliz im Bereich Developer Advocacy für das großartige Open-Source-Projekt Milvus. Open Source und die Unterstützung von Entwicklern, Engineers und coolen Projekten sind seit einigen Jahren meine Leidenschaft und umfassen Themen wie Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive und Spring.
Meine Medium-Beiträge: https://medium.com/@tspann
Mein YouTube-Kanal: https://www.youtube.com/@FLaNK-Stack
Neue Herausforderungen
In den letzten zwei Jahren habe ich an der Schnittstelle von Streaming und KI gearbeitet, und hier habe ich zum ersten Mal erkannt, wie wichtig eine Datenbank für KI ist, die jede Art von Daten in jedem benötigten Modus speichern und abfragen kann.
Ich habe mit generativer KI gearbeitet, aber ich musste dorthin, wohin die Zukunft führt und wo die neue Datenverarbeitung stattfindet. Die Verarbeitung unstrukturierter Daten wird jetzt benötigt, und ich muss die Botschaft verbreiten. Dies ist der richtige Ort. Mit Milvus, Towhee, Attu und Integrationen mit Kafka sowie all den coolen LlamaX-Frameworks lässt sich das umsetzen. Wir müssen eine globale Gruppe von Engineers für unstrukturierte Daten und Daten-Superstars aufbauen. Ich freue mich sehr, diese beschleunigte Reise fortzusetzen. Ich interessiere mich seit fast einem Jahrzehnt für Machine Learning, Natural Language Processing und Edge AI.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Mehr als Vektordatenbanken
Milvus allein ist ein leistungsstarker Datenspeicher und ein Grund, bei Zilliz arbeiten zu wollen. Dies ist erst der Beginn eines neuen Paradigmenwechsels für die nächste durch generative KI angetriebene Datenrevolution. Der Bedarf an leistungsstarken, schnellen Möglichkeiten zur Verarbeitung unstrukturierter Daten und an Vector ETL ist bereits offensichtlich und wächst weiter. In den nächsten Jahren werden wir einen Aufstieg von Engineering und Verarbeitung unstrukturierter Daten erleben, ähnlich wie wir es mit Spark, Flink und Kafka für strukturierte und semistrukturierte Daten gesehen haben.
Der Bedarf, Logs, E-Mails, Dokumente, Slack-Nachrichten, Fotos, Bilder, Videos, Audiodateien und noch mehr binäre Formate zu laden, wird Branchen verändern. Als ich mit Big Data begann, mussten wir viele JSON-, CSV-, XML-, relationale Tabellen- und strukturierte Daten bewegen. Diese Dateien haben wir immer noch, und wir streamen sie auch, aber wir benötigen unsere Daten für die Ähnlichkeitssuche verfügbar und vektorisiert für schnellen Zugriff.
Wir werden ebenso viele Prompts erstellen wie SQL-Anweisungen. Viele dieser Datenformate müssen für dieselben Anwendungen verwendet werden. Wir können JSON-Metadaten zusammen mit unseren Vektoren für zusätzliche Sucharten hinzufügen, während die Grenzen zwischen unstrukturierten Daten und strukturierten Daten verschwimmen, da Modelle und Prompts eine föderierte Sicht auf Daten erfordern, insbesondere für Live-Anwendungsfälle.
Ich habe dies bereits bei Anwendungen im öffentlichen Nahverkehr gesehen, und es wird in alle Unternehmensanwendungen einziehen, einschließlich IoT und Betrugsanalysen.
Die Zukunft bringt deutlich mehr Daten, einen enormen Bedarf an Verarbeitung unstrukturierter Daten, eine skalierbare Open-Source-KI-Datenbank, die die neuen Daten verarbeiten kann, und eine ständig wachsende Vielfalt an KI-Modellen.
Es braucht ein Team
Ich hatte das große Glück, bereits zuvor mit einigen meiner Kollegen zusammengearbeitet zu haben, und war gespannt darauf, wieder mit ihnen zu arbeiten. Außerdem war ich unglaublich beeindruckt von allen, mit denen ich vor meinem Einstieg gesprochen habe. Dies ist ein unglaublich kompetentes, intelligentes Team mit fundierter Erfahrung darin, innovative Technologie in den Mainstream zu bringen. Die Zukunft beginnt jetzt, lasst uns eintauchen.
Community
Begleiten Sie mich im Raum New York City zu Meetups und anderen Veranstaltungen.
Ich unterstütze außerdem viele der KI-Veranstaltungen in Princeton und arbeite mit StartupGrind Princeton und Trenton, Applied Generative AI und dem NJ GAI Meetup zusammen.
Weiterlesen

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

Milvus 2.6.x Now Generally Available on Zilliz Cloud, Making Vector Search Faster, Smarter, and More Cost-Efficient for Production AI
Milvus 2.6.x is now GA on Zilliz Cloud, delivering faster vector search, smarter hybrid queries, and lower costs for production RAG and AI applications.

Creating Collections in Zilliz Cloud Just Got Way Easier
We've enhanced the entire collection creation experience to bring advanced capabilities directly into the interface, making it faster and easier to build production-ready schemas without switching tools.



