Tim Spann: Perché sono entrato in Zilliz
Introduzione
Mi chiamo Tim Spann e lavoro in Zilliz nell'ambito della developer advocacy per lo straordinario progetto Open Source, Milvus. L'Open Source e aiutare sviluppatori, ingegneri e progetti interessanti sono stati la mia passione per diversi anni, occupandomi di cose come Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive e Spring.
I miei post su Medium: https://medium.com/@tspann
Il mio canale YouTube: https://www.youtube.com/@FLaNK-Stack
Nuove sfide
Negli ultimi due anni ho lavorato all'intersezione tra streaming e AI ed è qui che ho visto per la prima volta l'importanza di un database per l'AI in grado di archiviare e interrogare qualsiasi tipo di dato in qualsiasi modalità necessaria.
Ho lavorato con l'AI generativa, ma dovevo essere dove sta andando il futuro e dove sta avvenendo la nuova elaborazione dei dati. L'elaborazione dei dati non strutturati è necessaria ora e devo diffondere il messaggio. Questo è il posto giusto. Con Milvus, Towhee, Attu e le integrazioni con Kafka e tutti i fantastici framework LlamaX, è così che si fa. Dobbiamo costruire un gruppo globale di ingegneri dei dati non strutturati e superstar dei dati. Sono davvero entusiasta di continuare questo percorso accelerato. Mi interesso di machine learning, elaborazione del linguaggio naturale ed edge AI da quasi un decennio.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Più dei database vettoriali
Milvus da solo è un datastore potente e un motivo per voler lavorare per Zilliz. Questo è solo l'inizio di un nuovo cambio di paradigma per la prossima rivoluzione dei dati alimentata dall'AI generativa. La necessità di modi potenti e veloci per eseguire l'elaborazione dei dati non strutturati e l'ETL vettoriale è già evidente e in crescita. Nei prossimi anni, assisteremo a una crescita dell'ingegneria e dell'elaborazione dei dati non strutturati come abbiamo visto con Spark, Flink e Kafka per i dati strutturati e semistrutturati.
La necessità di caricare log, email, documenti, messaggi Slack, foto, immagini, video, file audio e ancora più formati binari trasformerà le industrie. Quando ho iniziato con i Big Data, dovevamo spostare molti dati JSON, CSV, XML, tabelle relazionali e dati strutturati. Abbiamo ancora quei file e li abbiamo in streaming, ma abbiamo bisogno che i nostri dati siano disponibili per la ricerca per similarità e che vengano vettorializzati per un accesso rapido.
Costruiremo tanti prompt quante istruzioni SQL. Molti di questi formati di dati dovranno essere utilizzati per le stesse applicazioni. Possiamo aggiungere metadati JSON insieme ai nostri vettori per ulteriori tipi di ricerca, mentre i confini tra dati non strutturati e dati strutturati diventano sfumati, poiché modelli e prompt richiedono una vista federata dei dati, soprattutto per i casi d'uso live.
L'ho già visto per applicazioni di trasporto pubblico e questo si estenderà a tutte le applicazioni enterprise, inclusi IoT e analisi delle frodi.
Il futuro ha molti più dati, un'enorme necessità di elaborazione dei dati non strutturati, un database AI open-source scalabile in grado di gestire i nuovi dati e una varietà sempre crescente di modelli AI.
Ci vuole un team
Sono molto fortunato ad aver collaborato in passato con diversi miei colleghi ed ero desideroso di lavorare con loro. Sono rimasto anche incredibilmente colpito da tutte le persone con cui ho parlato prima di entrare. Questo è un team incredibilmente competente e intelligente, con una profonda esperienza in ciò che serve per portare una tecnologia innovativa nel mainstream. Il futuro inizia ora, tuffiamoci.
Community
Unisciti a me nell'area di New York City per meetup e altri eventi.
Sto anche assistendo molti degli eventi sull'AI a Princeton e collaboro con StartupGrind Princeton e Trenton, Applied Generative AI e il NJ GAI Meetup.
Continua a leggere

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

8 Latest RAG Advancements Every Developer Should Know
Explore eight advanced RAG variants that can solve real problems you might be facing: slow retrieval, poor context understanding, multimodal data handling, and resource optimization.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.



