Tim Spann: Perché sono entrato in Zilliz
Introduzione
Mi chiamo Tim Spann e lavoro in Zilliz nell'ambito della developer advocacy per lo straordinario progetto Open Source, Milvus. L'Open Source e aiutare sviluppatori, ingegneri e progetti interessanti sono stati la mia passione per diversi anni, occupandomi di cose come Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive e Spring.
I miei post su Medium: https://medium.com/@tspann
Il mio canale YouTube: https://www.youtube.com/@FLaNK-Stack
Nuove sfide
Negli ultimi due anni ho lavorato all'intersezione tra streaming e AI ed è qui che ho visto per la prima volta l'importanza di un database per l'AI in grado di archiviare e interrogare qualsiasi tipo di dato in qualsiasi modalità necessaria.
Ho lavorato con l'AI generativa, ma dovevo essere dove sta andando il futuro e dove sta avvenendo la nuova elaborazione dei dati. L'elaborazione dei dati non strutturati è necessaria ora e devo diffondere il messaggio. Questo è il posto giusto. Con Milvus, Towhee, Attu e le integrazioni con Kafka e tutti i fantastici framework LlamaX, è così che si fa. Dobbiamo costruire un gruppo globale di ingegneri dei dati non strutturati e superstar dei dati. Sono davvero entusiasta di continuare questo percorso accelerato. Mi interesso di machine learning, elaborazione del linguaggio naturale ed edge AI da quasi un decennio.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Più dei database vettoriali
Milvus da solo è un datastore potente e un motivo per voler lavorare per Zilliz. Questo è solo l'inizio di un nuovo cambio di paradigma per la prossima rivoluzione dei dati alimentata dall'AI generativa. La necessità di modi potenti e veloci per eseguire l'elaborazione dei dati non strutturati e l'ETL vettoriale è già evidente e in crescita. Nei prossimi anni, assisteremo a una crescita dell'ingegneria e dell'elaborazione dei dati non strutturati come abbiamo visto con Spark, Flink e Kafka per i dati strutturati e semistrutturati.
La necessità di caricare log, email, documenti, messaggi Slack, foto, immagini, video, file audio e ancora più formati binari trasformerà le industrie. Quando ho iniziato con i Big Data, dovevamo spostare molti dati JSON, CSV, XML, tabelle relazionali e dati strutturati. Abbiamo ancora quei file e li abbiamo in streaming, ma abbiamo bisogno che i nostri dati siano disponibili per la ricerca per similarità e che vengano vettorializzati per un accesso rapido.
Costruiremo tanti prompt quante istruzioni SQL. Molti di questi formati di dati dovranno essere utilizzati per le stesse applicazioni. Possiamo aggiungere metadati JSON insieme ai nostri vettori per ulteriori tipi di ricerca, mentre i confini tra dati non strutturati e dati strutturati diventano sfumati, poiché modelli e prompt richiedono una vista federata dei dati, soprattutto per i casi d'uso live.
L'ho già visto per applicazioni di trasporto pubblico e questo si estenderà a tutte le applicazioni enterprise, inclusi IoT e analisi delle frodi.
Il futuro ha molti più dati, un'enorme necessità di elaborazione dei dati non strutturati, un database AI open-source scalabile in grado di gestire i nuovi dati e una varietà sempre crescente di modelli AI.
Ci vuole un team
Sono molto fortunato ad aver collaborato in passato con diversi miei colleghi ed ero desideroso di lavorare con loro. Sono rimasto anche incredibilmente colpito da tutte le persone con cui ho parlato prima di entrare. Questo è un team incredibilmente competente e intelligente, con una profonda esperienza in ciò che serve per portare una tecnologia innovativa nel mainstream. Il futuro inizia ora, tuffiamoci.
Community
Unisciti a me nell'area di New York City per meetup e altri eventi.
Sto anche assistendo molti degli eventi sull'AI a Princeton e collaboro con StartupGrind Princeton e Trenton, Applied Generative AI e il NJ GAI Meetup.
Continua a leggere

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Zilliz Cloud On-Demand Compute: Pay Only for What You Use
The customer case behind Zilliz Cloud On-Demand: how a $10K vector search bill came down to under $500, and the engineering changes that made it possible.

The AWS Outage Was a Wake-Up Call for Vector Database Cross-Region Disaster Recovery
Zilliz Cloud Had the Answer Before the Crisis. Zilliz Cloud is the world's first vector database with native cross-region disaster recovery.



