Tim Spann: Por qué me uní a Zilliz
Introducción
Mi nombre es Tim Spann y trabajo en Zilliz en promoción para desarrolladores para el increíble proyecto de código abierto, Milvus. El código abierto y ayudar a desarrolladores, ingenieros y proyectos geniales ha sido mi pasión durante varios años, abarcando cosas como Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive y Spring.
Mis publicaciones en Medium: https://medium.com/@tspann
Mi canal de YouTube: https://www.youtube.com/@FLaNK-Stack
Nuevos desafíos
Durante los últimos dos años he estado trabajando en la intersección del streaming y la IA, y aquí es donde vi por primera vez la importancia de una base de datos para IA que pudiera almacenar y consultar cualquier tipo de dato en cualquier modo que se necesite.
He estado trabajando con IA generativa, pero necesitaba estar donde va el futuro y donde está ocurriendo el nuevo procesamiento de datos. El procesamiento de datos no estructurados se necesita ahora y necesito correr la voz. Este es el lugar. Con Milvus, Towhee, Attu e integraciones con Kafka y todos los geniales frameworks LlamaX, así es como se logra. Necesitamos construir un grupo global de ingenieros de datos no estructurados y superestrellas de datos. Estoy muy emocionado de continuar este viaje acelerado. He estado interesado en el aprendizaje automático, el procesamiento del lenguaje natural y la IA en el borde durante casi una década.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Más que bases de datos vectoriales
Milvus por sí solo es un potente almacén de datos y una razón para querer trabajar en Zilliz. Este es solo el comienzo de un nuevo cambio de paradigma para la próxima Revolución de Datos impulsada por la IA Generativa. La necesidad de formas potentes y rápidas de procesar datos no estructurados y hacer ETL vectorial ya es evidente y está creciendo. En los próximos años, veremos un auge en la ingeniería y el procesamiento de datos no estructurados como ocurrió con Spark, Flink y Kafka para datos estructurados y semiestructurados.
La necesidad de cargar registros, correos electrónicos, documentos, mensajes de slack, fotos, imágenes, videos, archivos de audio e incluso más formatos binarios transformará las industrias. Cuando comencé con Big Data, teníamos que mover muchos JSON, CSV, XML, tablas relacionales y datos estructurados. Todavía tenemos esos archivos y los tenemos en streaming, pero necesitamos que nuestros datos estén disponibles para búsqueda por similitud y que estén vectorizados para un acceso rápido.
Crearemos tantos prompts como sentencias SQL. Muchos de estos formatos de datos deberán usarse para las mismas aplicaciones. Podemos agregar metadatos JSON junto con nuestros vectores para tipos adicionales de búsqueda, mientras las líneas entre los datos no estructurados y los datos estructurados se vuelven difusas a medida que los modelos y los prompts requieren una vista federada de los datos, especialmente para casos de uso en vivo.
Ya he visto esto en aplicaciones de transporte masivo y esto se trasladará a todas las aplicaciones empresariales, incluidas IoT y analítica de fraude.
El futuro tiene muchos más datos, una enorme necesidad de procesamiento de datos no estructurados, una base de datos de IA de código abierto escalable que pueda manejar los nuevos datos y una variedad cada vez mayor de modelos de IA.
Se necesita un equipo
Soy muy afortunado de haber colaborado antes con varios de mis compañeros de trabajo y estaba ansioso por trabajar con ellos. También quedé increíblemente impresionado con todos con quienes hablé antes de unirme. Este es un equipo increíblemente capacitado e inteligente, con una profunda experiencia en lo que se necesita para llevar tecnología innovadora al mercado general. El futuro empieza ahora, vamos a sumergirnos.
Comunidad
Únete a mí en el área de la ciudad de Nueva York para meetups y otros eventos.
También estoy ayudando en muchos de los eventos de IA en Princeton y trabajo con StartupGrind Princeton y Trenton, Applied Generative AI y el NJ GAI Meetup.
Sigue leyendo

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

Zilliz Cloud Introduces Advanced BYOC-I Solution for Ultimate Enterprise Data Sovereignty
Explore Zilliz Cloud BYOC-I, the solution that balances AI innovation with data control, enabling secure deployments in finance, healthcare, and education sectors.



