Tim Spann : Pourquoi j’ai rejoint Zilliz
Introduction
Je m’appelle Tim Spann et je travaille chez Zilliz dans la promotion développeurs pour l’incroyable projet Open Source, Milvus. L’Open Source et l’aide aux développeurs, aux ingénieurs et aux projets passionnants sont ma passion depuis plusieurs années, couvrant des sujets comme Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive et Spring.
Mes articles Medium : https://medium.com/@tspann
Ma chaîne YouTube : https://www.youtube.com/@FLaNK-Stack
Nouveaux défis
Ces deux dernières années, j’ai travaillé à l’intersection du streaming et de l’IA, et c’est là que j’ai vu pour la première fois l’importance d’une base de données pour l’IA capable de stocker et d’interroger tout type de données dans n’importe quel mode nécessaire.
J’ai travaillé avec l’IA générative, mais je devais être là où se dirige l’avenir et là où se déroule le nouveau traitement des données. Le traitement des données non structurées est nécessaire dès maintenant et je dois faire passer le message. C’est ici que cela se passe. Avec Milvus, Towhee, Attu et les intégrations avec Kafka ainsi que tous les frameworks LlamaX passionnants, voilà comment y parvenir. Nous devons construire un groupe mondial d’ingénieurs en données non structurées et de superstars de la donnée. Je suis tellement enthousiaste à l’idée de poursuivre ce parcours accéléré. Je m’intéresse au machine learning, au traitement du langage naturel et à l’IA en périphérie depuis près d’une décennie.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Plus que des bases de données vectorielles
Milvus à lui seul est un puissant datastore et une raison de vouloir travailler pour Zilliz. Ce n’est que le début d’un nouveau changement de paradigme pour la prochaine révolution des données alimentée par l’IA générative. Le besoin de moyens puissants et rapides pour effectuer le traitement des données non structurées et le Vector ETL est déjà évident et croissant. Dans les prochaines années, nous verrons l’essor de l’ingénierie et du traitement des données non structurées, comme nous l’avons vu avec Spark, Flink et Kafka pour les données structurées et semi-structurées.
Le besoin de charger des logs, des e-mails, des documents, des messages Slack, des photos, des images, des vidéos, des fichiers audio et encore davantage de formats binaires transformera les industries. Quand j’ai commencé avec le Big Data, nous devions déplacer beaucoup de JSON, CSV, XML, de tables relationnelles et de données structurées. Nous avons toujours ces fichiers et nous les avons en streaming, mais nous avons besoin que nos données soient disponibles pour la recherche par similarité et vectorisées pour un accès rapide.
Nous construirons autant de prompts que nous construisons d’instructions SQL. Nombre de ces formats de données devront être utilisés pour les mêmes applications. Nous pouvons ajouter des métadonnées JSON avec nos vecteurs pour des types de recherche supplémentaires, tandis que les frontières entre données non structurées et données structurées deviennent floues, car les modèles et les prompts nécessitent une vue fédérée des données, en particulier pour les cas d’utilisation en direct.
J’ai déjà vu cela pour des applications de transport en commun et cela s’étendra à toutes les applications d’entreprise, y compris l’IoT et l’analyse de la fraude.
L’avenir comporte beaucoup plus de données, un immense besoin de traitement des données non structurées, une base de données IA open-source évolutive capable de gérer les nouvelles données et une variété toujours croissante de modèles d’IA.
Il faut une équipe
J’ai beaucoup de chance d’avoir déjà collaboré avec un certain nombre de mes collègues et j’étais impatient de travailler avec eux. J’ai également été incroyablement impressionné par toutes les personnes avec qui j’ai parlé avant de rejoindre l’entreprise. C’est une équipe incroyablement compétente et intelligente, avec une solide expérience de ce qu’il faut pour amener une technologie innovante au grand public. L’avenir commence maintenant, plongeons-y.
Communauté
Rejoignez-moi dans la région de New York pour des meetups et autres événements.
J’aide également à organiser de nombreux événements IA à Princeton et je travaille avec StartupGrind Princeton and Trenton, Applied Generative AI et le NJ GAI Meetup.
Continuer à lire

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Announcing the General Availability of Zilliz Cloud BYOC on Google Cloud Platform
Zilliz Cloud BYOC on GCP offers enterprise vector search with full data sovereignty and seamless integration.

AI Agents Are Quietly Transforming E-Commerce — Here’s How
Discover how AI agents transform e-commerce with autonomous decision-making, enhanced product discovery, and vector search capabilities for today's retailers.



