Tim Spann: Por que entrei para a Zilliz
Introdução
Meu nome é Tim Spann e trabalho na Zilliz com advocacy para desenvolvedores no incrível projeto de Código Aberto, Milvus. Código Aberto e ajudar desenvolvedores, engenheiros e projetos interessantes tem sido minha paixão há vários anos, abrangendo coisas como Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive e Spring.
Minhas publicações no Medium: https://medium.com/@tspann
Meu Canal no YouTube: https://www.youtube.com/@FLaNK-Stack
Novos Desafios
Nos últimos dois anos, tenho trabalhado na interseção entre streaming e IA, e foi aí que vi pela primeira vez a importância de um banco de dados para IA que pudesse armazenar e consultar qualquer tipo de dado em qualquer modo necessário.
Tenho trabalhado com IA generativa, mas precisava estar onde o futuro está indo e onde o novo processamento de dados está acontecendo. O processamento de dados não estruturados é necessário agora e preciso divulgar isso. Este é o lugar. Com Milvus, Towhee, Attu e integrações com Kafka e todos os frameworks LlamaX interessantes, é assim que se faz. Precisamos construir um grupo global de engenheiros de dados não estruturados e superestrelas de dados. Estou muito animado para continuar esta jornada acelerada. Tenho me interessado por aprendizado de máquina, processamento de linguagem natural e IA de borda há quase uma década.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Mais do que Bancos de Dados Vetoriais
O Milvus por si só é um datastore poderoso e uma razão para querer trabalhar na Zilliz. Este é apenas o começo de uma nova mudança de paradigma para a próxima Revolução de Dados impulsionada por IA Generativa. A necessidade de formas poderosas e rápidas de fazer processamento de dados não estruturados e ETL Vetorial já é evidente e está crescendo. Nos próximos anos, veremos um aumento na engenharia e no processamento de dados não estruturados, como vimos com Spark, Flink e Kafka para dados estruturados e semiestruturados.
A necessidade de carregar logs, e-mails, documentos, mensagens do Slack, fotos, imagens, vídeos, arquivos de áudio e ainda mais formatos binários transformará indústrias. Quando comecei com Big Data, tínhamos que mover muito JSON, CSV, XML, Tabelas Relacionais e dados estruturados. Ainda temos esses arquivos e os temos em streaming, mas precisamos que nossos dados estejam disponíveis para busca por similaridade e sejam vetorizados para acesso rápido.
Construiremos tantos prompts quanto construímos instruções SQL. Muitos desses formatos de dados precisarão ser usados para as mesmas aplicações. Podemos adicionar metadados JSON junto com nossos vetores para tipos adicionais de busca, enquanto as linhas entre dados não estruturados e dados estruturados se tornam difusas à medida que modelos e prompts exigem uma visão federada dos dados, especialmente para casos de uso ao vivo.
Já vi isso em aplicações de transporte público, e isso avançará para todas as aplicações empresariais, incluindo IoT e análise de fraudes.
O futuro tem muito mais dados, uma enorme necessidade de processamento de dados não estruturados, um banco de dados de IA open-source escalável que consiga lidar com os novos dados e uma variedade cada vez maior de Modelos de IA.
É Preciso uma Equipe
Tenho muita sorte por já ter colaborado com vários dos meus colegas de trabalho antes e estava ansioso para trabalhar com eles. Também fiquei incrivelmente impressionado com todos com quem falei antes de entrar. Esta é uma equipe incrivelmente qualificada e inteligente, com uma profunda experiência no que é necessário para levar tecnologia inovadora ao mainstream. O futuro começa agora, vamos mergulhar.
Comunidade
Junte-se a mim na área da cidade de Nova York para meetups e outros eventos.
Também estou auxiliando muitos dos eventos de IA em Princeton e trabalho com StartupGrind Princeton e Trenton, Applied Generative AI e o NJ GAI Meetup.
Continue lendo

Zilliz Cloud Now Available in AWS Europe (Ireland)
Zilliz Cloud launches in AWS eu-west-1 (Ireland) — bringing low-latency vector search, EU data residency, and full GDPR-ready infrastructure to European AI teams. Now live across 30 regions on five cloud providers.

Why I’m Against Claude Code’s Grep-Only Retrieval? It Just Burns Too Many Tokens
Learn how vector-based code retrieval cuts Claude Code token consumption by 40%. Open-source solution with easy MCP integration. Try claude-context today.

Legal Document Analysis: Harnessing Zilliz Cloud's Semantic Search and RAG for Legal Insights
Enhance legal document analysis with Zilliz Cloud’s Semantic Search and RAG. Improve accuracy, efficiency, and scalability for contracts, case law, and compliance.



