Тим Спанн: почему я присоединился к Zilliz
Введение
Меня зовут Тим Спанн, и я работаю в Zilliz в сфере взаимодействия с разработчиками для потрясающего Open Source проекта Milvus. Open Source и помощь разработчикам, инженерам и крутым проектам уже много лет являются моей страстью, охватывая такие вещи, как Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive и Spring.
Мои публикации на Medium: https://medium.com/@tspann
Мой канал на YouTube: https://www.youtube.com/@FLaNK-Stack
Новые вызовы
Последние два года я работал на пересечении стриминга и AI, и именно здесь я впервые увидел важность базы данных для AI, которая могла бы хранить и запрашивать любые типы данных в любом необходимом режиме.
Я работал с генеративным AI, но мне нужно было быть там, куда движется будущее и где происходит новая обработка данных. Обработка неструктурированных данных нужна уже сейчас, и мне нужно распространять эту мысль. Это именно то место. С Milvus, Towhee, Attu, интеграциями с Kafka и всеми крутыми фреймворками LlamaX — вот как это делается. Нам нужно создать глобальную группу инженеров по неструктурированным данным и суперзвезд данных. Я очень рад продолжать это ускоренное путешествие. Я интересуюсь машинным обучением, обработкой естественного языка и edge AI уже почти десять лет.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Больше, чем векторные базы данных
Milvus сам по себе является мощным хранилищем данных и причиной хотеть работать в Zilliz. Это лишь начало нового сдвига парадигмы для следующей Революции данных на базе генеративного AI. Потребность в мощных и быстрых способах обработки неструктурированных данных и Vector ETL уже очевидна и растет. В ближайшие несколько лет мы увидим рост инженерии и обработки неструктурированных данных, как это было со Spark, Flink и Kafka для структурированных и полуструктурированных данных.
Необходимость загружать логи, электронную почту, документы, сообщения Slack, фотографии, изображения, видео, аудиофайлы и еще больше бинарных форматов трансформирует отрасли. Когда я начинал работать с Big Data, нам приходилось перемещать много JSON, CSV, XML, реляционных таблиц и структурированных данных. У нас все еще есть эти файлы, и они поступают потоково, но нам нужны наши данные, доступные для поиска по сходству и векторизованные для быстрого доступа.
Мы будем создавать столько же промптов, сколько создаем SQL-запросов. Многие из этих форматов данных нужно будет использовать для одних и тех же приложений. Мы можем добавлять метаданные JSON вместе с нашими векторами для дополнительных типов поиска, тогда как границы между неструктурированными и структурированными данными размываются, поскольку моделям и промптам требуется федеративное представление данных, особенно для сценариев использования в реальном времени.
Я уже видел это в приложениях для общественного транспорта, и это перейдет во все корпоративные приложения, включая IoT и аналитику мошенничества.
В будущем будет намного больше данных, огромная потребность в обработке неструктурированных данных, масштабируемая open-source база данных AI, способная работать с новыми данными, и постоянно растущее разнообразие моделей AI.
Нужна команда
Мне очень повезло, что я уже сотрудничал с рядом моих коллег раньше, и я стремился работать с ними. Меня также невероятно впечатлили все, с кем я общался до присоединения. Это невероятно квалифицированная, интеллектуальная команда с глубоким опытом в том, что нужно, чтобы вывести инновационную технологию в мейнстрим. Будущее начинается сейчас, давайте погружаться.
Сообщество
Присоединяйтесь ко мне в районе Нью-Йорка на митапах и других мероприятиях.
Я также помогаю со многими мероприятиями по AI в Принстоне и работаю со StartupGrind Princeton и Trenton, Applied Generative AI и NJ GAI Meetup.
Читать далее

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Why Context Engineering Is Becoming the Full Stack of AI Agents
Discover how context engineering unifies prompts, RAG, and tools to build smarter, production-ready AI agents powered by Milvus.

Introducing DeepSearcher: A Local Open Source Deep Research
In contrast to OpenAI’s Deep Research, this example ran locally, using only open-source models and tools like Milvus and LangChain.



