Тим Спанн: почему я присоединился к Zilliz
Введение
Меня зовут Тим Спанн, и я работаю в Zilliz в сфере взаимодействия с разработчиками для потрясающего Open Source проекта Milvus. Open Source и помощь разработчикам, инженерам и крутым проектам уже много лет являются моей страстью, охватывая такие вещи, как Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive и Spring.
Мои публикации на Medium: https://medium.com/@tspann
Мой канал на YouTube: https://www.youtube.com/@FLaNK-Stack
Новые вызовы
Последние два года я работал на пересечении стриминга и AI, и именно здесь я впервые увидел важность базы данных для AI, которая могла бы хранить и запрашивать любые типы данных в любом необходимом режиме.
Я работал с генеративным AI, но мне нужно было быть там, куда движется будущее и где происходит новая обработка данных. Обработка неструктурированных данных нужна уже сейчас, и мне нужно распространять эту мысль. Это именно то место. С Milvus, Towhee, Attu, интеграциями с Kafka и всеми крутыми фреймворками LlamaX — вот как это делается. Нам нужно создать глобальную группу инженеров по неструктурированным данным и суперзвезд данных. Я очень рад продолжать это ускоренное путешествие. Я интересуюсь машинным обучением, обработкой естественного языка и edge AI уже почти десять лет.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Больше, чем векторные базы данных
Milvus сам по себе является мощным хранилищем данных и причиной хотеть работать в Zilliz. Это лишь начало нового сдвига парадигмы для следующей Революции данных на базе генеративного AI. Потребность в мощных и быстрых способах обработки неструктурированных данных и Vector ETL уже очевидна и растет. В ближайшие несколько лет мы увидим рост инженерии и обработки неструктурированных данных, как это было со Spark, Flink и Kafka для структурированных и полуструктурированных данных.
Необходимость загружать логи, электронную почту, документы, сообщения Slack, фотографии, изображения, видео, аудиофайлы и еще больше бинарных форматов трансформирует отрасли. Когда я начинал работать с Big Data, нам приходилось перемещать много JSON, CSV, XML, реляционных таблиц и структурированных данных. У нас все еще есть эти файлы, и они поступают потоково, но нам нужны наши данные, доступные для поиска по сходству и векторизованные для быстрого доступа.
Мы будем создавать столько же промптов, сколько создаем SQL-запросов. Многие из этих форматов данных нужно будет использовать для одних и тех же приложений. Мы можем добавлять метаданные JSON вместе с нашими векторами для дополнительных типов поиска, тогда как границы между неструктурированными и структурированными данными размываются, поскольку моделям и промптам требуется федеративное представление данных, особенно для сценариев использования в реальном времени.
Я уже видел это в приложениях для общественного транспорта, и это перейдет во все корпоративные приложения, включая IoT и аналитику мошенничества.
В будущем будет намного больше данных, огромная потребность в обработке неструктурированных данных, масштабируемая open-source база данных AI, способная работать с новыми данными, и постоянно растущее разнообразие моделей AI.
Нужна команда
Мне очень повезло, что я уже сотрудничал с рядом моих коллег раньше, и я стремился работать с ними. Меня также невероятно впечатлили все, с кем я общался до присоединения. Это невероятно квалифицированная, интеллектуальная команда с глубоким опытом в том, что нужно, чтобы вывести инновационную технологию в мейнстрим. Будущее начинается сейчас, давайте погружаться.
Сообщество
Присоединяйтесь ко мне в районе Нью-Йорка на митапах и других мероприятиях.
Я также помогаю со многими мероприятиями по AI в Принстоне и работаю со StartupGrind Princeton и Trenton, Applied Generative AI и NJ GAI Meetup.
Читать далее

Why and How to Migrate from Self-Hosted Milvus to Zilliz Cloud
A simple, step-by-step guide to migrating from Milvus to Zilliz Cloud. Learn both endpoint and backup methods for a smooth, scalable vector database migration.

Zilliz Cloud Launches in AWS Australia, Expanding Global Reach to Australia and Neighboring Markets
We're thrilled to announce that Zilliz Cloud is now available in the AWS Sydney, Australia region (ap-southeast-2).

Zilliz Cloud Enterprise Vector Search Powers High-Performance AI on AWS
Zilliz Cloud on AWS powers secure, scalable, ultra-fast vector search for enterprise AI apps, with BYOC, sub-10ms latency, and zero-DevOps simplicity.



