Тим Спанн: почему я присоединился к Zilliz
Введение
Меня зовут Тим Спанн, и я работаю в Zilliz в сфере взаимодействия с разработчиками для потрясающего Open Source проекта Milvus. Open Source и помощь разработчикам, инженерам и крутым проектам уже много лет являются моей страстью, охватывая такие вещи, как Hadoop, Spark, Kafka, NiFi, Flink, Iceberg, Kudu, HBase, Hive и Spring.
Мои публикации на Medium: https://medium.com/@tspann
Мой канал на YouTube: https://www.youtube.com/@FLaNK-Stack
Новые вызовы
Последние два года я работал на пересечении стриминга и AI, и именно здесь я впервые увидел важность базы данных для AI, которая могла бы хранить и запрашивать любые типы данных в любом необходимом режиме.
Я работал с генеративным AI, но мне нужно было быть там, куда движется будущее и где происходит новая обработка данных. Обработка неструктурированных данных нужна уже сейчас, и мне нужно распространять эту мысль. Это именно то место. С Milvus, Towhee, Attu, интеграциями с Kafka и всеми крутыми фреймворками LlamaX — вот как это делается. Нам нужно создать глобальную группу инженеров по неструктурированным данным и суперзвезд данных. Я очень рад продолжать это ускоренное путешествие. Я интересуюсь машинным обучением, обработкой естественного языка и edge AI уже почти десять лет.
- https://community.cloudera.com/t5/Community-Articles/Using-Sentiment-Analysis-and-NLP-Tools-With-HDP-2-x-and-HDF/ta-p/249102
- https://community.cloudera.com/t5/Community-Articles/Open-NLP-Example-Apache-NiFi-Processor/ta-p/249293
- https://community.cloudera.com/t5/Community-Articles/Creating-HTML-from-PDF-Excel-and-Word-Documents-using-Apache/ta-p/247968
Больше, чем векторные базы данных
Milvus сам по себе является мощным хранилищем данных и причиной хотеть работать в Zilliz. Это лишь начало нового сдвига парадигмы для следующей Революции данных на базе генеративного AI. Потребность в мощных и быстрых способах обработки неструктурированных данных и Vector ETL уже очевидна и растет. В ближайшие несколько лет мы увидим рост инженерии и обработки неструктурированных данных, как это было со Spark, Flink и Kafka для структурированных и полуструктурированных данных.
Необходимость загружать логи, электронную почту, документы, сообщения Slack, фотографии, изображения, видео, аудиофайлы и еще больше бинарных форматов трансформирует отрасли. Когда я начинал работать с Big Data, нам приходилось перемещать много JSON, CSV, XML, реляционных таблиц и структурированных данных. У нас все еще есть эти файлы, и они поступают потоково, но нам нужны наши данные, доступные для поиска по сходству и векторизованные для быстрого доступа.
Мы будем создавать столько же промптов, сколько создаем SQL-запросов. Многие из этих форматов данных нужно будет использовать для одних и тех же приложений. Мы можем добавлять метаданные JSON вместе с нашими векторами для дополнительных типов поиска, тогда как границы между неструктурированными и структурированными данными размываются, поскольку моделям и промптам требуется федеративное представление данных, особенно для сценариев использования в реальном времени.
Я уже видел это в приложениях для общественного транспорта, и это перейдет во все корпоративные приложения, включая IoT и аналитику мошенничества.
В будущем будет намного больше данных, огромная потребность в обработке неструктурированных данных, масштабируемая open-source база данных AI, способная работать с новыми данными, и постоянно растущее разнообразие моделей AI.
Нужна команда
Мне очень повезло, что я уже сотрудничал с рядом моих коллег раньше, и я стремился работать с ними. Меня также невероятно впечатлили все, с кем я общался до присоединения. Это невероятно квалифицированная, интеллектуальная команда с глубоким опытом в том, что нужно, чтобы вывести инновационную технологию в мейнстрим. Будущее начинается сейчас, давайте погружаться.
Сообщество
Присоединяйтесь ко мне в районе Нью-Йорка на митапах и других мероприятиях.
Я также помогаю со многими мероприятиями по AI в Принстоне и работаю со StartupGrind Princeton и Trenton, Applied Generative AI и NJ GAI Meetup.
Читать далее

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.

DeepRAG: Thinking to Retrieval Step by Step for Large Language Models
Discover DeepRAG, an advanced retrieval-augmented generation (RAG) model that improves LLM accuracy by retrieving only essential data through step-by-step reasoning.



