Frank Liu: 내가 벡터 데이터베이스 회사에 합류한 이유
"머신러닝 모델은 컴퓨터를 위한 언어와 같고, 임베딩은 그 단어입니다." 저는 일대일 대화에서든 기조연설 중이든 머신러닝(ML) 모델과 그에 상응하는 임베딩을 설명할 때 이 비유를 자주 사용합니다. 저는 졸업 이후 거의 10년 동안 머신러닝(주로 컴퓨터 비전 하위 분야) 안팎에서 일해 왔습니다. 이 비유는 더 넓은 청중에게 임베딩의 중요성을 설명하는 간결한 방법입니다.
인간의 뇌에 기억과 감정을 담당하는 전용 영역(해마)이 있듯이, 머신에도 머신의 단어와 생각을 저장하고 인덱싱하기 위한 영구적인 솔루션이 필요합니다. 바로 이 영역에서 벡터 데이터베이스가 등장합니다 - 그것은 머신을 위한 해마입니다. 이것이 바로 우리가 Zilliz에서 구축하고 있는 것입니다.
제가 임베딩의 힘을 이해하지 못했다면 Zilliz의 미션은 제게 와닿지 않았을 것입니다. 이 블로그 게시물에서는 이 분야에서의 제 여정을 안내하고 제가 어떻게 Zilliz에 이르게 되었는지 보여드리겠습니다.
임베딩에 대한 간단한 입문서
수십 년 동안 우리는 컴퓨터가 우리처럼 세상을 이해하도록 "가르치려" 노력해 왔습니다. 예를 들어 챗봇을 만들려는 초기 시도는 키워드와 문구를 인식하는 데 초점을 맞추어, 전반적인 이해가 있는 듯한 착각을 만들어냈습니다. 최근에 이르러서야 우리는 Claude, Bard, ChatGPT와 같은 LLM을 통해 범용 챗봇을 향해 놀라운 진전을 이루었고, 복잡한 작업을 계획하고 실행할 수 있는 지능형 "에이전트"의 가능성을 열었습니다. 핵심적으로 이러한 챗봇은 특수화된 신경망입니다 - 확률적 경사 하강법의 여러 변형 중 하나로 훈련된 ML 모델입니다. 신경망에 익숙하지 않다면, 손수 만든 알고리즘으로는 불가능한 강력한 표현을 구축하기 위해 연속적인 "계층"을 사용하는 대규모 컴퓨터 모델로 생각하시면 됩니다.
모든 ML 모델의 핵심에는 고차원 벡터인 임베딩이라는 개념이 있습니다. 이는 모델에서 입력 데이터를 표현하는 추상적이지만 강력한 방법을 제공합니다. 이러한 임베딩에는 고유한 속성이 있지만, 이 게시물에서는 다루지 않겠습니다. 더 알아보고 싶으시다면 대부분의 기초를 다루는 제 벡터 검색에 관한 게시물을 읽어보실 수 있습니다.
벡터 검색과의 (많은) 만남
제가 임베딩의 잠재력을 처음 접한 것은 2014년 Yahoo에서 신경망을 다루기 시작했을 때였습니다. 당시 머신러닝은 여전히 "서부 개척 시대"였고, 신경망을 위한 도구는 없었습니다. 컨테이너 기반 오케스트레이션 플랫폼이 막 인기를 얻기 시작했습니다(Docker의 첫 버전은 2013년에 출시되었습니다). 컴퓨터 비전과 머신러닝에 참여하기에는 믿을 수 없을 만큼 흥미로운 시기였습니다.
Yahoo 플랫폼과 서비스를 머신러닝 기능으로 강화하려는 노력의 일환으로, 우리는 벡터 검색의 초기 도입자가 되었습니다. 이 결정은 당시 Yahoo가 소유하고 있던 제품인 Flickr에 대규모 시맨틱 검색을 도입하는 수개월에 걸친 프로젝트로 이어졌습니다. 제가 이 프로젝트에 직접 참여하지는 않았지만, 면밀히 지켜보았습니다. 이 벡터 검색의 초기 버전은 벡터 데이터베이스 분야의 또 다른 플레이어인 Vespa에 통합되었습니다.
비슷한 시기에 많은 대기업이 특히 이미지 인식과 같은 컴퓨터 비전 애플리케이션에서 벡터 검색의 잠재력을 깨닫기 시작했습니다. 신경망과 임베딩 표현의 힘을 높이 평가했지만, 저는 대학에서 전기공학을 전공했기 때문에 하드웨어 분야에서 더 일하고 싶었습니다. 그 결과, 저는 그 분야를 떠나 상하이에 기반을 둔 실내 위치 측정 회사를 창업했습니다. 이후 2~3년 동안 저는 큰 교훈을 얻었습니다 - 하드웨어 회사를 시작하는 것은 어렵다는 것입니다.
2019년에 우리는 관성 측정 장치(IMU)에서 머신 러닝과 스트리밍 데이터를 사용하는 방향으로 전환했습니다. 임베딩은 우리의 성공에 중요한 역할을 했고, 우리는 다수의 Fortune 500 기업을 포함한 다양한 고객을 위해 솔루션을 배포하는 계약을 확보했습니다. 저는 마침내 손익분기점에 도달할 때까지 2년 더 스타트업에서 계속 일했습니다. 그 시점에서 저는 새로운 모험을 시작할 때라고 결정했습니다.
2021년으로 시간이 흘러, 저는 Charles(우리 CEO)와 Robert(제품 총괄)와 마주 앉을 기회를 갖게 되었습니다. 수년에 걸쳐 임베딩과 벡터 검색은 더 넓은 ML 분야에서 제 정체성과 성공의 중심이 되었습니다. 그래서 Zilliz의 미션은 즉시 제게 깊이 와닿았습니다. 더 넓은 벡터 데이터베이스 분야를 검토한 후, 잘 알려져 있고 강력한 도구임에도 불구하고 시장에는 저렴하고 확장 가능한 벡터 검색 솔루션이 부족하다는 사실에 놀랐습니다. AI/ML 시대에 벡터 데이터베이스가 사실상의 스토리지 솔루션으로 기능할 수 있는 역량은 제게 분명했습니다. 그래서 저는 이곳으로 과감히 뛰어들었습니다.
엔터프라이즈 AI 인프라의 민주화
Zilliz에서 우리는 확장 가능하고 클라우드 네이티브한 벡터 데이터베이스를 도입할 때 몇 가지 과제에 직면했습니다. 임베딩이 아무리 강력하더라도, ML 엔지니어(저를 포함해)는 인프라와 도구의 중요성을 과소평가하는 경우가 많습니다. 우리는 본질적으로 만드는 사람들이며, 애플리케이션을 프로덕션에 배포하는 방법을 걱정하기보다는 거의 항상 학습 데이터를 다루거나 모델 아키텍처를 완성하는 데 시간을 쓰는 것을 선호합니다. 임베딩의 영역에서 Zilliz는 엔터프라이즈 AI 인프라를 민주화하려는 더 넓은 노력의 중심에 확고히 자리하고 있습니다.
함께하세요!
이 메시지가 마음에 와닿는다면, 저희에게 알려주세요! 저희는 GTM, 제품, 엔지니어링 분야에서 다양한 채용 기회를 마련하고 있습니다. 추천 시스템, 시맨틱 검색, 그리고 전반적으로 컴퓨터를 더 "인간답게" 만드는 일에 열정이 있으시다면, 언제든지 저희 채용 페이지를 확인해 보세요.
계속 읽기

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

Why Not All VectorDBs Are Agent-Ready
Explore why choosing the right vector database is critical for scaling AI agents, and why traditional solutions fall short in production.

Vector Databases vs. Document Databases
Use a vector database for similarity search and AI-powered applications; use a document database for flexible schema and JSON-like data storage.



