BiomapがMilvusを用いたAI駆動のベクトル検索でライフサイエンスの発見を大規模に変革する方法

22倍高速
タンパク質検索により、クエリ時間を10〜20分から1分未満に短縮しました。
500億以上
Sequence Scaleは、数億から数百億の生物学的配列へと拡大しました。
リアルタイムディスカバリー
RAGワークフローにおける複雑な生物学的クエリへのサブ秒応答。
クロスモーダル統合
タンパク質、DNA、RNA、テキスト、細胞データを単一の検索可能なフレームワークに統合。
Milvus has become the bridge that connects our multi-modal foundation models with real-world applications. It's not just about performance – it's about enabling entirely new approaches to biological discovery that were previously impossible.
Xiaoming Zhang
Biomapについて
Biomapは、創薬、合成生物学、医学研究における発見を加速するAIモデルの構築に注力する、主要なライフサイエンスAI企業です。そのプラットフォームの中核にあるのがxTrimoであり、生物学向けに特化して構築された大規模基盤モデルのファミリーです。最大2,100億パラメータまでスケールするxTrimoは、タンパク質、DNA、RNA、細胞、分子、科学テキストを単一のフレームワークに統合し、従来手法では実現できない予測とインサイトを提供します。
この能力を実現するには、ノイズの多い生物学データ、非常に多様な形式、数十億の配列をリアルタイムで検索する必要性など、技術的障壁を克服する必要がありました。Biomapは、生物学的エンティティ向けのカスタム埋め込みモデルを開発し、Milvus Vector Databaseなどの高度なデータインフラストラクチャを導入して、大規模で高速かつ正確な検索を可能にすることで、これらの課題に対処しました。この基盤により、研究者は免疫学、神経学、腫瘍学、希少疾患の治療など、さまざまな分野でブレークスルーを加速できるようになりました。
生物学AIのスケーリングにおける技術的障壁
BiomapがAI能力を拡大するにつれ、チームは従来のツールでは克服できないいくつかのボトルネックに直面しました。
1. 遅いタンパク質検索
Biomapのタンパク質構造予測パイプラインは以前、Multiple Sequence Alignment (MSA)に依存しており、単一の結果を返すのに10〜20分を要していました。小規模研究には許容できるものの、この遅延は、本番ワークロード、特に数億、あるいは数十億の配列へスケールする場合には実用的ではありませんでした。
2. マルチモーダルデータの複雑性
生物学データは本質的に、タンパク質、DNA、RNA、細胞イメージング、さらにはテキストなど、多くの形式で存在します。従来の検索手法では、これらのモダリティを効果的に橋渡しすることができず、複雑な生物学的システムを理解するうえで不可欠なクロスモーダルなインサイトを取りこぼしていました。
3. 速度と精度のジレンマ
生物医学研究では、小さな誤差が重大な結果につながる可能性があります。BiomapのRAGベースの発見アシスタントには、インタラクティブ性のためのサブ秒単位のクエリ応答と、科学的信頼性のための研究グレードの精度の両方が必要でした。しかし、ほとんどのソリューションでは速度と精度のどちらかを犠牲にせざるを得ませんでした。
4. 専門的なデータ要件
生物学データには、カスタムインデックス戦略、ドメイン固有の埋め込みモデル、科学的ワークロードに合わせた最適化を必要とする独自の特性がありますが、既製のソリューションではこれらの能力を提供できませんでした。
5. 多様なパフォーマンス要件
Biomapのユースケースによってニーズは大きく異なっていました。会話型アシスタントには即時回答が必要であり、タンパク質予測はクエリごとに数分を許容できるものの効率的なバッチ処理を必要とし、基盤モデルのトレーニングには高スループットのデータパイプラインが求められました。これらの多様な要件を単一の統合インフラストラクチャ内で管理することは、特に困難であることが判明しました。
Biomapが大規模な生物学AIを支えるためにMilvusを選んだ理由
Biomapは、AIワークロードをスケールさせるには、専用設計のベクトル検索プラットフォームが必要であることをすぐに認識しました。チームはまず、小規模な概念実証のために、人気のあるベクトル検索ライブラリであるFaissに着目しました。Faissは初期実験では良好に機能したものの、本番ワークロードに投入すると、実世界のライフサイエンスアプリケーションが求めるスケール、信頼性、柔軟性の要件を満たせず、失敗しました。複数の代替案をテストした結果、チームは以下の要因により、Milvusがすべての条件を満たす唯一のソリューションであることを見いだしました。
オープンソースの柔軟性: ライフサイエンスデータは高度に専門化されており、生物学的ユースケースに合わせたカスタムインデックス作成やアルゴリズムが必要になることがよくあります。Milvusのオープンソース設計により、Biomapは制約なくシステムを適応・拡張する自由を得ました。Biomapの技術担当VPであるXiaoming Zhang氏は、「オープンソースでなければ、このようなカスタマイズの余地はおそらくなく、私たちのシナリオには適合しません。」 と説明しています。
本番環境に対応した安定性: 本番環境へのデプロイにおいて、Biomapは、特にエンタープライズのバイオテック企業の間で活発なユーザーベースに支えられた成熟したプラットフォームを必要としていました。さまざまな業界で実績があり、バイオテック企業の間で強いコミュニティ採用があるMilvusは、Biomapが求める信頼性とエコシステムのサポートを提供しました。
包括的な機能セット: Milvusは幅広いインデックスタイプとハイブリッド検索機能をサポートしており、タンパク質、DNA、RNA、テキスト、その他のモダリティにわたる検索を、単一のシステム内で最適化できます。
スケール時のパフォーマンス: インタラクティブなアシスタントから大規模なタンパク質検索まで、Biomapにはサブ秒のクエリと大規模なバッチジョブの両方を処理できるインフラストラクチャが必要でした。Milvusの水平スケーラブルなアーキテクチャにより、ワークロードのサイズや規模にかかわらず、一貫したパフォーマンスが確保されました。
コミュニティとパートナーシップ: Biomapチームはまた、Milvusの活発なオープンソースコミュニティと、Milvusの開発元であるZillizとの長期的なパートナーシップの可能性も高く評価しました。
この技術的な深さ、エコシステムの成熟度、そして将来を見据えたサポートの組み合わせにより、MilvusはBiomapの本番インフラストラクチャにとって明確な選択肢となりました。
BiomapがMilvusを使用して生物学的AIサービスを支える方法
Biomapは、3つの重要なユースケースにMilvusを導入しました。それぞれが固有の科学的課題に対応し、合わせて同社の生物学的AIプラットフォームの中核を形成しています。
AI Discovery Assistant (RAG)
Biomapの研究ワークフローの中心にあるのは、高度なRetrieval-Augmented Generation (RAG)によって強化されたディスカバリーアシスタントです。オーケストレーションにはLangGraphを基盤として構築されており、このアシスタントは膨大な科学文献、特許、専門的な生物学データベースのコレクションからデータを取得します。数式、タンパク質構造、ドメイン固有の表記を豊富に含むこうしたデータは、その後ベクトル埋め込みに変換され、Milvusに保存されます。
Milvusはハイブリッドなベクトル検索と全文検索を実行し、クエリに対してサブ秒で最も正確な結果を提供します。これにより研究者は、文献を何時間もかけて調べるのではなく、専門的な生物学知識全体を検索し、リアルタイムで精密な回答を得ることができます。
大規模なタンパク質構造予測
Biomapはまた、低速なMultiple Sequence Alignment (MSA)手法をベクトル検索に置き換えることで、従来のタンパク質検索パイプラインを刷新しました。同社独自のタンパク質基盤モデルは高次元の埋め込みを生成し、それらはMilvusに保存され、クエリされます。この新しいアーキテクチャにより、検索規模は数億から50億を超えるタンパク質配列へと拡大し、以前は手の届かなかった発見を可能にしました。パフォーマンスも劇的に向上しました。かつて10~20分かかっていたクエリが、AI駆動の類似性指標による高い精度を維持しながら、現在では1分未満で完了します。
モデルトレーニングのためのクロスモーダルサンプル生成
マルチモーダル基盤モデルの開発を進めるため、Biomapは生物学的モダリティ間でデータをつなぐためにMilvusを活用しています。たとえば研究者は、特定のタンパク質配列に関連付けられた細胞画像を取得したり、分子レベルと細胞レベルのデータを統一されたベクトル空間内で整合させたりできます。この機能は高度なデータ拡張とクロスモーダルな関連性発見を支援し、テキスト、配列、画像データを橋渡しするモデルのトレーニングを加速します。
これらのアプリケーションを総合すると、Milvus が Biomap において、日々の発見から最先端の生物学的モデルのトレーニングに至るまで、領域を横断してスケール、精度、速度を組み合わせることをどのように可能にしているかが分かります。
Milvus が Biomap のプラットフォームに与えた影響
Milvus を採用することで、Biomap は従来のインフラでは実現できなかった成果を達成し、研究の速度と範囲の両方を変革しました。
10億規模での高速検索
Milvus の高性能インデックスエンジンにより、タンパク質配列検索で 22倍の高速化 が実現しました。以前は 10〜20 分かかっていたクエリが、現在では 500億配列 規模であっても 1 分未満で返されます。これは、数億から数百億の生物学的配列へと、精度や信頼性を犠牲にすることなく、10倍以上のスケール拡大 を実現したことを意味します。
より高度な生物学的発見
Milvus はまた、Biomap の発見そのものへのアプローチも変えました。検索品質は同社の基盤モデルの性能に直接結び付いているため、モデル精度の向上は即座に検索結果の改善へとつながります。これにより好循環が生まれます。モデルが進化するにつれて、Milvus によって駆動される検索エンジンはより精密になり、静的なアラインメントベースの手法では決して達成できなかった科学的洞察を引き出します。
クロスモーダルなブレークスルー
Milvus により、Biomap は分子レベルと細胞レベルのデータを同じベクトル空間内で橋渡しできるようになりました。このスケール差の「フラット化」によって、シームレスなクロスモーダル検索が可能になり、次世代のマルチモーダル基盤モデルのトレーニングを支えています。これは、生物学のための包括的な AI シミュレーターを構築するという同社の長期的ビジョンに向けた基礎的な一歩です。
ライフサイエンスのためのスケーラブルなプラットフォーム
最終的に、Milvus は Biomap に対し、社内研究を超えてより広範なライフサイエンス応用へ拡大するためのインフラを提供しています。同じプラットフォームは現在、製薬会社、病院、合成生物学企業向けのカスタマイズされたナレッジベースやインテリジェントエージェントを支えており、高速でスケーラブルな生物学的 AI の恩恵をエコシステム全体へと広げています。
今後の展望
Biomap の Milvus による成功は、ライフサイエンスエコシステム全体への拡大に向けた土台を築きました。同チームは現在、創薬を加速する製薬会社、臨床研究を推進する医療機関、生物設計を最適化する合成生物学企業、作物の遺伝的改良を推進する農業バイオテクノロジー企業など、さまざまなステークホルダーにサービスを提供するため、プラットフォームを拡大しています。各新しいユースケースは、複雑な生物学的データを大規模にアクセス可能で実用的なものにする、Milvus によるベクトル検索という同じ中核インフラの上に構築されています。
Xiaoming が述べたように、「Milvus は、ライフサイエンス業界全体における今後の事業拡大において、ベクトルデータベースの唯一の技術的選択肢となっています。」
このパートナーシップは、技術的統合を超えるものです。それは、生物学的発見が将来どのように行われるかの基盤を生み出しています。より速く、より精密で、かつてはサイロ化されていたモダリティを横断できるものです。Biomap が「生命のための AI シミュレーター」というビジョンを追求し続ける中で、Zilliz はこの野心を現実に変えるベクトルデータベースインフラを提供し、科学と産業の両方を変革し得るブレークスルーを可能にしています。
Milvus has become the only technical choice for vector databases in our upcoming business expansion across the life sciences industry.
Xiaoming Zhang


