ボトルネックからブレイクスルーへ:OrfiumがZilliz Cloudで10億ベクトルのオーディオ検索をスケールさせた方法

10億ベクトル
簡単に処理されます
リアルタイム応答
即時の著作権保護のために
コスト削減
同じファイルを処理しながら
単独エンジニアによる移行
より迅速な開発サイクルのために
With Zilliz Cloud, we moved from operating at our limits to building with confidence. It gave us the scale, performance, and flexibility to protect music rights in real time—something we couldn’t achieve with traditional systems.
George Kastrinakis
YouTube、TikTok、ラジオ、テレビを横断して毎日流れる何十億もの音楽スニペットを追跡し、楽曲がどこで使われてもアーティストに公正な報酬が支払われるようにすることを想像してみてください。Orfium は、グローバルな音楽権利および著作権テクノロジー企業であり、これは思考実験ではありません。彼らのミッションそのものです。
しかし、Elasticsearch/OpenSearch スタックに負荷がかかり始めると、エンジニアたちは新しい機能を構築する代わりに、インフラの火消しに追われるようになりました。カスタムセットアップは維持・最適化の負担が大きく、レイテンシは増加し、スループットはビジネスの成長に追いつかず、インデックス作成は限界に達しました。コストも予測しにくくなりました。「私たちは旧システムで可能なことの限界で運用していました」と、Orfium の Data Science and AI Services Director である George Kastrinakis 氏は述べています。
Orfium について
Orfium は、音楽権利管理の未来を形作るグローバルなテクノロジーリーダーです。同社は、AI を活用したテクノロジーと専門サービスを世界有数の音楽・エンターテインメント企業に提供し、著作権保護コンテンツの管理、ライセンス供与、レポーティング、収益化を最適化できるようにしています。
デジタル権利管理における深い専門知識を、堅牢な放送モニタリングおよびキューシート管理と組み合わせることで、Orfium はメディア環境全体における音楽利用を正確に識別、照合、報告します。これにより、クライアントに最大限の収益、比類ない精度、運用効率をもたらします。
2015〜2016年の創業以来、Orfium は YouTube、TikTok、BBC、Sky を含む世界トップクラスのレコードレーベル、出版社、放送局、プラットフォームにとって信頼されるパートナーとなってきました。高度なコンテンツ認識、AI を活用したデータ連携、透明性の高いロイヤリティ帰属を組み合わせることで、Orfium はアーティスト、作曲家、権利者が、自らの作品の価値を大規模に、リアルタイムで、世界中で保護し最大化できるよう支援しています。
課題:レガシーインフラ上での10億規模ベクトル音声検索
Orfium の事業が急速に拡大するにつれ、分析すべきコンテンツ量も増加しました。この成長は、コンテンツ認識および著作権管理サービスの基盤である既存インフラに大きな負荷をかけました。問題の核心はスケールでした。参照データベースは数十万の音声ファイルを含むまでに成長しており、既存のシステムはこの量のベクトルを処理できるようには設計されていませんでした。
Orfium のパイプラインは単に MP3 や MP4 を保存するだけではありません。機械学習モデルを活用して、類似性照合のための音声 embeddings を抽出します。「ベクトル埋め込みとは、高次元空間における音声特徴の情報量豊富な数値表現です」 と、Orfium の Data Science and AI Services Director である George Kastrinakis 氏は説明します。「2分間の音声ファイルの場合、複数の埋め込みを抽出します。それぞれがトラック内の特定セグメントの主要な音声特徴を捉えています。」
このアプローチでは音声セグメントごとに1つのフィンガープリントが生成されるため、各トラックは数十、場合によっては数百のベクトルを生み出します。これらの高次元ベクトルは音声固有の音響シグネチャを捉え、異なる文脈で再利用されたコンテンツを正確に検出できるようにします。「これらのフィンガープリントを組み合わせて検索を実行し、ある楽曲のどのセグメントが別のファイルに現れるかを検出する様子を想像できるでしょう」と George 氏は付け加えました。
しかし、この手法にはコストが伴いました。Orfium の既存の Elasticsearch および OpenSearch スタックは、当初は全文キーワード検索向けに設計されたものであり、高次元ベクトル類似性検索には適していませんでした。「従来のデータベースでは、すぐに壁にぶつかります。高価で遅くなってしまうのです」と George 氏は述べています。システムは限界まで追い込まれていました。500,000件の音声ファイルをインデックス化することは、巨大なパフォーマンス負荷となり、レイテンシの問題、急騰するコスト、そして何とか持ちこたえるためだけにフル稼働するインフラを引き起こしていました。
ベクトルネイティブなソリューションの探求
Orfiumのインフラが大規模な音声フィンガープリンティングの要求によって逼迫し始める中、エンジニアリングチームは、高次元ベクトル類似検索のために専用設計されたソリューションを包括的に探し始めました。
パフォーマンス、コスト、スケールのベンチマーク
Orfiumチームは、オープンソースのMilvus、Zilliz Cloud(Milvusのマネージド版)、TileDB、Snowflake、Pgvectorを含む複数の候補に対して、検索精度、コスト効率、スケーラビリティという3つの主要基準で社内ベンチマークを実施しました。
ベクトル検索精度。 同社のフィンガープリンティングプロセスでは、音声のセグメントごとに複数の特徴ベクトルが生成され、ベクトル空間が極めて過密になりつつあるため、厳しい量子化によって生じるベクトルのわずかな違いでさえ、検索指標に大きな影響を与える可能性があります。
コスト効率。 数十万から、将来的には数千万件の参照音声ファイルへとスケールする計画があり、それぞれが複数のベクトルを生成するため、総フットプリントは数百億ベクトル規模になると予測していました。従来の価格モデルでは、このような成長は法外に高額になる可能性があります。
スケーラビリティとスループット。 同社の本番パイプラインは、ラジオやテレビ放送、さらにYouTubeやTikTokからの音声を膨大な量で処理します。典型的なワークロードでは、最大で数百万件の音声ファイルからなる参照データベースを扱い、その結果、およそ数十億のベクトルが生じます。どのソリューションであっても、ボトルネックなしに高ボリュームのインデックス作成とクエリをサポートする必要がありました。
ブレークスルー:Zilliz Cloud
他の選択肢と比較して、オープンソースのMilvusは有望な柔軟性を提供し、チームがシステムレベルのチューニングを試せるようにしました。しかし、そのオーバーヘッドは大きなものでした。彼らはそれがもたらす制御性を評価していたものの、Georgeは「実際にすべてをセットアップするには多くの労力がかかった」と認めており、これはデプロイの迅速化とメンテナンスの最小化という目標に反するものでした。
その運用上の負担により、完全マネージドの代替案がより魅力的になりました。広範なテストの結果、マネージドMilvusであるZilliz Cloudが最上位に選ばれました。それは最も完成度が高く、本番環境に対応したソリューションとして際立っていました。Milvusの優れた機能をすべて備え、導入が容易で、負荷下でも高い性能を発揮し、チームがインフラではなくアプリケーション構築に集中できるマネージド体験を提供しました。
デプロイは簡単でした。1人のエンジニアが、参照データのアップロードや特徴抽出からシステムの設定まで、全面的な移行をZilliz Cloudコンソールだけで主導しました。
Georgeが要約したように、それは「パフォーマンス面、コスト面、使いやすさの面で、提供できる最良のもの」でした。
ソリューション:Zilliz Cloudで音声マッチングとカバー曲検出を強化
現在、OrfiumはZilliz Cloudを使用して、音声マッチングとカバー曲認識という2つのミッションクリティカルなサービスを支えています。前者は、さまざまなメディアプラットフォームにおける既知の楽曲の正確な使用を特定します。後者はさらに一歩進み、それらの楽曲の異なるバージョンやカバーを、再録音されていたりわずかに変更されていたりしても検出します。
これらの機能を支えるために、Orfiumは独自のニューラルネットワークを利用して音声コンテンツから埋め込みを作成しています。これらのベクトルはZilliz Cloudに保存され、ベクトル類似検索を使用して取得されます。従来の機械学習モデルとトランスフォーマーベースのアーキテクチャにより、メタデータの分析が促進され、2つのアセット間の関連度を判断します。Georgeは、同社が「ニューラルネットワークを使って埋め込みを作成し、その後、取得したベクトルに対してスコアリングを行う」と説明し、同時にアセット間のメタデータの類似性を評価するモデルも適用していると述べました。
Zilliz Cloudは現在、OrfiumのAWSベースのインフラにおいて中心的な役割を果たしています。AWS Marketplace経由でサブスクライブされており、コンピューティングとストレージのための既存のクラウドサービスと自然に並んで組み込まれています。
結果:パフォーマンスの飛躍的向上と運用の柔軟性が新たな機能を実現
Zilliz Cloud への移行により、Orfium は即座に測定可能な改善を実現し、システム性能を高め、運用を簡素化し、従来のインフラでは不可能だった機能を実現しました。
10億ベクトル規模でのスケーラブルなパフォーマンス
最も大きな成果の一つは、パフォーマンスを犠牲にすることなくシームレスにスケールできるようになったことです。チームは初期設定から、より高いスループットに最適化された構成へと迅速に移行し、その結果は期待を上回りました。かつてインフラの限界のように感じられていたものは、新しいシステムで容易に克服できるボトルネックにすぎなかったことが明らかになりました。
現在、Orfium はクラウド上で 50万〜100万件のオーディオファイルからなる参照データベース(およそ2.5億ベクトル)を容易に処理しています。以前の Elasticsearch ベースのスタックでは、この規模はシステム容量の限界まで追い込むものでした。Zilliz Cloud により、そうした制約はもはや懸念事項ではありません。
即時の著作権保護を実現するリアルタイム応答
レイテンシは課題から競争優位へと変わりました。Zilliz Cloud のベクトルネイティブなアーキテクチャにより、Orfium は放送、ソーシャル、ストリーミングの各プラットフォーム全体で高速な音声マッチングを実行できるようになりました。この機能は、コンテンツが公開または放送された瞬間にアーティストの知的財産を保護するという同社の使命を支えています。
George は次のように述べています。「レイテンシは重要です。現段階では、おそらく最も重要です。」Zilliz Cloud の速度と応答性により、大規模な時間依存の検出を確信を持ってサポートできます。
予測可能でコスト効率の高いスケーリング
以前の環境ではデータ量の増加に伴ってコストが急増していましたが、Zilliz Cloud はより持続可能なモデルを提供します。その価格体系は利用状況と価値に連動しており、Orfium はインフラ費用の暴走を心配することなく、自信を持って拡張できます。
かつて Elasticsearch システムを限界まで押し上げていた同じ 50万件のオーディオファイルでも、Orfium は現在、はるかに低いコストで一貫して高いパフォーマンスを実現しています。「精度、レイテンシ、そのほかすべての面で本当に高性能です」と George は述べています。
運用の簡素化とより迅速なイテレーション
運用のシンプルさも、際立った利点の一つです。Zilliz Cloud のマネージドな体験により、ベクトルインフラを維持する複雑さが解消され、チームは中断なくアップデートをデプロイし、ワークロードをスケールすることが容易になりました。
George は移行がいかにスムーズだったかを強調しました。「Zilliz を採用すると決めた瞬間から、実際に動くものができるまで、本当に非常に速かったです。」パイプラインに影響を与えることなくインフラ変更を行えるようになったことで、Orfium はより迅速にイテレーションを重ね、顧客価値の提供に集中し続けることができています。
次の展開:よりスマートな著作権検出エコシステムの構築
ベクトルベースの音声マッチングが十分に確立されたことで、Orfium は現在、歌詞の文字起こし、メタデータマッチング、ハイブリッド検索などのユースケースに Zilliz Cloud を活用しながら、著作権検出エコシステムを新たな領域へと拡張しています。
カバー曲や編曲向けの歌詞ベース検出: Orfium は、音声だけで楽曲を識別するのではなく、ファイルから歌詞を抽出し、保存済みの歌詞データベースと照合する計画です。この手法は補完的な保護を提供し、特に楽器編成、テンポ、またはボーカルスタイルによって楽曲のフィンガープリントが大きく変化する場合に有用です。
「アイデアとしては、オーディオファイルを取得し、歌詞を抽出して、その歌詞を既に持っているデータベースと照合するというものです」と George は説明しました。
ハイブリッド検索:ベクトルとテキストの組み合わせ: Zilliz Cloud は、ベクトル類似性とテキストベースのフレーズ検出を組み合わせるハイブリッド検索を通じて、歌詞マッチングをサポートできます。これにより、意味理解と従来のキーワードマッチングを組み合わせる道が開かれます。
セマンティックメタデータのマッチングと関係性の発見: アーティスト名、トラック情報、リリース日、ジャンルなどの関連データポイントを比較することで、Orfium は音声だけでは明らかにならない楽曲とアセット間の関係性を浮かび上がらせることができます。これにより、カバーやリミックスの特定から音楽的影響ネットワークのマッピングまで、より豊かな発見メカニズムが可能になります。
将来に向けたスケーリング:ベクトル量の100倍成長: Orfium のロードマップには積極的なスケール拡大が含まれています。現在のデプロイメントでは約100万件の音声ファイルを扱っていますが、長期的なビジョンでは数千万件から1億件超の音声アセットをインデックス化し、その結果、数百億のベクトルが生成されます。このような規模は、専用に設計されたベクトルデータベースなしには管理不能です。Zilliz Cloud のアーキテクチャは、最適なパフォーマンスと信頼性を維持しながら、この成長を支えるために必要なスケーラビリティと柔軟性を提供します。
結論:著作権保護の未来に向けたスケーラブルな基盤
Zilliz Cloud を採用することで、Orfium は限界の中での運用から、自信を持ったイノベーションへと移行しました。現在では、大規模な音声ライブラリ全体にわたってリアルタイム検出を提供し、エンジニアの運用を簡素化し、以前は想像もできなかった新たな機能を解き放っています。
Zilliz Cloud が Orfium のビジョンを支える一翼を担っていることを、私たちは誇りに思います。同社の技術的リーダーシップとイノベーションへの注力は、権利管理において何が可能かについて高い基準を示し続けており、同社がグローバル規模で音声とコンテンツインテリジェンスの未来を築いていく中で、そのミッションを支援できることを嬉しく思います。
It was the best thing to offer—performance-wise, cost-wise, and ease-of-use-wise.
George Kastrinakis


