UNIwiseはいかにしてMilvusでスケーラブルな剽窃検出プラットフォームを構築したか

費用対効果が高い
どのような規模でも
10,000件以上のドキュメント
単一バッチでのシームレスな処理、数百億のベクトルへの道筋
よりスマートな盗用検出
欧州言語間でのセマンティック類似検索
より迅速なイノベーション
新機能の構築により多くのエンジニアリング時間を割いて
Milvus transformed our ability to detect semantic plagiarism at scale. We can now process variable workloads ranging from 10 to 10,000+ documents daily while maintaining cost-effectiveness, which would have been impossible with traditional solutions.
Teis Petersen
UNIwiseについて
UNIwiseは、オンライン試験ソリューションを提供する欧州の大手プロバイダーであり、12年以上にわたり大学から信頼されています。デンマークに本社を置く同社は、スカンジナビア、英国、さらにその先の地域にある教育機関を支援しています。同社の主力プラットフォームであるWISEflowは、試験の作成と実施から採点、フィードバック、大学のLearning Management Systems(LMS)との統合まで、評価のライフサイクル全体をカバーしています。
この基盤の上に、UNIwiseはMilvusを活用したセマンティック剽窃検出システムであるWISEflow Originality,を立ち上げました。競合するベクトルデータベースソリューションではなくMilvusを選択することで、UNIwiseは数十億件の文書までスケール可能な費用対効果の高いプラットフォームを構築しました。最新のアーキテクチャとインテリジェントなスケーリング戦略により、WISEflow Originalityはエンタープライズグレードの性能と信頼性を提供し、大学に学術的誠実性を確保するための強力なツールを提供します。
課題:レガシーな剽窃検出を超えてスケールする
多くの欧州の大学がデジタル評価の利用を拡大するにつれ、多くの大学でレガシーな剽窃検出ツールの限界が見え始めました。Turnitinなどの既存システムは、運用コストが高く、増え続けるコンテンツ量に応じたスケーリングに苦労する従来型のテキスト照合技術に大きく依存していました。こうした手法はセマンティックな類似性を捉えられないことが多く、異なる言語間で言い換えられたコンテンツを検出することを困難にしていました。これは欧州の教育機関にとって重要なニーズです。
この需要に応えるため、UNIwiseはコストを管理可能な範囲に抑えながら、数十億件の文書にわたる比較を処理できるプラットフォームであるWISEflow Originalityの構築に着手しました。このシステムには、単純なテキスト一致を超えるセマンティックな理解が必要であり、デンマーク語、ノルウェー語、スウェーデン語、ドイツ語、英語、スペイン語を含む複数の欧州言語をサポートする必要がありました。同時に、WISEflowとシームレスに統合し、24時間のSLA内に結果を提供し、インフラストラクチャのオーバーヘッドを最小限に抑える必要がありました。
ビジネスの観点から見ると、UNIwiseは、はるかに大きなリソースを持つ既存の有力企業と競争しながら、小規模なエンジニアリングチームで複雑なデータ処理プラットフォームを構築するという課題に直面していました。また、エンタープライズ規模で運用効率と費用対効果を維持しながら、大学契約のためのEU公共入札プロセスにも対応する必要がありました。
ソリューション:Milvusでセマンティック検出エンジンを構築する
WISEflow Originalityを実現するため、UNIwiseはまもなく、ベクトルデータベースが従来のテキスト照合アプローチの数分の一のコストで、必要としていたセマンティック比較とスケーラビリティを提供できることに気づきました。同社は、Milvus、Weaviate、Redis Vector Search、OpenSearchを含む複数のベクトル検索ソリューションについて徹底的な評価を実施しました。各選択肢は、安定性、大規模データセットに対するスケーラビリティ、性能最適化、標準準拠、コミュニティとサポート、既存ツールとの互換性を含む重み付けされた基準に基づいて評価されました。
Milvusが選ばれた理由
Milvusは、複数の側面で最も適した選択肢として浮上しました。ドキュメントの品質は決定要因の一つでした。UNIwiseのエンジニアリングチームリードであるTeis Petersenは次のように述べています。「ベクトルデータベースを運用する必要があり、経験がない場合、本当に、本当に優れたドキュメントが必要です。それは本当に、本当に重要です。」 Milvusは、オンボーディングを加速する明確で利用しやすいドキュメントを提供していました。
同じく重要な点として、Milvusはベクトル操作のために専用設計されています。汎用データベースに後付けでベクトル検索機能を追加したものとは異なり、優れたスケーラビリティと性能を提供します。また、大規模で活発なオープンソースコミュニティと最新のクラウドネイティブアーキテクチャにより、UNIwiseは長期的なサポートと柔軟なデプロイ戦略に対する信頼を得ることができました。
技術アーキテクチャ
Milvusを中核として、UNIwiseは完全非同期のデータ処理パイプラインを実装しました。このシステムはMilvusに加え、384次元ベクトルを用いるMiniLM多言語文類似度モデルを利用しています。追加コンポーネントには、文書レイアウト検出用のYOLO v3と、テキスト抽出用のOCRモデルが含まれます。オーケストレーション層は、API管理とワークフロー調整を担うGoサービスと、機械学習を担うPythonサービスを組み合わせ、MLflowモデルリポジトリによって支えられています。すべてのコンポーネントは、AWS EKSサービス上のマネージドクラスターにデプロイされています。
エンドツーエンドのワークフローは、WISEflowからの文書取り込みから始まり、続いてタイトルやページ番号などの無関係な要素を除去するためのレイアウト検出を行います。その後、テキストが抽出、分割され、MiniLMモデルを使用してベクトルに埋め込まれます。Milvusはこれらの埋め込みをインデックス化し、類似度検索を実行します。その後、結果が集約され、WISEflowインターフェイス内に直接表示されます。
MilvusがUNIwiseの成果創出にどのように貢献したか
WISEflow Originalityの検索基盤としてMilvusを選択することで、UNIwiseは直面していた技術的課題に容易に対処できました。 このプラットフォームは現在、コスト効率、スケーラビリティ、高度な検出機能を、従来の盗用検出ツールでは実現できない形で組み合わせています。
スケールしながらコストを抑制
Milvusのクラウドネイティブ設計により、UNIwiseは需要に応じてリソースを柔軟にスケールアップおよびスケールダウンできるようになりました。このアプローチを採用することで、大量のデータがあるにもかかわらず、インフラコストを持続可能な水準に保つことができます。
ベクトル検索によるよりスマートな盗用検出
キーワードや文字列照合に限定された従来システムとは異なり、Milvusは多言語コンテンツ全体にわたる意味的類似度検索を可能にします。MiniLMモデルと組み合わせることで、UNIwiseは7つのヨーロッパ言語にわたって、言い換えや再構成された盗用を検出できます。
あらゆるワークロードに対応するスケーラビリティ
Milvusにおけるインデックス化と検索の分離により、UNIwiseは各機能を独立してスケールできました。これにより、少数の文書から単一バッチで10,000件を超える文書までのワークロードに対応でき、将来的には数百億ベクトルへの明確な道筋も確保できました。現在、このシステムは大規模なアーキテクチャ変更を必要とせず、大学のニーズに合わせて成長できます。
少人数チームでも実現する運用信頼性
MilvusはUNIwiseに信頼性の高いバックボーンを提供し、堅牢なエラーハンドリングを実現しました。包括的なドキュメントと大規模なオープンソースコミュニティの存在も学習曲線を緩和し、UNIwiseの小規模なエンジニアリングチームが過度な負担なしにシステムを維持・拡張できるようにしました。
重要な機能により多くの時間を投入
Milvusが大規模な類似度検索の重い処理を担うことで、UNIwiseは大学にとって重要な機能の構築に集中できました。オープンソースエコシステムは開発を継続的に加速させており、WISEflow Originalityが新たな学術要件に対応しながら、従来型プロバイダーに対して競争力を維持できるようにしています。
今後の計画とロードマップ
UNIwiseはMilvusで確立した基盤の上に構築を続けています。短期的には、チームはMilvus 2.6へアップグレードし、階層型ストレージを活用してさらなるコスト最適化を図るとともに、最新のパフォーマンス強化の恩恵を受ける予定です。
これらの計画は総じて、コスト削減、パフォーマンス向上、コンプライアンス確保というUNIwiseの継続的改善へのコミットメントを示すものであり、そのすべてにおいて、Milvusを同社の独自性検出プラットフォームのスケーラブルな中核として活用しています。
結論
UNIwiseのWISEflow Originalityにおける取り組みは、ドメイン専門知識と適切な技術基盤を組み合わせることで、焦点を絞ったチームが業界大手に挑戦できることを示しています。Milvusを採用することで、UNIwiseは、コスト効率に優れ、多言語対応で、数十億文書までスケール可能な盗用検出プラットフォームを構築しました。これは、従来のキーワードベースのシステムが実現に苦労していた能力です。
この成功は、教育テクノロジーにおけるベクトルデータベースの重要性が高まっていることを示しています。Milvus は UNIwise に、大規模なワークロードを処理し、新たな要件に迅速に適応し、大学にとって最も重要な機能にエンジニアリングリソースを投資する能力をもたらしました。
今後、UNIwise は欧州におけるデジタル評価の未来を引き続き形作っていく立場にあります。Milvus を戦略的な基盤として、同社はオリジナリティ検出機能を拡張しながら、セマンティック検索や AI 駆動型学習ツールにおける新たな機会を探ることができます。
If I were to choose again, I would still choose Milvus at this point. The scalability, documentation quality, and continuous innovation make it the right foundation for our plagiarism detection platform.
Teis Petersen


