Защита ИИ: продвинутые стратегии конфиденциальности с PrivateGPT и Milvus
Введение
По мере того как организации интегрируют Large Language Models (LLMs) и другие инструменты AI в свои операции, растет обеспокоенность безопасностью данных. Например, ключевые секторы, такие как финансы, банковское дело, здравоохранение и электронная коммерция, внедряют AI для поддержки широкого спектра функций — от создания контента и суммаризации документов до клиентской поддержки и ответов на вопросы на основе промптов. Однако такое широкое внедрение AI также создает существенные риски, такие как потенциальные нарушения конфиденциальности данных и несоблюдение стандартов соответствия.
Чтобы снизить эти риски, компании ищут решения, которые позволят им использовать возможности AI без ущерба для безопасности их чувствительных данных. На недавнем вебинаре, организованном Zilliz, Daniel Gallego Vico, основатель PrivateGPT и Zylon, поделился ценными идеями о различных инфраструктурах данных, предназначенных для повышения конфиденциальности данных в корпоративной среде. В этой публикации блога мы кратко изложим ключевые моменты презентации Daniel и предложим наш взгляд на эти разработки. Если вас интересуют более подробные сведения, посмотрите запись его выступления на YouTube.
Как инструменты AI угрожают конфиденциальности данных: риски и последствия
Figure- AI adoption is unstoppable. .png
Рисунок: внедрение AI невозможно остановить.
Daniel приводит впечатляющую статистику из отчета 2024 Work Trend Index: “75% работников умственного труда по всему миру уже используют AI в своих профессиональных задачах.” Такое широкое внедрение подчеркивает неизбежность интеграции AI на рабочих местах, но также выявляет значительные проблемы в защите приватных данных:
Утечка данных в результатах модели: Когда сотрудники используют LLMs, такие как ChatGPT, для анализа данных компании, эти модели, обученные на обширных наборах данных, могут непреднамеренно включать фрагменты своих обучающих данных в свои результаты. Это может привести к непреднамеренной утечке чувствительной информации, потенциально раскрывая детали из промптов и документов, использованных во время сеанса.
Обратная разработка анонимизированных данных: Несмотря на усилия по шифрованию или анонимизации Personally Identifiable Information (PII), таких как имена, адреса и номера кредитных карт, эти меры защиты не являются непреодолимыми. Опытные хакеры успешно применяли методы обратной разработки для декодирования зашифрованных данных, создавая значительную угрозу конфиденциальности данных.
Атаки на вывод модели: В таких атаках злоумышленник отправляет различные входные данные в модель AI и анализирует ответы, чтобы сделать вывод о том, были ли конкретные данные включены в обучающий набор. Например, этот метод может раскрыть, использовались ли медицинские записи конкретного пациента при обучении системы AI для здравоохранения, тем самым нарушая конфиденциальность пациента.
Figure- AI breaks privacy. .png
Рисунок: AI нарушает конфиденциальность.
Помимо этих конкретных рисков, угрозы конфиденциальности данных также возникают из-за скрейпинга данных, утечек вследствие недостаточных мер безопасности и потенциальной способности моделей AI запоминать чувствительные данные во время обучения. Любое раскрытие данных клиентов или заказчиков может привести к серьезным юридическим проблемам для организаций, не соблюдающих нормативные стандарты.
Разные уровни конфиденциальности AI
Разработка AI-приложений, таких как чат-боты или генерация с дополнением извлечением (RAG), часто требует интеграции различных сторонних сервисов, включая LLM, облачных провайдеров, модели эмбеддингов и векторные базы данных, такие как Milvus. Обеспечение соответствия всех этих сервисов строгим стандартам конфиденциальности и безопасности данных является важной, но сложной задачей.
Существует ряд решений для обеспечения конфиденциальности AI, предназначенных для решения этих вопросов конфиденциальности, каждое из которых предлагает разные уровни безопасности данных в зависимости от своей инфраструктуры. Организациям крайне важно тщательно понимать каждый вариант, чтобы выбрать решение, которое лучше всего соответствует их потребностям.
Дэниел представил пять различных стратегий обеспечения конфиденциальности AI: соответствующий требованиям SaaS, анонимизация данных, локальное выполнение, внутренняя разработка и локальная инфраструктура, не зависящая от поставщика. В следующих разделах мы обсудим эти решения, их преимущества и ограничения, чтобы помочь вам в процессе принятия решений.
Соответствующий требованиям SaaS
Соответствующий требованиям SaaS представляет собой базовый уровень конфиденциальности данных, при котором организация соблюдает нормативные стандарты, такие как GDPR или HIPAA. Изначально данные хранятся в инфраструктуре компании, а затем передаются поставщику AI Software as a Service (SaaS). Этот поставщик, в свою очередь, может передавать данные различным сторонним поставщикам для таких задач, как создание векторных эмбеддингов (с помощью таких инструментов, как Milvus), обучение LLM (например, OpenAI) и управление загрузкой данных.
Figure- AI Solutions by Privacy Level - Compliant SaaS .png
Рисунок: AI-решения по уровню конфиденциальности — соответствующий требованиям SaaS
Однако эта стратегия сопряжена со значительными рисками. Нарушение безопасности у любого стороннего поставщика может привести к несанкционированному доступу к данным вашей организации. Кроме того, эти третьи стороны имеют полный доступ к загруженным данным и потенциально могут использовать их для обучения собственных моделей, что создает дополнительные риски неправомерного использования данных.
Анонимизация данных
Анонимизация данных — это инфраструктурное решение для повышения конфиденциальности, предназначенное для защиты данных в SaaS- или облачных конвейерах. Перед передачей данных поставщику SaaS применяется дополнительный слой анонимизации. В ходе этого процесса персональная идентифицируемая информация (PII), такая как имена, адреса и номера кредитных карт, скрывается или заменяется шифрованием. В идеале такая анонимизация должна выполняться локально в защищенной инфраструктуре компании.
Figure- AI Solutions by Privacy Level - Data Anonymization .png
Рисунок: AI-решения по уровню конфиденциальности — анонимизация данных
Хотя анонимизация может значительно снизить риски повторной идентификации конфиденциальных данных или их неправомерного использования третьими сторонами, у нее есть недостатки. Обучение LLM на анонимизированных данных может привести к снижению точности результатов или выводов. Кроме того, несмотря на дополнительный уровень защиты, злоумышленники все еще могут повторно идентифицировать частичную информацию, сопоставляя ее с другими наборами данных.
Локальное выполнение
Локальное выполнение запускает весь AI-конвейер на изолированном устройстве, таком как персональный компьютер или сервер. Этот метод обеспечивает высокий уровень конфиденциальности данных, поскольку данные остаются внутри вашей системы, а LLM могут работать в автономном режиме. Он особенно подходит для отдельных исследователей, работающих с небольшими наборами данных.
Figure- AI Solutions by Privacy Level - Local Execution.png
Рисунок: AI-решения по уровню конфиденциальности — локальное выполнение
Однако осуществимость локального выполнения может быть ограничена из-за высоких затрат на настройку. Работа полностью на локальных системах требует высокопроизводительных GPU и мощных устройств для достижения результатов высокого качества. Кроме того, локальное выполнение может быть не лучшим вариантом для совместных проектов с участием нескольких людей или команд, поскольку оно ограничивает доступность данных и совместную работу в реальном времени.
Внутренняя разработка
Внутренняя разработка создает полный сквозной AI-конвейер в защищенной инфраструктуре компании. Этот подход гарантирует, что производительность LLM не ухудшается, при этом значительно снижая риск утечки данных. Он также облегчает доступ к данным и совместную работу между командами внутри предприятия.
Figure- AI Solutions by Privacy Level - In-House Development.png
Рисунок: AI-решения по уровню конфиденциальности — внутренняя разработка
Однако внедрение внутреннего решения требует существенных первоначальных инвестиций как денег, так и времени, что делает его осуществимым главным образом для крупных предприятий. Компаниям необходимо настроить всё с нуля, включая векторную базу данных, модели эмбеддингов, GPU и фронтенд. Кроме того, необходимо нанять и обучить технические команды для создания и поддержки системы, что увеличивает долгосрочные затраты и операционные требования.
Локальная инфраструктура без привязки
Для небольших предприятий и стартапов, которые не могут позволить себе построить полномасштабную инфраструктуру с нуля, универсальные AI-рабочие пространства, такие как Zylon, предлагают жизнеспособное решение. В этой модели данные остаются в инфраструктуре компании, а рабочее пространство предоставляет необходимые компоненты для запуска LLM и выполнения задач инференса локально. Zylon включает инструменты обеспечения конфиденциальности, такие как PrivateGPT, что позволяет пользователям запускать модели генеративного AI полностью на локальном оборудовании или в своей защищенной инфраструктуре.
Figure- AI Solutions by Privacy Level - On-prem Infra Agnostic.png
Рисунок: AI-решения по уровню конфиденциальности — локальная инфраструктура без привязки
При таком подходе Zylon не получает доступ к данным компании, что позволяет предприятиям использовать возможности AI без ущерба для конфиденциальности. Однако существенным ограничением этого решения является необходимость для организаций создавать свои дата-центры, чтобы сохранять контроль над своими данными, что может быть дорогостоящим. Это требование может накладывать ограничения на небольшие компании с ограниченными капитальными ресурсами.
Что такое PrivateGPT и как он повышает конфиденциальность AI?
PrivateGPT — это фреймворк, предназначенный для разработки контекстно-ориентированных LLM с усиленными средствами контроля конфиденциальности данных. Он предоставляет пользователям набор AI-инструментов и API для различных задач, таких как создание эмбеддингов с помощью моделей эмбеддингов, выполнение поиска по сходству с использованием векторных баз данных, таких как Milvus, или применение предварительно обученных LLM для инференса.
Диаграмма ниже иллюстрирует конвейер PrivateGPT, который обычно включает LLM, к которой конечные пользователи могут обращаться с запросами, модель эмбеддингов, преобразующую текст или изображения в векторные эмбеддинги, и векторную базу данных для хранения этих эмбеддингов.
Figure- PrivateGPT Architecture and Components.png
Рисунок: архитектура и компоненты PrivateGPT
PrivateGPT предлагает значительную гибкость, позволяя пользователям настраивать конфигурации и выбирать APIs или модели, которые лучше всего соответствуют их потребностям. Например, пользователи могут выбирать из различных LLM, таких как Llama или Mistral, в зависимости от требуемой сложности и скорости приложения. Пользователям также крайне важно выбрать векторную базу данных, которая является надежной и способна обеспечивать высокую скорость извлечения, например Milvus. Кроме того, доступно множество вариантов моделей эмбеддингов, включая модели от Hugging Face и NOMIC, что предоставляет широкий выбор для удовлетворения различных требований проектов и повышения общей производительности системы.
Для создания AI-приложений с использованием PrivateGPT разработчикам доступны две основные категории REST APIs: Primitives API и Recipes API. Эти APIs предназначены для облегчения создания приватных, контекстно-ориентированных AI-приложений при строгом соблюдении конфиденциальности данных.
Primitives API
Эта категория API позволяет командам разрабатывать AI-приложения с различными уровнями кастомизации:
High-Level API: Предназначенный для пользователей, предпочитающих простой подход без необходимости глубокой кастомизации, этот API предлагает готовый к использованию RAG-конвейер. Команды могут загружать документы, а API берет на себя многочисленные задачи обработки данных, такие как синтаксический анализ, разбиение, создание эмбеддингов метаданных и их хранение. Он также позволяет выполнять prompt engineering для предоставления контекстных ответов на запросы пользователей.
Low-Level API: Этот API позволяет пользователям, которым требуется больше контроля над своими AI-приложениями, создавать и настраивать отдельные компоненты RAG-конвейера. От логики, лежащей в основе векторных эмбеддингов, до процедур загрузки документов — пользователи могут экспериментировать, чтобы определить наиболее эффективные стратегии извлечения данных.
Recipes API
Недавно представленный продвинутый высокоуровневый API, Recipes API позволяет пользователям создавать структурированные рабочие процессы, или «recipes», для конкретных AI-задач, таких как суммаризация. Этот API бесценен для предприятий, стремящихся разрабатывать кастомизированные рабочие процессы, соответствующие их уникальным бизнес-требованиям. Он может бесшовно интегрироваться с локальными базами данных или системами управления контентом, позволяя компаниям автоматизировать и оптимизировать свои внутренние процессы без передачи данных на внешние серверы.
Настройки PrivateGPT для локального выполнения
Дэниел делится рекомендациями по настройке PrivateGPT для локального выполнения, что идеально подходит для обеспечения 100% конфиденциальности данных и работы офлайн. Дэниел рекомендует использовать Ollama для задач инференса в этой конфигурации, которая поддерживает GPU-конфигурации и бесшовно интегрируется с различными моделями LLM. Эта гибкость критически важна для адаптации к разным типам данных — тексту, аудио или изображениям — и конкретным вычислительным задачам. Популярные варианты LLM — Llama and Mistral AI, известные своей высокой производительностью в разнообразных сценариях использования.
Для векторной базы данных Дэниел советует использовать Milvus Lite, упрощенную версию широко известной векторной базы данных Milvus, знаменитой своими возможностями крупномасштабного поиска по сходству. Благодаря низкому потреблению ресурсов Milvus Lite идеально подходит для сред с ограниченными ресурсами. Она обеспечивает быстрый поиск по сходству и извлечение данных, что делает ее отличным выбором для небольших приложений, которым не требуется обширная инфраструктура.
Кроме того, Дэниел предлагает выбрать модель эмбеддингов, поддерживающую широкий спектр языков. Это гарантирует, что создаваемые векторные эмбеддинги будут применимы к различным международным контекстам и языковым потребностям, повышая общую полезность и охват AI-приложения.
Рисунок — Рекомендуемые конфигурации PrivateGPT для локального развертывания .png
Рисунок: Рекомендуемые конфигурации PrivateGPT для локального развертывания
Конфигурации PrivateGPT для выполнения в облаке
При разработке крупномасштабных AI-приложений рекомендуется настраивать PrivateGPT для выполнения в облаке, что позволяет пользователям получать доступ к своим экземплярам из любой точки мира. Такая конфигурация предполагает более сложные и требовательные требования к инфраструктуре по сравнению с локальным выполнением. Daniel описывает эффективную стратегию построения облачной архитектуры, которая максимизирует эффективность и при этом защищает конфиденциальность данных.
Для начала пользователям потребуется облачный экземпляр от поставщиков услуг, таких как AWS. Daniel рекомендует установить Milvus Standalone в качестве векторной базы данных на этом облачном экземпляре с использованием Docker. Milvus Standalone предлагает одноузловое развертывание, которое, несмотря на свою простоту, всё же предоставляет полноценные возможности векторного поиска, индексирования и хранения, что делает его идеальным для приложений PrivateGPT.
Кроме того, настройка сервера NodeJS на облачном экземпляре обеспечивает удобный доступ к AI-приложению и взаимодействие с ним. Этот сервер выступает посредником, обрабатывая запросы к модели PrivateGPT и от неё, обеспечивая бесперебойную и эффективную работу в сети.
Рисунок — Рекомендуемые конфигурации PrivateGPT для облачного развертывания.png
Рисунок: Рекомендуемые конфигурации PrivateGPT для облачного развертывания
Резюме
В этой публикации мы обсудили конфиденциальность данных при разработке AI-приложений, особенно при работе с конфиденциальной информацией клиентов. Мы узнали, что простого соблюдения нормативных стандартов недостаточно для защиты данных от сложных атак, таких как обратная разработка и вывод по модели.
Мы также подробно рассмотрели различные стратегии обеспечения конфиденциальности данных, оценив инвестиции и риски, связанные с каждой из них. Daniel поделился мнениями о том, как интеграция таких инструментов, как PrivateGPT, с векторными базами данных, такими как Milvus, повышает точность выходных данных LLM и защищает конфиденциальность. Мы также предложили практические рекомендации по настройке безопасных архитектур для локальных и облачных развертываний, чтобы компании могли создавать надежные и эффективные AI-системы, соблюдая строгие стандарты защиты данных.
Дополнительные ресурсы
Защита данных: безопасность и конфиденциальность в системах векторных баз данных
Обеспечение конфиденциальности данных в AI-поиске с Langchain и Zilliz Cloud
Что такое приватные LLM? Запуск больших языковых моделей в приватном режиме — PrivateGPT и не только
Ландшафт экосистемы GenAI: за пределами LLM и векторных баз данных
Читать далее

Data Deduplication at Trillion Scale: How to Solve the Biggest Bottleneck of LLM Training
Explore how MinHash LSH and Milvus handle data deduplication at the trillion-scale level, solving key bottlenecks in LLM training for improved AI model performance.

OpenAI o1: What Developers Need to Know
In this article, we will talk about the o1 series from a developer's perspective, exploring how these models can be implemented for sophisticated use cases.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.



