특정 도메인에서 LLM의 안전성 및 정렬 평가
AI의 최근 발전은 의료, 금융 서비스, 법률 산업과 같은 고위험 영역 전반에 잠재적으로 혁신적인 영향을 미칠 수 있는 정교한 대규모 언어 모델(LLMs)의 등장을 이끌었습니다. 이러한 모델은 상당한 이점을 제공하지만, 중요한 의사결정에 사용하려면 안전성, 정확성, 윤리적 기준을 보장하기 위한 철저한 평가가 필요합니다. 이처럼 민감한 환경에서 AI를 완전히 수용하기 전에 이러한 모델의 정확성, 보안, 공정성을 둘러싼 심각한 우려를 해결해야 합니다.
최근 Unstructured Data Meetup에서 Zhuo Li of Hydrox AI의 CEO가 LLM을 위한 안전성 평가의 현재 환경에 대해 이야기하고 AI Alliance와 협력 중인 평가 프레임워크 프로젝트에 대한 인사이트를 공유했습니다. 이 프로젝트는 민감한 환경에서 LLM을 안전하고 책임감 있게 배포할 수 있도록 포괄적인 도구와 방법을 개발하는 것을 목표로 합니다.
AI Alliance와 함께한 9월 Unstructured Data Meetup에서 발표하는 Zhuo Li
이 블로그에서는 행사 중 논의된 핵심 사항을 살펴보고 Hydrox AI와 AI Alliance 같은 기업들이 AI 안전성과 평가의 중요한 과제에 어떻게 대응하고 있는지 알아보겠습니다.
안전성 평가가 중요한 이유는?
Zhuo Li는 민감한 정보를 다루는 산업에서 안전성 평가의 중요성을 강조했습니다. 많은 LLM이 일반적인 안전성 문제를 처리할 수 있지만, 의료, 은행 또는 교육 전문가들이 직면하는 실제 시나리오에서는 종종 부족한 모습을 보입니다. LLM은 일반적인 작업에서는 잘 수행할 수 있지만 의료 기록이나 재무제표와 같은 민감한 데이터에서는 어려움을 겪을 수 있습니다.
LLM의 안전성 평가는 정확성, 법적 규제, 윤리적 책임과 같은 요소를 고려해야 합니다. 새로운 과제와 취약점이 지속적으로 발생하므로 이러한 평가는 계속되어야 합니다. 변화하는 환경에 적응하려면 정기적인 테스트와 개선이 필수적입니다.
또한 부정확하거나 편향된 AI 출력의 영향은 고위험 환경에서 치명적일 수 있습니다. 예를 들어 의료 분야에서 LLM이 제안한 잘못된 진단은 부적절한 치료로 이어져 환자의 생명을 위협할 수 있습니다. 마찬가지로 금융 분야에서 AI가 생성한 부정확한 위험 평가는 기업과 개인에게 상당한 재정적 손실을 초래할 수 있습니다. 따라서 이해관계자의 이익을 보호하기 위해 강력한 평가 방법론을 개발하는 것이 필수적입니다.
AI 평가의 현재 과제
AI 모델 평가에서 가장 큰 문제 중 하나는 신뢰할 수 없는 벤치마크입니다. 여러 평가 도구가 제공되지만, 많은 도구가 충분히 자주 업데이트되지 않거나 민감한 데이터를 다루는 산업의 특정 요구를 포괄하지 못합니다. 그 결과 기업은 어떤 AI 모델을 사용할지 선택할 때 오래되었거나 불완전한 정보를 바탕으로 결정을 내릴 수 있습니다.
최신 벤치마크가 부족한 것 외에도, 관련 위험을 완전히 이해하고 이를 해결하기 위한 올바른 조치를 취하도록 돕는 도구도 부족합니다. 이러한 격차가 바로 Hydrox와 같은 기업들이 IBM과 협력하여 AI Alliance 내에서 메우고자 하는 부분입니다. 이들은 현재 초기 버전을 갖춘 LLM용 포괄적 평가 프레임워크를 개발하고 있으며, 이는 고위험 영역에 맞게 설계되었습니다. 목표는 이러한 모델이 안전성, 법적 준수, 윤리적 사용에 대한 엄격한 기준을 충족하도록 하여 오류와 위험을 최소화하는 데 도움이 되도록 하는 것입니다.
이 프레임워크의 핵심 목표는 다음과 같습니다:
헬스케어, 금융, 법률 서비스와 같은 중요 부문에서 LLM 평가.
도메인 전문가와 실제 애플리케이션이 뒷받침하는 평가 프레임워크 개발.
LLM의 안전성, 확장성 및 위험을 평가하기 위한 개념 증명(PoC).
안전성, 기술 요구사항 및 규제를 고려하면서 생성형 AI를 통합하는 것에 대한 업계 최초의 권고사항.
기존 사전 학습 모델과 전문가가 식별한 특정 작업에 집중.
이 프레임워크의 초기 버전은 EPASS(Evaluation Platform for AI Safety and Security)라고 하며, 이미 "artprompt"와 "gptfuzzer" 같은 여러 공격 방법을 다루고 있고, 성적 콘텐츠와 허위 정보 같은 콘텐츠 범주를 분석합니다.
실제 사례 연구: 헬스케어와 교육
Zhuo Li는 이 평가 프레임워크가 헬스케어와 교육 같은 민감한 영역에서 어떻게 사용될 수 있는지 보여주는 몇 가지 사례 연구를 공유했습니다.
LLM은 환자 기록을 요약하거나 의료 이미지를 분석함으로써 헬스케어에서 의사를 지원하여 효율성을 크게 향상시킬 수 있습니다. 그러나 헬스케어 데이터의 민감성을 고려할 때, AI 시스템은 HIPAA와 같은 법률 준수를 보장해야 합니다. 이 프레임워크는 진단 또는 치료 제안의 편향을 AI 모델에서 확인함으로써 의사가 명확한 출력을 받을 수 있도록 돕습니다.
예를 들어, 과거 환자 데이터를 기반으로 치료 옵션을 제안하는 데 LLM을 사용하면 임상 의사결정을 가속화할 수 있습니다. 그러나 환자에게 잠재적 피해를 주지 않도록 이러한 제안이 정확하고 편향되지 않은 데이터를 기반으로 하는 것이 매우 중요합니다. 바로 여기서 안전성 평가가 필수적이 됩니다. 이는 단순히 규정 준수를 보장하는 것뿐만 아니라, 자신의 데이터가 안전하게 처리되고 AI 기반 권고가 신뢰할 수 있다고 확신해야 하는 환자들의 신뢰를 유지하는 데도 중요합니다.
교육 분야에서는 AI를 교육, 채점 및 평가 결정에 사용할 수 있습니다. 그러나 학생 데이터를 보호하고, FERPA와 같은 개인정보 보호 규정을 준수하며, AI 권고의 정확성을 보장하는 것이 필수적입니다. 이러한 모델에 대한 정기적인 감사는 편향을 식별하고 제거하는 데 도움이 되어, 학생과 교사 사이에서 AI 시스템에 대한 신뢰를 조성할 수 있습니다.
AI는 또한 개인화 학습을 지원하여 교육 콘텐츠를 개별 학생의 필요에 맞게 조정할 수 있습니다. 하지만 모델은 기존 편향이나 채점의 부정확성을 강화하지 않도록 정기적으로 평가되어야 하며, 이는 학생의 성과에 영향을 미칠 수 있습니다. 잘 구조화된 평가 프레임워크는 알고리즘이 학생의 학습 스타일과 배경에 적절히 적응하도록 보장함으로써 개인화 학습의 효과를 높일 수 있습니다.
EPASS(Evaluation Platform for AI Safety and Security)
강연 말미에 Zhuo Li는 지난 10개월 동안 개발된 플랫폼인 EPASS를 소개했습니다. 현재 이 플랫폼은 일반적인 사용 사례와 다양한 공격 방법을 지원하며, 정기적인 업데이트와 더 많은 도메인별 사용 사례 추가가 이루어지고 있습니다.
EPASS 비디오
그림 1은 현재 모델 대시보드를 보여주며, 네 가지 영역에서 각 모델의 순위를 표시합니다:
안전성: 범죄 및 혐오 발언과 같은 위험을 조장하는 위험.
프라이버시: 데이터 공유 및 멤버십 추론과 같은 데이터 유출과 관련된 위험.
보안: 역할극 및 프롬프트 인젝션과 같은 모델의 행동적 위험.
무결성: 저작권 및 사기와 같은 모델 윤리와 관련된 위험.
그림 1: 모델 대시보드(100 = 가장 안전, 0 = 가장 덜 안전)
이러한 모델은 정기적으로 평가 및 업데이트되며, 모든 모델의 비교는 그림 2와 3에 나와 있습니다. 이 그림들은 위에서 설명한 영역을 기반으로 한 전체 점수와 다양한 공격 방법을 기반으로 한 점수를 보여줍니다.
그림 2: 모델 리더보드(전체 평가)
현재 사용 가능한 19가지 공격 방법 중 다음을 강조할 수 있습니다:
Analyzing-based Jailbreak (ABJ): 이 방법은 LLM의 분석 및 추론 능력을 활용하여, 분석적 과제에 직면했을 때의 약점을 드러냅니다.
ArtPrompt: 이는 ASCII 아트를 이해하는 데 있어 LLM의 어려움을 악용합니다.
DrAttack: 이 방법은 프롬프트를 분해하고 동의어 검색과 인컨텍스트 학습을 사용하여 이를 재구성합니다.
Developer: 이는 개발자 모드를 모방하는 프롬프트를 사용하여 탈옥을 유도합니다
사용자는 플랫폼에서 모델을 평가하고 특정 사용 사례에 대해 위 영역 및 공격 방법에 대한 점수를 얻을 수 있습니다. 이를 통해 모델에 대한 정기적인 업데이트와 개선이 가능하며, 각 모델의 강점과 약점에 대한 인사이트를 제공합니다.
그림 3: 모델 리더보드(공격 방법)
또한 각 모델에 대해 사용자는 최신 전체 점수(그림 4)와 안전성(그림 5), 개인정보 보호(그림 6), 보안(그림 7), 무결성(그림 8)과 같은 특정 영역의 점수를 더 심층적으로 살펴볼 수 있습니다. 예를 들어, 안전성 점수는 허위 정보, 윤리, 범죄, 폭력과 같은 문제를 기반으로 평가됩니다. 개인정보 보호 영역에서는 데이터 수집, 삭제, 공유와 같은 요소가 중요합니다. 보안의 경우 프롬프트 인젝션과 API 취약점에 초점을 맞춥니다. 마지막으로, 무결성 측면에서는 스팸, 사기, 저작권 침해와 같은 우려 사항이 포함됩니다.
그림 4: 전체 점수
그림 5: 안전성 점수
그림 6: 개인정보 보호 점수
그림 7: 보안 점수
그림 8: 무결성 점수
또한 위 기준을 기반으로 프롬프트를 검증하기 위해 플랫폼 플레이그라운드를 사용할 수도 있습니다. 모델이 공격을 감지하면, 그림 9에서 볼 수 있듯이 특정 문제가 간단한 설명과 함께 강조 표시됩니다.
EPASS 플랫폼에서 제공되는 이러한 상세한 평가 분석은 사용자에게 LLM의 잠재적 취약점에 대한 정보를 제공할 뿐만 아니라, 애플리케이션을 보호하기 위한 선제적 조치를 취할 수 있도록 지원합니다. 모델이 실패할 수 있거나 조작될 수 있는 다양한 방식을 이해함으로써, 이해관계자는 보호 장치 및 모니터링 메커니즘 구현에 대해 정보에 입각한 결정을 내릴 수 있습니다.
또한 AI Alliance가 촉진하는 것과 같은 지속적인 협업과 사용자 및 개발자를 위한 인식 제고 이니셔티브는 진화하는 AI 배포 환경에서 매우 중요합니다. LLM이 일상 운영에 점점 더 통합됨에 따라, 팀이 이러한 모델의 역량과 한계를 모두 파악하는 것이 필수적입니다. AI 윤리, 안전성, 기술적 한계를 다루는 EPASS와 같은 협업 플랫폼은 책임 있는 AI 사용 문화를 조성할 수 있습니다. 이러한 집단적 접근 방식은 잠재적 함정을 예방하는 데 도움이 될 뿐만 아니라 전반적인 안전성을 향상시켜, 중요한 환경에서 AI 기술이 효과적이고 윤리적으로 적용되도록 보장합니다.
그림 9: 무결성 점수
결론
AI가 계속 발전함에 따라 안전성 평가에 대한 수요는 더욱 증가할 것입니다. Hydrox AI와 AI Alliance 같은 기업들은 LLM이 정확성, 보안 또는 윤리를 훼손하지 않으면서 고위험 도메인에서 운영될 수 있도록 보장하는 노력을 주도하고 있습니다. 이는 단순히 기능성에 관한 것이 아니라 안전하고 책임 있는 사용을 보장하는 것에 관한 것입니다.
Zhuo Li의 발표는 AI 개발자, 도메인 전문가, 기업 간의 지속적인 협업 필요성을 강조했습니다. 의료, 금융, 교육과 같은 분야에서 AI의 미래는 이러한 모델을 지속적으로 평가하고 개선할 수 있는 우리의 능력에 달려 있습니다.
AI는 고위험 도메인을 혁신할 잠재력을 지니고 있지만, 그 구현은 신중하고 세심하게 이루어져야 합니다. 포괄적인 평가 프레임워크와 도구를 구축함으로써 Hydrox와 그 파트너들은 더 안전하고 책임 있는 AI 주도 미래를 위한 기반을 마련하고 있습니다.
또한 이러한 기술이 계속 발전함에 따라 정책 입안자, 업계 리더, 연구자를 포함한 이해관계자들이 AI의 윤리적 함의에 대한 논의에 참여하는 것이 중요합니다. 모범 사례, 지침, 규제 프레임워크를 수립하면 위험을 완화하고 AI 배포의 투명성을 촉진하는 데 도움이 될 것입니다. 우리가 이 빠르게 변화하는 환경을 헤쳐 나가는 가운데, AI 개발에서 책임과 책무의 문화를 조성하는 것은 잠재적 피해를 최소화하면서 LLM의 이점을 실현하는 데 핵심이 될 것입니다.
계속 읽기

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

Zilliz Cloud Just Landed in Claude Code
The Zilliz Cloud Plugin brings the full power of Zilliz Cloud directly into your Claude Code terminal as natural-language conversations.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.



