DeepSeek이 항상 바쁜가요? 단 10분 만에 Milvus와 함께 로컬에 배포하세요—더 이상 기다릴 필요 없습니다!
DeepSeek-R1을 사용해 보다가 “서버가 바쁩니다. 나중에 다시 시도해 주세요,”라는 메시지를 마주친 적이 있다면, 이것이 얼마나 방해가 되는지 알고 있을 것입니다. 바쁜 서버를 기다리는 일은 특히 빠른 답변이 필요하거나 작업에 집중하고 있을 때 워크플로를 중단시킬 수 있습니다.
이를 피하는 실용적인 방법은 DeepSeek-R1을 자신의 머신에서 직접 실행하는 것입니다. 이렇게 하면 서버 지연을 우회하고 모델을 언제, 어떻게 사용할지 더 잘 제어할 수 있습니다. 이 가이드에서는 함께 작동하는 몇 가지 도구를 사용해 DeepSeek-R1을 로컬에 설정하는 과정을 살펴보겠습니다. Ollama는 시스템에 모델을 다운로드하고 실행하는 데 도움을 줍니다. 그런 다음 AnythingLLM을 사용해 간단한 인터페이스를 통해 DeepSeek-R1과 더 쉽게 상호작용할 수 있게 하겠습니다. 마지막으로 벡터 데이터베이스인 Milvus를 통합하여, 모델이 질문에 답할 때 사용자 자신의 문서나 맞춤 정보와 같은 외부 데이터를 참조할 수 있도록 하겠습니다.
시작하는 데 최고급 하드웨어가 필요하지는 않습니다. DeepSeek-R1은 더 일반적인 설정에서도 실행할 수 있는 더 작은 버전의 모델을 제공합니다. 업무, 연구 또는 개인 프로젝트에 DeepSeek-R1을 사용하든, 로컬에 설정하면 서버 문제를 피하고 필요에 맞게 모델을 조정하는 데 도움이 됩니다. Ollama로 DeepSeek-R1을 설정하는 것부터 시작해 보겠습니다.
Ollama로 DeepSeek-R1 배포하기: 설치 및 설정
먼저 로컬 머신에서 AI 모델을 실행하는 과정을 간소화해 주는 Ollama를 설치합니다. Ollama 다운로드 페이지를 방문해 운영 체제에 맞는 설치 프로그램을 선택하는 것으로 시작하세요.
그림: Ollama 다운로드 페이지
다운로드가 완료되면 실행하고 화면의 안내에 따라 설정을 완료합니다. 설치 후에는 명령줄 인터페이스를 열고 다음을 입력해 Ollama가 올바르게 설정되었는지 확인하세요:
ollama --version
모든 것이 제대로 설치되었다면 버전 번호가 표시됩니다. 이 확인 절차를 통해 로컬에서 AI 모델을 관리할 준비가 된 환경인지 확인할 수 있습니다.
다음으로 DeepSeek-R1을 다운로드합니다. 대부분의 사용자에게 70억 매개변수(7B) 버전은 성능과 리소스 요구 사항 사이에서 실용적인 균형을 제공하며, 일반적으로 약 18 GB의 VRAM을 갖춘 GPU가 필요합니다. 하드웨어 성능이 낮다면 1.5B 모델(약 3.9 GB의 VRAM)을 사용할 수 있습니다. 고급 설정의 경우 전체 671B 모델을 고려할 수 있지만, 훨씬 더 많은 리소스를 요구합니다. 원하는 모델 크기에 따라 아래 명령을 조정하세요:
ollama pull deepseek-r1:7b
위 명령은 아래와 같이 지정된 모델을 컴퓨터에 다운로드합니다:
그림: Ollama를 통해 컴퓨터에 deepseek-r1:7b 설치
모델 다운로드가 완료되면 다음을 실행하여 DeepSeek-R1을 시작합니다:
ollama run deepseek-r1:7b
다른 모델을 선택했다면 7b를 1.5b 또는 다른 버전으로 바꾸세요. 모델이 시작되면 명령줄에 프롬프트를 직접 입력하여 상호작용을 시작할 수 있습니다.
그림: 사용자가 질문을 하고 모델이 응답하는 deepseek-r1:7b 샘플 세션
위 스크린샷은 당신은 누구인가요?라고 질문했을 때 DeepSeek-R1이 소개로 응답하여 모델이 실행 중이고 지원할 준비가 되었음을 확인해 주는 샘플 세션을 보여줍니다.
AnythingLLM 설치 및 구성하기
명령줄을 통해 상호작용하는 것은 기본 테스트에는 적합하지만, 지속적으로 사용하기에는 번거로울 수 있습니다. AnythingLLM은 로컬에서 실행 중인 모델과의 대화를 더 직관적으로 만들어 주는 채팅 스타일 인터페이스를 제공합니다. 또한 여러 언어 모델 백엔드를 지원하고, 사용자 지정 데이터를 업로드하는 간단한 방법을 제공하며, Milvus 같은 벡터 데이터베이스와 통합할 수 있습니다. 아래는 기능 개요와 Ollama에 설치하고 연결하는 방법입니다.
AnythingLLM을 사용하는 이유
일부 기능은 다음과 같습니다.
대화형 채팅: AnythingLLM은 수동 명령줄 프롬프트를 채팅 창으로 대체하여 대화 흐름을 확인하고 이전 질의를 참조하기 쉽게 해줍니다.
중앙 집중식 모델 관리: 하나의 인터페이스에서 다양한 언어 모델을 실행하고 여러 터미널을 번갈아 다루지 않고도 모델 간에 전환할 수 있습니다.
데이터 통합: 벡터 데이터베이스(예: Milvus)에 대한 내장 지원을 통해 문서, 연구 파일 또는 기타 리소스를 업로드할 수 있으므로 모델이 질문에 답할 때 이를 참조할 수 있습니다.
간편한 임베딩 구성: 문서와 사용자 질의를 벡터로 변환하는 데 사용할 임베딩 모델을 선택하여, 시스템이 관련 정보를 더 정확하게 찾도록 도와줍니다.
이러한 기능은 기본적인 터미널 상호작용 이상의 것이 필요한 사람에게 더 원활한 워크플로를 제공합니다. 이제 AnythingLLM을 설치하고 구성하는 방법을 살펴보겠습니다.
1단계: AnythingLLM 다운로드 및 설치
AnythingLLM 웹사이트로 이동하여 운영 체제에 맞는 설치 프로그램을 선택합니다. 파일이 다운로드되면 실행하고 안내에 따라 설정을 완료합니다. 설치가 완료되면 AnythingLLM을 열면 Get Started 페이지 또는 마법사가 표시되어 애플리케이션이 초기 구성을 준비했음을 알려줍니다.
2단계: 초기 프롬프트 건너뛰기
AnythingLLM을 처음 열면 LLM Preference, Data Handling & Privacy, 선택 사항인 Survey에 대한 프롬프트가 표시됩니다. 지금은 각 화면에서 Skip을 선택하여 앱 내부에서 이러한 옵션에 접근하고 구성하는 방법을 보여드리겠습니다. AnythingLLM을 실행할 때마다 이러한 프롬프트가 표시되지는 않으므로, 나중에 어디에서 찾을 수 있는지 알아두면 필요에 따라 설정을 조정하거나 기본 설정을 업데이트하는 데 도움이 됩니다.
3단계: 첫 번째 워크스페이스 만들기
초기 프롬프트를 건너뛰면 첫 번째 워크스페이스를 만들라는 요청을 받게 됩니다.
워크스페이스 이름을 선택한 다음 오른쪽 화살표를 클릭하여 진행합니다. 여기서는 Milvus-DeepSeek-Local-Deploy라고 이름을 지정했습니다. 이 워크스페이스는 대화를 정리하고 업로드한 모든 문서를 저장하기 위한 전용 영역을 제공합니다. 생성이 완료되면 채팅 인터페이스가 표시됩니다.
여기에서 모델을 연결한 후 DeepSeek-R1과 상호작용하게 됩니다.
4단계: DeepSeek-R1을 워크스페이스에 연결하기
모델을 연결하려면 워크스페이스 이름 옆의 Settings 버튼을 클릭합니다. 열리는 패널에서 Chat Settings를 선택합니다. Workspace LLM Provider를 선택하고 Workspace Chat model을 설정하는 옵션이 표시됩니다.
Ollama를 사용하므로 제공자 목록에서 Ollama를 선택합니다. 그런 다음 Workspace Chat model을 클릭하여 Ollama를 통해 다운로드한 모델 중 하나를 선택합니다. 여기에는 DeepSeek-R1도 포함됩니다(예: 우리의 경우 deepseek-r1:7b).
그림: Ollama가 LLM Provider로 표시되고 deepseek-r1:7b as the selected model
모델을 선택한 후 변경 사항을 저장합니다. 이제 워크스페이스가 선택한 모델에 연결되어 채팅 인터페이스를 통해 직접 상호작용할 수 있습니다. 채팅을 시작하려면 채팅 인터페이스로 돌아가세요.
5단계: 질의로 모델 테스트하기
이제 작업 공간이 DeepSeek-R1에 연결되었으므로, 학습되지 않은 질문에 어떻게 응답하는지 테스트할 수 있습니다. Who is Chris Churilo?라고 질문해 보고, 모델이 명확한 답변을 제공하지 않는다는 점을 확인해 보세요.
그림: “Who is Chris Churilo?”에 대한 LLM의 응답
모델에는 Chris Churilo에 대한 정보가 없기 때문에 자세한 응답을 제공할 수 없습니다. 이러한 공백은 외부 지식 소스의 필요성을 보여줍니다. Milvus는 벡터 데이터베이스로, Chris Churilo에 대한 관련 데이터를 임베딩 형태로 저장하여 LLM이 이를 참조할 수 있게 해줍니다.
Milvus 설정 및 AnythingLLM과 통합하기
작업 공간을 외부 데이터에 연결하기 전에, 사용자 지정 데이터의 임베딩(단어나 이미지와 같은 데이터의 숫자 표현으로, 의미나 특징을 포착하여 유사한 항목들이 서로 더 가깝게 배치되도록 연속적인 벡터 공간에 표현한 것)을 저장할 수 있는 벡터 데이터베이스를 배포해야 합니다. Milvus를 설치한 다음 AnythingLLM이 이를 벡터 데이터베이스로 사용하도록 구성하여 모델이 더 풍부한 정보를 바탕으로 답변할 수 있게 하는 방법을 살펴보겠습니다.
Milvus 설치하기
먼저 Docker 와 Docker Compose가 컴퓨터에 설치되어 있는지 확인하세요. 그런 다음 터미널을 열고 다음을 실행하여 Milvus standalone Docker Compose 파일을 다운로드합니다:
wget https://github.com/milvus-io/milvus/releases/download/v2.5.4/milvus-standalone-docker-compose.yml -O docker-compose.yml
다음으로, 선호하는 텍스트 편집기에서 다운로드한 docker-compose.yml 파일을 엽니다. standalone 서비스 아래의 구성 설정을 찾아 COMMON_USER 및 COMMON_PASSWORD 필드를 원하는 자격 증명으로 업데이트합니다.
environment:
ETCD_ENDPOINTS: etcd:2379
MINIO_ADDRESS: minio:9000
COMMON_USER: milvus
COMMON_PASSWORD: milvus
이 자격 증명은 나중에 AnythingLLM이 Milvus에 연결하도록 구성할 때 사용할 것입니다. 변경 사항을 저장한 후 터미널로 돌아가 다음 명령을 실행하여 Milvus를 시작합니다:
docker-compose up -d
이 명령은 Milvus를 백그라운드에서 실행합니다. docker ps로 Docker 컨테이너를 확인하거나 구성되어 있다면 상태 확인 엔드포인트를 방문하여 Milvus가 실행 중인지 확인할 수 있습니다.
그림: 명령줄에서 docker compose를 사용해 Milvus 시작하기
이제 Milvus가 설치되었으므로, 이를 AnythingLLM과 통합하여 작업 공간이 이 외부 데이터 소스를 활용해 모델 응답을 개선할 수 있도록 준비가 되었습니다.
Milvus와 AnythingLLM 통합하기
이제 Milvus가 실행 중이므로, 사용자 지정 데이터에 대한 임베딩을 저장하고 검색하도록 AnythingLLM을 구성해 보겠습니다. 아래 단계를 따라 DeepSeek-R1 모델에서 더 문맥 기반의 응답을 활성화하세요.
1. 설정 열기
AnythingLLM 인터페이스의 왼쪽 하단 모서리에 있는 Open Settings 버튼을 클릭합니다. 그러면 여러 구성 카테고리가 있는 패널이 나타납니다.
그림: Open Settings 버튼이 강조 표시된 AnythingLLM 기본 인터페이스
2. 벡터 데이터베이스 선택하기
설정 패널에서 AI Providers를 확장하고 Vector Database를 선택합니다. Vector Database Provider에서 Milvus를 선택합니다. Milvus Docker Compose 파일에서 구성한 주소와 자격 증명을 입력할 필드가 나타납니다:
Milvus DB Address:
http://localhost:19530Milvus Username: (설정한 사용자 이름)
Milvus Password: (설정한 비밀번호)
Save를 클릭하여 설정을 확인합니다.
그림: Milvus가 선택된 AnythingLLM의 벡터 데이터베이스 설정
3. 임베더 선택(선택 사항)
계속 AI Providers 아래에서 원하는 경우 다른 임베딩 모델을 선택할 수 있습니다. 아무것도 선택하지 않으면 AnythingLLM은 기본 임베더를 사용합니다. 이 단계는 기본 사용에는 선택 사항이지만, 텍스트가 벡터화되는 방식을 최적화하고 싶다면 유용할 수 있습니다. 이 경우에는 기본 옵션을 사용하겠습니다.
그림: 해당하는 경우 AnythingLLM의 임베딩 모델 선택
4. 문서 업로드
기본 인터페이스나 워크스페이스 보기로 돌아갑니다. 모델이 참조하기를 원하는 문서를 드래그 앤 드롭하거나 인터페이스를 통해 선택하여 업로드합니다. AnythingLLM은 임베딩할 준비가 된 파일 목록을 표시합니다.
그림: 새로 추가된 파일이 표시된 문서 업로드 영역
5. 문서를 워크스페이스로 이동
문서가 나타나면 각 파일을 선택하고 Move to Workspace를 선택합니다. 오른쪽 패널에서 Save and Embed를 클릭합니다. AnythingLLM은 문서를 벡터 임베딩으로 변환하고 Milvus에 저장하여, DeepSeek-R1이 콘텐츠에 접근할 수 있게 합니다.
그림: 문서를 워크스페이스로 이동하고 임베딩하기
이 단계를 완료하면 DeepSeek-R1 모델이 임베딩된 문서를 참조할 수 있습니다. 예를 들어, 이제 Who is Chris Churilo? 라고 질문하면 아래에서 볼 수 있듯이 모델은 그녀가 누구인지 알 수 있습니다.
그림: DeepseekR1이 Milvus를 사용하여 Who is Chris Churilo? 질의에 어떻게 답할지 생각하는 중
모델은 Milvus에 저장된 관련 정보를 조회하여 이를 수행하며, 이전보다 더 자세한 응답을 제공합니다. 다음은 질의에 대한 최종 답변입니다.
그림: DeepseekR1이 Milvus를 사용하여 Who is Chris Churilo? 질의에 답변하기
이제 모델은 업로드된 문서를 인용하는 자세한 답변으로 응답합니다. 위 스크린샷에서 모델이 Chris Churilo의 역할, 배경, 기여에 대한 관련 세부 정보를 가져오는 방식을 볼 수 있으며, 이는 Milvus를 통합하기 전에는 사용할 수 없었던 정보입니다. 이렇게 향상된 응답은 로컬 LLM 배포와 벡터 데이터베이스를 결합하여 더 많은 정보를 갖추고 문맥을 인식하는 AI 경험을 만드는 가치를 보여줍니다.
Milvus에서 컬렉션 확인하기
AnythingLLM을 통해 문서를 임베딩한 후, 컬렉션 목록을 나열하여 Milvus가 문서를 올바르게 저장하고 있는지 확인할 수 있습니다. 아직 pymilvus를 설치하지 않았다면 다음 명령으로 설치를 시작하세요.
pip install pymilvus
그런 다음 다음 Python 코드를 실행하여 Milvus에 연결하고, 컬렉션 목록을 가져오고, 이름을 출력합니다.
from pymilvus import MilvusClient
# Connect to Milvus
client = MilvusClient(uri="http://localhost:19530") # Replace with your URI if it's different
# List all collections
collections = client.list_collections()
# Print results
print(f"Found {len(collections)} collections:")
for idx, collection in enumerate(collections, 1):
print(f"{idx}. {collection}")
# Optional: Close the connection when done
client.close()
Milvus를 방금 설치했다면 많은 컬렉션이 보이지 않을 것입니다. 하지만 AnythingLLM을 사용하여 문서를 임베딩한 후에는 사용한 워크스페이스 이름을 딴 새 컬렉션이 표시됩니다. 아래 예시 출력에서 관련 컬렉션은 21. Anythingllm_milvus_deepseek_local_deploy로 나열되어 있습니다.
이는 AnythingLLM이 업로드된 데이터의 임베딩을 저장하기 위해 Milvus에 전용 컬렉션을 성공적으로 생성했음을 확인해 줍니다.
이제 DeepSeek-R1을 로컬에 배포하고, 사용자 친화적인 인터페이스를 위해 AnythingLLM을 구성하며, Milvus를 벡터 데이터베이스로 통합하는 과정을 살펴보았습니다. 이 설정을 통해 모델은 사용자 지정 데이터에 접근하고 질문에 더 효과적으로 답변할 수 있습니다.
결론
Ollama, AnythingLLM, Milvus의 도움을 받아 DeepSeek-R1을 로컬에 설정하면 AI 워크플로를 맞춤화하고 향상시킬 수 있는 새로운 가능성이 열립니다. 이 접근 방식은 환경을 완전히 제어할 수 있게 해줄 뿐만 아니라, 모델이 특정 데이터 소스에 접근할 수 있도록 하여 관련성과 정확성을 개선합니다. 이 설정을 통해 더 이상 서버 가용성이나 일반적인 응답에 제한되지 않습니다—이제 AI는 사용자가 제공하는 정보를 바탕으로, 사용자의 요구에 맞게 직접 작업할 수 있습니다.
추가 자료
계속 읽기

Data Deduplication at Trillion Scale: How to Solve the Biggest Bottleneck of LLM Training
Explore how MinHash LSH and Milvus handle data deduplication at the trillion-scale level, solving key bottlenecks in LLM training for improved AI model performance.

Zilliz Cloud Enterprise Vector Search Powers High-Performance AI on AWS
Zilliz Cloud on AWS powers secure, scalable, ultra-fast vector search for enterprise AI apps, with BYOC, sub-10ms latency, and zero-DevOps simplicity.

1 Table = 1000 Words? Foundation Models for Tabular Data
TableGPT2 automates tabular data insights, overcoming schema variability, while Milvus accelerates vector search for efficient, scalable decision-making.


