On-Prem LLM
vs SaaS.
Build or Buy. 하드웨어 매트릭스, 손익분기점, 의사결정 기준 — 자체 AI 인프라 시점에 대한 정량 검토.
감으로 결정할 수 없는 영역입니다. 숫자로 판단합니다.
User/月 · 엔터프라이즈 최소 150석
연 $108K (≒ 1.5억 원)
50~100명 동시 사용
한국어 강화 30B급 모델 운영
이후 매년 약 1.5억 원 절감
4년 누적 5억 원+ 절감
두 가지
선택지.
SaaS Subscription
- +최신 프런티어 모델 (GPT-5.4, Claude Opus 4.7) 즉시 사용
- +인프라 관리 부담 0
- +SSO · 감사로그 · 컴플라이언스 기본 제공
- −엔터프라이즈 최소 150석 · 연간 계약 의무
- −데이터가 외부 서버로 송신됨
- −사용자 증가 = 비용 직선 증가
150명 × $60 × 12 = $108K/년 (≒ 1.5억)
500명 = $360K/년 (≒ 5억)
1,000명 = $720K/년 (≒ 10억)
On-Premise LLM Server
- +오픈 모델 무제한 사용 (Qwen · DeepSeek · Llama · EXAONE)
- +데이터 100% 사내 유지 · 송신 0
- +사용자 추가 시 추가 비용 0
- +파인튜닝 자유 · 자체 도메인 모델 구축 가능
- −관리 인력 필요 (DevOps 1명 정도)
- −3~4년 후 GPU 교체 검토
초기 3,000만 + 운영비 연 600만
사용자 수 무관 — 50명도 500명도 동일
4년 TCO ≒ 5,400만 (≒ SaaS 4개월치)
사용자 150명 이상 조직은 사내 구축이 거의 항상 유리합니다. SaaS 150석 1년 비용(1.5억 원)으로 중급 LLM 서버 + 4년 운영비 전체를 충당할 수 있습니다. 500명 이상 조직은 H100급 서버까지 정당화됩니다 (연 SaaS 5억 vs 서버 1억).
VRAM별 운영 가능
LLM 매트릭스.
서버 VRAM이 클수록 더 큰 LLM이 가능합니다. 하드웨어 등급에 따라 운영 가능한 모델 군이 명확히 구분되며, 이것이 사내 구축 의사결정의 핵심 변수입니다.
- Qwen 3.6 27B
- DeepSeek R1-Distill 32B
- SOLAR Pro 2 22B
- EXAONE 4.0 30B
- Llama 3.3 70B (Q4)
- Gemma 3 27B
- Qwen 3.6 72B (Full)
- Llama 3.3 70B (Full)
- DeepSeek R1-Distill 70B
- Command R+ 104B (Q4)
- Mistral Large 3 (Q4)
- DeepSeek V4-Flash (FP8)
- K-EXAONE 236B (Q4)
- Llama 4 Scout (8bit)
- Qwen VL 72B (멀티모달)
- 모든 70B Dense 풀스피드
- Llama 4 Scout 풀스피드
- DeepSeek V4-Flash (FP8)
- 모든 70B Dense FP16
- vLLM 프로덕션 서빙
- 대량 동시 추론 (배치)
- DeepSeek V4-Flash FP16
- Llama 4 Maverick
- GLM 5.1 754B (Q4)
- K-EXAONE 236B (Full)
- 1M 컨텍스트 운영
- DeepSeek V4-Pro 1.6T
- Kimi K2.6 1.1T
- GLM 5.1 Full
- 오픈웨이트 프런티어 전체
- 멀티 모델 동시 서빙
핵심 원리
VRAM 32GB는 30B급, 96GB는 200B급, 1TB는 1T급 모델을 운영합니다. 2026년 기준 오픈웨이트 성능은 클로즈드 프런티어와 거의 동급 — 하드웨어 등급이 모델 천장을 결정합니다.
서버 사양별
상세 견적.
각 등급별 GPU + CPU + RAM + 전력 + 운영비 종합. 2026년 5월 한국 시장 기준, 부가세 별도, 환율 1,400원/USD.
Single RTX 5090
- GPU
- RTX 5090 32GB ×1
- CPU
- AMD Threadripper 32C
- RAM
- 128GB DDR5
- POWER
- 1,200W · 사무실 OK
- 전력비
- 월 5~10만 원
Dual RTX 5090
- GPU
- RTX 5090 32GB ×2 (NVLink)
- CPU
- AMD EPYC 32~64C
- RAM
- 256GB DDR5 ECC
- POWER
- 2,000W · 전용 회로 권장
- 전력비
- 월 10~15만 원
RTX Pro 6000
- GPU
- RTX Pro 6000 Blackwell 96GB
- CPU
- AMD EPYC 64C
- RAM
- 512GB DDR5 ECC
- POWER
- 1,600W · 서버 전용 회로
- 전력비
- 월 15~25만 원
Single H100
- GPU
- NVIDIA H100 80GB
- CPU
- Xeon Platinum / EPYC
- RAM
- 768GB DDR5 ECC
- POWER
- 2,000W · UPS 필수
- 전력비
- 월 30~50만 원
Dual H200
- GPU
- NVIDIA H200 141GB ×2
- CPU
- EPYC 96C × 2 Socket
- RAM
- 1TB DDR5 ECC
- POWER
- 3,200W · 듀얼 UPS
- 전력비
- 월 50~80만 원
8× H200 Cluster
- GPU
- H200 141GB ×8 (NVLink Full)
- NETWORK
- InfiniBand HDR/NDR
- RAM
- 2~4TB DDR5 ECC
- POWER
- 10kW+ · 데이터센터급
- 전력비
- 월 200~400만 원
50명 이하 : TIER 1~2 (400~800만) — PoC 후 확장.
100~200명 : TIER 3 (3,000만) — 한국어 모델까지 운영 가능.
300~500명 : TIER 4 (5,000만) 또는 TIER 5로 시작.
500명+ : TIER 5~6으로 본격 인프라 구축.
사용자 수별
손익분기.
| 사용자 | SaaS 연간 | 권장 등급 | 서버 4년 TCO | 손익분기 | 4년 순 절감 |
|---|---|---|---|---|---|
| 20명 | ₩2,000만 | T1 · Single 5090 | ₩700만 | 5개월 | ₩7,300만 |
| 50명 | ₩5,000만 | T2 · Dual 5090 | ₩1,500만 | 4개월 | ₩1.85억 |
| ★150명 | ₩1.5억 | T3 · RTX Pro 6000 | ₩4,500만 | 3.6개월 | ₩5.5억 |
| ★300명 | ₩3억 | T4 · Single H100 | ₩7,500만 | 3개월 | ₩11.25억 |
| 500명 | ₩5억 | T5 · Dual H200 | ₩2억 | 4.8개월 | ₩18억 |
| 1,000명 | ₩10억 | T6 · 8× H200 | ₩7억 | 8.4개월 | ₩33억 |
★ 가장 ROI가 좋은 시나리오
ChatGPT Enterprise 최소 인원과 일치. 이 지점부터 사내 구축이 압도적으로 유리.
TIER 3 서버 3,000만 원 = 4개월치 SaaS 비용. 이후 약 4년간 절감 지속.
서버 + 운영비를 빼고도 5억 5천만 원 순 절감 — 추가 인프라 투자 여력 확보.
위 ROI 계산은 전체 라이선스 사용자가 SaaS를 적극 활용한다는 가정입니다. 실제로는 라이선스 구매 후 30~40%만 적극 사용하는 패턴이 일반적입니다.
사내 서버는 "전 직원이 무료로 쓸 수 있는 인프라"가 되어 활용도가 오히려 높아지는 경향이 있습니다. 활용도 증가는 추가 비용 없이 직접적 ROI 개선으로 이어집니다.
유료 SaaS
옵션 비교.
ChatGPT Enterprise
FLAGSHIPGPT-5.4. SSO · 감사로그 · 컴플라이언스. 연간 계약 의무.
ChatGPT Business
중소 조직용. 월/연 결제 선택 가능.
ChatGPT Go
NEWTeam과 Enterprise 중간 (10~149명 조직).
Claude Enterprise
FLAGSHIPClaude Opus 4.7. 긴 컨텍스트. 컴플라이언스 강력.
Microsoft 365 Copilot
Office 통합. MS 365 환경에 가장 자연스러움.
Gemini for Workspace
Gmail · Docs 통합. Google Workspace 사용자용.
Perplexity Enterprise
검색 특화. RAG 워크플로우.
DeepSeek API
가성비 ★V4-Flash. SaaS 중 가장 저렴. 토큰 단위 과금. 데이터 정책 검토 필요.
무료 로컬
LLM 종합.
모두 사내 서버에서 무료로 운영 가능. 상업적 활용 가능성 순.
Qwen 2.5 / 3.6
· 한국어 강함상업적 활용 자유 + 한국어 우수. 가장 균형 잡힌 선택.
DeepSeek R1-Distill
· 추론 ★o1급 추론 능력. 32B는 TIER 1에 최적화.
DeepSeek V4 Flash
· MoEQ4 양자화면 TIER 1 단일 GPU 가능. 1M 컨텍스트.
DeepSeek V4 Pro
· FRONTIER세계 최대 오픈웨이트. 데이터센터급 필요.
GLM 5 / 5.1
· Web AgentZ.AI · 칭화대. 웹 에이전트 최강. 라이선스 완전 자유.
Llama 4 Scout
· 10M 컨텍스트세계 최대 컨텍스트. 멀티모달. 7억 MAU 이하 무료.
Llama 3.3 70B
· 생태계 1위안정성 1위 · 가장 큰 생태계 · 풍부한 자료.
Kimi K2.6
· 에이전트 ★에이전트 안정성 최강. 자율 코딩 13시간 연속.
EXAONE 4.0 / K-EXAONE
· 국산한국 주권 LLM. 정부 컨소시엄. 라이선스 사전 검토 필수.
SOLAR Pro 2
· 국산한국어 + 상업 친화. Frontier LM 리더보드 입성.
Mistral Large 3 / Small 4
· GDPR유럽 GDPR 친화. 함수 호출 · 도구 사용 강력.
Gemma 3 / 4
Google. 27B 멀티모달. 140+ 언어 지원.
구축 시
고려 항목.
하드웨어 외의 의사결정 변수들 — 운영 단계에서 만나는 실제 변수.
라이선스 보유자와 실제 매일 사용자를 구분해야 합니다. 후자가 50명 이하라면 SaaS 유지가 합리적.
고객정보 · 계약서 · 재무자료 등 외부 송신 불가 데이터가 많다면 사내 구축이 절대적 우선.
H100 1대 700W · H200 2대 1.6kW · 8× H200 12kW+. 일반 사무실 전원 부족 — 전용 배전 · 냉각 필요.
최소 1명 (DevOps + AI 운영 가능자). 부재 시 백업 인력 또는 MSP 계약 검토.
Ollama (간편) · vLLM (프로덕션) · Qdrant (벡터DB) · LangGraph (에이전트). 모두 무료/오픈소스.
서버 다운 시 SaaS 폴백 가능하게 LiteLLM 등 프록시로 라우팅. 99.9%는 어렵지만 99%는 충분.
OpenWebUI · LibreChat · AnythingLLM 등 무료 UI 활용. ChatGPT 동급 경험 구축 가능.
Qwen 2.5/3.6 · EXAONE · SOLAR가 GPT-5 한국어와 큰 차이 없음. 일부 영역에선 더 자연스러움.
Apache 2.0 / MIT는 안전. Llama · EXAONE 비상업 조항 주의. 사내 활용은 대부분 문제없음.
3~4년 후 차세대 GPU 교체 검토 필요. 잔존 가치 + 신규 투자로 점진 업그레이드.
인프라 의사결정,
구조부터 설계합니다.
조직 규모 · 워크로드 · 데이터 민감도에 따라 답이 달라집니다. 아키텍처 레벨 검토부터 출발합니다.