Minerva
큰 모델의 품질, 작은 모델의 추론 효율 — 한국어·코드 특화 80B LLM
오픈소스 80B MoE 베이스에 한국어 데이터 추가 학습(CPT)·지시 학습(SFT)과 자체 개발한 하네스(Harness) 추론 방법론을 결합한 한국어 특화 대형 언어모델입니다. 한국어 코딩 시장 1위, 한국어 종합 지식 상위권을 목표로 하며, 양자화 시 단일 GPU로 운영 가능한 현실적 모델입니다.
학습 + 하네스 결합
한국어 학습에 하네스 추론 기법을 결합해 추가 성능 향상을 실측 검증 — 한국 최초 사례 목표
MoE 추론 효율
전체 800억 파라미터 중 추론 시 약 30억만 활성화 — 80억 모델 수준의 속도, 800억 모델의 품질
단일 GPU 운영
INT4 양자화 시 약 45GB — H100/A100 1장으로 추론, 상업 사용 제약 없는 Apache 2.0
벤치마크 예상 (vs 70B+ 국내 LLM)
| 벤치마크 | Minerva v0.2 | EXAONE 3.5 | A.X 4.0 | Solar Open |
|---|---|---|---|---|
| KMMLU (한국어 지식) | 66 | 65 | 78 | 80 |
| HAE-RAE (한국 문화·상식) | 64 | 78 | 85 | 86 |
| HumanEval (코드) | 85 | 72 | 80 | 84 |
| MBPP (기초 코드) | 78 | 68 | 74 | 78 |
| HumanEval-X-ko ★ (한국어 코드) | 70 | 55 | 68 | 72 |
| KLUE-NLI (한국어 추론) | 89 | 85 | 89 | 90 |
하네스(Harness) 방법론 — 추가 학습 없이 품질을 끌어올리는 추론 기법
계획
문제를 분석하고 풀이 전략을 먼저 수립
작성
수립한 계획에 따라 초안 응답 생성
비판
모델 스스로 초안의 오류·누락을 점검
수정
비판 결과를 반영해 응답 보완
검증
최종 응답의 일관성·정확성 확인 후 출력
같은 모델에 단계별 사고 흐름을 강제하여 응답 품질을 끌어올리는 기법으로, 모델 추가 학습 없이 코드 약 200줄로 적용됩니다. 실측 검증 결과 한국어 종합 지식 기준 +6점 향상을 확인했으며, '한국어 학습 + 하네스'를 결합한 한국 최초 사례를 목표로 합니다.
추론 강점 (Inference Advantages)
MoE 구조의 효율
한 번의 추론에 800억 중 관련 전문가 약 30억 파라미터만 계산(계산량 약 4%) — 일반 800억 모델 대비 압도적으로 빠른 응답
속도 vs 품질 균형
추론 속도는 80억 모델 수준, 학습 용량은 10배(800억) — 속도와 응답 품질 잠재력을 동시에 확보
롱컨텍스트 32K+
코딩 특화 아키텍처(Gated DeltaNet + MoE)로 32K 토큰 이상 처리 — 4K 한계의 일반 대화 모델과 차별화
한국어 × 코딩 결합
한국어 문서를 보고 코드를 짜는 시나리오에 가장 적합 — 다른 한국어 모델 대비 코드 이해·생성 정확도 우위
메모리 요구사항 및 운영 효율
| 구성 | 메모리 사용량 | 1장 GPU 추론 |
|---|---|---|
| 원본 (16-bit) | 160 GB | 불가 (H100 80GB 1장 부족) |
| INT8 양자화 | 약 80 GB | 가능 (H100 1장) |
| INT4 양자화 | 약 45 GB | 가능 (H100/A100 1장) |
양자화 적용 시 성능 손실은 1~2%로 사용자가 인지하기 어려운 수준이며, 표준 도구(AWQ, GPTQ)로 자동 변환됩니다. 클라우드 기준 NVIDIA A100 80GB 1장(시간당 약 $2, 월 약 192만원) 서버 한 대로 Minerva 80B INT4 운영이 가능합니다.
활용 시나리오
B2B 클라우드 API 서비스
최적 — 단일 GPU 서빙으로 현실적 운영 비용
기업 내부 한국어 코딩 어시스턴트
최적 — 한국어 도메인 지식 + 코딩 특화 베이스
한국어 RAG·문서 분석 시스템
적합 — 롱컨텍스트 32K+ 처리
엣지·모바일 임베디드
미지원 — 향후 8억급 디스틸 버전 별도 공개 검토
차세대 로드맵 (Nemotron 3 기반 전환)
Nemotron3 Super/Ultra 전환
120B~550B급 NVIDIA 오픈 베이스로 전환
RL 포스트트레이닝
강화학습 기반 코딩·한국어 특화 파인튜닝
VLM 확보 시 멀티모달
Nemotron VLM 확보 시 비전-언어로 확장
학습 파이프라인: CPT(한국어 추가 사전학습) → SFT(도메인 지도학습) → DPO(선호 정렬). 최종 성능 검증은 2026년 6월 1차 평가에서 공개 예정이며, 모델 가중치·코드·평가 결과는 HuggingFace 및 GitHub에 오픈소스로 공개됩니다 (라이선스: Apache 2.0 예정).