OFFLINE KOREAN RAG · BENCHMARK REPORT · 2026.07.31

작지만, 충분히 빠르다.
다만 일관성은 과제다.

2.3B Kanana-2가 8GB Mac에서 사내 문서 RAG를 얼마나 신뢰할 수 있게 수행하는지, 25개 질문과 실측 성능 데이터로 검증했습니다.

소스와 결과 보기 ↗
MacBook M3 · 8GB Ollama · Metal 100% 완전 오프라인

THE SHORT ANSWER

오프라인 한국어
RAG의 현실적인 기준선.

검색과 속도는 실사용 가능 수준에 도달했습니다. 다만 같은 입력에도 답변이 달라지는 소형 모델의 비결정성은 프로덕션 전환 전 반드시 다뤄야 할 핵심 리스크입니다.

하드웨어·속도 요구사항 충족 신뢰성 보정 필요
검색 정확도100%

grounded 질문 20/20

중앙 응답 시간2.3

검색 + 생성 전체

생성 속도47 tok/s

M3 통합 GPU · Q4

재현성75%

동일 입력 20회 반복

01 / QUALITY

검색은 정확했고,
답변은 대부분 근거를 지켰습니다.

정답 문서가 존재하는 20문항 모두에서 정답 도메인이 top-4에 포함됐습니다. 의역 질의에도 100% 정확하게 대응했습니다.

검색 정확도20/20
100%좋음
핵심 키워드17/20
85%좋음
인용 표기18/20
90%좋음
범위 밖 거절4/5
80%주의

환각 방어가
실제로 작동했습니다.

무관한 문서가 검색된 경우에도 모델은 사실을 만들어내지 않고 “확인되지 않습니다”로 스스로 정정했습니다.

검색의 오탐을 생성 단계가 한 번 더 방어

QUESTION TYPES

유형별 정확도

사실 검색
6/7
숫자·기한
4/5
복수 정보
2/2
교차 도메인
2/2
의역 질의
3/3
요약
0/1
거절
4/4
유사 함정
0/1

THE CATCH / CONSISTENCY

같은 질문에도
답이 바뀌었습니다.

정답 청크를 1순위로 가져와도, 소형 모델은 안전한 거절 문구를 과다 선택했습니다. 이는 이번 PoC에서 확인된 가장 중요한 제약입니다.

반복 테스트 전체15 / 2075% 일관성
연차휴가 최대 일수5 / 5
정산보고서 제출기한5 / 5
대표이사 결재 기준2 / 5
비밀번호 변경 주기3 / 5

02 / PERFORMANCE

기다림은 짧고,
대화는 매끄럽습니다.

중앙값 기준 약 2.3초. 모델이 메모리에 올라온 이후에는 한국어 답변 하나를 약 1.2초 만에 생성합니다.

End-to-end latency2,283ms median
32ms검색
425ms프롬프트
1,218ms생성
2,283ms응답 완료
콜드 스타트9.17초

세션 첫 질문 1회성 비용

Warm 로딩164ms

5분 keep-alive 내 중앙값

컨텍스트 확장-5%

4배 확장 시 decode 저하

03 / NEXT MOVES

실사용을 위한
가장 짧은 경로.

거대한 모델 교체보다 먼저, 현재 파이프라인에 작은 제어 장치를 더하는 것이 비용 대비 효과적인 다음 단계입니다.

01

생성 온도 낮추기

temperature를 0.1~0.2로 명시해 근거 기반 QA의 비결정성을 줄입니다.

최상
02

거절 시 1회 재시도

높은 검색 점수에도 거절하면 한 번 더 확인해 실사용 오류를 낮춥니다.

03

컨텍스트 창 확보

top_k 또는 청크 크기 확장 전 num_ctx를 명시적으로 늘립니다.

04

요약 프롬프트 보강

문서 밖 지식을 더하지 않고 원문을 충실히 요약하도록 지시를 강화합니다.

OPEN SOURCE

평가 하네스와
전체 결과를 공개했습니다.

25개 질문셋, 7개 도메인 샘플 코퍼스, 재현 가능한 평가 스크립트와 결과를 저장소에서 확인할 수 있습니다.

github.com/charlychoi/
kanana2-benchmark