생성 온도 낮추기
temperature를 0.1~0.2로 명시해 근거 기반 QA의 비결정성을 줄입니다.
OFFLINE KOREAN RAG · BENCHMARK REPORT · 2026.07.31
2.3B Kanana-2가 8GB Mac에서 사내 문서 RAG를 얼마나 신뢰할 수 있게 수행하는지, 25개 질문과 실측 성능 데이터로 검증했습니다.
THE SHORT ANSWER
검색과 속도는 실사용 가능 수준에 도달했습니다. 다만 같은 입력에도 답변이 달라지는 소형 모델의 비결정성은 프로덕션 전환 전 반드시 다뤄야 할 핵심 리스크입니다.
grounded 질문 20/20
검색 + 생성 전체
M3 통합 GPU · Q4
동일 입력 20회 반복
01 / QUALITY
정답 문서가 존재하는 20문항 모두에서 정답 도메인이 top-4에 포함됐습니다. 의역 질의에도 100% 정확하게 대응했습니다.
무관한 문서가 검색된 경우에도 모델은 사실을 만들어내지 않고 “확인되지 않습니다”로 스스로 정정했습니다.
QUESTION TYPES
THE CATCH / CONSISTENCY
정답 청크를 1순위로 가져와도, 소형 모델은 안전한 거절 문구를 과다 선택했습니다. 이는 이번 PoC에서 확인된 가장 중요한 제약입니다.
02 / PERFORMANCE
중앙값 기준 약 2.3초. 모델이 메모리에 올라온 이후에는 한국어 답변 하나를 약 1.2초 만에 생성합니다.
세션 첫 질문 1회성 비용
5분 keep-alive 내 중앙값
4배 확장 시 decode 저하
03 / NEXT MOVES
거대한 모델 교체보다 먼저, 현재 파이프라인에 작은 제어 장치를 더하는 것이 비용 대비 효과적인 다음 단계입니다.
temperature를 0.1~0.2로 명시해 근거 기반 QA의 비결정성을 줄입니다.
높은 검색 점수에도 거절하면 한 번 더 확인해 실사용 오류를 낮춥니다.
top_k 또는 청크 크기 확장 전 num_ctx를 명시적으로 늘립니다.
문서 밖 지식을 더하지 않고 원문을 충실히 요약하도록 지시를 강화합니다.