한국어-일본어 번역 특화 LLM 및 SLM 모델 동향과 연산 부하 최적화 보고서
서론 및 배경
한국어와 일본어는 언어학적으로 주어-목적어-동사(SOV)의 어순 구조, 조사 체계, 맥락 의존적 주어 및 목적어 생략, 대화 상대에 따른 다층적 경어법 등 대단히 유사한 문법적·문화적 특성을 공유한다1. 그러나 기존 상용 기계 번역 API는 상당수 한국어와 일본어 간 다이렉트 번역 대신 영어를 매개체로 거치는 피벗(Pivot) 방식을 채택하여, 존댓말 레벨의 미묘한 오차나 문맥 왜곡 현상을 빈번히 유발해 왔다.
최근 생성형 대형 언어 모델(LLM)과 소형 언어 모델(SLM)의 급격한 발전은 오픈소스 인프라 기반의 오프라인 및 로컬 번역 시스템 구축을 가능하게 만들었다2. 오픈소스 모델을 활용한 로컬 시스템은 기존 상용 번역 API 대비 운용 비용을 획기적으로 절감할 수 있을 뿐만 아니라2, 시스템 프롬프트를 조정하여 특정 어조, 직역 또는 의역 여부, 도메인 전용 용어집(Glossary) 준수 등을 정교하게 제어할 수 있는 구조적 이점을 제공한다2.
본 보고서에서는 한국어-일본어 번역에 특화되었거나 탁월한 성능을 보이는 최신 LLM 및 SLM 모델 라인업을 조사하고, 구글 Gemma 모델의 실용성을 검증한다. 나아가 추론 인프라의 연산 부하와 지연 시간을 극도로 낮추기 위한 아키텍처별 최적화 방안을 제시한다.
한국어-일본어 특화 및 우수 LLM/SLM 최신 모델 동향
동아시아 언어(CJK) 처리 능력을 강화한 최신 언어 모델들은 사전 학습 단계에서 동아시아 언어 데이터 비율을 대폭 늘리거나, 한국어와 일본어의 어휘를 정교하게 분할하는 토크나이저(Tokenizer)를 탑재하여 번역 정확도를 극대화하고 있다4.
LG AI Research가 공개한 EXAONE 3.5 시리즈는 한국어와 영어 영역에서 독보적인 사전 학습 가중치를 갖춘 대표적인 바이링구얼 모델군으로, 2.4B, 7.8B, 32B 파라미터 규격으로 제공된다5. 이 가운데 EXAONE 3.5 2.4B-Instruct 모델은 엣지 디바이스 및 자원 제약이 엄격한 환경을 겨냥해 최적화된 소형 언어 모델이다5. 비록 공식 사전 학습은 한국어와 영어를 위주로 진행되었으나, 102,400개의 넓은 어휘 사전 크기와 강한 한국어 문맥 이해력을 바탕으로 일본어 출력 지시 프롬프트와 결합할 때 매우 적은 메모리 점유율로 정교한 번역문을 생성해 낸다5.
알리바바의 Qwen 2.5 및 Qwen 3 시리즈는 방대한 동아시아 언어 코퍼스를 직접 학습하여 한국어 및 일본어 번역 분야에서 오픈소스 상위권의 성능을 발휘한다1. 오픈소스 AI 커뮤니티에서는 Qwen 2.5 32B 등을 기반으로 일본어와 동아시아 언어 특화 파인튜닝을 거친 Shisa v2 모델 시리즈가 주목받고 있으며1, 이는 생략이 잦은 구어체 및 대화체 번역에서 환각(Hallucination) 현상을 대폭 줄여주는 것으로 평가받고 있다1.
생성형 디코더 모델과 별개로, 전용 신경망 기계 번역(NMT) 아키텍처인 Meta의 NLLB-200 시리즈(600M, 1.3B, 3.3B)와 OPUS-MT 모델군은 인코더-디코더 구조를 기반으로 한국어와 일본어 간 다이렉트 번역을 지원한다11. 이들 NMT 모델은 문맥 자유도가 낮은 대신 연산 메모리 점유율이 극히 낮아, 단순 문서 번역 업무에서 가장 적은 컴퓨팅 부하를 기록한다11.
Gemma 모델 시리즈의 한국어-일본어 번역 적합성 및 한계
구글의 Gemma 시리즈, 특히 최신 Gemma 3 (12B 및 27B) 및 Gemma 2 라인업이 한국어-일본어 번역 임무를 성공적으로 수행할 수 있는지에 대해 Reddit r/LocalLLaMA 등 실제 로컬 LLM 운용 환경의 엔지니어링 데이터를 바탕으로 다각도로 평가가 이뤄지고 있다1.
Gemma 3 시리즈는 생성형 오픈소스 모델 중 다국어 번역 품질 면에서 고성능 상용 모델에 필적하는 우수한 능력을 보여준다2. 양자화 인식 훈련이 적용된 gemma-3-12b-it-qat 모델의 경우, 중저가 GPU 환경에서도 뛰어난 번역 텍스트를 안정적으로 출력한다10. 특히 Gemma 모델은 프롬프트 지시 이행력이 뛰어나, 번역 대상 문장의 존댓말 수준(경어체/평어체)을 조절하거나 원문의 관용적 표현을 직역할지 의역할지 선택하는 작업에서 강력한 성능을 발휘한다2. 추론 시 온도를 0.1 수준으로 낮게 설정할 경우 생성 변동성을 완벽히 제어하면서도 소스 텍스트에 충실한 결과를 얻을 수 있다2.
그러나 Gemma 모델을 단일 번역 전용 엔진으로 채택할 때 발생하는 명확한 한계점 역시 존재한다. Gemma와 같은 디코더 전용(Decoder-only) 생성형 모델은 각 토큰을 순차적으로 생성해야 하므로, 단순 NMT 모델에 비해 초당 생성 속도가 느리고 컴퓨팅 자원 소비가 크다2. 또한 소설이나 웹툰 타이틀 등 자극적이거나 비표준적인 구어체 문장을 번역할 때 원문에 없는 환각 문장을 덧붙이거나, 안전 필터링이 발동하여 답변 생성을 거부하는 현상이 보고되고 있다2.
아키텍처별 연산 부하, 추론 지연 시간 및 메모리 효율성 분석
번역 시스템 구축 시 연산 부하를 결정짓는 핵심 요소는 모델의 파라미터 수뿐만 아니라 기본 신경망 구조(Encoder-Decoder vs Autoregressive Decoder-only)와 메모리 대역폭 소비 방식이다2.
NLLB-200과 같은 인코더-디코더 NMT 아키텍처는 입력 텍스트 전체를 한 번에 병렬 인코딩한 후 정해진 번역 출력만을 단일 패스로 처리한다14. 이 방식은 긴 문맥에 대한 KV 캐시(Key-Value Cache) 축적이 필요하지 않아 VRAM 점유율이 수 기가바이트 미만에 머무르며, GPU뿐만 아니라 범용 CPU 환경에서도 매우 빠른 처리 속도를 보여준다13.
반면 Gemma, EXAONE, Qwen과 같은 자기회귀 디코더(Autoregressive Decoder) 모델은 이전 토큰을 바탕으로 다음 토큰의 확률 분포를 계속 계산해야 한다2. 이로 인해 시퀀스 길이가 길어질수록 메모리 대역폭 병목 현상이 발생하고 추론 지연 시간이 선형적으로 증가한다2. 따라서 시스템의 부하를 극도로 낮추려면 생성형 언어 모델 중에서도 파라미터 수가 3B 미만인 소형 언어 모델(SLM)을 선택하거나 양자화 포맷을 적극 도입해야 한다7.
| 모델명 | 모델 분류 | 파라미터 수 | 대표 아키텍처 | 추천 양자화/정밀도 | 최소 VRAM/RAM 점유 | 주요 연산 및 성능 특성 |
|---|---|---|---|---|---|---|
| NLLB-200 Distilled | NMT 전용 | 600M / 1.3B | Encoder-Decoder | FP16 / INT8 | 1.2 GB - 2.8 GB | 부하 극소, 초고속 번역, 프롬프트 지시 불가11 |
| EXAONE 3.5 2.4B | 범용 SLM | 2.4B | Decoder-only | GGUF (Q4_K_M) | ~ 1.6 GB | 한국어 이해도 우수, 온디바이스 저전력 추론5 |
| Qwen 2.5 3B | 범용 SLM | 3.0B | Decoder-only | GGUF (Q4_K_M) | ~ 2.2 GB | CJK 데이터 충실, 저자원 환경 적합1 |
| Gemma 3 4B | 범용 SLM | 4.0B | Decoder-only | Q4_K_M / INT4 | ~ 3.0 GB | 가벼운 무게 대비 안정적인 다국어 변환10 |
| Gemma 3 12B | 범용 LLM | 12.0B | Decoder-only | QAT / Q4_K_M | ~ 7.5 GB | 최고 수준의 문맥 및 어조 제어, 연산 부하 존재2 |
| Shisa v2 (Qwen 32B) | 특화 LLM | 32.0B | Decoder-only | GGUF (IQ4_XS) | ~ 18.5 GB | 동아시아 구어체 및 관용구 최적화, 고사양 필요1 |
연산 부하 절감 측면에서 가장 압도적인 성능을 제공하는 것은 NLLB-200 (1.3B) 및 EXAONE 3.5 (2.4B)이다7. EXAONE 3.5 2.4B 모델은 Q4_K_M 양자화를 적용할 경우 약 1.6GB의 VRAM만으로 동작하여, 일반적인 엔드포인트 기기나 저가형 서버 인프라에서도 안정적인 서비스를 제공한다7.
연산 부하 최적화를 위한 인프라 구축 및 모델 선택 전략
시스템에 가해지는 컴퓨팅 자원 소모를 최소화하고 서비스의 응답성을 극대화하기 위해서는 애플리케이션의 요구사항에 맞는 단계별 모델 배치 및 라우팅 전략을 수립해야 한다.
실시간으로 대량의 백그라운드 텍스트나 API 요청을 처리해야 하는 단순 번역 파이프라인에는 NLLB-200 1.3B를 CTranslate2 엔진과 결합하여 배치하는 방식이 가장 적합하다12. CTranslate2 추론 엔진은 C++ 기반의 메모리 최적화와 CPU/GPU 동시 가속을 지원하여, 디코더 모델 대비 5배 이상 빠른 초당 처리량을 확보해 준다13.
반면 사용자와의 실시간 대화, 문학 작품 번역, 또는 정교한 존댓말 어조 변경이 필수적인 정밀 작업 영역에서는 Gemma 3 12B 또는 EXAONE 3.5 2.4B/7.8B 모델을 채택하는 것이 권장된다2. 특히 LLM 추론 전용 서빙 엔진인 vLLM이나 llama.cpp를 활용하여 PagedAttention 메모리 관리를 적용하면 KV 캐시 병목 현상을 방지하고 연산 자원 점유율을 최적화할 수 있다8.
가장 이상적인 인프라 설계안은 두 아키텍처를 결합한 하이브리드 라우팅 시스템이다. 입력된 한국어 문장의 길이, 난이도, 어조 변경 프롬프트 유무를 분류기가 1차적으로 판별하여, 일반적인 정형 문장은 부하가 극히 적은 NLLB-200이나 EXAONE 3.5 2.4B로 처리하고7, 문맥 이해가 깊게 요구되는 텍스트만 Gemma 3 12B 모델로 전달함으로써 전체 시스템의 GPU 리소스 소모를 최소화할 수 있다2.
결론
한국어-일본어 번역 시스템 구축 시 기존 구글 Gemma 모델(Gemma 3 12B/27B)을 사용하는 것은 충분히 가능하며, 정교한 뉘앙스 및 어조 제어 측면에서 최고 수준의 번역 품질을 제공한다2. 그러나 오직 번역 기능만을 수행하면서 인프라 연산 부하를 최소화하고자 하는 목적에는 디코더 기반 대형 모델이 가진 유연성이 오히려 컴퓨팅 오버헤드로 작용할 수 있다2.
따라서 자원 제약이 엄격한 온디바이스 환경이나 저비용 서버 인프라에서는 EXAONE 3.5 2.4B와 같은 초경량 CJK 지원 SLM이나5, CTranslate2 기반으로 가속된 NLLB-200 1.3B NMT 모델을 우선적으로 채택하는 것이 기술적·경제적으로 가장 타당한 선택이다12. 요구사항에 맞춰 단일 고성능 모델 구동보다는 하이브리드 라우팅 아키텍처를 도입하는 것이 연산 효율성과 번역 품질을 동시에 달성하는 최적의 솔루션이다2.
引用文献
- LLMは、日本語、韓国語、タイ語などの文脈に基づいた言語を翻訳するのにどれほど効果的ですか? : r/LocalLLaMA - Reddit, https://www.reddit.com/r/LocalLLaMA/comments/1ljz6sh/how_effective_are_llms_at_translating_heavy/?tl=ja
- LLMはDeepLよりも翻訳で800倍安価です : r/LocalLLaMA - Reddit, https://www.reddit.com/r/LocalLLaMA/comments/1jfh1d7/llms_are_800x_cheaper_for_translation_than_deepl/?tl=ja
- A Free, Flutter Open-Source Mobile Client for Ollama LLMs (iOS/Android) - Reddit, https://www.reddit.com/r/FlutterDev/comments/1h2anlb/a_free_flutter_opensource_mobile_client_for/
- Hugging Face Fine-tune for Multilingual NER (Japanese Example) - tsmatz, https://tsmatz.wordpress.com/2022/10/24/huggingface-japanese-ner-named-entity-recognition/
- LGAI-EXAONE/EXAONE-3.5-2.4B-Instruct - Hugging Face, https://huggingface.co/LGAI-EXAONE/EXAONE-3.5-2.4B-Instruct
- EXAONE 3.5: Series of Large Language Models for Real-world Use Cases - arXiv, https://arxiv.org/html/2412.04862v3
- exaone3.5:2.4b - Ollama, https://ollama.com/library/exaone3.5:2.4b
- bartowski/EXAONE-3.5-2.4B-Instruct-GGUF - Hugging Face, https://huggingface.co/bartowski/EXAONE-3.5-2.4B-Instruct-GGUF
- Qwen - Hugging Face, https://huggingface.co/Qwen
- Best Local LLM for Japanese to English translation and explanation for 24gb VRAM - Reddit, https://www.reddit.com/r/LocalLLaMA/comments/1mb286h/best_local_llm_for_japanese_to_english/
- mbart-large-50-many-to-many-mmt vs nllb-200-3.3B - AIModels.fyi, https://www.aimodels.fyi/models/compare/mbart-large-50-many-to-many-mmt-facebook-vs-nllb-200-3.3b-facebook
- Hunyuan-MT-7B vs nllb-200-3.3B — comparison, examples, use, https://www.aimodels.fyi/models/compare/hunyuan-mt-7b-tencent-vs-nllb-200-3.3b-facebook
- ja_en_rt_translate_1.md · John6666/forum3 at main - Hugging Face, https://huggingface.co/datasets/John6666/forum3/blob/main/ja_en_rt_translate_1.md
- Hugging Face Fine-tune for Multilingual Summarization (Japanese Example) - tsmatz, https://tsmatz.wordpress.com/2022/11/25/huggingface-japanese-summarization/
- LGAI-EXAONE/EXAONE-3.5-2.4B-Instruct at main - Hugging Face, https://huggingface.co/LGAI-EXAONE/EXAONE-3.5-2.4B-Instruct/tree/main