PFN, 번역 특화 LLM ‘plamo-3-translate’ 출시
- •PFN, 번역 서비스 PLaMo 번역에서 번역 특화 LLM ‘plamo-3-translate’ 제공 시작
- •31B 모델, DeepL과의 4개 평가에서 58.00~87.00% 승률 기록
- •8B 모델, 여러 지표에서 이전 세대 앞서고 토큰 효율도 비교 모델 능가
Preferred Networks(PFN)는 2026년 10월 7일 번역 특화 대규모 언어 모델 ‘plamo-3-translate’를 번역 서비스 ‘PLaMo 번역’에서 제공하기 시작했습니다. PFN에 따르면 이 모델은 일본어·영어 번역과 다국어 번역에서 세계 최고 수준의 성능을 기존 번역·LLM API 비용의 수십분의 일로 구현합니다. 이전 세대 plamo-2-translate와 비교해 학습 토큰량과 데이터 합성에 사용한 연산량을 수백 배로 늘렸습니다.
PFN은 자체 개발한 일본산 LLM ‘PLaMo’ 3세대를 기반으로 번역에 특화해 학습했습니다. 2025년에 공개한 plamo-2-translate는 일본어·영어 간 번역이 중심이었고, 유창한 일본어를 생성했지만 의역이 많아 정보가 추가되거나 빠질 때가 있었으며 다국어 능력에도 과제가 있었습니다. 새 모델은 번역 데이터를 다시 모으고 LLM을 활용한 데이터 합성으로 학습 데이터 품질을 높였습니다. 모델 개발은 계속 진행 중이며, PFN은 향후 모델 가중치를 Hugging Face에 공개하고 기술 개발 내용을 설명하는 블로그 글도 게시할 예정입니다.
8B 모델 비교에서 plamo-3-translate는 여러 지표에서 이전 세대 plamo-2-translate를 앞섰습니다. PFTB 영어→일본어 점수는 0.447에서 0.547로, 일본어→영어는 0.602에서 0.672로 올랐고, PLaMo 번역 서비스의 영어→일본어 평가 점수는 0.430에서 0.571이 됐습니다. WMT24++ 영어→일본어 COMET-22 점수는 0.882에서 0.879로 거의 같은 수준이었습니다. FLORES+ 다국어 평가에서 일본어→다국어 chrF++는 39.28에서 43.40으로, 다국어→일본어는 29.90에서 31.04로 향상됐습니다. 비교 대상 TranslateGemma 27B는 8B 모델보다 규모가 3배 이상이지만, PFN 평가에서 새 모델이 종합적으로 앞섰습니다.
다국어 평가는 아랍어, 이탈리아어, 인도네시아어, 영어, 네덜란드어, 한국어, 스페인어, 태국어, 중국어 간체·번체, 독일어, 프랑스어, 베트남어, 러시아어를 대상으로 했습니다. 학습에는 헝가리어, 폴란드어, 힌디어, 페르시아어, 벵골어, 타갈로그어, 히브리어, 타밀어, 버마어, 우르두어, 말레이어, 네팔어, 카탈루냐어, 말라얄람어, 불가리아어, 세르비아어, 크로아티아어, 슬로바키아어, 슬로베니아어, 싱할라어, 아제르바이잔어, 조지아어, 아르메니아어, 우즈베크어, 리투아니아어, 크메르어, 라트비아어, 에스토니아어, 바스크어, 세부아노어, 벨라루스어, 텔루구어, 자바어, 카자흐어, 마라티어, 스와힐리어, 구자라트어, 펀자브어도 사용했습니다. PFN은 언어 간 번역도 일정 수준 학습했다고 설명했습니다.
최대 규모인 31B 모델은 PFN이 2026년 10월 7일 기준 공개 단가로 계산한 비교에서 일본어→영어 성능이 거의 모든 비교 대상 번역·LLM API를 앞섰습니다. 비교 대상보다 비용은 대체로 약 1/30이었고, 유일하게 성능이 더 높았던 Claude Fable 5.1과 비교하면 약 1/85였습니다. 다국어 번역에서도 API 대부분을 웃도는 점수를 수십분의 일 비용으로 냈다고 PFN은 밝혔습니다. PLaMo 번역은 API를 공개하지 않아, 비용 비교에는 PLaMo API의 입력 100만 토큰당 60엔, 출력 100만 토큰당 250엔을 가정해 적용했습니다.
참조 번역을 기준으로 한 평가 외에 PFN은 Gemini 3.1 Pro를 사용해 plamo-3-translate 31B와 DeepL 번역, Google 번역(Translation LLM)의 번역문을 비교했습니다. 판정 순서를 바꿔 각 샘플을 2회 평가했고, 결과가 엇갈리면 양쪽에 0.5승씩 배정했습니다. 31B 모델의 DeepL 대비 승률은 PFTB 영어→일본어 87.00%, PFTB 일본어→영어 58.00%, 서비스 평가 영어→일본어 73.82%, WMT24++ 영어→일본어 59.17%였습니다. Google 번역 대비 같은 순서의 승률은 86.00%, 71.00%, 91.47%, 70.62%였습니다. 모든 평가에서 승률이 50%를 넘었으며, PFN은 특히 일본어 출력에서 차이가 컸다고 설명했습니다.
PFN은 성능 향상 요인으로 PLaMo 학습 데이터에서 일본어가 차지하는 비율이 30%에 가깝다는 점, 번역에 목적을 한정한 학습, 대규모 고품질 번역 데이터를 꼽았습니다. 자체 개발 토크나이저도 비용 효율에 기여했다고 밝혔습니다. PFTB의 영어→일본어·일본어→영어 각 50건에서 측정한 1,000자당 출력 토큰 수는 plamo-3-translate가 일본어 447개, 영어 205개였습니다. Claude Fable 5.1은 일본어 893개, 영어 352개였고 GPT-6 Astra는 일본어 744개, 영어 224개였습니다. PFN에 따르면 일본어 출력의 토큰 효율은 Claude Fable 5.1의 약 2배입니다. 토큰 단가와 생성 속도가 같다면 같은 글자 수를 출력하는 비용은 약 절반이고, 글자 수 기준 생성 속도는 약 2배가 됩니다.
번역 사례로는 비즈니스 이메일에서 ‘이메일이 엇갈려 전달되어’와 같은 맥락에 맞는 정중한 표현, 소설에서 ‘그녀를 번쩍 들어 올렸다’와 같은 자연스러운 문장, 특허 문서에서 ‘청구항:’으로 시작하는 문체를 제시했습니다. 음식점 소개문에서는 ‘pints’를 단위명 그대로 두지 않고 ‘맥주’로 번역한 사례도 실었습니다. PFN은 문맥에 맞는 자연스러운 문장이 벤치마크에 드러나기 어려운 강점이라고 밝혔습니다.
PLaMo 번역은 브라우저 확장 프로그램을 통한 웹페이지 번역, 원문과 번역문을 좌우로 나란히 배치하는 레이아웃 유지 파일 번역, 영문 교정, 데스크톱 앱을 제공합니다. 새로 시작한 회의 번역은 일본어·영어·중국어 등 3개 언어의 발화를 자동 판별해 다른 언어로 실시간 번역합니다. 기간 한정 무료 체험도 신청할 수 있습니다.