
인공지능(AI) 데이터 및 솔루션 전문기업 플리토(대표 이정수)가 국립국어원이 주관하는 ‘2026년 한국어-외국어 말뭉치 구축 사업’의 수행 기업으로 선정되어 사업 착수에 나섰다.
‘한국어-외국어 말뭉치 구축 사업’은 AI 시대에 한국어 중심의 언어 데이터 주권을 확보하고, 통번역 및 음성인식 등 AI 언어 기술 개발을 지원하기 위해 추진되는 국립국어원의 대규모 데이터 구축 프로젝트다.
이번 사업은 경희대학교 산학협력단이 주관하며 플리토는 공동 수행 업체로 참여한다. 총 사업 규모는 약 38억 원으로, 플리토는 이 중 텍스트 545만 어절과 음성 50만 어절을 합친 총 595만 어절의 병렬 말뭉치 구축을 담당한다. 대상 언어는 베트남어, 인도네시아어, 태국어, 힌디어, 크메르어, 타갈로그어, 러시아어, 우즈베크어, 영어 등 기존 9개국 언어에 신규로 아랍어를 추가해 총 10개 언어로 진행된다.
올해 사업은 AI 통번역 기술 고도화를 위해 기존 문장 단위 구축 방식에서 문단 단위 변환 방식으로 고도화하여 병렬 말뭉치를 구축한다. 또한 기존 9개 언어에 대한 STS(Speech to Speech) 기반 말뭉치를 함께 구축하여 AI 음성 인터페이스 성능 향상을 도모한다. 이와 함께 신규 언어 및 유형에 맞춘 평가 기준 마련, 번역 플랫폼 개선 등 데이터 정제와 검수 체계 고도화를 위한 연구도 병행한다.
플리토는 다년간 축적된 데이터 정제 노하우를 바탕으로 국립국어원의 핵심 파트너 역할을 수행해왔다. 이번 사업을 통해 구축될 데이터까지 포함하면 플리토의 음성 포함 누적 구축 어절은 약 6,100만 개에 달할 전망이다.
구축된 데이터는 한국어와 동남아 지역 저자원 언어의 데이터 부족 문제를 해소하고, 국내외 AI 연구 및 기술 상용화의 핵심 자원으로 활용된다. 이를 통해 글로벌 AI 기술 격차를 해소하고 문맥 이해와 추론 능력을 갖춘 차세대 번역 모델 개발에 기여할 것으로 기대된다.
이정수 플리토 대표는 “플리토의 언어 데이터 전문성과 품질 관리 역량을 인정받아 올해 사업에도 참여하게 됐다”며, “정부 및 연구기관과의 지속적인 협력을 통해 고품질 AI 언어 데이터를 공급함으로써 한국형 AI 모델이 글로벌 시장에서 경쟁력을 확보하는 데 기여하겠다”고 밝혔다.
이미지 제공: 플리토







