상세 보기
한국어 노래 음성 합성을 위한 웹 서비스 개발 및 연구
Korean Singing-Voice Synthesis Web Services
- 박지은;
- 김지희
초록
최근 영상 컨텐츠 제작이 활발해지며 영상의 자막을 원하는 목소리로 설명하는 더빙, 나레이션 뿐만 아니라 커버 송 제작과 같은 음성 합성에 대한 요구가 많아졌다. 본 논문에서는 다양한 종류의 서비스를 다양한 음성 옵션에서 경험할 수 있는 플랫폼 제작을 제시하였다. 현재 개념 증명 단계로 Glow-TTS(Generative Flow for Text-to-Speech), HIFI-GAN(Generative Adversarial Networks for efficient and High Fidelity speech synthesis)을 이용하여 MLP-Singer(Parallel Korean Singing Voice Synthesis)와 HIFI-GAN을 이용하여 노래 음성 합성 기능을 제작하였다. 그리고 도커 컨테이너 상에서 프론트엔드, 백엔드, 웹서버를 구축하였다. 해당 서비스는 웹 사이트 형태로 제공되며 요청이 들어오면 음성 합성 결과를 출력하고 음성 파일 다운로드를 통해 사용할 수 있게 제공된다. 본 연구에서는 음성 합성 플랫폼을 제작하기 위한 전체적인 시스템 구조와 구현 방법 제시 및 구현된 시스템의 성능 평가를 통해 구현 가능함을 보였으며, 추가적으로 보완하여 서비스 할 수 있는 방법을 제공한다.
키워드
text to speech; singing voice synthesis; glow-tts; hifi-gan; mlp-singer; web service; .
- 제목
- 한국어 노래 음성 합성을 위한 웹 서비스 개발 및 연구
- 제목 (타언어)
- Korean Singing-Voice Synthesis Web Services
- 저자
- 박지은; 김지희
- 발행일
- 2022-01
- 저널명
- 한국정보기술학회논문지
- 권
- 20
- 호
- 1
- 페이지
- 181 ~ 189