Engineering
Speech to Text 서비스 소개
2022년 3월 11일
원문에서 보기 ↗Speech to Text는 NHN Cloud의 음성 인식 및 문자 합성 기술을 통해, 입력된 음성을 인식하고, 인식된 음성을 텍스트로 변환하여 제공합니다. 음성 받아쓰기, 음성을 통한 디바이스 제어, 음성 챗봇 서비스 등 음성을 문자로 변환해서 이용하는 다양한 분야에 적용할 수 있습니다.
주요 기능 및 특징
NHN Cloud 웹 콘솔을 통해 음성 파일을 업로드하거나 녹음을 하고, 음성 인식 결과를 들어 볼 수 있는 페이지가 존재합니다. 입력된 음성에서 NHN Cloud의 Speech to Text 엔진을 통해 음성을 인식하고 변환된 텍스트를 제공합니다. 음성 인식 API는 실제 서비스에서 사용할 수 있도록 REST API 형식으로 제공됩니다.

다양한 방식의 음성 입력 지원
- 인식할 음성을 음성 파일로 업로드할 수 있습니다.
- 마이크로 음성을 녹음하여 음성 입력을 할 수 있습니다.
- 다양한 형식의 음성 파일 입력을 지원합니다. (WAV, WebM, MP3, OGG, FLAC, AAC, AC3)
인식 결과 다운로드 지원
- JSON, TXT 파일을 다운로드할 수 있습니다.
- 음성 인식 결과 파일을 다운로드하여 원하는 결과로 수정할 수 있습니다.
Text to Speech 서비스 활용 예
- 음성을 자동으로 받아쓰는 기능 구축이 필요한 경우 (고객 센터 상담, 자막 생성 등)
- 음성을 통한 디바이스 제어가 필요한 경우 (IOT 디바이스 등)
- 음성 챗봇 서비스를 구축하는 경우
API 가이드
- 음성 파일을 쉽게 텍스트로 변환하실 수 있도록 API를 제공합니다. 자세한 내용은 다음 사용자 가이드를 참고하시기 바랍니다. https://docs.toast.com/ko/AI%20Service/Speech%20to%20Text/ko/api-guide/