도구별 실전 가이드 · 공식 정보 확인 2026-08-20
Kokoro-FastAPI 사용법: 무료로 시작하는 가장 현실적인 방법
CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다. Kokoro-FastAPI의 첫 실전 과제는 “두 화자가 번갈아 읽는 3분짜리 안내 음성과 자막 만들기”이며, 이 흐름을 직접 통제할 사람에게 맞습니다.
이럴 때 맞습니다
- “화자별 문단과 쉼표·강조가 표시된 900자 안내 대본” 같은 입력으로 Kokoro-FastAPI의 핵심 기능을 시험하려는 사람
- 화자 전환·문장 누락·자막 타임스탬프가 재생 음성과 맞는지 기준으로 Kokoro-FastAPI 결과를 직접 검수할 수 있는 경우
- Web·Self-hosted 환경에서 Apache-2.0 코드를 직접 설치·관리하려는 작업
이럴 때는 멈추세요
- Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI 설치·모델 준비·업데이트를 관리하지 않고 즉시 완성된 서비스를 원하는 경우
- 다음 위험을 사람이 확인할 수 없는 작업: 실존 인물을 닮은 음성을 동의 없이 합성하거나 긴 문장을 자동 연결하며 단어가 잘리는 문제.
처음 해볼 작업 3가지
두 화자 대본을 SSML로 나눈다
화자와 쉼표가 명시된 3분 TTS 입력이 준비된다.
짧은 조각으로 합성하고 잇는다
문장 누락 없이 두 화자의 음성이 연결된다.
음성과 자막 시간을 맞춘다
재생 구간과 일치하는 캡션이 포함된 안내물이 완성된다.
무료 조건과 주의점
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 저장소 코드는 상업적으로 사용할 수 있지만, 모델 가중치·입력 자료·생성물·번들 자산의 권리는 각각 따로 확인해야 합니다.
실존 인물을 닮은 음성을 동의 없이 합성하거나 긴 문장을 자동 연결하며 단어가 잘리는 문제.
직접 대안과 비교
- Pandrator — 문서를 여러 음성으로 낭독하고 TTS 산출물을 이어 오디오북으로 만들 수 있어, 두 화자가 읽는 안내 음성 제작은 GUI 흐름으로 대신할 수 있다.