도구별 실전 가이드 · 공식 정보 확인 2026-08-20
Kokoro-FastAPI Apache-2.0 오픈소스 조건과 시작 절차
작성: gentive · 편집·검수 책임: 신유빈 · 지원 환경: Web, Self-hosted · 페이지 갱신: · 운영·편집 기준
CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다.
CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다. Kokoro-FastAPI의 첫 실전 과제는 “두 화자가 번갈아 읽는 3분짜리 안내 음성과 자막 만들기”이며, 이 흐름을 직접 통제할 사람에게 맞습니다.
이럴 때 맞습니다
- “화자별 문단과 쉼표·강조가 표시된 900자 안내 대본” 같은 입력으로 Kokoro-FastAPI의 핵심 기능을 시험하려는 사람
- 화자 전환·문장 누락·자막 타임스탬프가 재생 음성과 맞는지 기준으로 Kokoro-FastAPI 결과를 직접 검수할 수 있는 경우
- Web·Self-hosted 환경에서 Apache-2.0 코드를 직접 설치·관리하려는 작업
이럴 때는 멈추세요
- Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI 설치·모델 준비·업데이트를 관리하지 않고 즉시 완성된 서비스를 원하는 경우
- 다음 위험을 사람이 확인할 수 없는 작업: 실존 인물을 닮은 음성을 동의 없이 합성하거나 긴 문장을 자동 연결하며 단어가 잘리는 문제.
참고 시작점
팩트시트 · 작업 근거 확인 필요: 아래 문구는 공식 제품 사실을 정리한 참고 시작점이며, 성공 결과를 보장하는 검증 절차가 아닙니다.
두 화자 대본을 SSML로 나눈다
화자와 쉼표가 명시된 3분 TTS 입력이 준비된다.
참고 시작점: 안내자 A와 질문자 B가 번갈아 읽도록 문단을 나누고 긴 문장에는 쉼을 넣어 줘.
- Kokoro-FastAPI의 multi-speaker TTS 형식으로 900자 대본의 화자 경계를 표시한다.
- SSML 쉼과 강조가 지원되는 구간만 사용하고 고유명사 발음을 별도 표기한다.
- voice mixing은 권리가 확인된 Kokoro 음색 조합으로 제한한다.
짧은 조각으로 합성하고 잇는다
문장 누락 없이 두 화자의 음성이 연결된다.
참고 시작점: 문단별 음성을 만든 뒤 문장 중간이 잘리지 않도록 자동 연결해 줘.
- OpenAI-compatible API에 화자별 문단을 짧은 요청으로 보낸다.
- auto-stitching 결과의 경계에서 마지막 단어와 첫 단어가 겹치거나 빠지는지 듣는다.
- CPU·AMD·NVIDIA 중 실제 실행 장치의 처리 시간과 오류를 기록한다.
음성과 자막 시간을 맞춘다
재생 구간과 일치하는 캡션이 포함된 안내물이 완성된다.
참고 시작점: 최종 음성에 문장별 타임스탬프 자막을 붙이고 화자 전환을 표시해 줘.
- caption timestamps를 생성해 read-along WebUI에서 음성과 함께 재생한다.
- 각 화자 전환과 문장 끝 타임스탬프를 파형의 실제 발화와 대조한다.
- 실존 인물을 연상시키는 음색이면 배포 전에 동의 범위와 합성 표시를 확인한다.
무료 조건과 주의점
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 저장소 코드는 상업적으로 사용할 수 있지만, 모델 가중치·입력 자료·생성물·번들 자산의 권리는 각각 따로 확인해야 합니다.
실존 인물을 닮은 음성을 동의 없이 합성하거나 긴 문장을 자동 연결하며 단어가 잘리는 문제.
직접 대안과 비교
- Pandrator — 문서를 여러 음성으로 낭독하고 TTS 산출물을 이어 오디오북으로 만들 수 있어, 두 화자가 읽는 안내 음성 제작은 GUI 흐름으로 대신할 수 있다.
공식 근거와 확인일
| 확인 항목 | 확인한 내용 | 공식 출처·확인일 |
|---|---|---|
| 제품 정보 | CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다. | Kokoro-FastAPI 공식 사이트 |
| 무료 조건 | Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도 | 공식 무료 정책·요금 안내 |
| 공식 코드 라이선스 | 오픈소스 코드의 사용·수정·재배포 조건 | 공식 코드 라이선스 |
| 공식 제품 페이지 | CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다. | 공식 제품 페이지 |