카테고리 가이드 · 2026-08-22 검토
음성·음악 무료 AI 도구
음성·음악 AI는 녹취, 음질 개선, TTS, 작곡 가운데 필요한 작업을 구분하면 무료 도구만으로도 충분히 시작할 수 있습니다. 한국어 발음과 화자 구분, 다운로드 권리, 분량 제한은 샘플 한 번보다 실제 프로젝트 길이로 비교하세요.
고를 때 확인할 세 가지
- 내 목소리와 비슷한 한국어 억양 또는 회의 환경의 소음에서 짧은 테스트를 진행하세요.
- 음원 공개나 수익화가 목적이면 생성 음악과 합성 음성의 라이선스를 별도로 확인하세요.
- 장시간 녹취는 월간 분수, 화자 분리, 자막 형식 내보내기까지 포함해 비용을 계산하세요.
먼저 비교할 도구
- Suno — 매일 50 크레딧 재충전, 하루 최대 약 10곡 생성
- ElevenLabs — 매월 10,000 크레딧, 카드 없이 음성·음악·STT 기능 사용
- Adobe Podcast — 하루 음성 보정 1시간, 파일당 30분·500MB + Studio 하루 2개 다운로드
- Otter.ai — 월 300분, 대화당 30분 + 녹음 파일 가져오기 계정당 3개
- Descript — 매월 미디어 처리·자동 전사 60분, 무료 편집·내보내기 제공
- Udio — 하루 10 크레딧·월 최대 100 크레딧; 현재 오디오·영상·스템 다운로드 불가
- Typecast — 음성 생성·미리듣기는 무제한, 매월 5분 다운로드와 720p 영상 내보내기 제공·출처 표기 필수
- Moises — 월 5곡, 파일당 5분까지 2트랙·4트랙 분리
음성·음악 전체 가이드 68개
- Suno — 가사나 분위기만 적으면 보컬과 반주를 포함한 완성형 노래를 빠르게 만들어 주는 AI 음악 도구예요.
- ElevenLabs — 감정과 억양을 살린 다국어 음성 합성, 음성 변환, 자막·더빙을 한곳에서 제공해요.
- Adobe Podcast — 잡음과 울림이 섞인 녹음을 클릭 한 번으로 또렷한 스튜디오 음성처럼 보정해 줘요.
- Otter.ai — 회의 음성을 실시간으로 받아쓰고 화자 구분, 요약, 질문 답변까지 제공하는 AI 회의록 도구예요.
- Descript — 녹음 파일의 글자를 편집하듯 오디오와 영상을 자르고 AI로 음질과 흐름을 다듬는 편집기예요.
- Udio — 장르, 가사, 분위기를 지정해 노래를 만들고 이어 붙이기와 리믹스를 할 수 있는 AI 음악 서비스예요.
- Typecast — 감정과 말투를 조절한 한국어 AI 음성을 만들고 영상까지 편집하는 국내 음성 제작 도구예요.
- Moises — 노래에서 보컬·드럼·베이스·기타를 분리하고 코드와 템포를 분석하는 AI 음악 연습 도구예요.
- Wispr Flow — 어떤 앱에서든 말한 내용을 문맥에 맞게 다듬어 입력해 주는 AI 받아쓰기 도구예요.
- Buzz — Whisper를 내 컴퓨터에서 실행해 녹음·영상의 전사·번역·자막 파일을 만드는 앱이에요.
- Supertone Play — 게임·숏폼·더빙에 쓸 자연스러운 한국어 캐릭터 음성을 빠르게 생성하는 국내 AI 보이스 도구예요.
- TTSMaker — 한국어를 포함한 100개 이상 언어를 음성으로 바꾸고 MP3·WAV로 내려받는 웹 TTS 도구예요.
- Fadr — 노래에서 보컬·드럼·베이스를 분리하고 리믹스·매시업·DJ 세트를 만드는 음악 AI예요.
- Auphonic — 레벨 균일화, 노이즈·잔향 제거, AutoEQ와 방송 음량 규격을 자동 처리하는 오디오 후반 작업 도구예요.
- voicebox — 내 기기에서 음성을 복제·합성하고 Whisper 받아쓰기와 다중 화자 타임라인을 처리하는 로컬 AI 음성 제작·받아쓰기 스튜디오입니다.
- Handy — 인터넷 연결 없이 마이크 음성을 텍스트로 바꿔 일상 입력과 접근성 작업에 활용한다.
- voice-pro — TTS·제로샷 음성 복제·전사·번역·보컬 분리와 YouTube 오디오 처리를 Gradio에서 제공한다.
- VoiceStudio — 로컬에서 음성 복제·설계, 다국어 더빙, 받아쓰기·전사와 오디오북 제작을 한 워크플로로 처리한다.
- Kokoro-FastAPI — CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다.
- auto-subs — DaVinci Resolve, Premiere, After Effects의 영상 음성을 기기에서 전사해 편집 타임라인에 자막을 넣는다.
- SmartSub — 로컬 음성 인식으로 영상 자막을 만들고 번역·AI 더빙·음성 복제·자막 입히기를 일괄 처리한다.
- TTS-WebUI — TTS·음성 변환·음악·오디오 생성 모델을 확장형 Gradio·React WebUI에서 통합 실행한다.
- whishper — Whisper로 오디오를 로컬 전사하고 자막을 번역·편집하는 웹 UI다.
- Whisper-WebUI — Whisper 모델을 선택해 자막을 쉽게 생성하는 Gradio 웹 UI를 제공한다.
- noScribe — 녹음에서 말을 텍스트로 옮기고 pyannote로 화자별 발화를 나누는 Whisper와 화자 식별을 묶은 인터뷰 전사 GUI입니다.
- epub_to_audiobook — EPUB의 장·본문을 추출해 TTS 음성 파일과 Audiobookshelf에 맞는 오디오북 구조로 변환한다.
- typewhisper-mac — Apple Silicon에서 온디바이스 Whisper로 받아쓰며 필요할 때만 선택적 클라우드를 사용한다.
- Chatterbox-TTS-Server — 사전 정의 음성·보이스 클론·OpenAI 호환 API로 긴 원고와 오디오북 규모의 음성을 CPU, CUDA, ROCm에서 합성한다.
- CyberVerse — WebRTC 음성 대화에 페르소나 기억, 도구, RAG와 선택적 립싱크 디지털 휴먼 영상을 결합한다.
- Speech-AI-Forge — 여러 TTS 모델을 Gradio WebUI와 API 서버에서 선택해 음성을 생성한다.
- aTrain — Whisper 기반으로 음성 녹음을 기기 안에서 전사하고 화자별 구간을 나눠 질적 분석 도구용 결과를 내보낸다.
- muesli — 회의나 마이크 음성을 기기에서 텍스트로 바꾸고 받아쓰기 입력을 제공하는 Apple Silicon용 로컬 회의 전사·받아쓰기 앱입니다.
- NaturalVoiceSAPIAdapter — SAPI 5 호환 프로그램이 Microsoft 자연 음성으로 텍스트를 읽게 연결하는 Azure 자연 음성을 SAPI 5 앱에 연결하는 TTS 어댑터입니다.
- Whisperboard — iOS에서 Whisper·whisper.cpp 기반으로 음성을 녹음하고 접근성 높은 전사문을 만든다.
- BiBi-Keyboard — Whisper·Qwen ASR 등으로 음성을 받아 텍스트로 바꾸고 LLM으로 문장을 다듬어 현재 앱에 입력한다.
- Transcribro — Android에서 온디바이스 음성 인식 키보드와 입력 서비스를 제공한다.
- TypeNo — macOS 메뉴 막대에서 개인정보 우선 방식으로 음성을 텍스트 입력으로 바꾼다.
- vocalinux — Whisper·whisper.cpp·VOSK를 오프라인 실행해 X11과 Wayland 앱 어디서나 음성 입력한다.
- chatterbox-tts-api — OpenAI TTS 형식의 요청으로 Chatterbox 음성과 승인된 샘플 기반 보이스 클론을 로컬 서비스에서 생성한다.
- MimikaStudio — Qwen·XTTS·RVC 계열 음성 모델로 화자를 복제하고 긴 문서를 오디오북으로 만드는 Apple Silicon용 로컬 음성 복제·오디오북 제작 앱입니다.
- Pandrator — PDF·EPUB를 음성책으로 만들고 자막·영상을 번역해 복제 음성으로 더빙하는 문서 오디오북과 번역 더빙을 만드는 로컬 음성 제작 GUI입니다.
- pindrop — WhisperKit을 로컬에서 실행해 메뉴 막대에서 바로 받아쓰기를 시작한다.
- TranscriptionSuite — 여러 로컬 STT 백엔드, 화자 분리와 캘린더 모드로 녹음을 전사한다.
- Voice-Clone-Studio — Qwen3-TTS와 VibeVoice 기반 WebUI에서 음성 복제·음성 설계와 자동 전사를 수행한다.
- voicetypr — Whisper 기반 오프라인 음성 입력으로 어떤 앱에서든 말한 내용을 텍스트로 바꾼다.
- whisper_android — TensorFlow Lite 기반 Whisper를 Android에서 오프라인 음성 인식과 번역에 사용한다.
- whisperIME — Whisper를 온디바이스 실행해 Android 입력기에서 받아쓰기와 번역 입력을 제공한다.
- say — Whisper로 음성을 텍스트 노트로 바꾸어 말로 빠르게 기록한다.
- tts-azure-web — 사용자 Azure 키로 텍스트를 음성으로 변환하는 웹 앱을 로컬 또는 클라우드에 배포한다.
- VoiceFlow — 단축키 받아쓰기와 시스템 오디오를 포함한 장시간 회의 녹음·Whisper 전사·BYO LLM 요약을 제공한다.
- subtitler — 브라우저 기기에서 음성을 전사하고 자막을 렌더링하는 온디바이스 웹 앱이다.
- Vocello — Apple Silicon에서 텍스트로 음성을 설계·합성하고 로컬 음성 스튜디오처럼 작업한다.
- whisper-website — Whisper로 오디오 파일을 자막으로 바꾸는 단순한 FastAPI 웹 애플리케이션이다.
- ACE-Step-Studio — 가사와 음악 스타일을 받아 보컬이 포함된 완곡, 커버, 뮤직비디오용 음원을 로컬에서 만든다.
- android_transcribe_app — 기기에서 음성을 텍스트 입력으로 바꾸거나 주변 발화를 실시간 자막으로 표시한다.
- Aria — 컴퓨터에서 재생되거나 마이크로 들어오는 음성을 즉시 인식해 접근성 자막으로 표시한다.
- AudioWhisper — 단축키로 짧은 음성 메모를 녹음하고 Whisper 또는 Google Gemini로 전사해 클립보드에 복사한다.
- kvoicewalk — 참조 음성과 무작위 스타일 변형을 조합해 Kokoro TTS용 유사 음색을 찾는 Kokoro 음색 공간을 탐색하는 음성 스타일 복제 앱입니다.
- petal — macOS 메뉴 막대에서 짧은 음성 파일이나 마이크 입력을 로컬 텍스트로 변환하는 메뉴 막대에서 빠르게 쓰는 로컬 우선 macOS 전사 앱입니다.
- voxd — Linux 배포판에서 음성을 텍스트로 입력하는 사용자 친화적 받아쓰기 도구다.
- Murf — 글을 넣으면 사람 목소리에 가까운 내레이션으로 읽어 주는 AI 음성 도구예요.
- Speechify — 읽어야 할 글을 음성으로 바꿔 듣고, 말한 내용을 글로 받아 적는 도구예요.
- Podcastle — 녹음부터 잡음 제거와 전사까지 팟캐스트 작업을 한곳에서 하는 도구예요.
- AIVA — 장르와 분위기를 고르면 배경음악 초안을 작곡해 주는 AI 음악 도구예요.
- NaturalReader — 문서와 웹페이지, PDF를 자연스러운 음성으로 읽어 주는 듣기 도구예요.
- Stable Audio — 설명 문장으로 짧은 음악과 효과음을 만드는 생성 오디오 도구예요.
- Mubert Render — 영상이나 매장에 쓸 배경음악을 무드만 골라 뽑아내는 음악 생성 도구예요.
- Kits AI — 내 노래나 녹음을 다른 목소리로 바꿔 보는 음악용 AI 보컬 변환 도구예요.