카테고리 가이드 · 2026-08-22 검토

음성·음악 무료 AI 도구

음성·음악 AI는 녹취, 음질 개선, TTS, 작곡 가운데 필요한 작업을 구분하면 무료 도구만으로도 충분히 시작할 수 있습니다. 한국어 발음과 화자 구분, 다운로드 권리, 분량 제한은 샘플 한 번보다 실제 프로젝트 길이로 비교하세요.

고를 때 확인할 세 가지

  1. 내 목소리와 비슷한 한국어 억양 또는 회의 환경의 소음에서 짧은 테스트를 진행하세요.
  2. 음원 공개나 수익화가 목적이면 생성 음악과 합성 음성의 라이선스를 별도로 확인하세요.
  3. 장시간 녹취는 월간 분수, 화자 분리, 자막 형식 내보내기까지 포함해 비용을 계산하세요.

먼저 비교할 도구

  • Suno — 매일 50 크레딧 재충전, 하루 최대 약 10곡 생성
  • ElevenLabs — 매월 10,000 크레딧, 카드 없이 음성·음악·STT 기능 사용
  • Adobe Podcast — 하루 음성 보정 1시간, 파일당 30분·500MB + Studio 하루 2개 다운로드
  • Otter.ai — 월 300분, 대화당 30분 + 녹음 파일 가져오기 계정당 3개
  • Descript — 매월 미디어 처리·자동 전사 60분, 무료 편집·내보내기 제공
  • Udio — 하루 10 크레딧·월 최대 100 크레딧; 현재 오디오·영상·스템 다운로드 불가
  • Typecast — 음성 생성·미리듣기는 무제한, 매월 5분 다운로드와 720p 영상 내보내기 제공·출처 표기 필수
  • Moises — 월 5곡, 파일당 5분까지 2트랙·4트랙 분리

음성·음악 전체 가이드 68개

  • Suno — 가사나 분위기만 적으면 보컬과 반주를 포함한 완성형 노래를 빠르게 만들어 주는 AI 음악 도구예요.
  • ElevenLabs — 감정과 억양을 살린 다국어 음성 합성, 음성 변환, 자막·더빙을 한곳에서 제공해요.
  • Adobe Podcast — 잡음과 울림이 섞인 녹음을 클릭 한 번으로 또렷한 스튜디오 음성처럼 보정해 줘요.
  • Otter.ai — 회의 음성을 실시간으로 받아쓰고 화자 구분, 요약, 질문 답변까지 제공하는 AI 회의록 도구예요.
  • Descript — 녹음 파일의 글자를 편집하듯 오디오와 영상을 자르고 AI로 음질과 흐름을 다듬는 편집기예요.
  • Udio — 장르, 가사, 분위기를 지정해 노래를 만들고 이어 붙이기와 리믹스를 할 수 있는 AI 음악 서비스예요.
  • Typecast — 감정과 말투를 조절한 한국어 AI 음성을 만들고 영상까지 편집하는 국내 음성 제작 도구예요.
  • Moises — 노래에서 보컬·드럼·베이스·기타를 분리하고 코드와 템포를 분석하는 AI 음악 연습 도구예요.
  • Wispr Flow — 어떤 앱에서든 말한 내용을 문맥에 맞게 다듬어 입력해 주는 AI 받아쓰기 도구예요.
  • Buzz — Whisper를 내 컴퓨터에서 실행해 녹음·영상의 전사·번역·자막 파일을 만드는 앱이에요.
  • Supertone Play — 게임·숏폼·더빙에 쓸 자연스러운 한국어 캐릭터 음성을 빠르게 생성하는 국내 AI 보이스 도구예요.
  • TTSMaker — 한국어를 포함한 100개 이상 언어를 음성으로 바꾸고 MP3·WAV로 내려받는 웹 TTS 도구예요.
  • Fadr — 노래에서 보컬·드럼·베이스를 분리하고 리믹스·매시업·DJ 세트를 만드는 음악 AI예요.
  • Auphonic — 레벨 균일화, 노이즈·잔향 제거, AutoEQ와 방송 음량 규격을 자동 처리하는 오디오 후반 작업 도구예요.
  • voicebox — 내 기기에서 음성을 복제·합성하고 Whisper 받아쓰기와 다중 화자 타임라인을 처리하는 로컬 AI 음성 제작·받아쓰기 스튜디오입니다.
  • Handy — 인터넷 연결 없이 마이크 음성을 텍스트로 바꿔 일상 입력과 접근성 작업에 활용한다.
  • voice-pro — TTS·제로샷 음성 복제·전사·번역·보컬 분리와 YouTube 오디오 처리를 Gradio에서 제공한다.
  • VoiceStudio — 로컬에서 음성 복제·설계, 다국어 더빙, 받아쓰기·전사와 오디오북 제작을 한 워크플로로 처리한다.
  • Kokoro-FastAPI — CPU·AMD·NVIDIA 환경에서 여러 화자를 섞어 긴 글 음성과 타임스탬프를 생성하는 Kokoro용 OpenAI 호환 TTS 서버와 읽기 WebUI입니다.
  • auto-subs — DaVinci Resolve, Premiere, After Effects의 영상 음성을 기기에서 전사해 편집 타임라인에 자막을 넣는다.
  • SmartSub — 로컬 음성 인식으로 영상 자막을 만들고 번역·AI 더빙·음성 복제·자막 입히기를 일괄 처리한다.
  • TTS-WebUI — TTS·음성 변환·음악·오디오 생성 모델을 확장형 Gradio·React WebUI에서 통합 실행한다.
  • whishper — Whisper로 오디오를 로컬 전사하고 자막을 번역·편집하는 웹 UI다.
  • Whisper-WebUI — Whisper 모델을 선택해 자막을 쉽게 생성하는 Gradio 웹 UI를 제공한다.
  • noScribe — 녹음에서 말을 텍스트로 옮기고 pyannote로 화자별 발화를 나누는 Whisper와 화자 식별을 묶은 인터뷰 전사 GUI입니다.
  • epub_to_audiobook — EPUB의 장·본문을 추출해 TTS 음성 파일과 Audiobookshelf에 맞는 오디오북 구조로 변환한다.
  • typewhisper-mac — Apple Silicon에서 온디바이스 Whisper로 받아쓰며 필요할 때만 선택적 클라우드를 사용한다.
  • Chatterbox-TTS-Server — 사전 정의 음성·보이스 클론·OpenAI 호환 API로 긴 원고와 오디오북 규모의 음성을 CPU, CUDA, ROCm에서 합성한다.
  • CyberVerse — WebRTC 음성 대화에 페르소나 기억, 도구, RAG와 선택적 립싱크 디지털 휴먼 영상을 결합한다.
  • Speech-AI-Forge — 여러 TTS 모델을 Gradio WebUI와 API 서버에서 선택해 음성을 생성한다.
  • aTrain — Whisper 기반으로 음성 녹음을 기기 안에서 전사하고 화자별 구간을 나눠 질적 분석 도구용 결과를 내보낸다.
  • muesli — 회의나 마이크 음성을 기기에서 텍스트로 바꾸고 받아쓰기 입력을 제공하는 Apple Silicon용 로컬 회의 전사·받아쓰기 앱입니다.
  • NaturalVoiceSAPIAdapter — SAPI 5 호환 프로그램이 Microsoft 자연 음성으로 텍스트를 읽게 연결하는 Azure 자연 음성을 SAPI 5 앱에 연결하는 TTS 어댑터입니다.
  • Whisperboard — iOS에서 Whisper·whisper.cpp 기반으로 음성을 녹음하고 접근성 높은 전사문을 만든다.
  • BiBi-Keyboard — Whisper·Qwen ASR 등으로 음성을 받아 텍스트로 바꾸고 LLM으로 문장을 다듬어 현재 앱에 입력한다.
  • Transcribro — Android에서 온디바이스 음성 인식 키보드와 입력 서비스를 제공한다.
  • TypeNo — macOS 메뉴 막대에서 개인정보 우선 방식으로 음성을 텍스트 입력으로 바꾼다.
  • vocalinux — Whisper·whisper.cpp·VOSK를 오프라인 실행해 X11과 Wayland 앱 어디서나 음성 입력한다.
  • chatterbox-tts-api — OpenAI TTS 형식의 요청으로 Chatterbox 음성과 승인된 샘플 기반 보이스 클론을 로컬 서비스에서 생성한다.
  • MimikaStudio — Qwen·XTTS·RVC 계열 음성 모델로 화자를 복제하고 긴 문서를 오디오북으로 만드는 Apple Silicon용 로컬 음성 복제·오디오북 제작 앱입니다.
  • Pandrator — PDF·EPUB를 음성책으로 만들고 자막·영상을 번역해 복제 음성으로 더빙하는 문서 오디오북과 번역 더빙을 만드는 로컬 음성 제작 GUI입니다.
  • pindrop — WhisperKit을 로컬에서 실행해 메뉴 막대에서 바로 받아쓰기를 시작한다.
  • TranscriptionSuite — 여러 로컬 STT 백엔드, 화자 분리와 캘린더 모드로 녹음을 전사한다.
  • Voice-Clone-Studio — Qwen3-TTS와 VibeVoice 기반 WebUI에서 음성 복제·음성 설계와 자동 전사를 수행한다.
  • voicetypr — Whisper 기반 오프라인 음성 입력으로 어떤 앱에서든 말한 내용을 텍스트로 바꾼다.
  • whisper_android — TensorFlow Lite 기반 Whisper를 Android에서 오프라인 음성 인식과 번역에 사용한다.
  • whisperIME — Whisper를 온디바이스 실행해 Android 입력기에서 받아쓰기와 번역 입력을 제공한다.
  • say — Whisper로 음성을 텍스트 노트로 바꾸어 말로 빠르게 기록한다.
  • tts-azure-web — 사용자 Azure 키로 텍스트를 음성으로 변환하는 웹 앱을 로컬 또는 클라우드에 배포한다.
  • VoiceFlow — 단축키 받아쓰기와 시스템 오디오를 포함한 장시간 회의 녹음·Whisper 전사·BYO LLM 요약을 제공한다.
  • subtitler — 브라우저 기기에서 음성을 전사하고 자막을 렌더링하는 온디바이스 웹 앱이다.
  • Vocello — Apple Silicon에서 텍스트로 음성을 설계·합성하고 로컬 음성 스튜디오처럼 작업한다.
  • whisper-website — Whisper로 오디오 파일을 자막으로 바꾸는 단순한 FastAPI 웹 애플리케이션이다.
  • ACE-Step-Studio — 가사와 음악 스타일을 받아 보컬이 포함된 완곡, 커버, 뮤직비디오용 음원을 로컬에서 만든다.
  • android_transcribe_app — 기기에서 음성을 텍스트 입력으로 바꾸거나 주변 발화를 실시간 자막으로 표시한다.
  • Aria — 컴퓨터에서 재생되거나 마이크로 들어오는 음성을 즉시 인식해 접근성 자막으로 표시한다.
  • AudioWhisper — 단축키로 짧은 음성 메모를 녹음하고 Whisper 또는 Google Gemini로 전사해 클립보드에 복사한다.
  • kvoicewalk — 참조 음성과 무작위 스타일 변형을 조합해 Kokoro TTS용 유사 음색을 찾는 Kokoro 음색 공간을 탐색하는 음성 스타일 복제 앱입니다.
  • petal — macOS 메뉴 막대에서 짧은 음성 파일이나 마이크 입력을 로컬 텍스트로 변환하는 메뉴 막대에서 빠르게 쓰는 로컬 우선 macOS 전사 앱입니다.
  • voxd — Linux 배포판에서 음성을 텍스트로 입력하는 사용자 친화적 받아쓰기 도구다.
  • Murf — 글을 넣으면 사람 목소리에 가까운 내레이션으로 읽어 주는 AI 음성 도구예요.
  • Speechify — 읽어야 할 글을 음성으로 바꿔 듣고, 말한 내용을 글로 받아 적는 도구예요.
  • Podcastle — 녹음부터 잡음 제거와 전사까지 팟캐스트 작업을 한곳에서 하는 도구예요.
  • AIVA — 장르와 분위기를 고르면 배경음악 초안을 작곡해 주는 AI 음악 도구예요.
  • NaturalReader — 문서와 웹페이지, PDF를 자연스러운 음성으로 읽어 주는 듣기 도구예요.
  • Stable Audio — 설명 문장으로 짧은 음악과 효과음을 만드는 생성 오디오 도구예요.
  • Mubert Render — 영상이나 매장에 쓸 배경음악을 무드만 골라 뽑아내는 음악 생성 도구예요.
  • Kits AI — 내 노래나 녹음을 다른 목소리로 바꿔 보는 음악용 AI 보컬 변환 도구예요.

관련 작업별 추천

도구 선정·검증 원칙 보기