유튜브·인스타 영상에서 목소리 제거하고 음악만 추출하는 방법 – UVR 무료 AI 음원분리
인스타그램 릴스나 유튜브 영상을 보다 보면 영상 자체보다 배경에 깔린 음악이 마음에 드는 경우가 있습니다.
그런데 정작 음악을 편집에 활용하려고 들어보면 사람 목소리, 대사, 내레이션 또는 노래 보컬이 함께 섞여 있어 그대로 쓰기 애매할 때가 있습니다.
작곡이나 편곡 작업을 할 때도 비슷합니다. 참고하고 싶은 곡에서 반주 구성만 들어보고 싶거나, 반대로 보컬만 따로 분리해서 분석하고 싶은 경우가 생깁니다.
요즘 방식은 사람 목소리가 있을 법한 주파수만 제거하는 것이 아니라 AI가 음악을 분석해 Vocals와 Instrumental을 별도의 Stem으로 나누기 때문에 원본 악기가 함께 사라지는 현상을 상당히 줄일 수 있기 때문입니다.
이번 글에서는 유료 웹사이트에 음원을 계속 업로드하지 않고 PC에서 사용할 수 있는 무료 프로그램 Ultimate Vocal Remover, 이하 UVR을 이용해 영상이나 노래에 섞인 목소리를 제거하고 음악·MR만 추출하는 방법을 정리했습니다.
유튜브·인스타 영상에서 음악만 필요할 때 생기는 문제
영상 편집을 하다 보면 흔히 “이 배경음악만 따로 있으면 딱 좋은데”라는 생각이 듭니다.
문제는 영상에 들어 있는 음악이 대부분 단독 트랙이 아니라 사람 목소리나 효과음과 하나로 합쳐진 최종 오디오라는 점입니다.
배경음악 위에 설명·내레이션·대사가 들어가 있어 그대로 사용하기 어려운 경우
마음에 드는 BGM이 있지만 촬영자의 말소리나 주변 목소리가 함께 녹음된 경우
악기 배치와 코드 진행을 듣기 위해 보컬을 줄이고 반주 부분만 분석하고 싶은 경우
반대로 악기를 줄이고 목소리만 분리해 발음·화음·멜로디를 확인하고 싶은 경우
예전 방식은 스테레오 음원의 중앙에 배치된 소리를 상쇄하거나 사람 목소리가 많은 주파수를 EQ로 줄이는 방식이 많았습니다.
하지만 보컬과 스네어, 베이스, 신스 등은 같은 주파수 대역을 공유하기 때문에 목소리를 제거하면서 악기도 함께 사라지는 문제가 생기기 쉽습니다.
UVR은 이와 달리 AI 기반 Source Separation을 이용해 소리의 특징 자체를 분류한다는 점에서 접근법이 다릅니다.
Ultimate Vocal Remover UVR이란?
Ultimate Vocal Remover GUI는 딥러닝 기반 음원분리 모델을 이용해 음악 파일에서 보컬과 악기를 분리하는 무료 오픈소스 프로그램입니다.
공식 프로젝트에서는 UVR이 보컬 제거 및 Source Separation 모델을 사용하는 GUI라고 설명하고 있으며 Windows, macOS, Linux 환경을 대상으로 제공하고 있습니다.
특히 단순한 보컬 제거 프로그램이라기보다는 모델에 따라 다음과 같은 작업을 할 수 있다는 점이 장점입니다.
- 음악에서 보컬만 추출
- 보컬을 제거해 Instrumental·MR 추출
- Vocals / Drums / Bass / Other 등 악기별 Stem 분리
- 여러 AI 모델 결과를 합치는 Ensemble
- 특정 모델을 이용한 리버브·에코 계열 후처리
웹 서비스는 설치가 필요 없어 편하지만 파일 업로드와 작업시간·파일길이·크레딧 제한이 걸리는 경우가 있습니다. 반면 UVR은 처음 설치와 모델 다운로드 과정이 조금 번거롭지만 준비가 끝나면 PC에서 여러 음원을 반복해서 처리하기 좋습니다.
Ultimate Vocal Remover 무료 다운로드 및 설치
UVR은 비슷한 이름을 사용한 프로그램이나 다운로드 사이트가 많기 때문에 검색 결과에서 아무 설치파일이나 받기보다는 공식 홈페이지 또는 공식 GitHub에서 받는 것을 권장합니다.
공식 GitHub의 일반 설치 패키지에는 UVR 인터페이스와 Python, PyTorch 등 실행에 필요한 구성요소가 포함되어 있기 때문에 일반적인 Windows 사용자는 별도로 Python 개발환경을 만들 필요가 없습니다.
공식 안내에서는 Windows 설치본을 Windows 10 이상 환경을 대상으로 제공하고 있으며, UVR을 Windows의 C: 메인 드라이브에 설치하도록 안내하고 있습니다. 보조 드라이브 설치 시 불안정할 수 있기 때문에 특별한 이유가 없다면 기본 설치경로를 사용하는 편이 좋습니다.
UVR 화면에서 꼭 알아야 할 설정
처음 실행하면 버튼과 AI 모델 이름이 많아 어렵게 보이지만 목소리 제거 후 음악만 뽑는 목적이라면 실제로 확인할 부분은 많지 않습니다.
① Select Input
목소리를 제거할 오디오 파일을 선택합니다.
작곡 프로그램에서 내보낸 WAV나 FLAC, 직접 제작하거나 합법적으로 확보한 MP3 등을 넣으면 됩니다.
② Select Output
분리가 끝난 파일을 저장할 폴더입니다.
테스트를 여러 번 할 예정이라면 원본 폴더와 분리 결과 폴더를 따로 만들어두는 편이 좋습니다. 모델을 바꿀 때마다 결과물이 늘어나기 때문입니다.
③ Process Method
사용할 AI 음원분리 방식을 선택하는 부분입니다.
보컬과 반주만 나누려는 첫 작업이라면 MDX-Net 또는 현재 Download Center에서 제공하는 보컬 분리용 모델부터 테스트하는 것이 이해하기 쉽습니다.
④ AI Model
실제 음원을 분리하는 AI 모델을 선택합니다.
같은 노래라도 모델에 따라 보컬 잔상이 많이 남기도 하고 반대로 악기의 고음역이 함께 제거되기도 합니다.
그래서 저는 특정 모델 하나를 무조건 최고라고 고정하기보다는 같은 노래의 20~30초 구간을 2~3개 모델로 테스트한 뒤 가장 자연스러운 결과를 고르는 방식을 추천합니다.
⑤ GPU Conversion
지원되는 GPU를 이용해 AI 계산을 처리하는 옵션입니다.
NVIDIA 그래픽카드가 정상적으로 인식되는 환경이라면 CPU만 이용할 때보다 작업시간을 상당히 줄일 수 있습니다.
⑥ Instrumental Only
이번 글에서 가장 중요한 옵션입니다.
사람 목소리를 없애고 음악·MR만 필요하다면 Instrumental 결과가 필요합니다.
반대로 보컬만 필요하다면 Vocals 쪽 결과를 사용합니다.
음악에서 목소리 제거하고 Instrumental·MR 추출하기
직접 제작한 음악이나 사용 권한을 확보한 음원 파일을 준비합니다. 가능하다면 MP3보다 WAV·FLAC처럼 압축 손실이 적은 원본에 가까운 파일이 유리합니다.
UVR 화면 상단에서 오디오 파일을 선택하고 Select Output에서 결과물을 저장할 폴더를 지정합니다.
처음이라면 보컬·Instrumental 분리를 목적으로 하는 MDX 계열 모델부터 시작하면 설정이 비교적 단순합니다.
VRAM 부족 오류가 없다면 GPU 가속을 사용하는 것이 처리시간 면에서 유리합니다.
영상에서 말소리·노래 보컬을 제외한 배경음악이 목적이라면 Instrumental 쪽 파일이 최종 결과입니다.
작업시간은 노래 길이, 모델, CPU·GPU 성능과 메모리 설정에 따라 달라집니다.
MDX-Net·Demucs·Ensemble 차이와 무엇을 선택할까?
UVR을 처음 접했을 때 가장 헷갈리는 것이 “모델이 너무 많은데 뭘 선택해야 하지?”라는 부분입니다.
공식 UVR은 여러 Source Separation 방식을 지원하고 추가 모델은 프로그램의 Download Center를 통해 제공될 수 있습니다.
| 방식 | 주요 특징 | 추천 상황 |
|---|---|---|
| MDX-Net | 보컬과 반주를 나누는 작업에 많이 사용되는 계열 | 목소리 제거·MR 추출을 처음 시도할 때 |
| MDX23C | UVR 5.6에서 공식적으로 지원되는 MDX 계열 | Download Center에서 제공되는 호환 모델을 테스트할 때 |
| Demucs | Vocals·Drums·Bass·Other처럼 여러 Stem으로 분리 가능 | 작곡·편곡·악기 분석 |
| VR Architecture | 다양한 보컬·리버브·에코 계열 모델을 활용할 수 있음 | 추출한 보컬이나 반주의 추가 후처리 |
| Ensemble Mode | 두 개 이상의 모델 결과를 조합 | 한 모델로 보컬 잔상이 잘 없어지지 않을 때 |
| Roformer 계열 | 공식 릴리스 페이지에서 별도 Beta Roformer 버전과 관련 모델을 안내 | 기본 모델 외에 최신 계열 모델을 추가로 비교하고 싶을 때 |
목소리가 조금씩 남는다면? 음질 개선 순서
AI 음원분리를 처음 사용하면 “목소리가 완전히 사라질 줄 알았는데 숨소리나 코러스가 조금 남네?” 라고 느낄 수 있습니다.
이건 꼭 설정을 잘못한 것은 아닙니다.
최종 믹싱된 음악에서는 보컬과 악기가 완전히 독립되어 있지 않고 리버브, 딜레이, 코러스와 공간계 효과가 좌우 채널 전체에 섞이기 때문입니다.
1. 다른 AI 모델로 짧은 구간 비교
같은 곡이라도 모델에 따라 결과 차이가 꽤 큽니다.
전체 곡을 매번 처리하기보다 후렴처럼 보컬이 강한 부분을 짧게 테스트한 뒤 가장 자연스러운 모델로 전체 곡을 처리하는 것이 효율적입니다.
2. 원본 음질을 높입니다.
가능하다면 여러 번 재인코딩된 저화질 MP3보다는 원본에 가까운 WAV나 FLAC을 사용하는 편이 좋습니다.
이미 손실 압축 과정에서 사라진 음향 정보는 AI가 완벽하게 복원한 뒤 분리할 수 있는 것이 아니기 때문입니다.
3. 리버브·코러스가 강한 곡은 한 번 더 후처리합니다.
메인 보컬은 없어졌는데 멀리서 울리는 목소리처럼 잔상이 남는다면 그 소리는 보컬 원음보다 Reverb 또는 Delay 성분일 가능성이 있습니다.
필요하다면 관련 분리 모델을 이용해 두 번째 처리를 해볼 수 있습니다.
AI 분리를 반복하면 보컬은 더 줄어들 수 있지만 심벌·기타·신스의 고음역이나 어택까지 손상되면서 금속성 소리나 물속에서 듣는 듯한 Artifact가 생길 수 있습니다. 한두 단계 안에서 가장 자연스러운 결과를 찾는 것이 좋습니다.
WAV·FLAC·MP3 어떤 파일로 저장할까?
| 형식 | 장점 | 추천 용도 |
|---|---|---|
| WAV | 무압축이라 편집 과정의 추가 손실을 줄이기 좋음 | 작곡·영상편집·추가 AI 처리 |
| FLAC | 무손실이면서 WAV보다 저장공간 절약 | 고음질 보관 |
| MP3 | 파일이 작고 호환성이 좋음 | 최종 감상·간단한 공유 |
저라면 UVR에서 분리한 뒤 추가 편집까지 할 예정이라면 WAV로 저장하고, 모든 편집이 끝난 최종 결과만 MP3로 변환할 것 같습니다.
MP3 → UVR → MP3 → 편집 → MP3처럼 계속 손실 압축을 반복하면 AI 분리 과정에서 생긴 미세한 Artifact가 더 눈에 띌 수 있습니다.
UVR은 그래픽카드가 꼭 있어야 할까?
UVR은 AI 연산이 필요한 프로그램이라 일반 오디오 플레이어나 간단한 EQ보다 하드웨어 영향을 많이 받습니다.
GPU가 없어도 일부 작업을 CPU로 실행할 수 있지만 모델과 음원 길이에 따라 처리시간이 크게 늘어날 수 있습니다.
공식 개발자가 GitHub 이슈에서 설명한 내용을 보면 많은 모델이 GPU 사용 시 8GB 정도의 VRAM을 필요로 하며 6GB는 사실상 하한선에 가까운 수준으로 언급됩니다.
| 환경 | 사용 느낌 | 권장 방식 |
|---|---|---|
| NVIDIA GPU | CUDA 기반 GPU 가속을 사용할 수 있는 대표적인 환경 | GPU Conversion 사용 |
| AMD Radeon | 일반 CUDA 방식은 사용할 수 없음 | 공식 DirectML 지원 버전 확인 |
| Intel Arc | DirectML 대응 버전 사용 가능 | 공식 Release 페이지 확인 |
| GPU 없음 | CPU 처리 가능 환경이 있지만 시간이 오래 걸릴 수 있음 | Segment를 낮추고 테스트 |
Ultimate Vocal Remover 오류 및 느린 속도 해결
CUDA Out of Memory 오류
AI 모델이 요구하는 VRAM보다 그래픽카드 메모리가 부족하면 CUDA 메모리 오류가 발생할 수 있습니다.
이 경우에는 Segment 또는 관련 Window 설정을 낮추고 다시 테스트합니다.
GPU Conversion을 켰는데 GPU 사용률이 낮은 경우
- UVR에서 GPU Conversion이 실제로 체크되어 있는지 확인
- NVIDIA 그래픽 드라이버 업데이트
- Windows 그래픽 설정에서 UVR이 외장 GPU를 사용하도록 설정
- 현재 GPU와 사용 중인 UVR 패치의 호환성 확인
- 새 GPU 세대라면 공식 GitHub의 최신 패치 안내 확인
특히 GPU 세대가 새로 출시된 직후에는 기본 UVR 설치본의 PyTorch·CUDA 구성과 호환되지 않는 경우가 있으므로 공식 GitHub Release와 Patch 안내를 함께 확인하는 것이 좋습니다.
Download Center에 모델이 없을 때
UVR 기본 설치 직후에는 사용하려는 모든 모델이 설치되어 있지 않을 수 있습니다.
Settings → Download Center에서 필요한 모델을 추가로 내려받고 목록에 반영되지 않는다면 프로그램을 한 번 종료 후 다시 실행합니다.
MP3에서 오류가 발생할 때
UVR의 수동 설치 환경에서는 비-WAV 파일 처리를 위해 FFmpeg 구성이 필요할 수 있습니다.
일반 사용자는 가능하면 의존성이 포함된 공식 설치 패키지를 이용하는 편이 편하고, 문제가 계속된다면 해당 음원을 WAV로 변환한 뒤 다시 불러오는 방법도 있습니다.
작곡가라면 보컬 제거보다 Stem 분리가 더 유용할 수 있습니다.
단순히 영상 BGM을 만들 목적이라면 Vocals와 Instrumental 두 개로 나누는 것만으로 충분합니다.
하지만 작곡이나 편곡을 한다면 Demucs의 여러 Stem 분리도 상당히 흥미롭습니다.
지원되는 모델에 따라 하나의 노래를 예를 들어 다음처럼 나눌 수 있습니다.
- Vocals
- Drums
- Bass
- Other
완전한 원본 멀티트랙을 복구하는 것은 아니지만 “이 구간 베이스는 어떻게 움직이는지”, “드럼 없이 코드와 보컬만 들으면 어떤 느낌인지” 등을 분석하기에는 꽤 유용합니다.
완성된 곡을 통째로 듣는 것보다 Drums / Bass / Vocals / Other를 각각 들어본 뒤 다시 합쳐보겠습니다. 악기 하나가 전체 믹스에서 어느 정도의 공간을 차지하는지 훨씬 이해하기 쉽습니다.
유튜브·인스타그램 영상 음악을 사용할 때 가장 중요한 점
여기서 한 가지는 반드시 구분해야 합니다.
UVR로 사람 목소리를 제거했다고 해서 원곡의 저작권이나 사용권까지 없어지는 것은 아닙니다.
예를 들어 다른 사람이 만든 음악에서 보컬만 제거해 Instrumental 파일을 만들었다고 해도 그 음악을 내가 자유롭게 상업 영상에 사용할 수 있다는 의미는 아닙니다.
따라서 다음과 같은 경우를 중심으로 사용하는 것이 안전합니다.
- 내가 직접 제작한 음악
- 사용 허락을 받은 음원
- 라이선스 범위에서 편집이 허용된 음원
- 저작권이 만료됐거나 이용 조건이 명확한 음원
- 작곡·편곡 연구 등 허용 범위 안에서 사용하는 자료
온라인 보컬 제거 사이트와 UVR 중 어떤 게 좋을까?
| 구분 | 온라인 AI 분리 | Ultimate Vocal Remover |
|---|---|---|
| 설치 | 필요 없음 | PC 설치 필요 |
| 초보 편의성 | 매우 쉬움 | 처음 모델 설정 필요 |
| 여러 파일 작업 | 요금·제한이 걸릴 수 있음 | 로컬 처리에 유리 |
| AI 모델 선택 | 서비스가 정한 방식 | 다양한 모델 비교 가능 |
| 업로드 | 서버에 파일 업로드 | PC 로컬에서 처리 |
| GPU | 내 PC 성능 영향 적음 | GPU 성능에 따라 속도 차이 |
| 추천 대상 | 한두 곡 빠르게 분리 | 작곡·편집 등 반복 작업 |
한두 번 간단하게 보컬을 제거하는 것이라면 웹서비스가 훨씬 편합니다.
반대로 작곡이나 영상편집을 하면서 여러 음원을 자주 분리하고 모델별 결과까지 비교한다면 저라면 UVR을 설치해두는 쪽을 선택할 것 같습니다.
목소리 제거 작업을 해보면 중요한 건 모델보다 원본입니다.
UVR에는 모델과 옵션이 워낙 많아서 처음 사용하면 Segment, Overlap, Ensemble 같은 수치에 먼저 눈이 갑니다.
그런데 실제 결과에 더 큰 영향을 주는 것은 원본 음원의 상태와 보컬이 믹싱된 방식입니다.
라이브 공연처럼 관객 소리와 리버브가 가득한 음원, 스마트폰으로 다시 녹음한 음악, 여러 차례 압축된 짧은 SNS 영상은 애초에 AI가 구분할 수 있는 정보가 부족합니다.
반면 원본에 가까운 음질이 좋은 파일은 같은 설정에서도 보컬과 악기 경계가 훨씬 자연스럽게 분리될 가능성이 높습니다.
그래서 처음부터 옵션을 극단적으로 높이기보다 좋은 원본 → 기본 설정 → 다른 모델 비교 → 필요한 부분만 후처리 순서로 작업하는 것을 추천합니다.
Ultimate Vocal Remover 자주 묻는 질문
유튜브 영상에서 목소리만 없애고 배경음악만 남길 수 있나요?
영상에서 사용 권한이 있는 오디오 파일을 준비한 뒤 UVR에서 보컬과 Instrumental을 분리하면 가능합니다. 음악만 필요하다면 Instrumental 결과를 사용합니다.
인스타그램 릴스의 말소리만 제거할 수 있나요?
말소리와 음악이 충분히 구분되는 영상이라면 AI 음원분리로 감소시킬 수 있습니다. 다만 말소리와 음악이 같은 음역에 강하게 겹쳐 있거나 주변 소음이 많다면 흔적이 남을 수 있습니다.
노래에서 가수 목소리를 제거하면 완벽한 MR이 만들어지나요?
원곡의 공식 Instrumental과 완전히 동일한 결과를 보장하지는 않습니다. AI가 완성된 믹스에서 소리를 추정해 분리하기 때문에 리버브나 코러스가 남거나 일부 악기가 함께 손상될 수 있습니다.
MR만 필요하면 Vocals Only와 Instrumental Only 중 무엇을 선택하나요?
목소리를 제외한 반주가 목적이라면 Instrumental 결과가 필요합니다. Vocals는 사람 목소리 쪽 결과입니다.
그래픽카드가 없어도 UVR을 사용할 수 있나요?
일부 모델은 CPU에서도 실행할 수 있지만 처리시간이 크게 증가할 수 있습니다. 음원분리를 자주 한다면 지원되는 GPU 환경이 훨씬 효율적입니다.
AMD Radeon이나 Intel Arc 그래픽카드도 사용할 수 있나요?
공식 UVR Release 페이지에서는 AMD Radeon과 Intel Arc 사용자를 위한 DirectML 지원 버전을 별도로 안내하고 있습니다. 설치 전 공식 Release 페이지에서 현재 배포 버전을 확인하는 것이 좋습니다.
UVR은 무료인가요?
Ultimate Vocal Remover GUI는 무료 오픈소스 프로젝트로 제공되고 있습니다. 공식 홈페이지와 GitHub를 통해 프로그램 및 프로젝트 정보를 확인할 수 있습니다.
작곡가도 UVR을 사용할 만한가요?
보컬 제거뿐 아니라 Demucs 계열의 여러 Stem 분리를 이용하면 Vocals·Drums·Bass·Other 등을 따로 들어볼 수 있어 편곡 구조나 악기 밸런스를 분석할 때 활용할 수 있습니다.
분리된 파일은 WAV와 MP3 중 무엇이 좋나요?
분리 후 추가 편집을 한다면 WAV를 추천합니다. 최종 감상이나 용량 절약이 중요하다면 모든 편집이 끝난 뒤 MP3로 변환하는 편이 좋습니다.
음악에서 목소리 제거하는 방법 요약
- Ultimate Vocal Remover 공식 홈페이지 또는 GitHub에서 설치
- 사용 권한이 있는 WAV·FLAC·MP3 음원 준비
- Select Input에서 음원 선택
- Select Output에서 저장폴더 지정
- MDX-Net 등 보컬 분리용 Process Method 선택
- 필요한 AI 모델이 없다면 Download Center에서 다운로드
- 지원 GPU가 있다면 GPU Conversion 활성화
- 목소리 제거가 목적이면 Instrumental 결과 선택
- Start Processing 실행
- 보컬이 많이 남으면 다른 모델 또는 Ensemble 비교
- 추가 편집이 필요하면 WAV로 저장
유튜브나 인스타그램에서 우연히 발견한 음악처럼 “배경음악은 마음에 드는데 사람 목소리 때문에 활용하기 어려운 상황”이라면 AI 음원분리는 생각보다 꽤 실용적인 해결책입니다.
특히 UVR은 단순히 보컬을 삭제하는 데 그치지 않고 음악을 여러 Stem으로 나눠볼 수 있어 영상편집뿐 아니라 작곡·편곡을 공부할 때도 활용 범위가 넓습니다.
다만 좋은 결과를 얻으려고 처음부터 모든 고급 설정을 바꿀 필요는 없습니다.
기본 모델로 분리 → 결과 청취 → 다른 모델 한두 개 비교 → 필요한 부분만 후처리 정도면 대부분의 작업에서는 충분합니다.