가능합니다. 원하는 사람의 목소리 샘플을 AI에 학습시킨 뒤, 새로운 텍스트를 입력하면 그 목소리와 비슷한 음색으로 읽게 만드는 기술이 이미 상용화되어 있습니다. 이 기능을 보통 ‘AI 음성 클로닝’, ‘보이스 클로닝’, ‘Voice Cloning’이라고 부릅니다.

캡컷처럼 미리 준비된 AI 목소리 중 하나를 고르는 방식과는 다릅니다. 본인이나 사용 허락을 받은 사람의 실제 음성 샘플을 등록하고, 그 목소리를 바탕으로 개인용 AI 음성을 만드는 방식입니다.

원하는 기능은 보이스 클로닝입니다

일반적인 AI TTS는 남성, 여성, 차분한 목소리처럼 서비스가 미리 만들어 놓은 목소리를 선택합니다. 반면 보이스 클로닝은 실제 사람의 목소리 샘플을 분석해서 음색, 말하는 속도, 억양, 발음 특성 등을 비슷하게 재현합니다.

예를 들어 직접 촬영한 영상 속 본인 목소리를 이용할 수 있습니다. 영상에서 비교적 깨끗하게 말하는 부분을 음성 파일로 준비한 뒤 보이스 클로닝 서비스에 등록합니다. 이후 ‘오늘 날씨가 정말 좋습니다’라는 새로운 문장을 입력하면 직접 다시 녹음하지 않아도 비슷한 목소리로 새로운 음성이 만들어지는 방식입니다.

ElevenLabs를 이용하는 방법

가장 대표적인 서비스 중 하나가 ElevenLabs입니다. Instant Voice Cloning 기능을 이용하면 짧은 음성 샘플을 등록해서 목소리를 만들고, 이후 Text to Speech에서 새로운 문장을 입력해 해당 목소리로 음성을 생성할 수 있습니다.

공식 안내에서는 Instant Voice Cloning을 사용할 때 최소 1분 정도의 음성을 준비하고, 약 1~2분 정도의 깨끗한 녹음이 권장됩니다. 지나치게 긴 파일보다는 잡음, 음악, 울림이 적고 한 사람의 목소리가 일정하게 들어 있는 파일이 중요합니다.

사용 과정은 어렵지 않습니다. 원하는 영상에서 목소리가 잘 들리는 부분을 준비한 다음 ElevenLabs의 Voices에서 Voice Clone을 생성합니다. 음성 파일을 올리고 목소리를 만든 뒤 Text to Speech에서 원하는 글을 입력하면 새로운 음성을 생성할 수 있습니다.

다만 ElevenLabs에서는 음성을 복제할 권리와 동의가 있다는 것을 확인해야 합니다. 유명인이나 공인 등 사칭 위험이 높은 목소리에는 별도의 제한도 적용됩니다.

Typecast도 가능합니다

한국어 사용이 중요하다면 Typecast도 살펴볼 만합니다. Typecast 역시 기존 AI 캐릭터 음성만 제공하는 것이 아니라 자신이 사용할 권리가 있는 목소리를 등록해서 Custom Voice를 만드는 보이스 클로닝 기능을 제공합니다.

현재 Typecast는 빠르게 목소리를 만드는 Instant Voice Cloning과 더 많은 음성으로 정밀하게 만드는 Professional Voice Cloning 방식을 안내하고 있습니다.

공식 안내 기준으로 Instant 방식은 5초 이상의 짧은 샘플부터 사용할 수 있으며, Professional 방식은 5분 이상의 음성 샘플을 이용합니다. 짧은 샘플은 목소리의 대략적인 음색과 말투를 빠르게 만드는 데 적합하고, 긴 샘플을 이용하는 방식은 발음과 억양, 감정 등을 더 정밀하게 재현하는 데 목적이 있습니다.

Typecast 역시 본인 목소리 또는 법적으로 사용할 권리가 있는 목소리만 복제할 수 있다고 안내하고 있습니다.

Edimakor에서도 할 수 있습니다

영상 편집까지 한 프로그램에서 처리하고 싶다면 HitPaw Edimakor의 Voice Clone 기능도 있습니다.

Edimakor에서는 Text to Speech의 My Voice 기능에서 직접 목소리를 녹음하거나 음성 파일을 가져와 목소리를 만들 수 있습니다. 이후 원하는 텍스트를 입력해서 복제된 목소리로 음성을 생성하는 방식입니다.

한국어를 포함한 여러 언어의 음성 생성도 지원하므로, 영상에서 음성을 준비하고 AI 음성 생성과 영상 편집을 한 프로그램에서 처리하려는 경우 편리할 수 있습니다.

Resemble AI도 있습니다

Resemble AI도 보이스 클로닝을 지원합니다. 빠르게 음색을 만드는 Rapid Clone과 더 많은 음성 데이터를 이용하는 Professional Clone 방식이 있습니다.

공식 안내상 Rapid Clone은 약 10초의 음성으로 만들 수 있고 Professional Clone은 10~25분 이상의 음성을 이용합니다. Professional Clone은 음성 제공자의 확인 가능한 명시적 동의를 요구합니다.

다만 Resemble AI는 일반적인 영상 편집보다는 API 연동이나 서비스 개발까지 생각하는 경우 활용도가 높은 편입니다. 단순히 영상 한두 개에 AI 목소리를 넣는 것이 목적이라면 ElevenLabs, Typecast, Edimakor 같은 방식이 이해하기 쉽습니다.

영상에서 바로 목소리를 가져올 수 있을까요

가능하지만 영상의 상태가 중요합니다. AI가 분석하는 것은 영상 자체가 아니라 영상에 들어 있는 사람의 음성입니다.

따라서 영상에서 원하는 사람만 말하는 부분을 골라 음성으로 준비하는 것이 좋습니다. 배경음악, 다른 사람의 목소리, 게임 소리, 자동차 소리 등이 크게 섞여 있으면 복제된 목소리의 품질이 떨어질 수 있습니다.

예를 들어 인터뷰 영상에서 한 사람이 혼자 1분 정도 말하고 배경음악이 거의 없다면 좋은 샘플이 될 수 있습니다. 반대로 영화처럼 배경음악과 효과음, 여러 배우의 대사가 계속 섞여 있다면 그대로 사용했을 때 정확도가 떨어질 가능성이 큽니다.

목소리가 자연스럽지 않은 이유

음성 클로닝에서는 샘플의 길이보다 녹음 품질이 상당히 중요합니다. 휴대전화로 가까운 거리에서 녹음한 깨끗한 목소리가 멀리서 녹음되어 소리가 울리는 긴 영상보다 더 좋은 결과를 낼 수도 있습니다.

말하는 사람의 목소리 크기와 말투도 일정한 것이 좋습니다. 한 파일 안에서 속삭이다가 갑자기 소리를 지르거나, 여러 감정과 말투가 심하게 섞이면 AI가 어떤 말투를 기준으로 해야 하는지 판단하기 어려워집니다.

AI는 목소리의 음색만 복사하는 것이 아니라 샘플에 들어 있는 억양, 말하는 속도, 발음 습관 등의 특징도 참고합니다. 차분한 목소리를 원한다면 차분하게 이야기하는 부분을 샘플로 사용하는 것이 좋습니다.

영상의 소리를 먼저 분리하는 방법

영상 파일이 MP4라면 먼저 오디오만 분리해서 사용하는 방법이 편합니다. MP4에서 MP3, WAV, M4A 등의 오디오를 추출한 뒤 필요한 대화 부분만 남기면 됩니다.

단순히 음성을 추출하는 것뿐 아니라 앞뒤의 다른 사람 대사나 음악이 들어 있는 부분도 가능한 한 제거하는 것이 좋습니다. 원본 영상에 배경음악이 계속 깔려 있다면 음성 분리 기능을 이용해 사람의 목소리를 최대한 깨끗하게 만든 뒤 사용하는 방법도 있습니다.

짧은 음성만 있어도 될까요

서비스에 따라 가능합니다. Typecast는 Instant Voice Cloning에서 5초 이상의 샘플을 안내하고 있고, Resemble AI의 Rapid Clone도 약 10초 수준의 음성을 사용할 수 있습니다.

하지만 ‘기능이 작동하는 최소 음성 길이’와 ‘실제로 자연스럽게 만드는 데 좋은 음성 길이’는 다릅니다. 아주 짧은 샘플은 목소리가 비슷하게 나오더라도 억양이나 말투가 부자연스러울 수 있습니다.

ElevenLabs의 경우 Instant Voice Cloning에서 약 1~2분의 깨끗한 음성을 권장합니다. 좋은 결과가 필요하다면 몇 초짜리 한 문장보다 일정한 환경에서 말하는 깨끗한 음성을 충분히 준비하는 편이 좋습니다.

한국어도 가능한가요

가능합니다. ElevenLabs, Typecast, Edimakor 등은 한국어 음성 생성을 지원합니다.

다만 목소리 샘플이 영어인데 한국어 문장을 읽게 하는 것처럼 학습한 언어와 생성하는 언어가 달라지면 원래 사람과 발음이 똑같지는 않을 수 있습니다. 음색은 비슷해도 한국어 억양이나 발음이 AI 모델의 특성을 따라갈 수 있습니다.

한국어 결과가 중요하다면 가능하면 해당 사람이 실제로 한국어를 말하는 깨끗한 샘플을 사용하는 것이 좋습니다.

본인 목소리라면 가장 간단합니다

자신의 목소리를 이용하려는 경우라면 직접 조용한 장소에서 새로운 샘플을 녹음하는 것이 가장 좋습니다. 굳이 기존 영상에서 목소리를 떼어낼 필요가 없습니다.

스마트폰 녹음기로 일정한 크기로 1~2분 정도 자연스럽게 문장을 읽은 뒤 해당 파일을 등록하면 영상에서 음성을 추출하는 것보다 배경음과 잡음이 적어서 좋은 결과를 만들기 쉽습니다.

다른 사람의 목소리는 주의해야 합니다

인터넷에 영상이 공개되어 있다고 해서 그 사람의 목소리를 자유롭게 AI로 복제할 수 있다는 뜻은 아닙니다. 타인의 목소리를 사용하려면 해당 음성을 복제하고 생성 콘텐츠에 사용할 수 있는 권리나 동의를 확인하는 것이 중요합니다.

특히 연예인, 유튜버, 방송인, 친구, 직장 동료 등의 목소리를 허락 없이 복제해 실제本人이 하지 않은 말을 한 것처럼 공개하는 것은 문제가 될 수 있습니다.

사기, 사칭, 허위정보 제작 등에 이용해서는 안 됩니다. 단순한 개인 실험이라도 서비스를 이용할 때 해당 서비스의 Voice Cloning 정책과 이용약관을 확인하는 것이 안전합니다.

기존 답변에서 잘못된 부분

‘특정 영상의 목소리를 텍스트 음성으로 만드는 기능은 아직 제공되지 않는다’는 설명은 현재 기준으로 맞지 않습니다.

현재는 실제 사람의 음성 샘플로 새로운 TTS 목소리를 만드는 보이스 클로닝 기능이 여러 상용 서비스에서 제공되고 있습니다. ElevenLabs, Typecast, Edimakor, Resemble AI 등이 대표적인 예입니다.

따라서 원하는 기능이 일반적인 AI TTS인지 검색하기보다 ‘Voice Cloning’ 또는 ‘AI 보이스 클로닝’ 기능이 있는 서비스를 찾는 것이 정확합니다.

가장 쉬운 선택 방법

웹에서 간단하게 목소리를 만들어 보고 싶다면 ElevenLabs나 Typecast가 편합니다. 영상 편집과 음성 복제를 한 프로그램에서 하고 싶다면 Edimakor 같은 영상 편집 프로그램을 사용할 수 있습니다. API를 이용해 앱이나 서비스를 개발하려는 목적이라면 Resemble AI 같은 개발자용 서비스도 고려할 수 있습니다.

어떤 서비스를 사용하든 가장 중요한 것은 깨끗한 음성 샘플입니다. 본인 또는 사용 허락을 받은 사람의 목소리를 준비하고, 배경음악과 다른 사람 목소리가 없는 부분을 골라 등록한 다음 텍스트를 입력해 음성을 생성하면 됩니다.

FAQ

캡컷에 있는 기본 AI 목소리를 사용하는 것과는 다릅니다. 보이스 클로닝은 사용자가 준비한 실제 음성 샘플을 기반으로 별도의 목소리를 만든다는 차이가 있습니다.

영상 전체를 올릴 필요도 없습니다. 원하는 사람의 목소리가 잘 들리는 부분만 오디오로 준비하면 충분합니다. 서비스에 따라 직접 음성 파일을 업로드하거나 화면에서 바로 녹음할 수도 있습니다.

완전히 똑같은 목소리가 만들어지는 것도 아닙니다. 짧은 샘플을 이용한 즉석 복제는 비슷한 음색을 만드는 정도일 수 있고, 더 긴 고품질 음성을 이용해 별도 모델을 만드는 방식이 발음과 감정 표현까지 더 정밀하게 재현하는 데 유리합니다.

결론적으로 원하는 영상의 목소리를 이용해 새로운 텍스트를 읽게 만드는 것은 현재 가능합니다. 찾고 있는 기능의 정확한 이름은 ‘AI Voice Cloning’이며, 본인 목소리 또는 정당한 사용 권한과 동의를 확보한 목소리로 이용하는 것이 중요합니다.