내 목소리로 TTS 만들기
내 목소리로 새 문장을 읽히려면 본인 녹음과 그 녹음에서 실제로 읽은 말이 필요합니다. 녹음 넣기 → 왼쪽에 녹음한 말 적기 → 오른쪽에 새 문장 적기 순서로 진행하세요. 제가 직접 녹음한 제 목소리입니다에 체크하고 내 목소리로 읽기를 누르면 됩니다. 내가 읽지 않은 문장이 어떻게 들리는지, 완성된 음성을 재생해 들어보세요.
연습 파일
원본은 보관하고 복사본으로 작업하세요. 예제는 보통 다운로드 폴더에 저장됩니다.
내 목소리 실험실 실행 예제 ZIP 다운로드 ↓화면은 실제 프로그램에서 캡처했습니다. 이미지를 누르면 새 탭에서 원래 크기로 볼 수 있습니다. 넓은 화면은 이미지 안에서 좌우로 밀어 보세요.
각 작업의 첫 화면을 먼저 보여드립니다. 이어지는 상세 절차도 펼쳐서 순서대로 진행하세요.
1. 내 목소리로 첫 문장 읽어보기
내 목소리로 첫 문장 읽어보기
“오늘의 주인공은 바로 저입니다.” 이 문장을 내가 직접 읽지 않았는데 내 목소리로 들린다면? 오늘 만들 결과가 바로 이것입니다.
TTS는 글을 음성으로 읽어주는 기능이에요. 저는 유튜브 영상의 짧은 해설을 만들 때 본인 녹음으로 실제 사용했습니다. 여기서는 같은 Qwen3-TTS Base 방식에 한글 버튼 화면을 붙여 따라 하기 쉽게 준비했습니다. 공식 Qwen 화면과는 다른, 이 글의 실행 예제입니다.
준비물은 PC, 본인 녹음, 새로 읽힐 한 문장입니다. 위의 연습 파일에서 예제 ZIP을 내려받고 처음 한 번만 설치하세요. 설치 방법은 바로 아래에서 펼칠 수 있습니다. 준비가 끝나면 녹음 넣기 → 두 문장 적기 → 읽기 버튼이면 됩니다. 개인 음성은 예제에 포함하지 않았습니다.
확인할 결과실제로 실행한 한글 화면입니다. 왼쪽은 내 녹음, 오른쪽은 새로 읽힐 문장입니다.
처음 한 번만: 설치와 실행 방법 1개 단계
처음 한 번만 설치하기
위 연습 파일에서 own-voice-tts-kit.zip을 내려받으세요. 보통 탐색기의 다운로드에 저장됩니다. ZIP을 오른쪽 클릭해 모두 압축 풀기를 선택하고, 풀린 폴더를 엽니다. ZIP 안에서 바로 실행하지 마세요.
① Python 3.11 준비: 이미 설치했다면 다음으로 넘어갑니다. 없다면 글 끝의 Python 공식 설치 자료에서 Windows 64비트 설치 프로그램을 받아 설치하세요. 설치 항목에 Python Launcher가 포함돼 있어야 합니다.
② 1-install.cmd 더블클릭: 검은 창에서 실행 환경과 모델을 내려받습니다. 처음에는 인터넷이 필요하고 모델만 약 2.5GB라 시간이 걸릴 수 있어요. READY가 나올 때까지 기다리세요. 오류가 나오면 창을 닫기 전에 마지막 오류를 확인합니다. Python을 찾지 못하면 ①을 다시 확인하세요.
③ 2-start.cmd 더블클릭: 브라우저에 내 목소리 실험실이 열립니다. 작업 중에는 함께 열린 검은 창을 닫지 마세요. 다음부터는 ②를 반복하지 않고 ③만 실행합니다. 시작되지 않으면 ②가 끝났는지 확인하고, 이미 열어 둔 실행 창이 있다면 같은 창을 사용하세요.
이 예제는 Windows의 CPU로 동작합니다. GPU 설정이나 별도 학습은 필요 없습니다. 설치 후 합성은 로컬 PC에서 하며 유료 API를 호출하지 않습니다. PC의 전력, 저장 공간은 사용합니다.
사진은 설치 뒤 패키지를 확인한 화면입니다. 그대로 입력하거나 외울 필요는 없어요.
확인할 결과별도 실행 환경에서 설치를 마친 결과입니다. CPU로 실행되며 학습과 음성 업로드는 하지 않습니다.
2. 녹음은 짧고 깨끗하게
스마트폰 녹음 앱으로 10초 안팎의 완결된 문장부터 준비해 보세요. 조용한 방에서 평소 말투로 읽으면 됩니다. 처음부터 성우처럼 말하려고 애쓰지 않아도 괜찮아요.
예문: “안녕하세요. 오늘은 내 목소리로 새로운 문장을 읽어보겠습니다. 짧은 문장부터 천천히 확인해 볼게요.”
음악이나 다른 사람 목소리는 빼 주세요. 이 예제는 1~30초 녹음을 받습니다. 너무 길면 녹음 앱의 편집 기능으로 문장이 끊기지 않는 짧은 구간을 사본으로 저장하세요. 녹음의 길이가 품질을 보장하는 것은 아닙니다.
녹음 앱에서 공유, 내보내기로 M4A 또는 WAV 파일을 PC에 옮깁니다. 원본은 따로 보관하세요.
확인할 결과녹음을 넣을 자리입니다. M4A와 WAV를 받을 수 있습니다.
3. 녹음 파일을 쏙 넣기
① 내 목소리 녹음 넣기의 클릭하여 업로드를 누릅니다. 파일 선택 창에서 방금 PC로 옮긴 녹음을 선택하고 열기를 누르세요. 녹음 파일을 이 칸으로 끌어다 놓아도 됩니다.
파일 이름이 보이면 준비됐습니다. 화면의 reference.wav는 제 예제 이름이에요. 내 파일 이름이 달라도 괜찮습니다.
파일을 읽지 못하면 M4A/WAV인지 확인하고, 녹음 앱에서 다시 내보내세요. 이 화면의 ‘업로드’는 이 PC에서 실행 중인 프로그램에 파일을 넣는 동작입니다. 외부 음성 서비스로 보내는 방식이 아닙니다.
확인할 결과업로드 칸에 실제 선택한 reference.wav 파일 이름이 표시됩니다.
4. 왼쪽에는 ‘녹음한 말’을 적어요
② 녹음에서 실제로 읽은 말에 원음을 듣고 내용을 그대로 적습니다. 이를 전사라고 해요. 어려운 작업처럼 들리지만, 내가 녹음에서 한 말을 받아 적으면 됩니다.
중간에 단어를 바꿔 읽었다면 계획했던 문장 대신 실제로 말한 문장을 쓰세요. 녹음에 없는 설명문이나 인사말을 덧붙이지 않습니다.
여기는 앞으로 읽힐 새 원고를 쓰는 칸이 아닙니다. 왼쪽은 이미 녹음한 말, 오른쪽은 새로 읽힐 말로 기억하면 헷갈리지 않아요. 자동 전사를 썼더라도 소리와 한 번 대조해 주세요.
확인할 결과참조 녹음의 내용을 적는 입력칸입니다. 새 원고를 넣는 오른쪽 칸과 구분하세요.
5. 오른쪽에는 재미있는 한 문장
③ 새로 읽힐 문장에 내 목소리로 듣고 싶은 말을 적습니다. 첫 실험은 짧고 가볍게 해볼까요?
오늘의 주인공은 바로 저입니다.
처음부터 긴 대본을 넣기보다 한 문장으로 시작하세요. 결과가 마음에 들면 “오늘도 수고했어요. 이제 좀 쉬어 볼까요?”처럼 다른 문장으로 바꿔 보면 됩니다.
이 예제는 원고 100자, 생성 음성 10초까지 확인하도록 만들었습니다. Qwen 모델 전체의 최대 길이라는 뜻은 아니에요.
확인할 결과녹음과 다른 새 문장을 입력했습니다. 이 문장을 내 목소리로 읽게 됩니다.
6. 이제 ‘내 목소리로 읽기’
제가 직접 녹음한 제 목소리입니다에 체크하고, 보라색 내 목소리로 읽기를 누릅니다.
프로그램이 내 녹음에서 목소리 특징을 읽고 새 문장을 만듭니다. 목소리 모델을 새로 학습하는 과정은 아닙니다.
체크나 입력이 빠졌다면 진행 상황에 안내가 나옵니다. 녹음 파일 → 녹음한 말 → 새 문장 순서로 빈칸을 확인하세요. 한 번 눌렀다면 결과가 나올 때까지 기다립니다.
확인할 결과본인 녹음 확인에 체크한 뒤 보라색 버튼을 누릅니다.
7. 잠깐만 기다려 주세요
CPU가 문장을 만드는 동안 아래 결과 칸에 처리 중 표시가 나옵니다. 짧은 음성이라도 만드는 데는 더 오래 걸릴 수 있어요. 버튼을 여러 번 누르지 말고 한 번의 결과를 기다리세요.
제 로컬 첫 비교에서는 2~4초짜리 음성을 합성하는 데 약 25~27초가 걸렸습니다. 모델을 여는 시간은 별도이고 PC와 문장에 따라 다릅니다. 기다리는 시간이 음성의 길이와 같지는 않아요.
오류 안내가 나오면 문장을 짧게 바꿔 다시 시도합니다. ‘설치 확인’ 안내가 나오면 처음 설치가 끝났는지 확인하세요.
확인할 결과버튼을 누른 뒤 실제 합성이 진행 중인 화면입니다.
8. 재생! 진짜 내 목소리 같나요?
완성! 안내가 나오면 ④ 완성된 목소리 듣기의 삼각형 재생 버튼을 누르세요. 내가 읽지 않은 문장이 어떻게 들리는지 확인합니다.
처음에는 세 가지만 들어보세요. 내 목소리와 닮았는지, 발음이 맞는지, 말끝이 잘리지 않았는지. 파일이 만들어졌다고 바로 영상에 넣기보다 원음과 번갈아 듣는 게 좋습니다.
제 첫 샘플은 목소리 유사도는 괜찮았지만 말투가 조금 느렸습니다. 아래에서 참조 녹음을 바꿔 비교한 방법도 이어서 볼게요.
확인할 결과완성된 음성을 재생해 실제 재생 시간이 진행되는 것을 확인했습니다.
9. 마음에 들면 내려받기
완성된 음성 칸의 아래쪽 화살표 모양 내려받기 버튼을 누릅니다. 브라우저의 다운로드 목록에서 파일을 확인하고, 보통 탐색기의 다운로드 폴더에 저장된 WAV를 다시 열어보세요. 저장 위치를 바꿨다면 선택한 폴더를 확인합니다.
WAV는 음성 파일 형식입니다. 영상 편집기에도 이 파일을 가져오면 됩니다. 브라우저 안에서 재생한 것과 별도로 내려받은 파일도 다시 재생해 저장이 끝났는지 확인하세요.
결과는 실행 예제의 output 폴더에도 작업별 새 폴더로 보관됩니다. 이전 음성을 덮어쓰지 않으니 여러 결과를 비교할 수 있어요.
확인할 결과실제 내려받기 버튼으로 WAV를 저장하고 파일 전체를 다시 읽어 확인했습니다.
10. 이번에는 나에게 한마디
원음과 왼쪽 전사는 그대로 두고 오른쪽 문장만 바꿔 보세요.
오늘도 수고했어요. 이제 좀 쉬어 볼까요?
다시 내 목소리로 읽기를 누르면 됩니다. 매번 새로 녹음하거나 학습할 필요는 없습니다. 다만 이 간단한 예제는 실행할 때마다 참조 목소리의 특징을 다시 계산합니다.
발음이 어색하면 문장을 짧게 나누고, 숫자나 약어는 원하는 소리대로 풀어 적어 보세요. 고유명사와 날짜는 특히 한 번 더 들어보는 편이 좋습니다.
확인할 결과같은 녹음을 두고 새 문장만 바꾼 상태입니다. 버튼을 누르면 별도 결과가 만들어집니다.
11. 말투가 느리다면 이걸 바꿔보세요
조금 더 빠르게, 짧게 쉬며 읽은 본인 녹음을 새로 준비합니다. 그 녹음에 맞춰 왼쪽 전사도 바꾸고, 같은 문장으로 비교하세요. 컴퓨터를 빠르게 만드는 것과 말투를 빠르게 만드는 것은 다른 문제입니다.
실제 제작에서 두 결과의 앞뒤 무음을 같은 기준으로 정리했을 때, 일반 해설은 3.10초 → 2.25초, 긴 해설은 6.18초 → 5.08초로 짧아졌습니다. 반대로 기관명 문장은 2.79초 → 2.92초로 조금 길어졌어요. 참조를 바꿨다고 모든 문장이 똑같이 빨라지는 것은 아닙니다.
목소리를 억지로 배속하거나 말끝을 잘라 맞추기보다 참조 말투 → 원고 길이 → 직접 듣기 순서로 조정해 보세요. 첨부 예제는 음성을 자동으로 자르거나 배속하지 않습니다. 처음 목표는 긴 대본 한 편보다, 마음에 드는 짧은 문장 하나입니다.
확인할 결과보관된 음성을 다시 읽은 실제 비교값입니다. 2번은 일반 해설, 3번은 기관명, 4번은 긴 해설입니다.











