영상 내레이션도, 팟캐스트 인트로도 — 무료 음성 복제 하나로 다 해결한 이야기
지난주 수요일 새벽 1시. 3분짜리 제품 소개 영상을 앞에 두고 멍하니 앉아 있었다. 내레이션만 벌써 7번 고쳤고, 내가 직접 녹음한 버전은 목이 감기 걸린 지 3일 된 사람처럼 갈라져 있었다. 친구가 전화로 물었다. "너 TTS 연구한다며? 왜 아직도 그러고 앉아 있는데?"
맞다. 왜 아직도 혼자 버티고 있었을까.
그날 밤 두 가지를 전부 다시 만들었다. 유튜브 쇼츠 내레이션, 그리고 3개월째 미루고 미루던 팟캐스트 인트로. 둘 다 '목소리 넣기'지만, 어려운 포인트가 완전히 딴판이더라.
쇼츠 내레이션: 빠르고, 안정적이고, 몇 번이고 고칠 수 있어야 한다
쇼츠 내레이션의 적은 딱 하나. '수정'이다. 클라이언트는 오늘은 톤이 너무 딱딱하다 내일은 템포가 느리다, 모레엔 아예 스크립트를 갈아엎는다. 매번 다시 녹음하면 목소리부터 항복한다.
이럴 때 텍스트 음성 변환 무료 서비스가 빛을 낸다. 스크립트에서 바뀐 부분만 고치고 다시 생성 — 30초면 새 오디오가 나온다. 속도랑 호흡도 미세 조정 가능하니, 마이크 앞에서 NG를 수십 번 찍는 것보다 몇 배는 편하다.
내 방식은 이렇다. 예전에 제일 잘 나왔던 깨끗한 녹음(조용한 방, 마이크에서 주먹 하나 거리, 2분 분량 낭독)을 무료 음성 복제 페이지에 올려서 내 목소리 복제를 만든다. 그 목소리로 내레이션을 뽑으면 톤이 항상 일정해서, 시청자들은 합성음인지 전혀 눈치 못 챈다.
하나 조심할 점. 대본에 'ㅋㅋㅋ'나 '아하' 같은 감탄사를 넣지 마라. 합성됐을 때 진짜 이상하게 나온다. 리액션이나 웃음 포인트는 화면과 BGM이 담당하고, 텍스트는 정보 전달만 하면 된다.
팟캐스트 인트로: 사람 냄새가 관건, 이건 완전히 다른 문제
팟캐스트는 얘기가 다르다. 청취자는 이어폰을 꽂고 있고, 첫 15초 안에 갈지 남을지 결정한다. 합성 냄새가 조금이라도 나면 바로 이탈한다. "이거 AI가 읽는 거 아니야?" 하고.
그래서 내 방식은 이렇게 나눈다. 인트로의 고정 파트 — 프로그램 이름, 자기소개, 오늘의 주제 — 만 복제한 목소리로 읽는다. 실제 대화는 당연히 내가 직접 녹음한다. 오프닝은 음질 깔끔하고 리듬 안정적, 본문은 진짜 숨소리와 말더듬이 살아있는 구성. 말더듬은 오히려 친근감이 되기도 하니까.
학습용 소스의 품질이 팟캐스트 쪽에서는 훨씬 더 중요하다. 첫 시도에 잡음 섞인 녹음을 썼더니 치찰음이 떠서 소름이 돋았다. 소스 갈아서 다시 올리니 바로 정상. 가입 없이 음성 합성이 되는 점이 여기서 진짜 편하다. 실패 비용이 0원이니까 마음 편히 갈아끼우면 된다.
직접 비교해본 사람은 안다. 쇼츠는 효율과 교체 가능성이 핵심이고, 팟캐스트는 신뢰감이 핵심이다. 같은 음성 복제 온라인 도구라도 검수 기준이 완전히 다르다.
내가 실제로 돌리는 워크플로우
요즘 매주 이렇게 한다. 참고용으로:
- 스크립트 다 쓰면 일단 한 번 통독하면서 문어체 다 제거 (「~라고 알려져 있다」류는 전부 삭제)
- 내레이션은 통째로 복제 목소리로 생성, 내보내서 타임라인에 맞춰 편집
- 팟캐스트 인트로는 따로 한 버전 생성, 톤 파라미터를 내레이션보다 느리고 부드럽게
- 최종 합성 전에 이어폰으로 처음부터 끝까지 청음 — 폰 스피커론 멀쩡한 게 이어폰 속에서는 잡음이 다 들통난다
덧붙이면, 대량 콘텐츠 만드는 분들이라면 음성 합성 무료 API를 자동화 파이프라인에 붙일 수 있다. 하루에 내레이션 수십 개 뽑아도 부담이 없다. 오디오북 음성 만들기에도 써봤는데, 원고가 길수록 이 방식이 진가를 발휘한다.
FAQ
내 목소리를 복제하면 남들이 합성음인지 알아챌까요?
소스가 깨끗하면 일상적인 콘텐츠에선 거의 못 알아챕니다. 다만 팟캐스트처럼 귀를 대고 듣는 매체는 섞어 쓰는 걸 추천합니다. 고정 파트는 합성, 즉석 파트는 실제 녹음.
유튜브나 쇼츠에 AI 음성 무료로 넣으면 문제되나요?
주요 플랫폼이 AI 더빙 무료 콘텐츠를 일괄 금지하진 않습니다. 중요한 건 콘텐츠 자체의 가치예요. 표기를 하거나 자연스럽게 쓰되, 무지성 양산은 피하세요.
무료 TTS, 언제까지 쓸 수 있나요? 갑자기 유료 전환되면 어떡하죠?
몇 달째 쓰는 중인데 무료 음성 복제 정책은 그대로고, 가입 없이 바로 씁니다. 물론 무료 서비스의 10년 뒤는 아무도 장담 못 하니, 중요한 오디오는 백업해두고 학습에 쓴 원본 녹음도 지우지 마세요.
마무리 대신에
그날 새벽 2시, 내레이션을 다시 생성해서 보냈고 클라이언트는 다음 날 아무 말 없었다. 클라이언트 세계에서 무반응은 거의 만점이다. 미룬 지 3개월짜리 팟캐스트 인트로도 하룻밤에 끝났다.
목소리 작업에 시달리는 중이라면, 오늘 밤 10분만 투자해봐라. 2분짜리 깨끗한 목소리를 녹음해서 VoxClone에서 복제해보는 것. 마음에 안 들면 지우면 된다. 돈 들지 않으니까. 그리고 다국어 음성 합성 무료 기능까지 있으니, 영어 콘텐츠 시작할 때도 같은 목소리로 갈 수 있다 — 이건 진짜 의외로 유용하다.