밥따뚜 스튜디오도움말
v0.1.1

AI 자동 자막

영상 속 말소리를 AI가 받아써서, 말한 시간에 맞춰 자막을 넣습니다. Gemini 또는 OpenAI를 고릅니다.

그림·영상 1 차트 2 2분 v0.1.1 기준
이 문서의 순서
30초 요약
  • 툴바 자동 자막 (Ctrl+Shift+T) → 자막 만들기.
  • 단어마다 시간을 받아서 말하는 순간에 맞춰 자막이 들어갑니다.
  • 진행률은 아래 상태바에 나옵니다. 긴 영상은 10분씩 나눠 처리합니다.
자동 자막 만들기움직이는 그림
엔진을 고르고 자막 만들기 → 말한 시간에 맞춰 자막이 들어갑니다

#따라 하기

  1. 툴바 자동 자막 을 누르면 왼쪽 자막 탭이 열립니다.
  2. 대상: 타임라인 전체 소리 또는 선택한 클립의 원래 소리.
  3. 엔진 · 언어(기본 한국어)를 고릅니다.
  4. 자막 만들기를 누르고 상태바를 봅니다: 소리 추출 중 → 받아쓰는 중 → 받아쓰기 완료.
  5. 자막 트랙에 자막이 들어가고 자막 N개를 넣었습니다. 알림이 뜹니다.

#실제로 해 본 결과

위 그림은 실제 OpenAI(whisper-1)로 만든 결과를 고치지 않고 그대로 보여 줍니다. 약 16초짜리 내레이션(말소리 약 11초, 네 문장)이 자막 4개로 들어갔고, 누른 뒤 들어가기까지 두 번 시험해 2.3초 · 4.0초 걸렸습니다.

16초 내레이션 → 자막 (실제 측정, OpenAI whisper-1)
인터넷 속도와 서버 상태에 따라 달라집니다. 10분이 넘는 소리는 10분씩 나눠 차례로 처리합니다.
고유명사는 고쳐 주세요

위 시험에서는 "밥따뚜"가 **"바바타"**로, "보스전"이 **"부산"**으로 받아써졌습니다(시험용 내레이션이 Windows 기계 음성이라 더 틀리기 쉬웠습니다). 이름 · 게임 용어는 틀리기 쉽습니다. 자막 목록에서 바로 고치거나, OpenAI 엔진의 단어 힌트에 밥따뚜, Fungeon 처럼 미리 적어 두세요.

#대상 두 가지

대상 받아쓰는 소리 구간
타임라인 전체 소리 볼륨 · 음소거 · 덕킹까지 반영한 최종 소리 영상 전체
선택한 클립의 원래 소리 (N개) 고른 클립만, 볼륨 · 음소거를 무시한 원래 소리 고른 클립들의 처음 ~ 끝

소리가 있는 클립을 고른 채로 자막 탭을 열면 자동으로 두 번째가 골라집니다.

#엔진

Gemini (기본) OpenAI
모델 gemini-3.5-transcribe whisper-1
단어 단위 시간
단어 힌트 칸 — (앞 200자)
필요한 키 Gemini 키 (AI 음성과 같은 키) OpenAI 키
참고

고른 엔진의 키가 없고 다른 엔진의 키가 있으면 있는 쪽으로 자동으로 바꿔서 진행합니다. 둘 다 없으면 환경 설정 창이 열립니다. → API 키 넣기

언어: 한국어(기본) · 영어 · 일본어 · 중국어 · 자동 감지

#자막이 나뉘는 규칙

단어를 이어 붙이다가 아래 중 하나가 되면 새 자막을 시작합니다.

조건 기본값 바꾸는 곳
글자 수가 한 줄 글자 × 최대 줄을 넘음 22자 × 2줄 = 44자 자막 탭 한 줄 글자 (660) · 최대 줄 (14)
자막 하나가 너무 길어짐 6초 환경 설정 자막 최대 길이 (1~15초)
말이 끊김 0.7초 넘게 조용 고정
문장이 끝남 (. ! ? …) 한 줄의 40% 이상 쌓였을 때 고정
자막 하나의 한계 (기본값 = 100)
세로 쇼츠는 화면 폭이 좁아서 한 줄 글자와 줄 수를 줄이면 읽기 편합니다.
  • 0.8초보다 짧은 자막은 0.8초로 늘립니다(다음 자막과 겹치지 않게).
  • 긴 자막은 가운데에 가까운 띄어쓰기에서 두 줄로 나눕니다.

#오류가 나면

문구 해결
자막을 만들 소리가 없습니다. 구간이 0.5초보다 짧음
소리가 있는 클립을 선택해 주세요. 선택한 클립 대상인데 소리 있는 클립을 안 고름
알아들을 수 있는 말소리를 찾지 못했습니다. 말소리가 없거나 너무 작음
API 키가 없습니다. … API 키 넣기

보기 설정

테마
글자 크기
움직이는 그림

데이터를 아끼려면 "눌러서 재생"을 고르세요. 움직이는 그림은 누를 때만 받습니다.