AI 자동 자막
영상 속 말소리를 AI가 받아써서, 말한 시간에 맞춰 자막을 넣습니다. Gemini 또는 OpenAI를 고릅니다.
이 문서의 순서
30초 요약
- 툴바 자동 자막 (Ctrl+Shift+T) → 자막 만들기.
- 단어마다 시간을 받아서 말하는 순간에 맞춰 자막이 들어갑니다.
- 진행률은 아래 상태바에 나옵니다. 긴 영상은 10분씩 나눠 처리합니다.
움직이는 그림#따라 하기
- 툴바 자동 자막 을 누르면 왼쪽 자막 탭이 열립니다.
- 대상:
타임라인 전체 소리또는선택한 클립의 원래 소리. - 엔진 · 언어(기본 한국어)를 고릅니다.
- 자막 만들기를 누르고 상태바를 봅니다:
소리 추출 중→받아쓰는 중→받아쓰기 완료. 자막트랙에 자막이 들어가고자막 N개를 넣었습니다.알림이 뜹니다.
#실제로 해 본 결과
위 그림은 실제 OpenAI(whisper-1)로 만든 결과를 고치지 않고 그대로 보여 줍니다. 약 16초짜리 내레이션(말소리 약 11초, 네 문장)이 자막 4개로 들어갔고, 누른 뒤 들어가기까지 두 번 시험해 2.3초 · 4.0초 걸렸습니다.
16초 내레이션 → 자막 (실제 측정, OpenAI whisper-1)
고유명사는 고쳐 주세요
위 시험에서는 "밥따뚜"가 **"바바타"**로, "보스전"이 **"부산"**으로 받아써졌습니다(시험용 내레이션이 Windows 기계 음성이라 더 틀리기 쉬웠습니다). 이름 · 게임 용어는 틀리기 쉽습니다. 자막 목록에서 바로 고치거나, OpenAI 엔진의 단어 힌트에 밥따뚜, Fungeon 처럼 미리 적어 두세요.
#대상 두 가지
| 대상 | 받아쓰는 소리 | 구간 |
|---|---|---|
| 타임라인 전체 소리 | 볼륨 · 음소거 · 덕킹까지 반영한 최종 소리 | 영상 전체 |
| 선택한 클립의 원래 소리 (N개) | 고른 클립만, 볼륨 · 음소거를 무시한 원래 소리 | 고른 클립들의 처음 ~ 끝 |
소리가 있는 클립을 고른 채로 자막 탭을 열면 자동으로 두 번째가 골라집니다.
#엔진
| Gemini (기본) | OpenAI | |
|---|---|---|
| 모델 | gemini-3.5-transcribe |
whisper-1 |
| 단어 단위 시간 | ||
| 단어 힌트 칸 | — | (앞 200자) |
| 필요한 키 | Gemini 키 (AI 음성과 같은 키) | OpenAI 키 |
참고
고른 엔진의 키가 없고 다른 엔진의 키가 있으면 있는 쪽으로 자동으로 바꿔서 진행합니다. 둘 다 없으면 환경 설정 창이 열립니다. → API 키 넣기
언어: 한국어(기본) · 영어 · 일본어 · 중국어 · 자동 감지
#자막이 나뉘는 규칙
단어를 이어 붙이다가 아래 중 하나가 되면 새 자막을 시작합니다.
| 조건 | 기본값 | 바꾸는 곳 |
|---|---|---|
| 글자 수가 한 줄 글자 × 최대 줄을 넘음 | 22자 × 2줄 = 44자 | 자막 탭 한 줄 글자 (6최대 줄 (1 |
| 자막 하나가 너무 길어짐 | 6초 | 환경 설정 자막 최대 길이 (1~15초) |
| 말이 끊김 | 0.7초 넘게 조용 | 고정 |
문장이 끝남 (. ! ? …) |
한 줄의 40% 이상 쌓였을 때 | 고정 |
자막 하나의 한계 (기본값 = 100)
- 0.8초보다 짧은 자막은 0.8초로 늘립니다(다음 자막과 겹치지 않게).
- 긴 자막은 가운데에 가까운 띄어쓰기에서 두 줄로 나눕니다.
#오류가 나면
| 문구 | 해결 |
|---|---|
자막을 만들 소리가 없습니다. |
구간이 0.5초보다 짧음 |
소리가 있는 클립을 선택해 주세요. |
선택한 클립 대상인데 소리 있는 클립을 안 고름 |
알아들을 수 있는 말소리를 찾지 못했습니다. |
말소리가 없거나 너무 작음 |
API 키가 없습니다. … |
API 키 넣기 |