AI 영상 프롬프트 작성법: 정말 효과 있는 공식 (예시 포함)
AI 영상 프롬프트는 모델에게 무엇을 생성할지 알려주는 글입니다. 구조가 맞으면 Veo 3.1 Fast 같은 모델도 한 문장으로 바로 쓸 수 있는 클립을 만들어냅니다. 여기서 공식과 용어, 바로 복사해 쓸 수 있는 네 가지 예시를 소개합니다.

작성자 Vincent Park
게시일

AI 영상 프롬프트는 피사체, 행동, 카메라, 조명, 길이를 적어 텍스트-투-비디오 또는 이미지-투-비디오 모델에게 정확히 무엇을 생성할지 알려주는 지시문입니다. 공식을 제대로 지키면 Veo 3.1 Fast나 Kling 3 Pro 같은 모델은 한 문장만으로 첫 시도에 바로 쓸 수 있는 클립을 만들어냅니다. 반대로 모호하게 쓰면 모델이 추측할 수밖에 없고, 아무도 쓸 수 없는 결과에 생성 횟수만 낭비하게 됩니다. 이 가이드에서는 효과 있는 프롬프트의 구조, 샷을 실제로 바꾸는 카메라·조명 용어, 그리고 VIBE의 네 가지 모델에 바로 쓸 수 있는 예시를 다룹니다.
한 문장으로
AI 영상 프롬프트는 화면에 누가(무엇이) 나오는지, 무엇을 하는지, 카메라가 어떻게 움직이는지, 장면이 어떻게 조명되는지를 적은 구조화된 텍스트 지시문으로, 영상 생성 모델이 한 번에 일관되고 쓸 수 있는 클립을 만들 수 있도록 작성됩니다.
AI 영상 프롬프트란?
글로 쓴 프롬프트는 텍스트-투-비디오 또는 이미지-투-비디오 모델이 당신에게 주는 유일한 조종 장치입니다. 이미지 프롬프트와 달리 AI 영상 프롬프트는 시간에 따른 변화 — 무엇이 움직이는지, 카메라가 어떻게 움직이는지, 샷이 얼마나 지속되는지 — 를 설명해야 하며, 한 프레임이 어떻게 보이는지만으로는 부족합니다. 이미지-투-비디오 프롬프트는 더 짧아도 됩니다. 사진이 이미 피사체와 배경을 고정하므로, 프롬프트는 추가하고 싶은 행동과 카메라 움직임만 설명하면 됩니다. VIBE의 프리미엄 모델(Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro)과 무료 모델(Seedance Pro Fast, Wan 2.6, PixVerse)은 모두 같은 기본 구조를 읽지만 가중치는 다릅니다 — 어떤 모델은 카메라 표현에 더 의존하고, 어떤 모델은 주로 행동 동사에서 움직임을 추론합니다. 모델을 고르는 방법은 AI 영상 생성 앱 완벽 가이드에서 다루며, 이 가이드는 모델을 고른 뒤 무엇을 입력할지 다룹니다.

훌륭한 AI 영상 프롬프트의 구조
영상 모델과의 접촉에서 살아남는 프롬프트는 모두 대략 이 순서로 같은 다섯 부분으로 나뉩니다. 하나라도 빠뜨리면 모델이 스스로 그 빈칸을 채우는데, 보통은 평범한 내용으로 채웁니다.
- 피사체 — 화면에 누가 또는 무엇이 있는지, 캐스팅 디렉터처럼 묘사합니다: 나이, 옷차림, 표정, 하나의 특징적인 디테일.
- 행동 — 샷마다 명확한 동사구 하나. '카메라를 향해 걸어오다 돌아서며 미소 짓는다'는 통하지만 '멋진 일들을 잔뜩 한다'는 통하지 않습니다.
- 카메라 — 샷의 종류와 움직임: 넓은 익스트림 롱샷, 미디엄 클로즈업, 느린 돌리인, 핸드헬드 트래킹 샷.
- 조명과 색 — 빛의 질(부드러운 창문 빛, 강한 한낮 햇빛, 네온사인)과 두세 가지 색상 기준점(앰버, 청록, 따뜻한 갈색).
- 길이와 스타일 — 클립이 몇 초인지, 그리고 시각적 톤: 시네마틱, 다큐멘터리, 애니메, 제품 사진.
“넓은 익스트림 롱샷, 눈높이: 노란 레인코트를 입은 여성이 해질녘 비에 젖은 도심 횡단보도를 빠르게 건너고, 웅덩이에 네온사인이 비친다. 그녀가 고개를 들어 미소 짓는다. 부드러운 파랑과 앰버 조명, 8초, 시네마틱.”
샷을 바꾸는 카메라·조명 용어
실패하는 프롬프트 대부분은 아이디어의 문제가 아니라 어휘의 문제입니다 — 콘셉트는 괜찮았지만, 그것을 표현한 단어가 너무 모호해 반영되지 않은 것입니다. 다음은 실제로 효과를 내는 용어들입니다:
- 넓은 익스트림 롱샷 — 더 가까이 자르기 전에 장면을 설정하며, 우연이 아닌 의도된 프레이밍으로 읽힙니다.
- 미디엄 클로즈업, 살짝 뒤쪽 각도 — 정면 응시 없이 인물을 자연스럽게 소개하는 방법입니다.
- 느린 돌리인 / 푸시인 — 피사체의 움직임 없이도 긴장감을 쌓습니다.
- 핸드헬드 트래킹 샷 — 다큐멘터리나 UGC 스타일로 읽히는 작은 인간적인 흔들림을 더합니다.
- 골든아워 림라이트 — 피사체 주위의 따뜻한 테두리와 더 어두운 배경. 거의 모든 모델에서 고급스러워 보입니다.
- 따뜻한 램프 보조광이 있는 부드러운 창문 빛, 복도에서 들어오는 차가운 림라이트 — 하나가 아닌 두 개의 광원을 겹치는 것이 밋밋한 클립과 잘 조명된 클립을 가릅니다.

“카운터 뒤에서 우유를 스티밍하는 바리스타를 향한 느린 돌리인, 따뜻한 램프 보조광, 그녀 뒤 거리 창문에서 들어오는 차가운 파란 빛, 증기가 빛을 머금는다. 그녀가 고개를 들어 카메라를 향해 살짝 미소 짓는다. 12초, 핸드헬드의 미세한 움직임.”
AI 영상 제작 도구는 프롬프트를 어떻게 클립으로 바꿀까?
2026년 9월 기준, Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro는 물론 오픈소스인 Wan, Seedance 계열까지 주요 소비자용 영상 모델은 모두 수백만 개의 영상-캡션 쌍으로 학습된 확산 모델(diffusion model)이며, 이는 2022년 구글 리서치 논문 Video Diffusion Models에서 처음 소개된 기법입니다. 모델은 노이즈에서 출발해 프레임마다 노이즈를 제거하며 텍스트가 설명하는 방향으로 나아가는데, 프롬프트는 모델이 '정답'이 어떤 모습인지 알 수 있는 유일한 신호입니다. 그래서 '놀라운', '고품질' 같은 형용사보다 구체적인 명사와 동사가 더 효과적입니다 — 그런 단어로는 모델이 노이즈를 제거해 나아갈 시각적 단서가 전혀 없기 때문입니다.
- 샷에 맞는 모델을 고르세요: 네이티브 오디오와 카메라 움직임에는 Veo 3.1 Fast와 Kling 3 Pro, 더 긴 시네마틱 테이크에는 Sora 2 Pro, 프리미엄 크레딧을 쓰기 전에 무료로 프롬프트를 테스트하려면 Seedance Pro Fast나 Wan 2.6.
- 위의 피사체–행동–카메라–조명–길이 공식 순서대로 프롬프트를 작성하세요.
- 생성한 뒤 일반 속도와 프레임 단위 모두에서 결과를 확인하세요 — 연속성 문제는 대부분 슬로모션에서만 드러납니다.
- 한 번에 하나의 변수만 바꾸세요. 움직임이 틀렸다면 행동 구절을, 분위기가 틀렸다면 조명을 수정하세요. 한꺼번에 다 바꾸면 무엇이 샷을 고쳤는지 알 수 없게 됩니다.
- 게시하기 전에 플랫폼이 요구하는 화면비로 내보내세요 — 틱톡과 릴스는 9:16, 유튜브는 16:9입니다.
Veo 3.1 Fast vs Kling 3 Pro vs Sora 2 Pro: 모델별로 무엇을 써야 할까
다섯 부분으로 이뤄진 공식은 그대로지만, 모델마다 조금씩 다른 강조점에 더 잘 반응합니다. 각 모델의 강점에 맞춰 썼을 때 VIBE의 영상 모델들이 어떻게 비교되는지 살펴보세요:
| 모델 | 가장 잘 맞는 용도 | VIBE 내 최대 길이 | 네이티브 오디오 | 이미지-투-비디오 |
|---|---|---|---|---|
| Veo 3.1 Fast | 오디오 중심의 짧은 장면 — 대사나 분위기음 | 8초 | 있음 | 없음 |
| Kling 3 Pro | 의도적인 카메라 움직임이 있는 더 긴 테이크 | 15초 | 있음 | 있음 |
| Sora 2 Pro | 더 긴 샷에 걸친 시네마틱한 연속성 | 12초 | 없음 | 없음 |
| Seedance Pro Fast | 업그레이드 전 빠르고 무료로 프롬프트 반복 | 8초 | 없음 | 있음 |
OpenAI 자체의 Sora 2 프롬프트 가이드는 장면 묘사, 카메라 지시, 행동을 한 줄에 몰아넣지 말고 별도의 문장으로 나누라고 권장하며, 구글 딥마인드의 Veo 모델 페이지도 같은 패턴을 보여줍니다 — 구체적이고 평이한 묘사가 두 모델 모두에서 형용사를 잔뜩 쌓는 것보다 낫습니다. 같은 구조는 VIBE 안에서 Kling 3 Pro와 Sora 2 Pro에도 그대로 통합니다.
“정적인 넓은 샷, 골든아워: 텅 빈 도심 옥상에 줄전구가 바람에 부드럽게 흔들리고, 배경의 스카이라인은 살짝 초점이 흐리다. 마지막 2초 동안 종이 랜턴이 프레임을 가로질러 떠간다. 대사 없이 바람 소리만. 12초, 필름 그레인, 따뜻한 앰버 팔레트.”
AI 영상 프롬프트에서 흔한 실수
낭비되는 생성 대부분은 몇 가지 똑같은 실수 때문입니다:
- 구체성 대신 형용사를 쌓기. '아름답고, 놀랍고, 멋진 영상'은 모델에게 노이즈를 제거해 나아갈 아무런 단서도 주지 않습니다 — 형용사마다 눈에 보이는 디테일로 바꾸세요.
- 한 문장에 두 가지 행동. '뛰다가, 뛰어오르고, 손을 흔든다'는 한 테이크에 세 개의 샷을 요구하는 것입니다. 클립이 실제로 담을 시간이 있는 단 하나의 행동을 고르세요.
- 카메라 지시가 없음. 카메라를 지정하지 않으면 대부분의 모델은 기본적으로 정적인 미디엄 샷으로 돌아갑니다 — 때로는 괜찮지만, 그만큼 통제권을 포기하는 셈입니다.
- 길이와 행동의 모순. 8초짜리 샷에는 대화 전체가 들어갈 수 없습니다. 생성하는 초 수에 맞게 행동을 조정하세요.
- 결과가 거의 맞을 때 한꺼번에 다섯 가지를 바꾸기. 그러면 어떤 수정이 샷을 고쳤는지, 혹은 망쳤는지 알 수 없어 반복 개선이 아니라 그냥 추측하게 됩니다.

어떤 모델로 무료로 시작해야 할까?
이 공식을 익히는 데 프리미엄 크레딧은 필요 없습니다. Seedance Pro Fast, Wan 2.6, PixVerse는 VIBE에서 무료이고 로그인도 필요 없으며, 프리미엄 모델과 같은 피사체–행동–카메라–조명 구조를 읽습니다 — 즉 Veo 3.1 Fast나 Kling 3 Pro 크레딧을 쓰기 전에 빠르게 실패하며 표현이 실제로 무엇을 만들어내는지 배우기에 가장 저렴한 곳입니다. 각 모델의 크레딧 비용과 등급은 VIBE의 모델 목록에 나와 있으며, AI 영상 생성 앱 완벽 가이드에서 무료와 유료의 차이를 더 자세히 다룹니다. 다음으로 스타일별 어휘 — 애니메 선화, 셀 셰이딩, 시네마틱 컬러 그레이딩 — 이 궁금하다면 AI 애니메 영상 생성기 가이드를 참고하세요.
“미디엄 샷, 눈높이: 골든 리트리버 강아지가 햇살 가득한 뒷마당 잔디밭에서 굴러가는 테니스공을 쫓아가며 귀를 펄럭인다. 밝은 한낮의 햇빛, 얕은 피사계 심도, 6초.”

자주 묻는 질문
AI 영상 프롬프트에 가장 좋은 공식은 무엇인가요?
피사체, 행동, 카메라, 조명, 길이를 이 순서로 씁니다: 화면에 누가 또는 무엇이 나오는지, 그것이 하는 단 하나의 행동, 카메라가 어떻게 구도를 잡거나 움직이는지, 장면이 어떻게 조명되는지, 그리고 클립이 몇 초여야 하는지를 설명합니다. 이 구조는 VIBE의 프리미엄 모델과 무료 모델 모두에서 통합니다.
AI 영상 프롬프트는 얼마나 길어야 하나요?
보통 한두 문장에서 세 문장이면 충분합니다. 문단 전체를 채우는 프롬프트는 8~15초짜리 클립에서 모델이 실제로 실행할 수 있는 단 하나의 행동과 단 하나의 카메라 움직임을 묻어버리기 쉽습니다 — 각 문장을 장면 전체 묘사가 아니라 눈에 보이는 하나의 지시로 제한하세요.
Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro에 각각 다른 프롬프트가 필요한가요?
같은 피사체-행동-카메라-조명 구조가 세 모델 모두에서 통하지만, 각 모델의 강점에 맞춰 비중을 조절하세요. VIBE에서 네이티브 오디오를 생성하는 Veo 3.1 Fast와 Kling 3 Pro에는 소리 단서를, 오디오를 생성하지 않는 Sora 2 Pro에는 카메라와 조명 디테일을 더 강조하세요.
AI 영상 프롬프트를 무료로 작성할 수 있나요?
네. Seedance Pro Fast, Wan 2.6, PixVerse는 VIBE에서 로그인 없이 무료로 사용할 수 있으며, 프리미엄 모델과 같은 피사체-행동-카메라-조명 공식을 읽습니다. 그래서 Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro에 프리미엄 크레딧을 쓰기 전에 표현의 효과를 먼저 배울 수 있습니다.
왜 제 AI 영상 생성기는 프롬프트의 일부를 무시하나요?
대개 프롬프트가 클립 길이가 허용하는 것보다 더 많은 것을 요구하거나, 한 문장에 두 가지 행동을 쌓았기 때문입니다. 생성하는 초 수에 맞춰 행동을 하나로 좁히고, 어떤 디테일이 자꾸 빠진다면 문장 앞쪽으로 옮겨 더 큰 비중을 주세요.
AI 영상 프롬프트에서 실제로 효과 있는 카메라 용어는 무엇인가요?
구체적인 샷의 종류와 움직임입니다: 넓은 익스트림 롱샷, 미디엄 클로즈업, 느린 돌리인, 핸드헬드 트래킹 샷. '시네마틱한 카메라 워크' 같은 모호한 지시는 모델이 렌더링하길 바라는 실제 샷과 움직임을 구체적으로 이름 붙이는 것보다 훨씬 신뢰도가 낮습니다.
오늘 AI 영상을 만들어 보세요
iOS 및 Android에서 VIBE를 무료로 다운로드하세요. 로그인이 필요 없습니다. 10개 이상의 AI 영상 모델에 접근하고 텍스트 프롬프트나 이미지에서 영상을 생성하세요.
더 읽어보기
모든 글
영상 스타일AI 애니메이션 영상 생성기: 프롬프트로 애니메 스타일 클립 만들기
AI 애니메이션 영상 생성기는 그림을 그리지 않고도 프롬프트나 사진을 움직이는 셀 셰이딩 애니메 클립으로 바꿔줍니다. 어떤 VIBE 모델을 골라야 하는지, 실제로 효과 있는 프롬프트 어휘, 저작권 경계선까지 정리했습니다.
Vincent Park9분 소요
AI 영상 생성AI 영상 생성 앱이란? 2026년 완벽 가이드
AI 영상 생성 앱은 글로 쓴 프롬프트나 사진 한 장을 1분도 안 되는 시간에 완성된 영상 클립으로 바꿔준다. 실제로 어떻게 작동하는지, 어떤 모델이 쓸 만한지, 쓰지도 않을 기능에 돈을 쓰지 않고 제대로 된 앱을 고르는 법까지 살펴본다.
Vincent Park11분 소요