브랜드명과 제품 사진 한 장만 있으면, 기획부터 촬영·나레이션·배경음악까지 AI가 알아서 만들어주는 숏폼 광고 영상 제작 에이전트.
한 줄의 말이 완성된 영상이 되기까지, 각 단계마다 실제로 어떤 API와 모델이 움직이는지, 왜 그렇게 설계했는지 그대로 공개합니다.
Cloudflare Functions는 요청 하나에 시간·메모리 제한이 있어서, 몇 분씩 걸리는 영상 합성은 별도로 떼어 AWS Lambda에 ffmpeg 레이어를 얹어 처리합니다. 화면은 그 동안 가볍게 계속 응답합니다.
위의 사용 방법 6단계가 실제로는 이런 모델·API 호출로 이루어져 있습니다.
사람과 나누는 대화 전체(브랜드·제품·되묻기·스토리보드 3안 생성)를 담당합니다. 도구 호출 대신 답변 끝에 :::부탁 같은 텍스트 규약으로 다음 동작을 지시합니다.
인물 얼굴과 컷 그림을 만듭니다. 참조 이미지 여러 장을 같이 넣어 "이 얼굴·이 제품·이 장소 그대로"를 유지하며 새 장면을 그리는 참조-편집 방식입니다.
같은 장소·인물이라도 컷마다 다른 각도가 필요합니다. 장소·인물·샷·카메라·구도 다섯 축에 가중치를 다르게 줘서, 매번 다른 각도의 참조 후보를 자동으로 골라줍니다.
채택된 컷 그림 한 장을 첫 화면 삼아, 그 안에서 자연스럽게 움직이는 몇 초짜리 영상으로 바꿉니다. 한 번에 한 컷씩만 접수합니다.
컷 길이에 맞춰 자동으로 채워진 대사를 성우 목소리로 읽습니다. 준성·민욱·이현 세 목소리 중 고를 수 있고, 피치·속도·감정 세기도 조절됩니다.
갖고 있는 곡을 올리거나, 분위기·장르를 적은 주문서로 새로 만듭니다. 올린 곡은 시작 지점을 고를 수 있습니다.
컷 영상들 + 나레이션 + 음악을 순서대로 이어붙이고 자막·음량을 맞춰 한 편의 mp4로 렌더링합니다.
대화·컷·선택 내역이 매 단계 서버에 저장됩니다. 새로고침하거나 브라우저를 닫아도 "지난 기획"에서 그대로 이어집니다.
| 영역 | 사용 기술 | 역할 |
|---|---|---|
| 프론트엔드 + API | Cloudflare Pages + Functions | 대화창, 결과물 화면, 가벼운 API 전부 |
| 대화 · 기획 | DeepSeek Chat | 대화 엔진, 스토리보드·기획서 생성 |
| 이미지 생성 | OpenAI gpt-image | 인물·컷·제품 이미지, 참조 기반 편집 |
| 영상 생성 | Kling 3.0 Pro (fal.ai) | 컷 이미지 → 짧은 영상 클립 |
| 나레이션 | Typecast | 한국어 TTS, 감정·속도 조절 |
| 최종 조립 | AWS Lambda + ffmpeg | 컷·나레이션·음악 합성, mp4 렌더링 |
브랜드명과 제품명을 입력합니다.
실물 제품이면 제품 사진을 올립니다.
AI가 만든 광고 기획(컷 구성)을 확인하고, 필요하면 수정을 요청합니다.
인물·장소·컷 그림을 순서대로 확인하며 마음에 드는 것을 고릅니다.
나레이션 목소리와 배경음악을 선택합니다.
완성된 영상을 확인하고 다운로드합니다.
완성본 예시 — 오설록 세작 티백 광고, 15초AI 나레이션·배경음악까지 자동으로 붙은 실제 결과물
위 영상에서 그대로 뽑은 장면들입니다 — 같은 인물·같은 제품이 컷마다 흔들리지 않는 걸 시간 순서대로 보여줍니다.





