FREE W01 HIGGSFIELD

유행하는 바이럴 영상에
내 얼굴 넣기

춤을 만든 게 아닙니다. 춤을 그대로 가져온 겁니다. 안무·카메라 무빙·컷 타이밍은 원본 그대로 두고, 사람·옷·배경만 통째로 갈아끼웁니다.

위 = 원본 / 아래 = 결과물

원본 영상 파일은 맨 아래에서 받으실 수 있습니다.

00

한 줄로 말하면

유행하는 영상을 하나 구합니다.
그 영상의 춤·카메라·컷은 그대로 두고
사람·옷·배경만 AI가 새로 그립니다.
→ 내가 춤을 추는 게 아니라, 남의 춤 위에 내 얼굴을 덮는 겁니다.

인형에 옷을 갈아입히는 것과 같습니다. 뼈대(움직임)는 원본 그대로, 겉모습만 바뀝니다. 그래서 촬영도, 안무도, 사람도 필요 없습니다.

필요한 건 딱 세 가지

A

원본 영상

유행 중인 그 클립. 이 페이지 맨 아래에서 받으시면 됩니다.

B

얼굴 사진 1장

주인공으로 넣을 얼굴. 정면 클로즈업이면 됩니다.

C

장면 사진 1장

주인공 + 주변 사람들 + 배경이 한 장에 들어간 그림. AI로 만듭니다.

이 셋을 Higgsfield에 넣으면 끝입니다. 아래는 그 과정을 하나씩 풀어 쓴 것뿐이에요.

읽다가 막히면, AI한테 물어보세요

아래 버튼을 누르면 이 페이지 전체 + 질문 문장이 한 번에 복사됩니다. ChatGPT나 클로드에 그대로 붙여넣으세요. 처음부터 쉬운 말로 다시 설명해주고, 막히는 부분은 계속 물어보실 수 있습니다.

함께 복사되는 질문
아래는 AI 영상 제작 워크플로우 설명서입니다.
저는 영상 편집도 AI 툴도 거의 처음 써봅니다.

① 이 작업이 전체적으로 뭘 하는 건지 먼저 한 문단으로 알려주세요.
② 그다음 각 단계를 하나씩, 중학생도 알아들을 수 있게 풀어주세요.
③ 전문 용어가 나오면 그때그때 쉬운 말로 바꿔 설명해주세요.
④ 마지막에 제가 오늘 당장 해야 할 일 3개만 순서대로 정리해주세요.

--- 설명서 ---
01

전체 흐름

01

원본 영상 확보

맨 아래에서 받은 원본 영상을 29초로 자릅니다. 길수록 비용이 정비례로 올라갑니다. 오디오를 지우지 마세요.

02

얼굴 이미지 1장 (@Image1)

주인공 클로즈업. 학습된 얼굴 모델(Soul)로 뽑으면 일관성이 가장 좋습니다. 원본 첫 컷의 앵글·조명에 맞춥니다.

03

장면 이미지 1장 (@Image2)

주인공 + 주변 인물 + 배경이 한 프레임에. 여기가 전체를 좌우합니다. 배경은 반드시 원본 영상과 같은 종류로.

04

모션 트랜스퍼

Higgsfield → Motion Transfer. 원본 영상 + 이미지 2장을 넣습니다. 720p 기준 초당 6.5 크레딧.

05

소리 다시 입히기

출력물은 무음으로 나옵니다. 원본 오디오를 ffmpeg로 붙입니다. 추가 비용 0원.

06

인스타 규격 출력

H.264 High + AAC + faststart. 29초 기준 약 9MB로 떨어집니다.

02

프롬프트 전문

그대로 복사해서 쓰시면 됩니다. 영문 그대로 넣어야 결과가 안정적입니다.

@Image1 — 주인공 얼굴

soul_2 · 3:4 · 2K
Ultra photorealistic close-up beauty portrait. Long glossy dark hair,
sleek and slightly windswept. Sharp confident expression, direct eye
contact with camera. Defined deep red lip, clean editorial Korean
makeup, luminous skin with real visible texture and pores. Neutral
dark charcoal studio background. Soft key light from front-left with
subtle rim light on the jaw. Shot on 85mm, shallow depth of field,
high detail. No mask, no hat, no accessories, no text, no logo.

@Image2 — 장면 (제일 중요)

아래는 제가 실제로 쓴 프롬프트입니다. 배경을 오피스 계단으로 잡은 게 이 편의 실수예요. 아래 「깨진 지점」에서 이유를 적었습니다. 따라 하실 땐 배경만 원본에 맞게 바꾸세요.

nano_banana_pro · 3:4
High-fashion cinematic music-video still, photorealistic editorial.
<<<ELEMENT_ID>>> stands alone at the centre of a dim modern office
lobby with a wide dark staircase behind her, lit so she is the
brightest figure in frame. She wears a sharp tailored WHITE mini
dress with a structured neckline, white heels, one hand on her hip,
strong confident stance, long glossy dark hair, deep red lip. Behind
and around her on the staircase stand eight young Korean office
workers, all dressed entirely in BLACK: a glossy black cat mask with
pointed ears covering the upper half of the face, a tailored black
blazer, a short black skirt, black tights and black heels. Identical
masks, different hair lengths. Strong graphic contrast between the
single white figure and the black-clad crowd. Moody cinematic
lighting, deep blacks, hard shadows, shallow depth of field, Korean
fashion film look. No text, no logos.
<<<ELEMENT_ID>>> 자리에 본인 레퍼런스 ID를 넣으세요

Higgsfield에서 인물 이미지를 Element로 등록하면 ID가 나옵니다. 프롬프트 안에 꺾쇠 세 개로 감싸 넣으면 자동으로 주입됩니다.

Genjutsu 최종 생성

hf_mult_motion_control · 720p
Use @Video1 ONLY for choreography, performer positions, camera
movement, source shot cuts and timing. Rebuild the complete visible
cast from the image references throughout the entire supplied
29-second clip, from its very first frame through its last frame.

@Image1 defines the central lead woman's recognizable face, long
glossy dark hair and deep red lip. Her identity must stay locked and
identical in every frame.

@Image2 defines her fitted WHITE mini dress and white heels, and
defines the surrounding ensemble: young Korean office workers all
dressed entirely in BLACK - a glossy black cat mask with pointed ears
covering the upper half of the face, a tailored black blazer, a short
black skirt, black tights and black heels. @Image2 is also the single
visual reference for the scene's lighting, colour grading, deep blacks
and setting.

Maintain this same cast and photographic look for the whole clip.
Changing camera distance must not change their identities or redesign
the setting. Every ensemble member keeps the same mask and outfit even
when they leave frame and return. Strong graphic contrast between the
single white lead and the black-clad crowd. Photorealistic, no text,
no logos.
마지막 세 문장이 핵심입니다

① 카메라 거리가 바뀌어도 정체성·배경이 바뀌면 안 된다 ② 프레임 밖으로 나갔다 돌아와도 같은 가면·같은 옷 ③ 흰 1명 대 검정 다수의 대비를 유지한다. 이게 빠지면 중간에 사람이 바뀝니다.

이미지 넣는 순서 = @Image 번호

얼굴을 먼저, 장면을 나중에 넣습니다. 순서가 바뀌면 프롬프트의 @Image1/@Image2가 반대로 걸립니다.

03

명령어 전부

ffmpeg만 있으면 됩니다. 무료입니다.

원본 자르기

cut.sh
ffmpeg -y -ss 0 -t 29 -i 원본.mp4 \
  -c:v libx264 -preset veryfast -crf 20 원본_29s.mp4
-an 을 붙이지 마세요

오디오를 지우는 옵션입니다. 저는 이걸 붙였다가 결과물이 무음으로 나왔습니다. 원본 소리를 그대로 살려야 합니다.

소리 다시 입히기

mux.sh
ffmpeg -y -i 결과_무음.mp4 -ss 0 -t 29 -i 원본.mp4 \
  -map 0:v:0 -map 1:a:0 \
  -c:v libx264 -profile:v high -level 4.0 -pix_fmt yuv420p \
  -crf 20 -preset medium \
  -c:a aac -ar 44100 -ac 2 -b:a 192k \
  -movflags +faststart -shortest 완성.mp4

비교 영상 만들기

compare.sh
ffmpeg -y -ss 0 -t 29 -i 원본.mp4 -i 결과_무음.mp4 \
  -filter_complex "[0:v]scale=720:-2,setsar=1[a];\
[1:v]scale=720:-2,setsar=1[b];[a][b]vstack=inputs=2[v]" \
  -map "[v]" -map 0:a:0 \
  -c:v libx264 -pix_fmt yuv420p -crf 23 -preset medium \
  -c:a aac -b:a 128k -movflags +faststart 비교.mp4
04

제가 깨진 지점 3가지

성공담은 이미 많습니다. 여기가 시간을 아껴드리는 부분입니다.

증상원인해결
소리가 안 남 원본을 자를 때 -an으로 오디오를 지웠다. 출력물은 원래 무음이라 붙일 소리가 없어진다. 원본에서 오디오만 다시 먹싱. 추가 비용 0원.
중간부터 장면이 달라 보임 @Image2 배경이 원본 영상의 배경과 다른 종류였다. 원본은 학교 운동장인데 오피스 계단을 넣었다. @Image2 배경을 원본과 같은 종류로 다시 만든다.
얼굴이 중간에 바뀜 @Image1은 학습 모델, @Image2는 사진 1장으로 따로 만들어 화장·이목구비가 어긋났다. @Image2를 만들 때 @Image1을 레퍼런스로 같이 넣는다.
모션은 100% 따라옵니다. 무너지는 건 항상 배경입니다.

원본과 결과물을 10컷씩 뽑아 대조해봤습니다. 안무·카메라·컷 타이밍은 10컷 전부 일치했습니다. 어긋난 건 배경 하나뿐이었습니다. 10초짜리로 테스트했을 땐 클로즈업 구간이라 배경이 안 보여서 이 문제가 드러나지 않았습니다.

05

비용

길이크레딧비고
5초32.5테스트용
10초65구도 확인용으로 충분
29초188.5릴스 한 편 분량
30초195720p 기준 초당 6.5
먼저 10초로 확인하세요

바로 풀 길이로 돌리면 구도가 틀렸을 때 그대로 날아갑니다. 10초로 방향을 확인하고 나서 길이를 늘리는 게 안전합니다.

06

파일 받아가세요

제가 쓴 원본 바이럴 영상입니다. 제가 만든 게 아니라 지금 돌고 있는 그 클립 자체예요. 이걸 넣어야 같은 안무·같은 카메라·같은 컷 타이밍이 나옵니다. 없으면 시작을 못 합니다.

⬇ SOURCE — 이것부터 받으세요 원본 바이럴 영상 MP4 · 1280×720 · 37.5초 · 11.6MB · 소리 포함
코덱만 바꿔서 올렸습니다

원본은 HEVC 29MB라 안 열리는 브라우저·편집기가 많습니다. 해상도·길이·프레임·소리는 전부 그대로 두고 H.264로만 다시 인코딩했습니다. 내용은 완전히 동일합니다.

아래 둘은 결과 확인용입니다. 작업에는 필요 없습니다.

이 편은 여기까지입니다

다음 편은 제품 사진 한 장으로 UGC 광고 영상 만드는 법입니다. 만들면 여기 올립니다.

인스타그램에서 보기 →