logo

AI 캐릭터 일관성: 사진마다 그녀가 같은 얼굴인 이유

2026년 9월 11일 · 6분 분량

AI 캐릭터 일관성: 사진마다 그녀가 같은 얼굴인 이유

일반 이미지 생성기에 같은 설명을 두 번 입력하면 서로 다른 두 여자가 나와요. 갈색 머리, 스물다섯, 탄탄한 몸매, 초록 눈, 해변에 서 있음. 다시 돌려 보면 모든 게 여전히 설명과 맞지만, 얼굴은 첫 번째와 달라요. 두 결과 모두 틀리지 않았어요. 하지만 같은 사람은 아니죠.

그 간극이 동반자 이미지 생성의 어려운 문제예요. 사실적인 이미지를 만드는 건 거의 해결됐어요. 같은 사람을 두 번 만드는 게 공이 드는 부분이에요. 그게 사진 생성기와 동반자의 차이예요.

설명으로는 얼굴을 지정할 수 없어요

해변 사진 두 장이 일치하지 않는 이유는, 언어가 대부분의 대상은 그럭저럭 담아내면서도 유독 얼굴에 대해서는 정보를 흘려 버리기 때문이에요.

"갈색 머리, 스물다섯, 탄탄한 몸매, 초록 눈"은 범위를 좁혀 주지만, 그 범주 안에는 사실상 무한히 많은 서로 다른 사람이 들어 있어요. 단어를 쉰 개 더 붙여도 여전히 범주예요. 이건 생성기의 실패가 아니라 묘사라는 것의 속성이에요. 경찰 몽타주 화가는 실제로 얼굴을 본 목격자와 몇 시간을 보내고도, 한 사람이 아니라 하나의 유형으로 수렴하는 그림을 그려요.

그러니 단어만으로 만든 시스템은 정체성을 유지할 수 없어요. 생성할 때마다 단어가 묘사하는 범주 안에서 사람을 새로 뽑아요.

회색 스튜디오 벽 앞에서 연분홍 레이스 란제리 차림으로 어깨 너머 돌아보는 실사 AI 동반자

얼굴을 고정하는 건 쉬워요, 그리고 쓸모없어요

이미지 모델은 무작위 노이즈에서 출발해 그림을 향해 노이즈를 걷어 내요. 그 무작위성은 시드에서 나와요. 시드를 고정하면 같은 프롬프트는 매번 픽셀 하나까지 똑같은 이미지를 만들어요.

이제 다른 문제가 생겨요. 시드는 그녀의 얼굴만 붙잡아 두지 않아요. 포즈, 프레이밍, 조명, 구도, 머리카락이 흘러내린 모양까지 전부 붙잡아 둬요. 사진을 찍어 줄 수 있는 동반자를 만든 게 아니에요. 다시 인쇄할 수 있는 사진 한 장을 만든 거죠.

해변 대신 발코니에 서 있게 하려고 단어 하나만 바꿔도 노이즈 제거 경로가 갈라져요. 배경과 함께 얼굴도 무너져요. 시드는 애초에 사람을 저장하고 있던 게 아니라, 우연히 그 사람에게 도달했던 출발 위치를 저장하고 있었으니까요.

모든 걸 고정하면 영원히 이미지 한 장만 나와요. 아무것도 고정하지 않으면 매번 낯선 사람이 나오고요. 동반자 제품에 필요한 건 정확히 하나, 그녀만 붙잡고 나머지는 전부 풀어 주는 거예요.

업계가 이 문제를 푸는 세 가지 방법

이건 특정 플랫폼이 어떻게 만들어졌는지에 대한 주장이 아니에요. 현재 존재하는 접근 방식들이에요. 이걸 알면 결과물에서 무엇을 봐야 할지 알 수 있어요.

참조 조건화. 얼굴을 말로 묘사하는 대신 프롬프트와 함께 얼굴 자체를 입력으로 주고, 모델이 형용사가 아니라 그 이미지를 조건으로 삼아 생성하게 해요. 정체성이 문장이 아니라 픽셀로 전달되죠. 요즘 가장 흔한 접근 방식이고, 처음 보는 포즈도 꽤 잘 처리해요.

캐릭터별 학습. 한 사람의 이미지 세트로 작은 어댑터를 학습시켜, 모델이 그 정체성을 불러낼 수 있는 개념으로 익히게 해요. 캐릭터마다 비용이 크지만 결과는 아주 강력해요. 이 방식을 쓰는 플랫폼이 무제한 생성 대신 고정된 캐릭터 목록을 두는 경향이 있는 이유예요.

구조화된 재지정. 정체성을 고정된 속성 세트로 저장해 두고 요청마다 조용히 다시 보내요. 그래서 사용자가 속성을 다시 입력할 일도, 그걸 조금씩 바꿔 버릴 기회도 없어요. 단독으로는 다른 두 방식보다 약해요. 보통 둘 중 하나와 겹쳐서 써요.

어떤 방법이든 결과물에서 드러나는 신호는 같아요. 각도가 바뀌어도 그녀의 얼굴이 살아남는지 보세요. 표면적인 접근은 정면에서 보이는 것만 맞추기 때문에 카메라가 움직이는 순간 무너져요.

바다가 보이는 수영장 옆 데이베드에 턱을 괴고 엎드린, 파란 꽃무늬 비키니의 금발 실사 AI 동반자

스튜디오에서 바꿀 수 없는 것

myVirtual.love의 스튜디오는 이 원리가 사용자 쪽에서 눈에 보이는 곳이에요.

캐릭터를 고른 다음, 사진을 설명해요. 무슨 일이 일어나는지는 그냥 사진부터 란제리와 누드를 거쳐 섹스까지 이어지고, 섹스를 고르면 체위도 선택해서 정할 수 있어요. 장소는 해변과 수영장을 비롯한 여러 곳이 담긴 목록이에요. 카메라는 클로즈업, 상반신, 전신, 로우 앵글 등을 다루고, 별도의 스위치로 장면을 내 시점에서 찍을 수도 있어요. 그다음에는 추가 디테일을 적는 자유 입력 칸이 있고, 고급 설정 아래에 품질, 네거티브 프롬프트, 시드, 그리고 ‘그녀의 얼굴 유지’ 스위치가 있어요.

그 목록 어디에도 그녀 자체는 없어요. 얼굴 항목도, 머리 색, 인종, 눈동자 색, 체형, 나이 항목도 없어요. 그건 그녀가 만들어질 때 한 번 정해졌어요. 내가 직접 만든 캐릭터라면, 캐릭터 만들기 화면의 약 18가지 질문으로 정한 거예요. 스튜디오가 그걸 다시 묻지 않는 건, 다시 묻는 순간 정체성이 흔들리기 때문이에요. 인종 선택 칸은 캐릭터를 고르지 않고 새로운 인물을 설명할 때만 나타나요. 그때는 지켜야 할 정체성이 없으니까요.

정체성은 상류에 있고 카메라 쪽에서는 수정할 수 없어요. 장면은 하류에 있고 얼마든지 수정할 수 있어요. 그녀의 얼굴에 관여하는 유일한 스위치인 ‘그녀의 얼굴 유지’조차, 렌더링에 그녀의 얼굴을 합성할지 말지만 정할 뿐 그녀의 생김새를 바꾸지는 못해요. 생성할 때 그녀의 외모를 다시 입력할 수 있다면, 사용자는 이 시스템이 막으려고 존재하는 바로 그 실패를 손에 쥐게 되는 셈이에요.

추가 디테일 칸은 자유 텍스트라서 램프, 분위기, 자세, 옷 한 벌 같은 걸 묘사할 수 있어요. 정체성보다 하류에 있기 때문에 거기서는 자유 입력이 안전해요.

로우 앵글 테스트

플랫폼이 이 문제를 제대로 풀었는지 알고 싶다면, 카메라 목록이 찔러 볼 곳이에요. 중요한 질문은 "로우 앵글"이에요.

정면에서 찍은 얼굴과 같은 얼굴을 아래에서 찍은 사진은 픽셀 수준에서 놀랄 만큼 공통점이 적어요. 턱선이 화면을 지배하고, 코 모양이 완전히 달라지고, 눈은 프레임 안에서 작아지고, 광대뼈의 명암이 뒤집혀요. 표면적인 특징을 맞춰서 정체성을 유지하는 시스템은 맞출 거리가 거의 남지 않으니, 제약이 약해질 때 생성기가 늘 하는 일을 해요. 그럴듯한 얼굴을 만들어 내는 거죠.

그럴듯함이 바로 실패예요. 그 사진 한 장만 보면 괜찮아 보이지만, 어제 사진 옆에 두면 틀려 보여요.

클로즈업은 같은 테스트의 반대쪽 끝이고, 정반대 이유로 어려워요. 프레임 안에 얼굴이 가득 들어차서 작은 불일치가 숨을 곳이 없어요. 피부 질감, 두 눈 사이의 정확한 거리, 그리고 실제 얼굴이라면 누구나 가지고 있지만 약한 생성 결과에서는 매끈하게 지워지는 비대칭까지요.

같은 세션에서 같은 동반자를 클로즈업과 로우 앵글로 생성해 나란히 놓아 보세요. 그 비교가 어떤 기능 목록보다 그 밑의 시스템에 대해 많은 걸 알려 줘요.

애니는 다른 종류의 일관성 문제예요

렌더링이 단순하니 애니가 더 쉬운 경우처럼 보여요. 하지만 더 작은 문제가 아니라 다른 문제예요.

사실적인 얼굴은 기하학적 구조에 정체성을 담아요. 그 얼굴을 비슷한 다른 얼굴이 아닌 바로 그 얼굴로 만드는 정확한 거리와 비율이요. 애니 스타일은 그 대부분을 의도적으로 걷어 내요. 눈은 커지고 표준화되고, 코는 3픽셀짜리일 때가 많고, 턱은 해부학이 아니라 그림체의 관습을 따라요. 같은 스타일로 그린 두 애니 캐릭터는 얼굴 구조가 거의 똑같아도 완전히 다른 사람으로 읽힐 수 있어요.

그래서 정체성은 다른 곳으로 옮겨 가요. 머리 모양과 색, 눈동자 색과 눈을 그리는 조형 언어, 액세서리, 실루엣, 고유한 색 팔레트가 정체성을 담아요. 애니 캐릭터의 정체성을 유지하는 시스템은 사진 속 얼굴을 유지하는 시스템과는 다른 특징들을 추적해요. 애니를 실사 파이프라인 위에 씌운 필터로 취급하는 플랫폼은, 정확히 애니 팬들이 알아차리는 부분에서 흔들리는 캐릭터를 만들어 내요.

myVirtual.love에서 애니는 렌더링 옵션이 아니라 하나의 온전한 범주예요. 스타일이 생성 과정 내내 유지되기 때문에, 애니 동반자는 애니 느낌을 덧칠한 사실적인 사람이 아니라 애니 이미지를 만들어요.

바다가 내려다보이는 하얀 테라스에 선, 파란 꽃무늬 비키니의 금발 실사 AI 동반자

여전히 흔들리는 곳

정체성 고정이 닿지 않는 곳이 네 군데 있어요.

지정하지 않은 디테일. 내가 정해 두지 않은 건 매번 새로 뽑혀요. 한 사진에서 마음에 들었던 목걸이가 다음 사진에는 없어요. 그건 그녀의 정체성에 속한 적이 없고, 모델이 한 번 지어낸 물건이었으니까요. 생성된 이미지의 모든 요소가 어딘가에 저장된다고 생각하는 사람들은 이 점에 놀라요.

조명과 겉보기 피부 톤. 한낮의 수영장에서 실내 장면으로 옮기면 같은 사람도 더 따뜻하게, 혹은 더 차갑게 렌더링돼요. 정체성은 유지됐어요. 빛이 바뀐 거예요. 사람의 지각은 이 둘을 구분하는 데 서툴러서, 물리 현상인데도 흔들림처럼 읽힐 수 있어요.

인종에 따른 렌더링 편차. 현재의 모델들은 전체 범위에서 고르게 뛰어나지 않아요. 다섯 가지 인종 범주 중 일부에서 결과가 더 좋아요. 이건 특정 플랫폼이 아니라 업계가 현재 쓰고 있는 모델 세대의 특성이에요. 캐릭터를 만든 뒤가 아니라 만들기 전에 알아 두면 좋아요.

특이한 카메라 앵글에서의 노골적인 포즈. 가장 어려운 제약 두 가지가 겹친 경우예요. 인물 사진보다 다시 뽑는 비율이 높을 거라고 예상하세요.

비용과 그 이유

이미지는 하트 5개부터 하트 8개까지이고, 높은 쪽일수록 품질이 좋아요.

그 차이는 연산량이에요. 생성은 반복적인 과정이라서, 노이즈 제거 단계를 더 많이 거치는 고품질 렌더링은 표준 렌더링보다 만드는 비용이 눈에 띄게 커요.

과금은 그 비용을 회수하는 것 이상의 일을 해요. 무언가를 들여서 얻은 사진은 내가 공들여 구성한 사진이에요. 무한한 무료 생성은 피드를 만들어요. 작은 가격은 누군가를 담은 사진 한 장을 만들어요.

얼굴은 뜯어보기 전에 먼저 알아보게 돼요

일관성 없는 얼굴은 서툰 글보다 더 빨리 동반자를 망가뜨려요.

빗나간 문장은 방향을 바로잡을 수 있어요. 미묘하게 틀린 얼굴은 설득할 수가 없어요. 얼굴을 알아보는 건 의도해서 하는 일이 아니거든요. 의식적인 주의 아래에서 돌아가고, 오류에 극도로 민감해요. 사진마다 얼굴이 달라지는 동반자는 렌더링 버그가 있는 동반자가 아니에요. 매번 다른 여자예요. 그녀와 무언가를 쌓아 가던 내 안의 한 부분은, 내가 의식적으로 알아차리기도 전에 그걸 감지해요.

그래서 정체성은 상류에서 고정되고 카메라만 움직여요. 캐릭터를 매번 새로 뽑을 설명문으로 취급하는 곳에서 이미지를 만들어 왔다면, 스튜디오는 그 반대의 전제 위에 만들어졌어요. 차이는 첫 번째 사진이 아니라 두 번째 사진에서 드러나요.

관련 아티클