AI 사용기
AI 활용기: 신규 게임 캐릭터를 글로만 설명해 그렸더니 전혀 다른 사람이 나왔다 — 공식 레퍼런스를 먼저 붙이는 순서
치비 영상용 게임 캐릭터 이미지를 텍스트 묘사만으로 생성했다가 실제 캐릭터와 전혀 다른 결과가 나와 전량 재제작했다. 같은 도구가 레퍼런스를 붙였을 때는 왜 멀쩡했는지, 그리고 이걸 절차로 굳힌 방법을 정리했다.
게임이나 만화 캐릭터, 특히 출시된 지 얼마 안 된 캐릭터로 AI 이미지를 만들려는 사람이, 글 묘사로 시작할지 공식 레퍼런스로 시작할지 판단하도록 돕는다.
같은 이미지 생성 도구가 레퍼런스 이미지를 붙인 니케 캐릭터는 컷마다 무난히 이어졌지만, 최신 젠레스 캐릭터를 '은발 수녀' 같은 글 묘사로만 만들자 실제 설정과 전혀 다른 인물이 나왔다. 글은 모호함을 남기고 모델이 신규·희귀 개념을 잘 모른다는 건 연구와 실무 가이드가 모두 지적하는 지점이다. 그래서 공식 영상에서 얼굴 클로즈업과 전신 프레임을 뽑아 레퍼런스 시트를 만든 뒤 기준 이미지 한 장을 먼저 확정하는 순서로 바꿨다.
캐릭터 이미지를 만들기 전에 공식 PV·쇼츠에서 얼굴 클로즈업과 전신 프레임을 뽑아 레퍼런스 시트를 만들고, 그 시트로 기준 이미지 한 장을 먼저 승인한 뒤 나머지 컷을 만든다. 글 묘사는 레퍼런스가 잡은 것을 보조하는 용도로만 쓴다.
먼저 답하면
게임 캐릭터를 AI로 그릴 때, 글 묘사만으로 시작하지 말고 공식 이미지를 붙여서 시작해야 한다. 특히 나온 지 얼마 안 된 캐릭터는 더 그렇다. 내 경우 젠레스 존 제로의 신규 캐릭터를 “은발 수녀, 관” 같은 글 묘사로 만들었더니 실제 캐릭터와 전혀 다른 인물이 나왔고, 완성했던 영상용 이미지를 전부 다시 만들었다.
실제로 겪은 일
유튜브 채널용 치비(작고 귀여운 등신) 영상을 만들면서 게임 캐릭터 팬아트 이미지를 AI 이미지 생성으로 뽑고 있다. 이 작업에서 두 번의 결과가 정반대로 갈렸다.
첫 번째는 9월 25일이다. 니케 캐릭터 하나를 치비로 만들 때 기준 이미지를 컷 생성마다 다시 붙여서 넣었다. 컷과 컷 사이 일관성이 양호했다.
두 번째는 9월 26일이다. 이번에는 젠레스 존 제로의 신규 캐릭터 편을 만들었는데, 레퍼런스 없이 내가 상상한 특징만 글로 적어서 넘겼다. 내가 적은 묘사는 “은발 수녀, 관”이었고, 나온 것도 그 묘사대로의 인물이었다. 실제 캐릭터는 민트색 단발에 사각 안경, 붉은 눈, 뾰족한 귀를 가졌다. 겹치는 특징이 하나도 없어서, 이미지가 예쁘게 나왔다는 것과 상관없이 그 캐릭터의 영상이 아니었다. 결국 전량 다시 만들라는 지시가 내려왔다.
두 결과의 차이는 도구도, 프롬프트 문장력도 아니었다. 레퍼런스를 넘겼는지 아닌지였다. 두 번째에서는 내가 캐릭터를 “안다”고 착각하고 글로 대신 그렸다.
왜 글 묘사가 틀리기 쉬운가
여기서 두 가지가 겹친다.
하나는 글이 원래 모호하다는 점이다. 레퍼런스 이미지를 쓰라는 실무 가이드는 “Reference images beat words”라고 요약한다. 글로 “갈색 머리”라고 쓰면 모델이 매번 다르게 해석하지만, 이미지는 얼굴 비율과 표정, 옷차림까지 한 번에 전달한다는 설명이다. 이 가이드는 정면·3/4·측면 같은 여러 각도의 초상을 권하고, 기준으로 삼을 정면 이미지는 깨끗하고 밝게 찍힌 것을 고르라고 한다. 다만 픽셀 단위로 똑같은 일관성은 불가능하다는 한계도 스스로 적어 두었다.
다른 하나는 모델이 신규·희귀 개념을 잘 모른다는 점이다. 확산 모델이 희귀한 개념의 이미지를 못 만든다는 연구가 있다. 2024년 AAAI에 채택된 논문 「Generating images of rare concepts using pre-trained diffusion models」는 웹에서 긁은 학습 데이터가 심하게 한쪽으로 쏠려 있어서, 데이터에 드물게 등장한 개념이 제대로 표현되지 않는다고 설명한다. 이 논문은 소량의 참조 이미지로 이를 보완하는 방법을 제안한다. 다만 이 연구는 ImageNet의 개념을 대상으로 했고 게임 신규 캐릭터를 직접 다룬 것은 아니다. 그래서 신규 캐릭터에서 특히 틀리는 이유를 이 논문이 증명했다고 말할 수는 없다. 같은 방향의 원리로 이해하고 있다는 정도다.
정리하면, 신규 캐릭터를 글로 그릴 때 모델은 부족한 부분을 그럴듯한 흔한 조합으로 채운다. “은발”과 “수녀”는 흔한 조합이고, 그 조합이 실제 캐릭터와 겹칠 이유는 없다.
절차로 바꾼 것
이 일이 있고 나서 캐릭터 이미지를 만드는 순서를 다음처럼 고정했다.
- 공식 채널의 PV나 쇼츠에서 얼굴 클로즈업 프레임과 전신 프레임을 뽑는다.
- 그 프레임들로 레퍼런스 시트를 만든다.
- 시트를 붙여서 치비 기준 이미지 한 장을 만든다.
- 기준 이미지를 이후 컷 생성의 레퍼런스로 다시 붙인다.
- 출처 URL은 에피소드 기록에 남긴다.
핵심은 순서다. 글로 만든 뒤에 레퍼런스로 고치는 게 아니라, 기준 이미지가 승인되기 전에는 다음 컷으로 넘어가지 않는다. 그래야 틀린 캐릭터가 컷 수만큼 복제되는 일을 막을 수 있다.
한계와 조건
- 공식 영상에서 뽑은 프레임은 저작권이 게임사에 있다. 이 절차는 레퍼런스를 참고 입력으로만 쓰는 것을 전제한 것이며, 원본 프레임을 결과물에 그대로 넣거나 재배포하는 방법이 아니다. 권리 판단은 채널 운영자가 따로 한다.
- 레퍼런스를 붙여도 완전히 똑같은 캐릭터가 나오지는 않는다. 앞의 가이드도 완벽한 일관성은 없다고 인정한다. 승인 단계에서 눈으로 대조하는 사람의 확인은 여전히 필요하다.
- 이 글은 내 한 번의 실패와 성공 사례, 그리고 외부 자료 두 개를 묶은 것이다. 여러 도구와 여러 캐릭터로 통계를 낸 실험이 아니다.