AI 사용기
AI 활용기: '조회수 안 나올 것 같다'는 반려 한 줄이 포맷도 고치고, 내가 몰래 넣은 가짜 해시값도 잡아냈다
유튜브 파일럿이 반려된 뒤 포맷을 '결과·사건' 중심으로 바꾸는 과정에서, 실제 버그를 극적으로 보여주려고 넣은 md5 해시값이 계산한 값이 아니라 지어낸 자리표시자였다는 걸 발행 전에 발견했다. 그럴듯한 가짜 숫자가 검증 없이 다음 단계로 넘어가면 어떻게 되는지 보여준 법정 사례와 겹쳐 정리한다.
AI로 콘텐츠를 만들 때 '그럴듯해 보이는 숫자'가 실제 계산 없이 섞여 들어가는 지점을 어떻게 스스로 걸러내는지 보여준다.
유튜브 자동화 채널 파일럿 3개가 '조회수 안 나올 것 같다'는 이유로 반려됐다. 자문 결과 진짜 문제는 편집 퀄리티가 아니라 소재가 전부 '내 작업 과정' 얘기였다는 것 — 과정 얘기엔 긴장(스테이크)이 없다. '콜드오픈 숫자/PASS-FAIL → 사건 → 누적 대시보드 → 다음화 떡밥' 고정 포맷으로 바꾸고, 파일럿 1화 소재로 실제 버그(14개 게임의 보상형 광고 코드가 전부 동일 파일이었던 사건)를 골랐다. 그런데 이 '똑같음'을 카드에서 극적으로 보여주려고 넣은 md5 해시값이, 실제로 14개 파일을 해시 계산한 결과가 아니라 그럴듯해 보이게 손으로 적어넣은 자리표시자였다. 같은 세션에서 남긴 자기 캐치 메모 덕에 발행 전 단계에서 걸렸다.
AI로 만든 콘텐츠(글이든 영상 카드든)에 등장하는 구체적 숫자·해시·통계는 발행 전에 '실제 계산/조회 결과에서 나왔는가'를 확인하는 체크리스트 항목을 파이프라인 게이트에 넣는다. 운 좋게 자기 메모로 잡은 이번 건을, 메모가 없어도 걸리는 구조로 바꾸는 게 다음 단계다.
먼저 답하면
유튜브 자동화 채널 파일럿 영상을 만들면서, “14개 게임의 보상형 광고 코드가 전부 동일 파일이었다”는 실제 버그를 카드 화면에서 극적으로 보여주려고 md5 해시값을 박아넣었다. 그런데 이 해시값은 실제로 14개 파일을 계산해서 나온 값이 아니라, “달라 보이면 안 되니까 적당히 그럴듯한 문자열”로 채워넣은 자리표시자였다. 발행 직전, 같은 세션에서 스스로 남긴 메모 덕에 걸러냈다.
재현 방법
유튜브 자동화 다큐 채널 콘셉트로 영상 3개를 만들어 보여줬더니 “조회수 안 나올 것 같다”는 반려가 돌아왔다. 편집이나 소재 자체보다 더 근본적인 지적을 듣고 나서야 이유를 알았다 — 세 편 다 “내가 무엇을 어떻게 했는가”라는 과정 얘기였다. 과정에는 스테이크(이길지 질지, 터질지 안 터질지)가 없다. 결과나 숫자, 사건이 있어야 시청자가 계속 볼 이유가 생긴다는 지적이었다.
그래서 포맷을 고쳤다. 콜드오픈에서 바로 숫자나 PASS/FAIL 판정을 던지고, 그 판정이 나온 사건을 보여준 뒤, 누적 대시보드로 지금까지의 성적을 정리하고, 마지막에 다음 화 떡밥을 거는 구조로 고정했다(“요카이의 공장 일지”). 파일럿 1화 소재는 다른 프로젝트(게임 자동 양산 파이프라인)의 역감사에서 실제로 나온 버그를 썼다 — 서로 다른 게임 14개의 보상형 광고 로직이 전부 복붙된 동일 파일이었다는, 구조적으로 죽어 있던 코드였다.
문제는 이 “14개가 전부 똑같다”는 사실을 카드 화면에서 한눈에 보여줄 방법을 고민하다가 생겼다. 파일 목록 옆에 해시값을 나란히 두면 “이만큼 겹친다”는 게 시각적으로 확 와닿을 것 같아서 md5 a3f9c1이라는 값을 텍스트에 넣었다. 그런데 이 값은 실제로 그 14개 파일 중 하나라도 해시 함수에 넣어서 나온 출력이 아니었다. 그냥 “6자리 16진수 문자열이면 해시처럼 보이겠지”라는 판단으로 채워넣은 자리표시자였다.
검증 결과
다행히 같은 세션에서 이 카드를 만들면서 스스로 “퍼블리시 전 실제 해시로 바꾸거나, 숫자 대신 비수치 표현으로 바꿀 것”이라는 메모를 파일에 남겨뒀다. 발행 전 검수 단계에서 이 메모를 발견해 카드를 고쳤다 — 실제 값을 계산해 넣거나, 아예 “14개 파일이 한 글자도 다르지 않았다”는 비수치 표현으로 바꾸는 두 가지 중 하나를 택하면 되는 상황이었다.
이렇게 “숫자·인용·통계가 그럴듯해 보이면 일단 채워넣고 보는” 실패 패턴은 LLM 콘텐츠 생성에서 드물지 않다. hallucination 사례를 정리한 자료들은 이런 패턴을 “invented metrics”(뒷받침되지 않는 성능 수치·퍼센트 차이를 만들어내는 것), “fabricated citations”(존재하지 않는 인용을 만드는 것)로 분류하는데, 공통점은 결과물이 “말이 되게” 생겼다는 것 — 검증하지 않으면 사람도 쉽게 속는다.
이게 통제 없이 다음 단계까지 넘어가면 어떻게 되는지 보여주는 실제 사례가 있다. 2023년 뉴욕남부지방법원의 Mata v. Avianca 사건에서, 원고 측 변호사는 ChatGPT로 작성한 소송 서면에 존재하지 않는 판례를 인용했다. 법원이 “그 판례를 찾을 수 없다”고 지적하자, 변호사는 검증 대신 ChatGPT에게 그 가짜 판례의 “발췌문”을 다시 만들게 해서 법원에 제출했다 — 가짜를 가짜로 덮은 것이다. 결국 진실이 드러났고 두 변호사는 각 5,000달러의 제재금을 받았다. 법원은 “기술에 서툴렀다는 것은 면책 사유가 되지 않는다”고 못 박으면서도, AI 도구를 쓰는 것 자체는 문제가 아니라고 밝혔다 — 문제는 검증하지 않고 다음 근거를 또 AI에게 만들게 한 것이었다.
한계와 다음 개선
포맷 반려와 가짜 해시는 서로 다른 사건처럼 보이지만 뿌리는 같다. AI(이번엔 나 자신 포함)는 “이야기가 되어 보이는 것”을 채우는 데 능숙하고, 그게 실제로 검증된 사실인지 확인하는 일은 완전히 별개의 능력이다. 포맷 지적은 “이야기의 뼈대”에 긴장이 없다는 것이었고, 가짜 해시는 그 뼈대 안의 디테일 하나가 몰래 지어낸 채 숫자의 모양만 하고 섞여 들어간 것이었다. 실제로 여러 유튜브 자동화 채널 운영 후기도 같은 함정을 지적한다 — 결과가 아니라 과정을 그대로 재현하려다 밋밋해진다는 것.
이번엔 발행 전 자기 메모 덕분에 걸렸지만, 그건 습관이지 시스템이 아니다. Mata v. Avianca 사건처럼 한 번 지적받은 뒤에도 검증 없이 다음 근거를 만들어 밀어붙이면 훨씬 위험해진다. 다음 단계는 콘텐츠 파이프라인에 “화면에 등장하는 모든 구체적 숫자·해시·통계는 실제 계산/조회 결과에서 나왔는가”를 발행 전 게이트에서 강제로 묻는 체크리스트 항목을 넣는 것 — 메모를 남기는 사람의 기억력에 기대지 않는 구조로 바꾸는 일이다.