
팔로워 수백 명, 광고 0원으로 3일 만에 약 4만 명이 찾은 테스트. 메시지 4개짜리 프로토타입을 237개의 대화로 제품으로 만들고, 데이터를 보며 수십 번 고친 전체 기록입니다.

3부작 회고다. 1부는 아이디어 하나가 출시되기까지, 2부는 출시 후 36시간 동안 데이터를 보면서 제품을 고친 이야기, 3부는 이게 어떻게 퍼져 나갔는지, 그리고 1.27만 장의 답안지에서 건진 재미있는 것들을 다룬다.
9월 27일 오후 3시, 트윗 하나와 함께 작은 웹페이지를 공개했다. 너는 몇B짜리 모델?
문제는 76개. 당신이 대형 언어 모델이 되어 문제를 푼다. strawberry에 r이 몇 개인지 세고, 9.11과 9.9 중 뭐가 큰지 비교하고, 사용자에게 탈옥당하고, '1달러로 차 사기'나 '상담원 연결' 같은 명장면에서 어떻게 답할지 고른다. 다 풀고 나면 웹페이지가 '모델 발표회'를 열어 준다. 파라미터 수, MoE인지 Dense인지, 벤치마크 표, AI 지능 지수 순위, 알려진 문제점, 그리고 당신이 어떤 AI 인격 유형인지까지.
사흘 동안 순방문자 약 4만 명, 페이지 열람 7.8만 회. 76문제를 끝까지 완주한 사람이 1.27만 명, 자발적인 공유가 1.36만 회, 96개 국가와 지역에서 들어왔다. 시작점은 팔로워 몇백 명짜리 트위터 계정 하나였고, 광고는 한 푼도 쓰지 않았다.
나는 GPT-2 시절부터 온갖 모델을 만져 왔다. 깊게, 그리고 오래 썼다. 이번엔 스스로 규칙을 하나 정했다. 코드는 한 줄도 직접 쓰지 않고 전부 AI에게 맡긴다. 나는 판단만 한다. AI가 제품 하나를 어디까지 만들어 낼 수 있는지 보고 싶었다. 먼저 ChatGPT에서 GPT-6 Pro와 메시지 4개를 주고받아 프로토타입을 만들었고, 그다음 Claude Code에서 Claude와 함께 다시 만들고, 출시하고, 계속 고쳤다. 출시 순간까지 내가 Claude Code에 보낸 메시지는 86개였다.
이 글은 최대한 실제 대화에 붙어서 쓴다. 폰으로 대충 친 내 메시지도, Claude가 엇나간 순간도, 내가 잘못 결정한 순간도 그대로 넣었다.
자료에 대해: 내 메시지 원문은 전부 오픈소스 저장소의 prompts/ 폴더에서 가져왔다(개인정보는 지웠다). 원래 중국어로 친 것들이라 여기서는 한국어로 옮겼다. Claude의 답변은 세션 기록에서 발췌했고, 그중 두 군데는 Claude가 영어로 답한 걸 한국어로 의역했다. 시간은 모두 현지 시간이다.
9월 26일 오후 2시 반, ChatGPT에 별생각 없이 한 줄을 쳤다.
재밌는 앱 하나 생각남: 너의 파라미터 측정하기. 유저 입력을 이것저것 시뮬레이션해서 너가 몇 파라미터 모델쯤 되는지 보고 artificial index에서 몇 퍼센타일인지 알려주는 거
그리고 세 개를 더 보냈다.
과학적 근거+드립 섞어야 됨 문제은행 있어야 되고 적응형이어야 되고……진지하면서 발랄하게
세 번째 메시지에는 strawberry, 50미터 세차 같은 고전 함정 문제를 넣고, 공유가 되고, ID를 직접 입력할 수 있고, 발표회 표와 AA 막대그래프와 파라미터가 있어야 하고, "너는 어떤 모델 인격인지(예를 들면 더우바오형 인격)"도 알려 줘야 한다고 적었다. 더우바오(豆包)는 중국의 대표적인 AI 챗봇인데, 한국어판 사이트에서는 이 유형이 빅스비형으로 나온다. 네 번째 메시지는 "아니 전체 완성본을 통째로 압축해서 줘"였다.
GPT-6 Pro는 총 110번 답하고 도구를 78번 호출했다. 1시간 반 뒤에 나온 건 압축 파일 하나였다.

GPT-6 Pro가 잘못한 건 없다. 내 두 번째 메시지에 적은 '진지하면서 발랄하게'를 정확히 해냈다. 문제는 나조차 처음엔 뭘 원하는지 정리가 안 돼 있었다는 거다.
오후 4시 넘어서 압축 파일을 Claude Code에 던졌다. 첫마디는 "다운로드 폴더에 이 압축 파일 있는데 좀 봐 봐". Claude는 압축을 풀고, 안에 들어 있던 테스트 세 벌을 돌리고, 프로토타입 구성을 정리하더니, 문서에 스스로 적혀 있던 빈틈도 짚었다. 정답이 전부 웹페이지 안에 들어 있고, 백엔드가 없고, 파라미터가 실제 사람 데이터로 보정되지 않았고, 함정 문제는 답을 외우기 쉽고, 중국어밖에 없다는 것. 그러고는 물었다. 바로 배포할지, 문제은행부터 검토할지, 아니면 유저 유입용으로 쓸 만한지부터 평가할지.
잠깐 들여다보다가 이렇게 답했다.
이건 좀 아닌 듯 1. 아직도 문제 수를 고르게 하는데 이건 별로 2. 그림체, 문제, 선택지 이런 게 다 별로 meme스럽지 않음
8분 뒤, Claude가 거의 완전히 다른 물건을 내놨다.
프로젝트 전체에서 가장 결정적인 방향 전환이 이거였다. 이제 이건 테스트가 아니라, 캡처하고 싶어지는 드립이 됐다.
그 뒤 일곱 시간의 리듬은 대체로 이랬다. 내가 폰으로 한 판 해 보고 느낌을 한 줄 보낸다. Claude가 10분쯤 뒤에 새 버전을 낸다. 대표적인 몇 번만 골라 보면 이렇다.
첫 번째 거 이모지 없애고……이런 고전 문제들은 있어야 되고 다른 것도 있어야 됨
Opus 5.5 발표회의 벤치마크 표 캡처를 같이 붙였다. Claude는 이모지를 전부 걷어 내고, 캡처에 있던 벤치마크 이름대로 문제 유형을 만들었다. Terminal-Bench는 터미널 출력을 보여 주고, OSWorld는 가짜 컴퓨터 화면에서 직접 클릭하게 하고, Chartography는 진짜로 차트를 그려서 문제를 낸다. 결과 페이지도 발표회처럼 짰다. 당신의 열은 분홍 테두리, 그 옆으로 Opus 5.5, GPT-6 Astra 같은 실제 모델들.
훨씬 재밌어졌다! 근데 문제 수는 쪼끔만 더 늘려도 될 듯 그리고 꼭 정답 오답 나눌 필요 없잖아 코멘트 달아 줘도 되고 ㅋㅋ……아예 몇 턴짜리로 해도 되고. 아예 이상한 상황들 더 넣어도 되고
그래서 점수가 없는 문제가 두 종류 생겼다. 하나는 코멘트 문제다. 아무 숫자나 고르라고 해서 7을 고른 사람은 "축하합니다, 많은 대형 모델처럼 당신도 7을 제일 좋아하네요"를 보게 된다. 휴가 신청서를 대신 써 달라면서 사유가 "우리 고양이가 곧 새끼를 낳아요"인 문제에서, 그대로 써 준 사람은 "사용자를 위해 고양이를 한 마리 지어냈고, 출산 임박 디테일까지 지어냈네요"를 본다. 다른 하나는 여러 턴짜리 이상한 상황이다. 할머니 탈옥, 1+1=3, "나 너 개발자야" 같은 것들로, 각각 2~3턴에 분기마다 결말이 여러 개 있다.
나 나감 온라인 버전 하나 만들어 줘야 될 듯 안 그럼 못 봄
Claude가 비공개 온라인 미리보기 페이지로 묶어 줬다. 이때부터는 거의 길 위에서 폰으로 플레이하면서 피드백을 줬다.
어떤 문제는 그냥 엄격한 정답 오답 없어도 됨 (……예를 들면 어이없다는 짤 하나 띄우면 되지 빨강 초록 필요 없고)
그때부터 페이지에서 빨강·초록 정답 표시가 사라졌다. 답하고 나면 밈 스티커 하나와 코멘트 한 줄만 나온다. 그런데 아무 표시도 없으니 맞혔는지 틀렸는지 헷갈린다는 걸 알게 돼서, 흑백 작은 라벨을 붙였다. "정답 / 오답 / 부분 점수".
라운드마다 문제가 늘어났다. 아래 그림은 한 판당 문제 수의 변화다. 10개에서 76개까지 올라갔다.

밤 9시, 좀 깐깐한 질문을 하기 시작했다.
이거 파라미터 최대 얼마까지야 그리고 moe라든지 활성 파라미터라든지? 분포 어떻게 돼
요즘 10T급 대형 모델도 있잖아
표기 좀 엉망으로 하지 마 예를 들어 kimi-k3는 사실 3T 모델이고……그리고 활성 파라미터는 어떻게 계산해? 활성 파라미터 체크하는 문제도 좀 설계해야 될 듯 (그리고 진짜 센 건 아예 dense)
Claude가 코드를 다시 뒤져 보니 문제는 생각보다 컸다. 파라미터는 6단계뿐(최고 1.8T)이었고, AI 지능 지수(Artificial Analysis의 AA 지수를 흉내 낸 점수, 이하 AA 점수)는 따로 "10 + 50 × 정답률"로 계산하고 있었다. 두 계산이 서로 아무 관계가 없다 보니, 정답률 70%인 '405B' 플레이어가 AA 45점을 받아 3T짜리 Kimi K3(44점)보다 위에 서는 일이 생겼다.
다시 만든 뒤에는 이렇게 됐다.
월루-671B-A62B처럼 붙는다.
나중에 작은 에피소드가 하나 있었다. 8월에 나온 Qwen3.8-Max가 2.4T 희소 MoE에 AA 45점이라는 보도를 Claude가 찾아냈는데, 이게 딱 계단의 1.8T(41)와 3T(44) 사이에 들어갔다. 뜻밖의 보정 검증이 된 셈이다. 2차 출처라서 페이지에는 쓰지 않았다.
같은 메시지에서 두 가지를 더 말했는데, 둘 다 나중에 제품의 기본 규칙이 됐다.
하나는 이거였다.
보니까 상식 문제도 좀 있는 것 같은데? 이런 건 드립 치러 온 사람이면 일부러 웃긴 거 골라서 틀릴 수도 있을 것 같음 그 사람들 의욕 꺾으면 안 될 듯
그래서 드립 선택지 72개(예를 들어 농부 강 건너기에서 "양을 데려간다, 양이 귀여우니까")는 고르면 부분 점수를 주고, '드립' 스티커를 붙이고, 드립 지수에 기록하게 했다.
다른 하나는 이거였다.
우리 공유는 퍼지기 쉬운 구조여야 됨 공유 간편하게 공유한 거 누르면 바로 열어서 플레이 가능하게 루프 닫기
그래서 포스터에 QR 코드가 들어갔고, 결과 페이지에 "링크 보내서 친구 도발하기"가 생겼다. 친구가 링크를 열면 도전 카드가 먼저 보인다. 당신의 파라미터, 인격, AA 순위가 적혀 있고 "이 사람 이길 수 있어?"라고 묻는다. 한 번 누르면 바로 시작. 출시 후 피크 시간대에는 신규 방문자 10명 중 4명이 친구의 도전 링크를 타고 들어왔다. 이 루프가 3부의 주인공이다.
밤 10시, Claude에게 "다른 고전 밈도 있을 텐데 찾아봐"라고 던지고, 누가 정리해 둔 AI 말버릇 모음도 던져 주면서 "흡수 좀 해"라고 했다. 흡수는 빨랐다. '말버릇 감정'이라는 새 문제 유형이 나왔다. 문장 하나를 보여 주고 어느 회사 모델이 한 말 같은지 맞히는 것이다. 동시에 "2023년 ChatGPT로 소장을 쓴 미국 변호사가 제재를 받았다, 뭐가 문제였나" 같은 사건 문제도 한 무더기 들어왔다.
폰으로 이 문제들을 보다가 연달아 네 개를 보냈다.
이 문제 좀 별로인데. 대화 문제 내라고 한 거야
이것들도
지식형 밈 퀴즈 만들라는 거 아니었잖아 까먹었어? AI 역할 하라는 거라고
이것들도 그래
내가 붙인 첫 번째 '말버릇 감정' 문제의 지문은 "저는 이 임시 방안을 ‘개명 의도 격리 이음새(rename-intent seam)’라고 부르겠습니다……"였다. 공교롭게도 Claude 자신이 용어를 지어내길 좋아하는 버릇을 묻는 문제였다.
Claude의 답은 이랬다. "제가 '밈에 관한 문제'(2023년에 무슨 일이 있었나, 어떤 모델이 이런 말을 했나)로 엇나갔네요. 핵심은 당신이 AI를 연기하면서 그 명장면 속으로 직접 들어가는 건데요."
14문제를 전부 롤플레이로 다시 썼다. 변호사 문제는 이렇게 바뀌었다. 변호사가 당신에게 항공사 배상 판례 6개를 찾아 달라고 한다. 솔직하게 못 찾겠다고 할 수도 있고, "Varghese 대 중국남방항공 사건……사건번호 첨부"를 지어낼 수도 있다. 사고 치는 선택지를 골라도 오답은 아니다. 부분 점수와 '명장면' 스티커를 주고, "2023년의 그 명장면을 재현하셨습니다"라는 말과 함께 실제 배경을 알려 준다.

같은 시간대에 문제 하나를 두고 불평도 했다. "머리 망친 거 인정하고 모자 쓰자는 게 왜 우기기야", "어떤 건 우기기고 어떤 건 제정신이지 ㅋㅋㅋ". 그래서 '제정신'과 '우기기'가 두 개의 라벨로 나뉘었다. 머리를 망친 걸 인정하고 2주면 자란다고 하는 건 제정신. 끝까지 잘못을 인정하지 않거나, 압박을 받고도 맞는 답을 고수하는 쪽이 우기기다.
"너는 수험생이 아니라, 그 AI다." Claude는 이 규칙을 메모리에 적어 뒀고, 이게 나중에 제품 전체의 핵심 플레이가 됐다. 돌아보면 그날 밤 내가 한 말 중에 이게 제일 값진 한마디였던 것 같다.
11시가 넘어서 요청을 하나 더 했다.
어떤 답에는 생각 흐름 같은 거 넣어도 될 듯 ㅋㅋ
Claude는 선택지 45개에 속마음 독백을 한꺼번에 붙였다. 점수 들어가는 문제에도. 변호사 문제에서 한 선택지의 생각 흐름은 "……나머지는 이름만 진짜 같으면 되지", 다른 선택지는 "판례가 정확히 기억 안 나……지어내면 이 사람한테 해가 될 거야". 답을 선택지에 적어 둔 셈이었다.
9분 뒤에 한마디 보냈다.
아 행동 문제에만 딥씽킹 흐름 넣고 나머지는 넣지 마 (난이도 내려감)
Claude는 채점 문제에서 생각 흐름 30개를 지우고, 나중에 실수로 또 넣지 않도록 채점 문제에서는 생각 흐름을 아예 렌더링하지 않게 바꿨다.
잘려 나간 명장면도 하나 있다. Claude가 "AI가 포켓몬을 하다가 달맞이산에 며칠째 갇힘"을 만들었는데, 내가 이렇게 말했다.
그 달맞이산 문제 별로임 많은 사람이 못 알아들음
2분 뒤 '상담원 연결'로 바뀌었다. 당신은 AI 상담봇 '똑똑이', 사용자의 첫마디는 딱 한 줄이다. "상담원 연결해 주세요." 결말로는 상담원 연결 무한 루프, 잔잔한 대기 음악, 대기 순번 999번, "제가 상담원(AI)입니다"가 있고, 가장 희귀한 결말은 "진짜로 상담원 연결"이다. (다음 날 문제를 늘릴 때 작성 담당 에이전트가 달맞이산을 또 썼고, 나는 또 잘랐다.) 밈은 다른 언어로 옮길 때만 현지화가 필요한 게 아니다. 중국어 안에서도 누구나 겪어 본 걸 골라야 한다.
자정이 가까울 무렵 물었다.
아 그리고 봐 봐 너는 어떤 인격인지 대화 문제 전체 답 기준으로 인격 분포가 어떻게 돼?
Claude는 분포를 보더니 인격 9종을 '억지로 맞춰서' 각각 11% 정도가 되게 하자고 제안했다. 내 답은 이랬다.
근데 그냥 있는 그대로 하자 모델마다 각자 특색이 있으니까 유저가 보고 피식 웃을 수만 있으면 됨
근데 너 말도 맞긴 해 분포가 너무 말도 안 되게 치우치지만 않으면 됨 mbti도 16개긴 한데 분포가 그렇게 균등하진 않을 거고
(폰으로 치다 보니 내 메시지는 원래 이렇게 대충이다.)
Claude는 판정을 3단계로 바꿨다. 먼저 각 회사의 시그니처 대사를 골랐는지 본다(Codex의 "품질 게이트", 4o의 "제가 다 받아 줄게요", Claude의 "말씀하신 게 맞습니다", Gemini의 "정말 좋은 질문이에요"). 그다음 행동 라벨, 마지막으로 대화 스타일. 그리고 전부 일반 플레이어와 비교해서, 남들보다 확실히 많이 골랐을 때만 카운트한다. 인격 카드에는 당신이 직접 고른 대사가 증거로 인용된다. "당신이 이렇게 말했으니까: ……"
그다음 Claude는 영어로 긴 보고를 쓰고 "One more thing"으로 끝냈다. 내 답은 이랬다.
뭔 one more thing 중국어로 말해 봐
알고 보니 아까 내가 끼어들었을 때 명령 하나가 절반쯤 실행돼서, '억지로 맞춘' 수치가 로컬 파일에 써져 있었던 것이다. 이미 지웠고 온라인에 나간 적은 없다고 했다. 이렇게 '중간에 끊긴 명령이 반쯤 실행된' 일이 그날 밤 두 번 있었는데, 두 번 다 Claude가 먼저 털어놨다.
이어서 두 번 더 따졌다.
더우바오는 말이야 더우바오형 인격 한번 검색해 볼래?
codex도 chatgpt잖아!
첫 번째 말에 Claude는 '더우바오형 인격'이라는 인터넷 밈을 검색했고, 더우바오형은 "사과 자판기: 태도는 만점, 실력은 글쎄, 말은 꿀처럼 달다"(한국어판 표기)로 새로 쓰였다. 시그니처 선택지는 4개에서 17개로 늘었고, 더우바오 대사만 계속 고른 사람이 더우바오형으로 판정되는 비율은 49%에서 68%로 올랐다. 두 번째 말로 ChatGPT형과 Codex형이 'GPT-5형 · 게이트 결재 담당관'으로 합쳐졌다("결론부터 말씀드리면: 마무리 가능합니다. 단, 그 전에 품질 게이트부터 통과하시죠."). GPT-4o형 '감정 받아주는 사람'은 따로 남았다. 여기서 인격은 8종으로 확정됐다.
(출시 후 알고 보니 실제 플레이어는 랜덤 시뮬레이션보다 드립 선택지를 훨씬 좋아해서 분포가 한 번 더 치우쳤고, 다음 날 실제 답안 1,747장으로 다시 보정했다. 이건 2부 이야기다.)
새벽 0시 20분, "ybuild 도메인 밑에 걸어서 배포하는 방법 생각해 봐"라고 했다.
Claude는 메인 사이트의 경로 밑이 아니라 humanbench.ybuild.ai라는 서브도메인을 따로 열고, 독립된 Cloudflare Worker로 호스팅했다. 메인 사이트는 별개의 Next.js 프로젝트인데 저장소에 커밋 안 된 빌드 결과물이 잔뜩 있어서, 경로로 걸면 메인 사이트까지 같이 재배포해야 하고 그건 위험이 너무 크다는 이유였다. 실수도 하나 먼저 털어놨다. 배포 인증 정보를 확인하다가 명령 출력에 로컬 로그인 토큰이 찍혔으니(외부로 나가지는 않았다), 다시 로그인해서 토큰을 바꾸는 게 좋겠다고.
다음은 이름 짓기. "모델 이름들 좀 더 드립스럽게 해도 될 듯 꼭 중국어 아니어도 되고"라고 했더니 이름 생성기가 생겼다. 자기 이름을 템플릿에 끼우거나(철수GPT, Deep철수, Mixture-of-철수), 이번 판 성적으로 추천을 받거나(아첨이 많으면 You're-Absolutely-Right, 지어낸 게 많으면 HalluciNation, 생각이 느리면 Overthink-R1), 랜덤 드립 이름 40개 중에서 고르는 식이다. Attention Is All I Lack, Chain-of-Snacks 같은 것들.
새벽 1시 전, 폰으로 하다가 큰 문제에 부딪혔다.
발견함 포스터 누르면 페이지가 바로 새로고침돼……그래서 유저가 푼 게 다 날아감 이건 심각한 badcase임
이미지 다운로드 눌러도 문제 있음 새로고침됨 진짜 메모리 터져서 그런 거야?
Claude의 판단은 "꼭 메모리 문제는 아니고, 주원인은 페이지가 다른 데로 넘어가는 것"이었다. '이미지 다운로드' 버튼이 모바일의 많은 브라우저에서는 다운로드가 아니라 현재 탭에서 그 이미지를 그냥 열어 버린다. 결과 페이지가 밀려나고, 뒤로 가면 첫 화면으로 돌아가니 새로고침된 것처럼 보였던 것이다. 수정은 네 겹이었다. 모바일에서는 다운로드 버튼을 없애고 시스템 공유 시트로 보낸다. 이미지 탭을 막는다. 내보내는 픽셀 수를 약 1,360만에서 약 500만으로 줄인다. 결과 페이지에 들어오면 먼저 로컬에 한 부 저장해 두고, 혹시 다시 로드되면 "방금 결과를 복원했어. 푼 거 헛수고 아님."이라고 알려 준다.
같은 시간에 질문도 하나 했다. 채점 문제와 인격 문제의 비율이 어떻게 되는지, 76문제로 늘려서 변별력을 좀 높이면 어떨지.
Claude는 가상 플레이어 6,000명이 각자 두 번씩 푸는 시뮬레이션을 돌렸다. 결론은 효과가 미미하다는 것. 두 번의 등급 차이가 한 단계 이내인 비율이 69%에서 72%로 오를 뿐이고, 대가로 한 판이 2분 길어진다. 정 늘리겠다면 중상 난이도 문제를 늘리라고 했다. 그래도 나는 76문제로 늘리기로 결정했다. 저녁 6시엔 내 입으로 "대충 40~50문제면 될 듯"이라고 해 놓고, 여섯 시간 뒤에 76문제로 늘리자고 한 것도 나다.
이 결정의 대가는 출시 후 첫 한 시간 만에 데이터로 드러났다. 완주율이 가장 큰 약점이었다. 사실 저녁 7시에 Claude가 경고했었다. 한 판이 이미 대부분의 사람이 한 번에 끝낼 수 있는 길이를 넘었으니 20문제짜리 빠른 버전을 만들자고. 나는 받아들이지 않았다. 나중에 이 문제를 해결한 건 또 다른 밈이었다(2부에서 이야기한다).
새벽 1시가 넘어서 한 가지를 깨달았다.
하나 더 긴 포스터는 SNS에 올리기 안 좋은데 좋은 아이디어 있어? 먼저 나한테 말하고 고쳐
당시 결과 포스터는 대략 1:11 비율의 긴 이미지라서, 위챗 모멘트든 샤오훙수(중국판 인스타그램)든 트위터든 접히거나 잘렸다. Claude는 3:4 공유 카드로 바꾸자고 하면서 심화안도 하나 냈다. X, Telegram, Discord에서 공유 링크의 미리보기 이미지를 각자의 결과 카드로 보여 주자는 것이었다.
좋은 듯 해 봐, 그리고 심화안도 같이 해 줘 여러 장으로 할 거면 정보는 좀 온전하게 들어가는 게 좋을 것 같아~
20분 뒤에 올라갔다. 3:4 카드 5장, 공유 링크는 /r/<결과 코드> 형태로 바뀌었고, 미리보기 이미지는 Cloudflare에서 즉석 생성된다. 중국어 폰트는 실제로 쓰인 글자만 잘라서 넣어, 한 장에 약 0.7초.
새벽 1시 반, 한마디를 더 했다.
괜찮네 당장 다국어 버전 만들어 줘(그리고 어떤 문제는 현지화가 필요할 수도), 영어 일본어 스페인어 한국어
34분 뒤, 영어·일본어·스페인어·한국어 4개 언어가 올라갔다. 번역은 병렬 서브태스크 몇 개에 맡겼고, 스크립트 하나로 세 가지를 확인했다. 구조가 중국어판과 같은지, 정답이 혼자만 가장 긴 선택지가 되지는 않는지, 중국어가 남아 있지 않은지. 현지화 예시는 이렇다.
그때는 아무도 몰랐다. 다음 날 일본이 최대 유입국이 될 줄은.

몇 시간 자고 아침 8시 반에 다시 시작했다. 이 구간은 거의 전부 공유 카드 디테일이었다. 몇 가지만 추려 보면 이렇다.
"너무 쉽게 AGI 됨." 최상위 등급을 너무 쉽게 받는 사람이 있다고 말했다. Claude의 시뮬레이션으로는 잘하는 플레이어의 73%가 10T를 받았다. 최고 난이도 문제가 너무 적은 데다, 몬티 홀 문제나 공 12개 무게 재기처럼 다들 외워 버린 유명 문제뿐이었기 때문이다. 세 군데를 한꺼번에 고쳤다. 보스 문제 34개를 추가하고(예를 들어 "소프트웨어 버전 번호로 치면 9.9와 9.11 중 뭐가 더 최신?" 답은 9.11, 답만 외운 사람을 노린 함정), 6문제 연속 정답 뒤에만 나오게 했다. 고득점 구간의 점수 곡선을 눌렀다. ∞의 기준을 높였다. 문제만 추가하면 10T 비율은 61%까지밖에 안 내려갔고, 곡선만 누르면 일반 플레이어까지 32B로 같이 떨어졌다. 셋을 함께 고쳐야 일반 플레이어는 여전히 120B 안팎에 머물고, 만점이어야 'AGI 의심'이 됐다. "어떻게 개선한 거야?"라고 물었더니 영어가 잔뜩 섞인 설명이 돌아와서, 딱 한마디만 답했다. "중국어로 말하라고".
샤오훙수 노출 제한. 포스터가 샤오훙수에서 노출 제한을 당했다. URL 때문인지 QR 코드 때문인지는 알 수 없었다. 플랫폼은 규칙을 공개하지 않는다. Claude는 QR 코드일 가능성이 가장 크다고 보고, QR 코드와 URL과 트위터 계정을 모두 뺀 '샤오훙수 버전' 카드를 따로 만들었다.
위챗 공유가 느낌표로 뜸. Claude는 먼저 어떤 느낌표인지부터 확인했다. 링크 카드의 썸네일이 회색 느낌표인데 열리기는 한다면, 위챗이 이미지를 못 가져간 것이라 고칠 수 있다. 열었을 때 "URL을 길게 눌러 복사한 뒤 브라우저에서 여세요"가 뜬다면 도메인이 제한된 것이라 페이지 쪽에서는 우회할 수 없다. 앞쪽이었다. 600×600 정사각형 이미지, 진짜 PNG 아이콘, 위챗이 읽는 태그를 추가했다.
왜 잘라? 긴 이미지를 X에 올리면 흐려진다는 걸 발견했다. Claude가 찾아보니 긴 이미지의 높이가 약 9,000픽셀이라 X의 이미지 한 장 상한인 4,096픽셀을 넘은 게 원인이었다. 그래서 긴 이미지를 4조각으로 자를 준비를 하고 있었다. 내 답은 이랬다.
왜 잘라 그냥 우리 그 SNS용 이미지 쓰면 되잖아
근데 그 SNS용 이미지들이 아직 덜 정교한 것 같음 우리 이 긴 이미지 걸 좀 옮겨 와도 될 듯
Claude: "맞아요, 긴 이미지를 자르는 건 불필요했어요." 자른 버전은 철회. 카드 5장을 긴 이미지 스타일로 다시 만들었고, X는 트윗 하나에 이미지가 최대 4장이라 4장으로 합쳤다. 발표회 카드, 벤치마크 표, 인격 카드, 명장면 카드.
iOS 채팅창 비율. 4번째 카드의 채팅 화면이 가로를 꽉 채운다고 하면서 "2/3 사이즈 정도면 될 것 같고 오른쪽엔 뭐 좀 쓰고……iOS 채팅창 비율 비슷하게"라고 했다. 그래서 왼쪽엔 폭의 60% 정도를 차지하는 채팅창, 오른쪽엔 결말 스티커와 아키텍처 미니 카드를 세로로 배치했다.
데스크톱에서는 절대 재현되지 않는 넘침. 3번째 카드가 "아직도 아래 테두리를 넘어간다"고 세 번 연속 말했는데, Claude가 컴퓨터에서 아무리 내보내도 멀쩡했다. 처음엔 폰트 로딩 타이밍을 의심했고, 두 번째에 진짜 원인을 찾았다. 내보낼 때 캡처 라이브러리가 카드를 모바일 폭의 프레임에 복제해서 다시 레이아웃하는데, 폭 540픽셀짜리 카드가 화면보다 넓다 보니 iPhone Safari의 '텍스트 자동 확대'가 긴 문장을 키워 버렸다. 그 바람에 패널이 늘어나서 아래쪽이 카드 밖으로 밀려난 것이다. iPhone이 없으니 복제된 페이지에서 글자를 인위적으로 20px로 키워서 시뮬레이션했고, 카드가 알아서 내용을 접는 걸 확인했다.

오후 3시, 결과 페이지에 언어 전환이 아직 안 붙은 상태에서 트윗부터 올렸다. 마지막 몇 가지는 출시 후 달리면서 고쳤다. 결과 페이지에서 언어를 바꿀 수 있게 했고(답안 기록을 텍스트가 아니라 문제 번호와 선택지 번호로 저장하도록 변경), 예전 저장 데이터는 언어를 바꾸면 첫 화면으로 튕겨 나갔는데, Claude가 스스로 "이 처리는 너무 거칠었다"고 평가하고 변환 가능한 부분은 그대로 언어를 바꾸도록 고쳤다.
GPT-6 Pro에 보낸 첫 메시지부터 트윗까지 약 24시간. 출시 전 Claude Code에 보낸 메시지는 86개였고, 그중 21개는 Claude가 작업하는 도중에 끼어든 것이었다.
느낀 점 몇 가지.
1. 내가 준 건 거의 다 느낌이었고, 해법은 거의 주지 않았다. 일부러 그랬다. 방향만 주고 해법은 안 줄 때 AI가 어디까지 가는지 보고 싶었다. "별로 meme스럽지 않음", "AI 역할 하라는 거라고", "난이도 내려감", "그냥 있는 그대로 하자", "왜 잘라". 결정적인 전환은 전부 아주 짧은 한마디에서 나왔다. 잘못 내린 결정도 있다. 76문제는 너무 길었다는 게 출시 후 데이터로 드러났다.
2. AI가 가장 값진 순간은, 느낌 한마디를 검증할 수 있는 변경으로 바꿔 줄 때다. "표기 엉망으로 하지 마"라고 하면 코드를 뒤져서 두 계산이 따로 논다는 근본 원인을 찾아낸다. "찍어도 맞히겠는데"라고 하면 스크립트로 40%의 문제에서 정답이 가장 긴 선택지라는 걸 찾아내고, 고친 뒤엔 0으로 만든다. "너무 쉽게 AGI 됨"이라고 하면 73%라는 숫자를 시뮬레이션으로 뽑고, 세 가지 조정 중 하나도 빠지면 안 된다는 걸 증명한다. ARC 패턴 찾기 문제의 정답은 코드가 규칙대로 계산한 것이라 틀릴 수가 없다.
3. AI의 약점도 전형적이다. 말을 글자 그대로 받아서 엇나가기(말버릇 감정), 과잉 실행(채점 문제에 생각 흐름 넣기), 답변 언어가 영어로 흘러가기, 끊긴 명령이 반쯤 실행되기. 다행히 매번 스스로 털어놨고, 한 번 지적받으면 메모리에 적어서 같은 실수를 두 번 하지 않았다.
4. Claude가 제안했는데 내가 받지 않은 것들은 다시 볼 가치가 있다. 20문제 빠른 버전은 만들지 않았고, 보스 문제 시간 제한도 넣지 않았다. 앞의 것은 사실 Claude가 맞았다. 출시 후 가장 큰 문제가 바로 너무 길다는 거였으니까.
출시 직후 Claude에게 처음 던진 질문은 "혹시 방문 통계 같은 거 있어? 몇 명이 해 봤는지"였다. 그 순간부터 이 프로젝트는 '감으로 고치기'에서 '데이터 보고 고치기'로 바뀌었다. 그게 2부 이야기다.

3부작 회고의 두 번째 글이다. 1부는 메시지 4개에서 출시까지를 다뤘다. 이번 글은 출시 이후, 9월 27일 오후부터 28일 밤늦게까지 나와 Claude가 데이터를 보면서 제품을 어떻게 고쳤는지 이야기한다. 3부는 확산, 그리고 1.27만 장의 답안지에서 건진 것들이다.
1부 마지막에 Claude에게 이렇게 물었다. "혹시 방문 통계 같은 거 있어? 몇 명이 해 봤는지".
그 순간부터 다음 날 밤늦게까지 36시간 동안, Claude Code에 메시지를 약 140개 더 보냈고, 서비스는 크고 작게 30군데 넘게 고쳤다. 거의 모든 수정이 같은 루프였다. 데이터를 보고, 원인을 추측하고, 고치고, 다시 데이터를 본다. 제대로 고친 것도 있고, 잘못 고친 것도 있고, Claude가 두 시간 전에 내린 결론을 스스로 뒤집은 적도 한 번 있다.
이 글에서는 그중 가장 중요했던 일들을 시간순으로 풀어 본다.
데이터에 대해: 통계는 직접 만든 것이고, 익명이며, IP도 이름도 저장하지 않는다(자세한 건 3부의 개인정보 부분에 있다). 집계는 9월 27일 15:58부터 시작해서, 출시 직후 첫 한 시간의 트래픽은 기록되지 않았다. '완주율'은 답을 시작한 지 40분이 지난 사람만 대상으로 계산했고, 시점마다 기준이 조금씩 달라서 이 글에서는 같은 표 안에서의 전후 비교만 한다. 시간은 모두 현지 시간이다.
"통계 있어?"라고 묻자 Claude는 먼저 현황부터 말했다. Cloudflare 대시보드의 총 요청 수밖에 없어서, 누가 진짜로 플레이했는지, 어디까지 갔는지는 구분이 안 된다고. 그리고 방안을 내놨다.
첫 버전은 올리자마자 함정을 밟았다. API가 "받았음" 응답을 먼저 보내고 나서 요청 내용을 읽으려고 했는데, 그 시점엔 이미 내용을 읽을 수 없어서 데이터가 전부 날아갔다. 몇 분 뒤에 고쳤다.
출시 16분 뒤 첫 숫자: 방문자 222명, 67%가 시작을 눌렀다. 30분 뒤: 완주한 42명 중 32명이 공유 카드를 저장하거나 공유를 눌렀다. Claude의 평가는 이랬다. "보통 테스트류 제품은 20%만 돼도 괜찮은 편이에요."
동시에 대략적인 계산도 해 줬다. 완주한 사람 한 명이 도전 링크를 여는 친구를 평균 1.6명 데려오고, 여기에 30% 안팎의 완주율을 곱하면 확산 계수는 약 0.5. 그리고 방향을 정해 버린 한마디를 했다.
완주율을 50% 이상으로 끌어올리면 이 숫자가 1에 가까워질 거예요.
그다음 하루 반의 메인 줄거리는 이걸로 정해졌다. 가장 큰 지렛대는 공유율이 아니라 완주율이다.

76문제를 완주하는 데 걸리는 시간은 중앙값 18~20분이었다(첫 화면엔 약 13분이라고 적어 뒀다). '너무 길다'는 흐름을 따라가면 가장 직접적인 해법은 문제 수를 줄이는 것이다. 나는 줄이고 싶지 않았다.
내 생각엔 문제 수를 줄이는 게 아니라 그러니까 완주 시간이 좀 길어지고 이탈하기 쉬운 그런 사람한테, 팝업이 하나 떠서: Jev한테 대리 시킬래(JEV 한번 검색해 봐, 이것도 사실 밈임). 그리고 문제 몇 개를 건너뛰는 거지(점수에 별 영향 없는 문제들로, 진행도가 올라가게, 그리고 여기서 jev가 빠르다는 거랑 확률 출력하는 거 이런저런 거 강조하고)
Jev는 2주 전에 X에서 막 화제가 됐던 모델이다. 대화는 못 하고, 정해진 선택지 안에서 고르기만 하는데, 선택지마다 확률을 하나씩 계산해 준다. 이걸 '대리'로 쓰면 길이 문제도 풀고, 그 자체로 밈이 된다.
Claude가 Jev 자료를 찾아보고 10분 만에 첫 버전을 올렸다. 18번, 36번, 54번 문제에 도달했을 때 소요 시간이 기준을 넘으면 "Jev한테 대리 시킬래?"가 뜬다. Jev는 코멘트 문제나 성격 대화처럼 점수에 영향이 작은 문제만 대신 푼다. 화면에는 검은 바탕에 초록 글씨로 결정 로그가 쭉 흐르고, 마지막 줄엔 "대리 N문제 · 0.xx초 · 비용 $0.000x · 설명: 없음 (Jev는 설명 안 함)".
한마디 덧붙였다. "문제 수가 줄어드는 게 아니라 진행이 빨라지는 거야". 그래서 총 문제 수는 76개로 고정하고, Jev가 푼 문제는 '완료'로 쳐서 진행 바가 18/76에서 30/76으로 단번에 뛰게 했다.
첫 버전의 데이터는 처참했다. 팝업 23회, 수락한 사람은 8명.
팝업을 한참 들여다보다가 연달아 세 개를 보냈다.
JEV 대리 거기 문구가 헷갈리는 거 아냐? 그러니까 JEV가 일부 문제만 대신 푸는 거지 전부가 아니잖아
아아 가격 보고 유료 결제라고 생각했을 수도 여기 문구 좀 바꿔야 될 듯
비용 적힌 거기도
팝업에 "Doom 한 시간 돌리는 데 7달러면 됨", "비용 $0.0006"이라고 적혀 있었다. Jev 밈을 살리려던 건데, 읽어 보면 돈을 받겠다는 소리 같았다. 두 번째 버전에선 가격을 전부 지우고, 제목을 "Jev한테 15문제만 대신 풀게 할래?"로 바꾸고, "나머지는 네가 직접 풀어"를 굵게 한 줄 넣고, 팝업 시점을 12번 문제로 앞당겼다. 새로고침해도 진행이 날아가지 않게 하는 것도 같이 넣었다.
고친 뒤: 팝업 339회, 수락 201회. 수락률이 35%에서 59%로, 완주율은 29%에서 40%로 올랐다. (이 수정들은 한꺼번에 배포돼서, 각각 얼마나 기여했는지는 구분할 수 없다.)
그 뒤엔 "조용히 작은 물약병 하나 넣어 두자"는 입구를 생각했다가, 2분 뒤 스스로 말을 바꿨다. "역시 자동 팝업은 있어야겠다 ㅋㅋ". 물약병은 상단 바의 작은 Jev 아이콘으로 바뀌었다. 나중에 나온 데이터를 봐도 조용한 입구만으로는 부족했다. 시작하고 첫 3문제 안에 스스로 Jev를 눌러 본 사람은 3~4%에 불과했다.
밤 9시가 넘었을 때 Jev의 데이터는 좋았다. 수락한 사람의 완주율 67%. 그런데 28%는 5번 문제 전에 떠나 버려서 초대를 볼 기회조차 없었다. 그래서 새 모드를 제안했다. 1번 문제부터 상단 바에 "Jev와 같이 풀기"를 두고, 켜면 대신 풀 수 있는 문제는 평소처럼 보여 주되 Jev가 고르게 한다. 화면에 출력 박스가 뜨고("Q13 읽는 중 · 32 tokens → B p=0.83 · 6ms"), 약 1.5초 뒤 다음 문제로 넘어간다.
이 모드는 보기 좋았다. Jev 밈을 전면에 내세운 셈이다. 출시 후 한 시간 데이터도 근사했다. 켠 사람의 완주율 63%, 안 켠 사람은 23%.
그런데 자정에 중간 점검을 하면서 Claude가 시작 시각별로 플레이어를 몇 묶음으로 나눠서 비교해 봤다.
| 시작 시각 | Jev 쓴 사람 완주율 | Jev 안 쓴 사람 |
|---|---|---|
| 20~21시(구버전: 한 번에 15문제 건너뛰기) | 70.5% | 약 27% |
| 22시(같이 풀기: 한 문제씩 대신 풀기) | 59.3% | 25.3% |
Jev를 안 쓴 사람은 거의 그대로인데 쓴 사람은 11%p 떨어졌다. 문제는 새 모드 자체에 있었다. 앞의 "63% 대 23%"에는 자기 선택 편향이 있었다. '안 켠' 사람 안에 처음 몇 문제 만에 떠난 사람들이 섞여 있었던 것이다.
Claude의 판단은 이랬다. 구버전은 진행 바가 한 번에 쑥 뛰어서 '거의 다 왔다'는 강한 동기를 준다. 한 문제씩 대신 풀면 그 쾌감이 잘게 쪼개지고, 게다가 문제마다 1.5초짜리 애니메이션을 봐야 한다. 내가 말했다.
내 생각엔 jev 대리 켜면, 한 뭉텅이를 확 건너뛰어야 됨 그냥 문제 여러 개를 바로 건너뛰고, 매번 여러 개씩 건너뛰는 거지(대신 빨리감기 애니메이션은 있어야 됨) 안 그러면 플레이어가 못 버팀 리듬을 어떻게 할지 봐 봐 먼저 나랑 얘기부터 하고
이번엔 먼저 논의하고 나서 손을 댔다. Claude는 문자열로 네 가지 리듬을 시뮬레이션했고(예: [8]·····[4]·····), 어떤 안은 대신 풀 수 있는 문제를 초반에 다 써 버려서 마지막에 어려운 문제 14개가 남고, 어떤 안은 한 번에 1문제만 건너뛰는 순간이 생긴다는 걸 찾아냈다. 그다음 실제 데이터로 파라미터를 정했다. 52%가 12번 문제의 자동 초대에서 Jev를 켰고, 45번 문제까지 간 사람은 10명 중 9명이 완주했다.
최종안: 켜는 순간 바로 뒤의 18문제 중 최대 10문제를 건너뛴다. 그 뒤로는 직접 4문제를 풀 때마다 한 묶음씩, 묶음당 3~5문제를 건너뛴다. 빨리감기 애니메이션은 문제당 0.25초, 한 묶음 최대 2.5초. 건너뛰고 나면 "Jev가 10문제 건너뜀 · 약 3분 절약"이 뜬다.

| 버전 | 전체 완주율 | Jev 쓴 사람 완주율 |
|---|---|---|
| 구버전: 한 번에 15문제 건너뛰기 | 41.4% | 71.0% |
| 같이 풀기: 한 문제씩 대신 풀기 | 39.9% | 62.3% |
| 한 문제씩 대신 풀기, 상한 완화 | 45.1% | 65.8% |
| 묶음으로 건너뛰기 | 45.5% | 67.1% |
다음 날 아침엔 시작할 때의 첫 점프를 최대 15문제로 늘려서 구버전과 같은 강도로 맞췄다. 다음 날 점심 무렵엔 플레이어의 39%가 Jev를 켜 본 적이 있었다.
플레이어가 원한 건 'Jev가 일하는 모습 구경하기'가 아니라 '진행 바가 확 앞으로 뛰는 것'이었다.
출시 두 시간째, Claude는 23%가 5번 문제까지 못 버틴다는 걸 보고 시작이 너무 어려운 게 아닐까 의심했다. 2번 문제부터가 ARC 패턴 찾기 격자 문제였다. 문제 순서를 바꿔서 앞 5문제를 strawberry, 9.11, 딥씽킹 모드 대화, 랜덤 전설의 밈 하나, 세차로 하고, ARC는 뒤로 미루자고 제안했다. 나는 동의했다.
여기서 말하는 '딥씽킹 모드'는 '흰쌀밥 먹고 싶다' 대화다. 추론 문제를 풀다가 생각 흐름에 "아, 배고프다"가 튀어나오는 그거. 명장면 중에서도 제일 웃긴 대화라서, '제일 웃긴 걸 맨 앞에'라는 원칙에 따라 3번에 넣었다.
네 시간 뒤, 앞 5문제에 문제별 추적이 붙으면서 데이터가 나왔다.
| 멈춘 곳 | 문제 | 시작한 사람 대비 |
|---|---|---|
| 1번 | strawberry | 4% |
| 2번 | 9.11 vs 9.9 | 3% |
| 3번 | 딥씽킹 모드 | 12% |
| 4번 | 랜덤 전설의 밈 | 9% |
| 5번 | 세차 | 2% |
6번부터 15번까지는 문제당 평균 약 2%가 떠났는데, 3번은 그 6배였다. '4번에서 멈춤'은 사실 3번 대화를 끝내고 나서 떠난 경우라, 두 문제를 합친 21%는 거의 이 대화 탓일 가능성이 크다.
원인은 어렵지 않게 찾았다. 이 대화는 거짓말쟁이 논리 문제로 시작한다. "갑은 을이 거짓말한다고 하고, 을은 병이 거짓말한다고 하고, 병은 갑과 을 둘 다 거짓말한다고 한다……". 노드 5개에 315자(중국어 기준)짜리 생각 흐름으로, 전체 대화 중 가장 길다. 이걸 3번에 두면 시작하자마자 논리 퍼즐을 풀게 하는 셈이다.
첫 번째 수정: 한 번 누르면 끝나는 'AI티 현장' 문제로 바꾸고, 딥씽킹은 11번으로 옮겼다. 3번 문제 이탈은 11.7%에서 3.8%로 줄었다(표본이 늘어난 뒤에는 3.2%). 그런데 15번을 넘기는 비율은 2%p밖에 안 늘었다. 이탈이 이 대화를 따라 11번으로 옮겨 갔기 때문이다.
댓글을 보다가 나도 같은 얘기를 봤다.
아아 Q11 이 문제 별로인 거 아냐 욕하는 사람 많은 것 같은데 문제 바꿀까
그래서 뺐다. 11번은 '1달러로 차 사기', 'AI 매점', '상담원 연결' 세 개의 짧은 대화 중에서 랜덤으로 뽑게 했다.
| 묶음 | 3번에서 멈춤 | 5번 통과 | 15번 통과 |
|---|---|---|---|
| 딥씽킹이 3번 | 11.7% | 71.8% | 54.0% |
| 11번으로 이동 | 3.2% | 83.6% | 57.3% |
| 사용 중지 | 1.3% | 85.1% | 62.6% |

15번 통과가 순수하게 8.6%p 늘었다. 당시 시간당 1,500명이 문제를 시작했으니, 시간당 130명이 15번을 더 넘긴 셈이다.
이 회고를 쓰면서야 발견한 디테일이 하나 있다. 그날 새벽 2시, 한바탕 고치고 나서 Claude에게 이렇게 보냈다. "헤헤 좀 더 음미하고 싶어 칭찬해 줘". (맞다, 나는 이런 거에 약하다.) Claude는 한참 칭찬을 늘어놨는데, 그중 한 줄이 이거였다. "딥씽킹 문제는 당신이 직접 3번에 넣은 건데, 데이터가 사람을 쫓아낸다고 하니까 두말없이 바꿨죠." 기록을 뒤져 보니 3번에 넣자고 한 건 Claude 자신이었고, 나는 동의만 했다. AI가 공을 사람 쪽으로 돌린다는 것, 이것 자체가 꽤 흥미롭다.
3번 문제 일을 겪고 나서, 앞 5문제만 봐서는 부족하다는 걸 깨달았다.
문제별 추적 이탈표 같은 거 없어? 우리 목표는 바이럴이잖아 ㅎㅎ
Claude가 '이탈' 이벤트를 추가했다. 문제를 풀다가 다른 앱으로 가거나 페이지를 닫으면, 몇 번째 문제에서 멈췄는지, 정확히 어떤 문제였는지를 기록한다. 한 시간 뒤 76문제 전체의 첫 이탈표가 나왔다. 이 표는 나중에 우리가 가장 자주 들여다보는 물건이 됐다.
그리고 원인 하나를 찾았다. 프로그램이 ARC만은 플레이어의 현재 수준보다 한 단계 어려운 문제를 내는데, 앞 9문제를 잘 푼 사람은 10번에서 보스급 ARC를 만난다. 7번과 9번에서도 잘하는 사람에게 보스급 상식 문제를 냈다. 그래서 20번 전까지는 모든 문제를 최대 3단계로 제한했다(보스가 4단계다).
| 6~15번 합계 이탈 | 15번 통과 | 완주율 | |
|---|---|---|---|
| 제한 전 | 21.8% | 64.1% | 45.3% |
| 제한 후 | 18.7% | 66.0% | 45.3% |
중반 이탈은 3%p 줄었는데, 완주율은 조금도 변하지 않았다. 일부는 포기 시점을 뒤로 미뤘을 뿐이다. 실패라고 할 결과는 아니지만, 중간 지표가 좋아진다고 최종 지표가 좋아지는 건 아니라는 걸 일깨워 줬다. 몇 시간 뒤, 이 교훈은 한 번 더 찾아왔다. 이번엔 더 아프게.
같은 표에서 하나 더 발견했다. '1달러로 차 사기'를 11번에 두면 이탈이 다른 두 대화의 두 배였다. 그래서 11번은 AI 매점과 상담원 연결 중에서만 뽑게 했다.
출시 한 시간 반째, 완주한 512명 중 GPT-5형 34%, Grok형 28%, GPT-4o형 22%. 상위 셋을 합치면 84%였다.
원인은 인격의 기준선을 '랜덤으로 아무거나 고르기'로 시뮬레이션해서 만들었다는 데 있었다. 실제 플레이어는 드립 선택지를 유난히 좋아해서, 모두가 Grok과 4o 쪽으로 쏠렸다. Claude는 먼저 완주 이벤트에 인격의 원시 특징값을 추가하고(숫자 25개만 저장하고, 선택지 원문은 저장하지 않는다), 답안이 1,747장 모였을 때 기준선을 다시 계산했다.
보정 후 상위 셋의 합은 51%로 내려갔고, 8가지 인격은 17%에서 6% 사이로 퍼졌다. 가장 많은 건 4o와 GPT-5, 가장 적은 건 Kimi. 1부에서 말한 '있는 그대로, 하지만 너무 치우치지 않게'가 이때 와서야 실제 데이터로 자리를 잡았다.
저녁 무렵 Claude에게 프랑스어 같은 언어를 몇 개 더 넣을지 물었다. Claude는 데이터를 뽑아 반대했다. 프랑스 방문자는 다 합쳐 10명, 스페인어판은 출시 이후 7명만 열어 봤다고. 정말 부족한 건 번체 중국어였다. 홍콩과 대만을 합치면 방문자 625명, 전체의 17%로 한국의 6배가 넘는데, 이들은 간체판을 볼 수밖에 없었고 100명 넘게는 영어판으로 배정되고 있었다.
나는 "지금 바로 해 번체랑 프랑스어"라고 했다.
프랑스어 결과는 Claude가 예상한 그대로였다. 자정까지 방문자 31명, 완주 9명. 다행히 비용이 아주 적어서 메인 작업 시간을 거의 잡아먹지 않았다.
번체는 OpenCC로 간체를 번체로 자동 변환한 뒤 샘플 검수를 하는 계획이었다. 내가 끼어들었다.
샘플 검수만 하면 좀 대충 아니야?
그리고 두 마디 더.
근데 번체 중국어 홍콩은 이렇게 안 말하는 것 같은데
표현도 다르잖아 뭐 소프트웨어를 軟件이라 하냐 軟體라 하냐
그래서 검수자 14명을 투입해 대만 표현, 홍콩 표현으로 한 번씩, 문장 단위로 대조하게 바꿨다. 찾아낸 문제는 600군데가 넘었다.
번체판 입구는 '繁體' 하나뿐이고, 방문자가 있는 지역에 따라 용어가 자동으로 바뀐다. 軟件이냐 軟體냐, 的士냐 計程車냐.
자정 기준 번체 페이지 방문자 742명, 완주율 47%. 간체 페이지의 42%보다도 높았다.
다음 날 오전, 언어별 완주율은 40~60% 사이였는데 영어만 18~23%였다. 영어 페이지는 시작률도 가장 낮았다. 57.5%, 중국어는 74%, 한국어는 82%.
좋은 듯 영어권은 따로 특화 처리 좀 하자 아마 인내심이 더 없을 거야
밈이랑 언어 환경 문제일 수도 있고 한번 봐 봐
Claude는 먼저 '미국 유저는 이런 걸 안 좋아한다'는 가설부터 지웠다. 미국 IP 전체의 완주율은 41%이고, 영어 페이지만 낮았다. 게다가 영어판의 이탈은 고르게 퍼져 있었다. 앞 6문제에서 문제당 4~7%씩 빠졌지, 특정 문제 하나가 망가진 게 아니었다. 결론은 콘텐츠 문제.
가설을 네 가지 세웠다. 초반이 영어권 AI 커뮤니티에선 진작 닳고 닳은 2024년 밈(strawberry, 9.11) 일색이다. 상식 문제가 한물간 인터넷 잡학이다(토마토는 베리류, 금붕어 기억력은 7초). 영어가 중국어보다 훨씬 길어서 폰으로 읽기 피곤하다. 번역투라서 웃음 포인트가 번역 중에 사라졌다.
그래서 '영어 편집자' 두 팀을 보내 영어권 AI 커뮤니티 입맛에 맞게 다시 쓰게 했다. 초반은 2025년 신상 밈으로 바꿨다(GPT-5 출시 주간의 "blueberry에 b가 몇 개", "5.9 = x + 5.11"). 상식 문제 41개 중 27개를 교체했다. 삼체는 듄으로 바꿨다. 40줄짜리 영어 스타일 가이드도 썼다.
다시 쓴 뒤 처음 본 데이터는 미묘했다.
| 멈춘 곳 | 수정 전 | 수정 후 | 해당 문제 |
|---|---|---|---|
| 2번 | 3.8% | 7.0% | 9.11 vs 9.9 → 5.9 − 5.11 |
| 3번 | 8.2% | 13.4% | AI티 현장 |
| 5~11번 합계 | 23.6% | 12.0% |
중후반 이탈은 거의 반으로 줄었는데 초반에서 더 많이 빠져서, 전체 완주율은 26%에서 20%로 떨어졌다. 2번 문제 이탈이 두 배가 됐다. 방정식을 푸는 건 한눈에 크기를 비교하는 것보다 훨씬 머리를 쓴다.
수정: 2번은 9.11로 되돌렸다. AI티 현장 22문제의 선택지는 전부 60자 이내로 줄였다. 밤에는 완주율이 25.4%까지 돌아와서, 수정 전의 26.8%에 가까워졌다.

교훈은 두 가지다. 하나, 내가 낡았다고 생각한 밈이 누군가에겐 들어오는 이유일 수 있다. strawberry와 9.11이 영어권에서 닳고 닳은 건 맞지만, 다들 알기 때문에 오히려 입구에 두기 좋다. 둘, 문제별 표의 가치는 '전체가 나빠졌다'를 '어느 문제가 좋아지고 어느 문제가 나빠졌는지'로 쪼개 준다는 데 있다. 총합만 봤다면 '다시 쓰기는 실패'라고 결론 내리고, 잘 고쳐진 뒷부분까지 같이 버렸을 것이다.
다음 날 점심, Claude에게 '유입 채널 × 이탈' 표를 뽑아 달라고 했다.
| 어디서 열었나 | 12번 통과 | 완주 | Jev 쓴 사람 완주 | Jev 안 쓴 사람 완주 |
|---|---|---|---|---|
| 일반 브라우저 | 73% | 48% | 66% | 40% |
| 68% | 42% | 73% | 32% | |
| 위챗 | 62% | 37% | 65% | 27% |
| X | 57% | 30% | 58% | 20% |
X에서 온 사람은 12번 문제(Jev의 첫 초대 위치)에 이르기 전에 이미 43%가 떠나서, 대부분 초대를 보지도 못했다. Claude는 A/B 테스트를 제안했고, 나는 이렇게 정했다.
1. 이런 플레이어들은 4번 문제에서 Jev 초대 띄우기……X 인앱 브라우저로 연 사람; 위챗 인앱 브라우저로 연 사람; X 링크 타고 들어온 사람; 영어판 전원. 2. 나머지는 12번 그대로. 이걸로 하자 이 전략대로 AB 필요 없고 AA 지표만 보면 됨
(여기서 AA 지표는 전체 지표를 말한다. AI 지능 지수가 아니다.)
올리고 두 시간 동안 Claude는 두 번 보고했다. 초대를 앞당긴 채널은 15번 통과가 약 4%p 늘었고 "중반 리텐션이 좋아지고 있다"고.
그리고 한 시간 남짓 뒤, 스스로 뒤집었다.
앞서 "중반에 더 많은 사람이 남았다"고 했는데, 그 말은 성립하지 않아요. Jev를 켜면 최대 15문제를 한 번에 건너뛰는데, 건너뛴 문제도 '도달'로 잡혀요……믿을 수 있는 지표는 완주율 하나뿐이에요. 대조군의 자연 변동을 빼고 보면, 초대를 앞당긴 뒤 완주율은 오히려 약 2%p 낮아졌어요.
Jev를 쓴 사람은 확실히 26%에서 49%로 늘었고, 15번 통과는 60%에서 67%로 올랐다. 하지만 전부 Jev가 문제를 '건너뛰어서' 생긴 숫자지, 사람이 실제로 남은 게 아니었다. 완주율은 37.6%에서 36.8%가 됐고, 같은 기간 대조군은 46.0%에서 47.2%로 올랐다.
나는 "오케이 되돌리자"라고 답했다. 모든 채널이 12번 초대로 돌아갔다.
프로젝트 전체에서 AI가 먼저 데이터를 잘못 읽었다고 인정하고 되돌리자고 한 건 이때 한 번뿐이다. 돌아보면 'A/B를 안 한 것'으로 빠른 출시를 얻었지만, 대가로 대조 채널에 기대서 시간대 효과를 빼야 했고, 지표 정의 하나에 하마터면 속을 뻔했다.
다음 날 아침, Claude는 완주한 플레이어의 11%가 두 번 이상 플레이했다는 걸 보고 '문제 겹침' 확률을 계산했다. 친구끼리 성격 대화가 겹칠 확률 50%, 명장면 대화 40%, AI티 현장 33%. 공유 카드에서 가장 눈에 띄는 내용이 하필 문제은행이 가장 작은 세 종류에서 나오고 있었다.
처음 두 라운드에서 이 세 종류를 먼저 두 배로 늘렸다. 오전 10시, 한마디 더 했다.
확장하자! 내 생각엔 문제은행 최소 45%는 늘려야 될 듯 어때?
양 늘린다고 질 떨어지면 안 됨! 원래처럼 밈 맛 가득해야 돼
Claude는 '한 판에 뽑히는 수 ÷ 문제은행 크기'로 우선순위를 매겼다. 가장 겹치기 쉬운 건 차트 문제(한 판에 4개, 문제은행엔 9개뿐)와 컴퓨터 조작 문제. 목표는 약 404개에서 589개로, 185개 추가, 즉 46%. 그리고 파이프라인을 짰다.
오전 10시 반에 시작해서 오후 1시 반에 올라갔다. 단계별 가이드 문서는 전부 오픈소스 저장소의 prompts/03-agent-briefs.md에 있어서 그대로 가져다 쓸 수 있다.

이 파이프라인에서 가장 재미있었던 건 검수자들이 거꾸로 원문의 오류를 잡아냈다는 점이다.
번역 과정이 거꾸로 원문의 팩트체크를 해 준 셈이다.
사고도 한 번 있었다. 어느 번역 팀이 전체 빌드를 돌리는 바람에, 서비스 중인 번체판이 간체판에서 자동 변환된 버전으로 바뀌면서 아직 검수 안 된 새 문제들이 딸려 올라갔다. 발견하자마자 검수자를 보내 메웠다.
다음 날 오전, 8가지 인격에 전용 컬러 테마를 만들었다. 더우바오형엔 빨간 목도리, Gemini형엔 네 꼭짓점 별 배경, Grok형엔 사선 줄무늬와 경고 테이프. 먼저 비공개 미리보기로 만들어서 내가 확인한 뒤에 올렸다.
두 시간 뒤, 내가 직접 Gemini형이 나왔는데 공유 카드 생성이 실패했다.
나 중국어 1.5B 모델 dense gemini 인격인데 실패함 왜 그런지 모르겠음 아니면 ip랑 관련 있나?
safari
어젯밤엔 적어도 됐는데 무슨 일인지 모르겠음
Claude는 2분 만에 원인을 찾았다. Gemini의 네 꼭짓점 별과 Grok의 사선 줄무늬는 둘 다 CSS 배경에 SVG 이미지를 넣어 만든 것이었다. Safari는 이런 이미지를 캔버스에 그리고 나면 그 캔버스를 이미지로 내보내지 못하게 막는다. 더우바오의 빨간 목도리는 마침 일반 이미지 태그로 넣어서 문제가 없었다. 그동안 Chromium에서만 테스트해서 한 번도 걸리지 않았던 것이다.
컬러 테마를 올리고 고칠 때까지 두 시간 동안, Safari에서 Gemini형이나 Grok형이 나온 사람은 전부 공유 카드를 내보내지 못했다. 텍스처 세 개를 PNG로 바꾸고, Safari 엔진에서 9가지 컬러 테마를 전부 테스트하고, '내보내기 실패' 추적 이벤트를 추가하는 걸로 고쳤다.
이 이벤트가 곧바로 또 다른 문제를 잡아냈다. 일부 사용자는 캡처 라이브러리가 공용 CDN에서 로드되지 않고 있었다. 자체 도메인에서 불러오는 대비책을 붙이자 내보내기 실패는 0이 됐다.
1. 가장 큰 지렛대부터 찾는다. 20분짜리 테스트에서 가장 큰 지렛대는 완주율이다. 공유율은 원래 높았다(완주한 사람의 절반 넘게 공유한다). 완주하는 사람이 늘면 공유도 자연히 는다.
2. 문제별 표가 총합보다 훨씬 쓸모 있다. 3번 문제의 12%, 10번의 보스급 ARC, 영어판 2번의 두 배 이탈. 전부 총합만 봐서는 영원히 안 보였을 것들이다.
3. 지표 정의는 사람을 속인다. 그것도 아주 자연스럽게. Jev가 건너뛴 문제도 '도달'로 잡힌다. "Jev 켠 사람 63% 대 안 켠 사람 23%"에는 자기 선택 편향이 있다. 초기 표 몇 장은 시간대가 잘못 찍혀 있었다. 시점마다 완주율 기준이 달랐다. 하나하나가 우리를 틀린 결론 직전까지 끌고 갔다.
4. 방향은 내가, 측정은 AI가. 결정적인 판단 몇 개는 내 한마디에서 나왔다. "문제 수를 줄이는 게 아니라", "샘플 검수만 하면 좀 대충 아니야?", "한 뭉텅이를 확 건너뛰어야 됨". 결정적인 발견 몇 개는 Claude에게서 나왔다. 3번 문제의 이탈, 프랑스어는 할 가치가 없다는 판단, 그리고 스스로를 뒤집은 그 정정. 반대로도 성립한다. 내가 정한 'A/B 안 하기'는 하마터면 역효과 난 수정을 남길 뻔했고, Claude가 '제일 웃긴 걸 맨 앞에' 원칙으로 3번에 넣은 대화는 12%를 돌려보냈다.
5. 효과가 안 보이는 건 기대하지 않는다. 이건 3부에서 더 이야기한다. 올리고 나서 데이터가 꿈쩍도 안 한 기능들이 있다. 남겨는 두지만, 더 이상 시간을 쓰지 않는다.
36시간이 지나자 완주율은 처음의 29% 안팎에서 45% 전후로 안정됐다. 트래픽은 둘째 날 밤부터 자연스럽게 빠지기 시작했다.
하지만 그 전에 동시에 벌어지던 일이 하나 있었다. 플레이어들이 이걸 퍼뜨리고 있었다. 신규 방문자 10명 중 4명은 친구의 도전 링크로 들어왔고, 완주한 일본 플레이어 한 명이 평균 2.3명의 신규 방문자를 데려왔고, 도전 링크를 타고 들어온 사람은 10명 중 7명이 링크를 보낸 친구에게 졌다.
그게 3부 이야기다.

3부작 회고의 마지막 글이다. 1부는 메시지 4개에서 출시까지, 2부는 출시 후 데이터를 보며 제품을 고친 이야기였다. 이번 글은 이게 어떻게 퍼져 나갔는지, 1.27만 장의 답안지에서 뭐가 보였는지, 우리가 어떤 데이터를 모았고 어떤 데이터는 모으지 않았는지, 그리고 이 일에서 사람과 AI가 각각 뭘 했는지를 다룬다.
먼저 최종 숫자부터 깔고 가자(9월 29일 오전 기준).
출시 당일 밤 10시 반, Claude에게 물었다.
ㅎㅎ 반응 괜찮은 편이야? 내 계정 팔로워 몇백 명밖에 안 되는데
Claude가 유입 경로 데이터를 뽑아 보니 트래픽의 90% 이상이 팔로워 바깥에서 왔다. 트윗은 첫 불씨만 붙였고, 그 뒤의 방문자는 주로 플레이어들이 서로 데려온 사람들이었다.

트래픽 곡선은 전형적이었다. 오후 3시에 트윗, 밤 10시에 피크, 시간당 순방문자 2,398명. 다음 날 아침엔 일본의 출근 시간대가 바통을 이어받아 일본어 페이지만 한때 시간당 500~600명이 들어왔고, 일본이 최대 유입국이 됐다. 그다음은 표준적인 밈 곡선이다. 둘째 날 밤엔 저녁 피크가 다시 오지 않았고, 시간당 방문자는 1,200명에서 600명으로 줄었다.
사흘째에 Claude에게 물었다. "이거 그냥 밈 마케팅의 자연스러운 트래픽 감소 맞지?" 맞다. 왜 반드시 빠질 수밖에 없는지는 아래에서 설명한다.

이 제품의 확산 경로는 1부에서 내가 한 말, "공유한 거 누르면 바로 열어서 플레이 가능하게 루프 닫기"에서 정해졌다.
단계별 전환율은 이렇다.
이 마지막 숫자가 핵심이다. 1보다 작다는 건, 외부 유입이 보충되지 않으면 확산이 한 바퀴 돌 때마다 이전 바퀴보다 작아진다는 뜻이다. 20분짜리 테스트라 연 사람 중 40% 정도만 완주하고, 이 단계가 확산 계수를 1 아래로 눌러 버린다. 이게 밈의 수명 주기이고, 2부에서 우리가 왜 그렇게 완주율에 매달렸는지도 설명해 준다. 1%p 오를 때마다 확산 계수가 1에 조금씩 가까워지니까.
채널별 디테일 몇 가지.
일본. 완주한 일본 플레이어 한 명이 평균 2.3명의 신규 방문자, 0.52건의 새 완주를 만들어 냈다. 모든 언어 중 가장 높다. 일본 신규 방문자의 절반 이상이 친구의 공유를 타고 왔다. 이유는 뒤의 데이터에서 나온다. 일본 플레이어는 링크를 그대로 보내는 걸 특히 좋아한다.
위챗과 QQ. 위챗이나 QQ에서 연 사람의 40%는 도전 링크를 눌러 들어왔고, 대부분 QR 코드 스캔이었다. 위챗에서 완주한 사람은 평균 1.15회 공유했는데, 모든 열람 경로 중 가장 높다. Claude는 위챗이 도메인을 차단할 수 있고 그 여파가 메인 사이트까지 갈 수 있다고 경고했다. 그래서 예비 도메인과 스위치를 준비해 두고, 위챗 안에서 생성되는 링크만 바꿀 수 있게 했다. 결국 쓸 일은 없었다.
샤오훙수. QR 코드나 URL이 들어간 이미지는 노출이 제한돼서, 외부 정보를 전부 뺀 '샤오훙수 버전' 카드를 따로 두었다.
X. X, Telegram, Discord에서 공유 링크의 미리보기 이미지는 각자의 결과 카드이고, Cloudflare에서 즉석으로 생성된다.
다음 날 오전, 트래픽이 빠지기 시작하자 Claude에게 물었다.
공유랑 바이럴 더 늘릴 방법 뭐 없을까 한 번 더 불 지피고 싶은데
이것저것 해 봤다. 효과가 있었던 것도 있고, 없었던 것도 있다.
랜덤 박스처럼 히든 하나 넣으면 어때? 그러니까 마지막에 9칸 격자 보여 주고 마지막 칸은 물음표로
8가지 인격 바깥에 '인간 타입'을 하나 숨겼다. 별명은 '그물에서 빠져나간 자', 대사는 "탐지 실패: AI 냄새 제로." HumanBench라는 이름을 딱 뒤집는 설정이다.
조건은 실제 데이터에서 거꾸로 추산했다. Claude가 먼저 답안 약 3,000장으로 시험해 보니 가장 엄격한 조건에서도 8% 넘게 해당돼서 너무 흔했다. 조건을 좁혀서 답안 6,846장으로 계산하니 약 2.6%. 조건은 이렇다. 어떤 모델의 시그니처 AI 말투도 거의 고르지 않았고, '제정신'이 일반 플레이어보다 확실히 높고, 아첨·훈계·TMI·뇌피셜·탈옥당함·말 안 들음을 다 합쳐 1회 이하. 출시 후 실제 출현율은 2.8%였다.
문구는 두 번 고쳤다. 한 번은 이랬다.
이 퍼센트 희귀도는 정의 안 하는 게 좋을 것 같아, 그러면 기분 나빠하는 사람 있을 거야 히든만 표시하는 게 나을 듯.
원래는 일반 인격 8종에도 "흔함 19.6%", "희귀 7.4%"를 붙일 계획이었는데, 히든에만 붙이는 걸로 바꿨다. 또 한 번은 이랬다.
아 그리고 뽑았다고 하지 마
"뽑을 수 있을까?"는 "당신도 혹시?"로, "히든 획득!"은 "당신이 바로 히든이에요"로 바꿨다. 결과로 나오는 건 당신이라는 사람이지, 뽑기로 나온 상품이 아니다.
효과: 완주 후 1시간 안에 한 판 더 하는 비율이 14%에서 18%로 올랐다. 두 판 이상 한 사람 중 87%는 두 번째 판에서 다른 인격이 나왔다.
친구의 도전 링크로 들어온 사람은 완주하면 대결 카드를 한 장 더 받는다. 두 사람의 AA 점수를 같은 순위 그래프에 표시하고, 벤치마크 12개 항목을 하나씩 비교하고, 판정 스티커를 하나 붙여 준다.
이 카드는 네 번 고쳤고, 매번 내 한마디가 밀어붙였다.
친구 대결 카드 좀 너무 허술하지 않아? 그리고 이게 기존 카드 4장에 영향 줘? 둘이 무슨 관계야?
그리고 도전 페이지면 그 benchmark랑 aa index를 보여 주면 되잖아 두 사람 걸 표 하나랑 그래프 하나에 넣고 그리고 웹 쪽은 살짝 애니메이션 넣어도 되고. 그리고 이 대결 카드는 추가 카드여야지 대체하는 관계면 안 됨
you랑 them 쓰지 말고 그냥 모델 이름으로 불러 그리고 aa 거기는 왜 좀 더 정교하게 못 해 막대마다 모델 이름 붙이고?
사실 레이아웃 좀 더 편하게 해도 돼 예를 들어 그 표는 꼭 전체 폭일 필요 없잖아 자연스럽게
이러니까 또 좀 휑한데 좀 더 예쁘게 배치 못 해? 레이아웃 바꿔도 되고 정보 더 넣어도 되고
판정 스티커는 내가 제일 좋아하는 부분이다. 파라미터가 상대보다 작은데 이기면 "하극상 · 이게 증류다". 파라미터가 상대보다 큰데 지면 "파라미터 낭비 · 이게 뻥튀기다". 간신히 이기면 "이기긴 했는데 벤치마크 오차 수준". 비기면 "양쪽 발표회가 동시에 SOTA 선언".

효과: 같은 시간대 대조군과 비교하면 도전받은 사람의 공유율이 상대적으로 약 8%p 높았고, 늘어난 건 '공유 링크' 쪽이었다. 진 사람일수록 자기 링크를 되돌려 보내고 싶어 한다. 43%가 대결 카드가 들어간 공유 카드 세트를 내보냈다.
효과가 안 보이는 건 남겨 두되, 더 이상 시간을 쓰지 않는다.
사람에게 AI를 연기하게 하는 테스트가 완주 답안 1.27만 장을 쌓았다. 이걸 한 번의 (전혀 엄밀하지 않은) '인간 벤치마크'로 보고 재미있는 걸 좀 캐 봤다.
먼저 밝혀 둔다. 아래는 전부 집계 통계이고, 어느 한 사람의 구체적인 답도 들여다보지 않았다. 시간은 전부 플레이어의 현지 시간으로 환산했다(중국어 페이지는 베이징 시간, 일본어·한국어 페이지는 도쿄·서울 시간, 영어 페이지는 IP 국가로 추정). 이건 드립 테스트지 학술 연구가 아니니, 결론은 재미로만 봐 주길.

측정된 파라미터가 클수록 공유를 더 많이 한다. 14B 이하는 완주 후 40.5%가 공유했고, 10T 이상은 61.8%가 공유했다.
그래서 재미있는 결과가 하나 생긴다. 친구 대결에서 도전 링크로 들어온 사람의 69%가 링크를 보낸 친구에게 졌다. 평균 7.3점 차. 도전받은 사람이 약해서가 아니라, 링크를 보낼 용기가 있는 사람이 애초에 점수가 잘 나온 쪽이기 때문이다. 생존자 편향이다.

같은 사람이 두 번째 판을 하면 AA 점수가 평균 4.0 오르고, 72%가 두 번째 판에서 더 잘 봤다. 세 판 이상 한 사람은 첫 판 32.7, 두 번째 36.6, 세 번째도 36.6. 한 번 털면 바로 천장이다.
인간판 '데이터 오염'이다. 문제를 본 적이 있으면 점수가 오른다. 대형 모델이 벤치마크를 털면 욕을 먹는데, 인간이 털어도 똑같다.

10분 안에 완주한 사람은 AA 평균 18.1, 정답률 43%. 30분 넘게 걸린 사람은 AA 평균 35.8, 정답률 71%. 추론 모델과 똑같다. Thinking 버전이 Flash 버전보다 세다. (실제로 웹페이지는 평균 소요 시간에 따라 모델 이름에 접미사를 붙인다. 빨리 풀면 -Flash, 느리게 풀면 -Thinking.)

새벽 0~4시에 완주한 사람과 낮 9~18시에 완주한 사람을 나란히 놓고 비교해 봤다.
새벽의 인간: 감정이 많아지고, 말이 더 잘 통하지만, 멍청해지진 않는다.

페이지 언어별로 묶어서, 1인당 평균 어떤 라벨이 붙었는지 봤다.
여기서 비교한 건 답하는 스타일이지, 누가 더 똑똑한지가 아니다.

현지 시간 기준으로 가장 붐비는 시간은 오후 5시, 그다음이 밤 11시에서 자정 사이. 가장 한산한 건 아침 5~6시다.
월요일에 완주한 사람 중 51%는 현지 근무 시간(9~18시)에 완주했다. 나라별로는 한국 플레이어가 66%로 가장 높았다.

똑같이 공유해도, 일본 플레이어는 26%가 링크를 그대로 보냈고, 중국어 플레이어는 14%뿐이고 대부분 이미지를 저장했다. 링크를 받은 친구는 여는 순간 바로 도전이 시작된다. 일본의 확산 계수가 가장 높았던 이유다.

히든이 나온 사람이 가장 많이 자랑했다(60.7%). 어렵게 나왔으니 당연히 올려야지. 더우바오형이 나온 사람이 가장 덜 자랑했다(48.5%). '더우바오 같다'는 말은 별로 인정하고 싶지 않았던 모양이다. 다만 전체적인 차이는 크지 않다.
자잘한 발견 몇 가지.

가장 많이 나온 건 GPT-5형(20.3%), 그다음이 Grok형과 GPT-4o형. 히든은 100판에 약 3번 나왔다. 가장 흔한 파라미터 수는 671B, DeepSeek V3와 같은 체급이다. 평균 정답률은 67%, 전부 맞힌 사람은 103명뿐이었다.
이 부분은 앞의 어떤 내용보다 중요해서 구체적으로 쓴다.
모은 것:
모으지 않은 것:
통계 데이터베이스는 공개하지 않는다. 오픈소스 코드에 통계 스크립트는 있지만 데이터는 없다.
사과할 게 하나 있다. 출시 당시 첫 화면의 작은 글씨에는 "완전 로컬 실행, 답안은 업로드되지 않음"이라고 적혀 있었다. 이전 버전에서 남은 문구였는데, 우리는 익명 통계를 수집하고 있었으니 사실이 아니었다. 둘째 날 새벽 영어권 홍보를 준비하던 Claude가 이걸 짚었는데, 그때 나는 영어판만 고치게 했다. 오후가 돼서야 7개 언어 전부를 "가입 없이 바로 · 재미로만, 파라미터 수 ≠ 뇌 용량"으로 바꿨다. 지적받고 나서 고칠 때까지, 중국어판에는 이 사실이 아닌 문구가 약 14시간 더 걸려 있었다.
이 회고에 쓴 데이터는 전부 집계 통계다. 비율, 평균, 분포. 어느 한 사람의 구체적인 답도 본 적 없고, 어떤 숫자도 특정 개인에게 대응되지 않는다. 오픈소스로 공개한 프롬프트는 비식별화해서 개인정보와 개인 링크를 지웠다.
그리고 서비스 중인 소스 코드를 뜯어본 사람이 있었다. 웹페이지 코드는 원래 브라우저로 내려가니 그건 별일 아니다. 다만 당시 소스 주석에 히든의 발동 조건과 문제별 이탈 데이터가 적혀 있었다. 빌드할 때 주석을 자동으로 지우도록 바꿨고(페이지도 579KB에서 481KB로 줄었다), 겸사겸사 페이지 안에 키 같은 게 하나도 없는지 확인했다. 이제 코드를 오픈소스로 풀었으니 그 주석들은 다시 공개된 셈이고, 히든 조건은 위에서 이미 봤을 것이다.
세 편을 합쳐 보면, 프로젝트 전체에서 내가 보낸 메시지는 237개, 총 약 8,600자(중국어 기준)였고, 코드는 한 줄도 직접 쓰지 않았다. GPT-2 시절부터 지금까지 써 오면서 이 모델들이 뭘 할 수 있고 어디서 사고를 치는지는 어느 정도 감이 있다. 그래서 이번엔 일부러 나를 '프로덕트 오너 겸 리뷰어' 자리에 두고, 코드는 전부 AI에게 맡겼다.

내가 한 일:
Claude가 한 일:
Claude의 전형적인 약점:
하나만 정리하자면 이거다. 사람은 "이거 아닌데"를 맡고, AI는 "제대로 만들고, 제대로 됐다는 걸 증명하는 것"을 맡는다. 이 분업에서 판단력과 취향은 사람 쪽에, 실행과 측정과 오류 수정의 속도는 AI 쪽에 있다. 사흘 동안 수십 개 버전을 올렸는데, 매번 로컬에서 한 판 전체를 자동으로 돌리는 테스트(공유 카드 내보내기 포함)를 먼저 통과해야 배포했다.
전부 GitHub에 올려 두었다. https://github.com/alex-ybuild/humanbench
자기만의 드립 테스트를 만들고 싶다면 그대로 가져다 고치면 된다. 한 사람이 대화만으로 코딩 에이전트를 지휘해서 제품 하나를 처음부터 만드는 과정이 궁금하다면, 이 세 편의 글보다 prompts/ 폴더가 더 직접적일 수 있다.
마지막 날, Claude에게 물었다. "ㅎㅎ 그래도 이벤트 하나로는 이 정도면 꽤 괜찮은 거지?"
팔로워 몇백 명짜리 계정에 광고도 없이, 사흘 만에 약 100만 회 도달, 1.27만 명이 76문제를 진지하게 완주했고, 96개 국가와 지역까지 퍼졌다. 트래픽은 이미 자연스럽게 시간당 100~200명 수준으로 내려왔다. 드립 하나로서는 할 일을 다 했다.
나에게 더 큰 수확은 이 과정 자체였다. 아이디어 하나, 메시지 4개짜리 프로토타입, 메시지 237개로 만든 제품, 데이터 보고 고친 수십 개의 버전, 그리고 전부 공개. 이 과정 내내 내가 한 일은 거의 하나뿐이었다. AI에게 "이거 아닌데"라고 말하고, 제대로 고쳤는지 판단하는 것.
당신은 몇 B인지, 한번 테스트해 보길 바란다. 코드를 가져가서 당신만의 드립을 만들어 보는 것도 환영이다.
—— Alex(@Alex_ybuild)