모바일 앱과 게임 UA를 위한 크리에이티브 테스트 시스템은 새 광고 묶음을 신뢰할 수 있는 우승작으로 바꾸고, 그 우승작을 다음 묶음으로 다시 바꾸는 루프입니다. 저는 제가 직접 구매하는 캠페인 안에서 이 루프를 만들고 운영하므로, 지출을 읽는 사람이 곧 다음 버전을 쓰는 사람입니다.
이 페이지는 크리에이티브 테스트가 무작위처럼 느껴지거나, 팀이 광고를 많이 내보내는데도 배우는 것이 적은 그로스 또는 UA 리드를 위한 것입니다. 시스템이 무엇인지, 무엇이 필요한지, 그리고 UGC와 AI 영상이 어디에 들어맞는지를 설명합니다. 방법론의 첫 단계는 글로 정리되어 있고, 광고 제작은 광고를 만듭니다. 이 페이지는 다음에 무엇을 만들지 결정하는 시스템입니다.
이 페이지에 담긴 플랫폼 정보는 2026년 9월 23일과 24일 기준 Google, Meta, TikTok의 공식 문서와 대조해 확인했습니다.
크리에이티브 테스트는 왜 무작위처럼 느껴질까요
모바일 앱과 게임을 위한 크리에이티브 테스트는 팀이 라이브 캠페인 안에서 광고를 비교하고, 테스트가 아니라 플랫폼이 누가 무엇을 보는지 결정할 때 무작위처럼 느껴집니다. Meta, Google, TikTok은 각자의 모델이 잘될 것으로 예상하는 광고에 예산을 몰아주므로, 초반에 앞선 광고가 지출을 독차지하고 나머지는 공정한 샘플을 받아보지 못합니다. 돌아오는 결과는 아이디어의 순위가 아니라 딜리버리의 순위입니다. 버전마다 세 가지를 동시에 바꾸면 다음 라운드로 이어지는 것이 아무것도 없습니다. 무작위성은 설계 자체에 있습니다.
Gordon, Zettelmeyer, Bhargava, Chapsky는 페이스북 실험 15건을 관찰 기반 추정치와 비교했고, 그 추정치가 실험 결과를 재현하지 못하는 경우가 많다는 것을 발견했습니다. 즉 대시보드상의 승자가 자동으로 진짜 승자는 아니라는 뜻입니다. 그래서 큰 배치를 처음 읽을 때는 걸러내는 데서 그칩니다. 소거 라운드는 모든 광고를 전용 설치 캠페인에서 동시에 출발시켜 지출을 읽고, 최종 판단은 매출이 나올 때까지 기다립니다. Meta가 계속 스케일하던 광고 다섯 개를 제거했을 때, 알고리즘은 그 다섯 개가 한 번도 도달하지 못한 목표치를 넘는 새로운 크리에이티브 여섯 개를 드러냈습니다.
왜 크리에이티브 반복 속도가 충분히 빠르지 않을까요
모바일 앱이나 게임 UA 팀이 대체로 광고 크리에이티브를 충분히 빠르게 반복하지 못하는 이유는 루프 안에 핸드오프가 끼어 있기 때문입니다. 광고가 지쳤다는 것을 보는 사람이 브리프를 쓰고, 그 브리프는 스튜디오 차례를 기다리고, 스튜디오는 포트폴리오를 보고 추측하며, 다음 버전은 우승작이 이미 시들해진 뒤에야 도착합니다. 제약은 크리에이티브 공급이고, 그 안의 병목은 제작 속도가 아니라 다음에 무엇을 만들지 결정하는 일입니다. 빠른 반복이란 지출 배분을 읽는 사람이 곧 우승작의 다음 버전을 쓰는 것을 뜻하며, 그 사이에 브리프도 어카운트 매니저도 끼어들지 않습니다.
제가 운영하는 방식이 바로 이것입니다. 매 라운드는 서면 판단으로 끝나고, 다음 아이디어는 거기서 나오며, 우승작은 버전이 되고 패배작은 다시 만들지 않습니다. Horse Racing Solitaire에서는 175개의 광고가 한 계정에서 5개월 동안 돌았고, 그중 14개가 설치당 1파운드 미만이었습니다. 외부 스튜디오의 광고가 브리프만 받고 계정 접근권은 받지 못한 채 합류했을 때, Meta는 그 광고에 배분하던 예산 비중을 22일 동안 30%에서 4.5%로 끌어내렸습니다. 광고 제작은 테스트 버전을 먼저 만들고 우승작만 마무리합니다.
크리에이티브 테스트 시스템은 어떻게 만들까요
앱과 게임 UA를 위한 크리에이티브 테스트 시스템은 다섯 부분으로 이루어져 있습니다. 두 층위의 테스트입니다. 서로 크게 다른 콘셉트는 구매 기준으로 아이디어 전체를 놓고 판단하고, 한 콘셉트의 여러 버전은 이름 붙인 변수 하나를 대조군과 비교해 바꾸므로 승리가 무언가를 알려줍니다. 모든 광고에 같은 출발선을 주는 구조입니다. 전용 설치 캠페인 안에서 테스트 버전을 돌리고, 모든 광고를 동시에 출시하며, 지출을 선별 시그널로 읽고, 예산은 건드리지 않습니다. 출시 전에 써 두는 의사결정 규칙입니다. 지표, 지출 한도, 리뷰 기간, 무엇을 결론 없음으로 볼지입니다. 테스트한 변수와 그 결정을 담은 모든 광고의 기록입니다. 그리고 우승작만 다시 제작하는 프로덕션 라인입니다.
앞의 세 가지는 구매로 검증할 수 있는 것보다 버전이 더 많은 계정을 제가 운영하는 방식입니다. 배치가 작으면 곧바로 구매 테스트로 넘어가며, 소거 라운드는 예산 계산까지 포함해 글로 정리되어 있습니다. 대부분의 팀이 건너뛰는 것은 기록입니다. 라운드는 각 광고의 지출, 설치, 초기 행동, 결정을 기록하며, 그 기록에는 바뀐 변수와 다음 가설도 함께 있어야 합니다. 규칙이 먼저입니다. Johari, Koomen, Pekelis, Walsh는 테스트를 반복해서 확인하다가 처음으로 유의미해지는 시점에 멈추면 거짓 양성이 늘어난다는 것을 보여주었습니다. 저는 매출을 기준으로 판단을 내리는데, 같은 IPM과 CPI 뒤에 설치 대비 구매 전환율 5%가 숨어 있을 수도, 20%가 숨어 있을 수도 있기 때문입니다.
| 플랫폼 | 제공하는 것 | 읽는 방법 |
|---|---|---|
| Meta | A/B 테스트: 변수 하나, 측정 가능한 가설, 다른 캠페인이 쓰지 않는 오디언스, 7일에서 30일 | 각 그룹 안에서도 딜리버리는 여전히 최적화됩니다. 즉 Meta가 노출을 배분하는 방식에서 어떤 광고가 더 잘 도는지를 보여줄 뿐입니다 |
| TikTok | Split Test: 가설을 먼저 세우고, 의미 있게 다른 변수 하나, 예상 검정력 80% 이상, 7일에서 30일, 진행 중 수정 불가 | Smart Creative와 Automate Creative 모두 스플릿 테스트를 지원하지 않으며, Smart Creative는 피로도가 높다고 분류한 광고를 자동으로 일시 정지시킵니다 |
| Google App campaigns | Directional experiment: 명확한 결과를 위해 테스트당 속성 하나, 특정 App 캠페인 설정에만 적용, 기본 종료일 14일, 고정된 예산이나 기간 규칙 없음 | 소재들은 광고로 조합되어 서로 상대적으로 평가되며, 독립적으로 노출을 측정하는 것이 아닙니다 |
크리에이티브 테스트 시스템에서 UGC와 AIGC는 어디에 들어맞을까요
UGC와 AIGC는 앱과 게임을 위한 크리에이티브 테스트 시스템 안에서 테스트할 포맷이지, 그 자체로 답은 아닙니다. 크리에이터가 자기 폰으로 찍은 영상은 광고가 아니라 게시물처럼 읽히며, 앱이라면 대개 훅은 화면을 보여주기 전에 누군가 자기만의 말로 문제를 짚어주는 것입니다. AI 영상은 뒤에 촬영이 없으므로, 아무도 촬영하기 전에 오프닝 멘트 세 개를 실제 관객 앞에 놓아볼 수 있습니다. 어느 쪽도 기본값으로 이기지는 않습니다. 크리에이터 보증에 대한 근거는 크리에이터, 제품, 플랫폼에 따라 달라지고, AI로 만든 광고에 대한 근거는 아직 초기 단계이며 결제자가 아니라 참여도를 측정합니다.
AI 영상이 먹히는 주장을 찾아내면, 크리에이터는 그 이긴 주장을 촬영하고, 게임플레이나 앱 화면 캡처는 제품이 스스로를 파는 곳이라면 어디든 앞장섭니다. 어느 조합을 쓸지는 계정의 판단이 결정합니다. EatBetter에서는 유료로 돌린 크리에이터 콘텐츠가 2개월 만에 월간 반복 매출을 1만 달러에서 18만 달러로 끌어올린 엔진이었습니다. Barari, Eisend, Jain이 135건의 실험을 검토한 결과 크리에이터 보증은 평균적으로 참여도와 구매 의도를 끌어올리는 것으로 나타났습니다. Kapoor와 Kumar의 현장 실험에서는 개인화된 생성형 영상이 한 리테일러의 기존 고객들 사이에서 참여도를 높였지만, 개인화와 AI를 분리해서 보지 않았고 설치에 대해서는 아무것도 측정하지 않았습니다. 앱을 위한 UGC 광고와 AI UGC 광고를 참고하세요.
크리에이티브 테스트 시스템을 만드는 전문가는 무엇을 할까요
모바일 앱과 게임을 위한 크리에이티브 테스트 시스템을 만드는 전문가는 루프를 세우고, 운영하고, 계속 돌아가게 남겨둡니다. 구체적으로는 계정이 무엇에 보상해왔는지에서 콘셉트를 쓰고, 각 버전이 무엇을 테스트할지 정하고, 모든 광고가 같은 출발선에서 시작하도록 테스트를 설계하고, 허영 지표가 아니라 지출을 읽고, 예산을 갉아먹기 전에 패배작을 중단하고, 다음 라운드가 출발할 판단을 써 두는 일입니다. 또한 내부 팀을 훈련시키는 일이기도 합니다. 한 사람의 머릿속에만 있는 시스템은 시스템이 아니기 때문입니다. 모든 소재를 제작하는 것은 별개의 일입니다.
저는 이것을 UA 리테이너 안에서 해왔고, 그 안에서 광고는 제가 운영하는 캠페인에서 테스트됩니다. Deutsche Telekom에서는 사내 크리에이티브 테스트 프로세스를 구축하고 팀이 스스로 UA를 운영하도록 훈련시켰습니다. 그리고 광고 제작을 통해서도 해왔으며, 여기서는 판단이 광고와 함께 돌아옵니다. 제가 여는 대부분의 계정에서 크리에이티브 공급이 결정적인 제약이며, 그래서 Growth Audit은 무엇이 테스트되었는지, 무엇이 검증 없이 나갔는지, 지출이 승자를 고르는지 허영 지표가 고르는지를 읽습니다.
왜 크리에이티브 테스트와 퍼포먼스 마케팅을 한 사람에게 맡겨야 할까요
크리에이티브 테스트와 퍼포먼스 마케팅을 한 사람에게 맡기면, 대부분의 크리에이티브 학습이 새어나가는 그 핸드오프가 사라집니다. 지출 배분을 읽는 사람이 다음 콘셉트를 씁니다. 전환 시그널을 설정한 사람은 저렴한 설치 광고가 결제자를 데려온 더 비싼 광고에 왜 졌는지 압니다. 이 업무를 스튜디오와 에이전시, 바이어로 나누면 각자는 서로에게 늘 데이터보다 낡은 문서를 넘기게 됩니다. 한 사람이 소유하면 더 빠르고 판단도 정직합니다. ROAS에 대한 책임을 지는 사람이 같은 사람이기 때문입니다.
리테이너 안에서는 제가 미디어를 사고, 시그널을 소유하며, 크리에이티브 루프를 운영하고, 프로덕션이 범위에 포함되면 제 네트워크가 광고를 만듭니다. 한 구독 앱 계정에서는 콘셉트와 그 버전이 917개 광고 전반의 ROAS 편차 중 25.2%를 설명했고, 언어는 4.8%를 설명했습니다. 이는 크리에이티브 기록과 매출이 같은 사람 손에 있을 때만 얻을 수 있는 판단입니다. Signal Engineering이 먼저입니다. 망가진 데이터 위의 테스트 루프는 잘못된 승자를 더 빨리 찾아낼 뿐이기 때문입니다. 모바일 게임을 위한 paid UA와 구독 앱을 위한 paid UA는 제품에 따라 루프가 어떻게 달라지는지 설명합니다.
적합한 대상
- paid UA에 월 10만 달러 안팎을 쓰고 있거나, 그 수준에 도달할 자금이 확보된 구독 앱과 모바일 게임
- 크리에이티브를 많이 내보내면서도 어떤 광고가 왜 이겼는지 말하지 못하는 팀
- 1등 광고가 피로해졌는데 다음 배치에 테스트 계획이 없는 게임
- 크리에이티브를 위해 외부 스튜디오를 써봤고 이를 테스트 시스템과 비교해보고 싶은 팀
제공 내용
- 고객님의 광고 계정에 세팅된 테스트 루프입니다. 전용 설치 캠페인에서 테스트 버전을 돌리고, 모든 광고를 동시에 출발시키며, 지출이 결정하고, 우승작은 제대로 다시 제작합니다
- 제가 소유하는 크리에이티브 브리프와 소재 전략이며, 크리에이티브 프로덕션을 추가하시면 광고는 제 네트워크가 제작합니다
- 매 라운드 끝에 나오는 서면 판단입니다. 무엇이 이겼는지, 무엇이 졌는지, 다음에 무엇을 만들지입니다
- 목표 대비 주간 수치이며, 크리에이티브 반복 속도를 제가 스스로 책임지는 지표 중 하나로 삼습니다
- 고객님의 팀이 계속 보유하는 문서와, 저 없이도 이 프로세스를 운영할 수 있는 훈련입니다
자주 묻는 질문
크리에이티브 테스트가 왜 무작위처럼 느껴질까요
플랫폼이 최적화하고 있는 캠페인 안에서 광고를 비교하면 크리에이티브 테스트는 무작위처럼 느껴집니다. 그러면 초반에 앞선 광고가 지출을 독차지하고 나머지는 공정한 샘플을 받지 못합니다. 해법은 설계를 바꾸는 것입니다. 전용 설치 캠페인, 모든 광고의 동시 출발, 선별 시그널로서의 지출, 그리고 출시 전에 써 두는 의사결정 규칙입니다. 소거 라운드가 바로 그 설계입니다.
광고 크리에이티브 반복 속도가 왜 충분히 빠르지 않을까요
UA 팀의 반복이 대체로 느린 이유는 수치를 보는 사람과 다음 광고를 만드는 사람 사이에 핸드오프가 끼어 있고, 브리프는 그 사이에 기다리면서 낡아가기 때문입니다. 저는 지난 라운드의 판단에서 곧바로 다음 버전을 쓰며, 그 사이에 브리프도 어카운트 매니저도 끼어들지 않습니다. 한 계정에서 5개월 동안 175개의 광고가 그 속도입니다.
크리에이티브 테스트 시스템은 어떻게 만드나요
콘셉트 테스트와 버전 테스트를 분리하고, 모든 광고가 같은 출발선에서 시작하는 구조로 테스트하고, 출시 전에 지표와 지출 한도를 써 두고, 테스트한 변수와 결정을 담아 모든 광고를 기록하고, 우승작만 다시 제작하세요. 각 플랫폼의 테스트 도구는 도움이 되지만, 어느 것도 가설이나 매출을 기준으로 한 판단을 대신하지는 못합니다.
UGC와 AIGC는 크리에이티브 테스트 시스템에 속하나요
네, 답이 아니라 테스트할 포맷으로서 그렇습니다. AI 영상은 아무도 촬영하기 전에 어떤 주장이 먹히는지 테스트하고, 카메라 앞 크리에이터는 반응이 제품을 팔아줄 때 스케일이 붙는 경향이 있으며, 게임플레이나 앱 화면 캡처는 제품이 스스로를 파는 곳에서 앞장섭니다. AI UGC 광고가 무엇에 유용한지는 별도 페이지에 있습니다.
크리에이티브 테스트 시스템을 만드는 전문가는 무엇을 하나요
계정을 읽고, 계정이 보상해온 것에서 콘셉트를 쓰고, 각 버전이 무엇을 테스트할지 정하고, 테스트를 설계하고, 지출을 읽고, 패배작을 중단하고, 다음 라운드가 출발할 판단을 써 두고, 고객님의 팀이 이를 운영하도록 훈련시킵니다. Deutsche Telekom에서는 사내 크리에이티브 테스트 프로세스를 구축하고 이를 넘겨주는 것이 그 일이었습니다.
크리에이티브 테스트와 퍼포먼스 마케팅을 한 사람이 맡아야 하나요
제가 다루는 지출 규모에서는 그렇습니다. 지출 배분과 전환 시그널, 예산 결정이 다음 콘셉트로 이어지는데, 이를 스튜디오와 에이전시, 바이어로 나누면 그 사이마다 문서가 끼어듭니다. Fractional Head of UA가 맡는 범위는 채널과 측정, 크리에이티브 테스트를 하나의 업무로 나열합니다.
크리에이티브 우승작이라고 부를 수 있기까지 얼마나 걸리나요
소거 라운드는 며칠간의 딜리버리 후, 또는 출시 전에 정한 지출 한도에 도달했을 때 중 먼저 오는 시점에 판단을 내립니다. 그 우승작이 실제로 결제자를 데려오는지는 고객님의 매출이 무르익는 데 걸리는 시간만큼 걸리며, ROAS가 의미를 가지려면 구매가 몇 건 필요한지는 계정마다 다릅니다.
출처
- What are best practices for A/B tests for Meta ads? Meta Business Help Center. 변수 하나를 테스트하고, 측정 가능한 가설에서 시작하며, 다른 진행 중인 캠페인이 쓰지 않는 오디언스를 사용하고, 최소 7일에서 최대 30일간 진행합니다. 2026년 9월 24일 브라우저에서 확인.
- Split Test Best Practices TikTok Business Help Center, 2026년 1월 최종 업데이트. 가설을 먼저 세우고, 의미 있게 다른 변수 하나, 예상 검정력 80% 이상, 7일에서 30일, 진행 중 수정 불가. 통계적 상수가 아니라 제품 자체의 권장 사항입니다. 2026년 9월 23일 확인.
- About Smart Creative TikTok Business Help Center, 2025년 11월 최종 업데이트. 피로도가 높다고 분류한 크리에이티브를 일시 정지시키며 스플릿 테스트는 지원하지 않습니다. 이 피로도 분류는 독립적으로 검증되지 않았습니다. 2026년 9월 23일 확인.
- About Automate Creative TikTok Business Help Center, 2026년 9월 최종 업데이트. 고객님의 소재를 Symphony AI로 변형한 버전이며, 스플릿 테스트는 지원하지 않습니다. 2026년 9월 23일 확인.
- Set up a directional experiment for App campaigns Google Ads Help. 명확한 결과를 원할 때는 테스트당 속성 하나, 기본 종료일 14일, 엄격한 일률적 예산이나 기간 규칙은 없으며, 테스트가 진행되는 동안 선두 그룹이 바뀔 수 있습니다. 현재는 특정 App 캠페인과 동영상 설정에만 적용됩니다. 업데이트 날짜는 표시되어 있지 않습니다. 2026년 9월 23일 확인.
- About asset reporting for App campaigns Google Ads Help. 광고 하나에 여러 소재가 들어갈 수 있고 평가는 상대적이므로, 소재별 행은 독립적인 노출 테스트가 아닙니다. 2026년 9월 23일 확인.
- A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook Gordon, Zettelmeyer, Bhargava, Chapsky, Marketing Science, 2019. 미국의 페이스북 실험 15건, 사용자 관측치 5억 건, 노출 16억 건. 저자 두 명은 페이스북 직원이었으며, 앱에 한정된 연구는 아닙니다.
- Always Valid Inference: Continuous Monitoring of A/B Tests Johari, Koomen, Pekelis, Walsh, Operations Research, 2022. 정해진 기간을 둔 테스트를 반복해서 확인하다가 유의미해지는 시점에 멈추면 거짓 양성이 늘어납니다. 일반적인 웹 실험이며, 이 방법을 구현한 Optimizely의 지원을 받았습니다.
- A meta-analysis of the effectiveness of social media influencers: Mechanisms and moderation Barari, Eisend, Jain, Journal of the Academy of Marketing Science, 2025년 온라인 게재. 논문 71편, 실험 연구 135건, 효과 크기 571개. 결과 지표는 앱 설치나 LTV가 아니라 참여도와 구매 의도이며, 효과는 크리에이터, 제품, 플랫폼에 따라 달라집니다.
- Frontiers: Generative AI and Personalized Video Advertisements Kapoor, Kumar, Marketing Science, 2025. 인도의 한 리테일러의 기존 고객 21,328명을 대상으로 한 WhatsApp 현장 실험이며, 개인화된 생성형 영상이 참여도를 약 6에서 9퍼센트포인트 끌어올렸습니다. 개인화, 영상, AI 제작 여부는 따로 구분되지 않았으며, 결과 지표는 설치나 매출이 아니라 참여도입니다.