Custom Product Pages Apple и Play Experiments Google существуют с 2021 года, но в мобильном гейминге creative testing в 2026 году впервые напрямую связан с реальной атрибуцией. В топовых рынках стоимость органического установки выросла на %400, и каждый прирост IPM, полученный через CPP, напрямую влияет на 6-месячный LTV. Новые методы расчета статистической значимости сократили длительность тестирования с 12 недель до 6 — в этой статье мы выстраиваем этот цикл.
Почему Custom Product Pages теперь приоритет
Когда вы создаёте CPP в Apple, каждый вариант получает собственную deep link. Направляя эту ссылку в кампании Apple Search Ads, контент инфлюэнсеров или сеть премиум-издателей, вы видите в графе атрибуции, какой creative конвертирует в каком сегменте. До 2025 года это было невозможно — весь трафик поступал на дефолтный лист App Store, и вы только предполагали производительность creative.
Теперь другое: каждая кампания отправляет трафик на разный CPP, и метрика IPM в App Store Connect соответствует campaign ID. Для F2P hyper-casual игр разница %5 в IPM означает экономию $40.000 CPI в месяц. Вот почему CPP теперь не опция — это обязательная среда тестирования.
На Google Play Play Experiments работает по похожей логике, но механизм распределения трафика отличается: Google автоматически делает split %50-%50, ручное распределение невозможно. Это ограничивает некоторые сценарии, но упрощает расчет статистической значимости — каждый вариант получает равное воздействие.
Расчет длительности теста
6-недельный цикл основан на такой формуле:
minimum_sample = (z_score^2 * p * (1-p)) / (margin_of_error^2)
weekly_impressions = average_daily_traffic * 7
weeks_needed = minimum_sample / weekly_impressions
Для игры с 10.000 impressions в день при уровне доверия %95 и погрешности %2:
| Метрика | Значение |
|---|---|
| z_score (95% доверие) | 1.96 |
| p (ожидаемая конверсия) | 0.05 |
| margin_of_error | 0.02 |
| minimum_sample | 456 установок |
| weekly_impressions | 70.000 |
| weeks_needed | 6.5 |
Вы достигаете статистической значимости за 6 недель. Ожидание 12 недель — ненужный риск. Когда результат готов, начинайте итерацию.
Приоритизация скриншотов vs видео vs иконки
Два creative asset оказывают наибольшее влияние на IPM: первый скриншот и иконка приложения. Видеопревью автоматически воспроизводится, но %68 пользователей скролят за 3 секунды — статический скриншот дает более контролируемое сообщение.
Приоритет тестирования в таком порядке:
- Вариант иконки — 3 варианта, каждый с разной цветовой схемой. В casual играх теплые цвета показывают на %12 больше IPM, в hardcore RPG предпочитают холодные.
- Сообщение первого скриншота — ориентированное на фичу vs ориентированное на персонажа. В match-3 выигрывает фича (демонстрация power-up), в нарративном RPG — персонаж.
- Длительность видеопревью — 15 секунд vs 30 секунд. На Tier-1 рынках 15 секунд показывают на %8 выше completion rate.
В каждом цикле тестирования изолируйте одну переменную. Если менять иконку и скриншот одновременно, вы не узнаете, какой asset работает. Эта изоляция — основной подход Roibase в оптимизации App Store: однопеременный тестовый цикл, явная атрибуция.
Критерий выбора победителя
Прироста IPM недостаточно — нужно проверить качество установок. Cross-check с этими метриками:
- D1 retention — процент возврата пользователей с нового creative на следующий день
- Tutorial completion — завершение воронки в первой сессии
- First IAP conversion — соответствие между обещанием creative и реальностью в игре
Если вариант повышает IPM на %32, но D1 retention падает на %15, значит вы использовали misleading creative. Этот вариант не победитель — он привлекает спам-трафик.
Проблема распределения трафика Play Experiments
На Google Play распределение не ручное, но вы можете это обернуть в свою пользу: направляйте pre-registration кампании на один вариант, органический трафик — на другой. Так вы увидите сегментную производительность.
Pre-reg пользователи обычно имеют выше intent — выше ожидания LTV. Если вариант A показывает %40 IPM в pre-reg, а B — %28 в organic, вы можете выстроить стратегию: платные кампании в A, ASO дефолт в B.
Порог статистической уверенности Google — %90, у Apple выше. Это позволяет быстрее получить результаты, но выше риск false positive. Придерживайтесь 6-недельного цикла, не объявляйте победителя рано.
Цикл творческой итерации: 4 периода за 6 недель каждый
За один квартал вы выполняете 4 итерации:
| Неделя | Активность | Результат |
|---|---|---|
| 1-6 | Первый тест (иконка) | Победитель-иконка |
| 7-12 | Второй тест (скриншот) | Набор скриншотов-победителей |
| 13-18 | Третий тест (видео) | Победитель-видео |
| 19-24 | Финальный комбинированный тест | Оптимизированный CPP |
В каждом цикле вы фиксируете победителя как дефолт и переходите к следующему asset. Через 24 недели прирост IPM на %32 накапливается кумулятивно — не сразу, а по %8-10 с каждой итерации.
Чтобы держать этот цикл непрерывным, нужен пайплайн производства creative: когда тест начался, следующий набор asset'ов должен быть готов. Не жидайте 6 недель впустую — параллельное производство.
Риск A/B/C теста
3-вариантный тест выглядит привлекательно, но split трафика проблематичен: каждый вариант получает %33, достижение статистической значимости требует 9 недель. Вместо этого:
- Первый раунд: A vs B (6 недель)
- Возьмите победителя, сравните с C (6 недель)
- Зафиксируйте финального победителя
Всего 12 недель, но каждый цикл валидный — двухэтапная элиминация вместо трех вариантов за раз.
Дифференциация creative Tier-1 vs развивающихся рынков
Creative, работающий в США, на %18 меньше IPM дает в Бразилии — психология цвета и культурные ссылки другие. Создавайте geo-специфичные CPP:
- Tier-1 (US, UK, DE): Минималистский дизайн, четкое value proposition, месседжинг "без реклам"
- Tier-2 (BR, MX, TR): Яркие цвета, социальное доказательство (счетчик загрузок), конкурентный угол
В CPP Apple geo targeting недоступен, но на уровне кампании вы маршрутизируете deep link. В Play Experiments есть гео-фильтр — проще делать split.
На развивающихся рынках тест длится дольше: объем трафика ниже, требуется 8-10 недель. Валидируйте на Tier-1 сначала, потом переходите на развивающиеся — параллельное тестирование распыляет ресурсы.
Ловушка статистической значимости
%95 доверие — не всегда правильный threshold. Если вы получаете 50.000 impressions в день, %90 доверие достижимо за 4 недели, ожидание 6 недель для %95 — ненужный риск. Выбирайте threshold по этой таблице:
| Ежедневные impressions | Уровень доверия | Недель потребуется |
|---|---|---|
| 5.000 | %90 | 8 |
| 10.000 | %90 | 6 |
| 50.000 | %90 | 4 |
| 10.000 | %95 | 9 |
| 50.000 | %95 | 6 |
При высоком трафике низкое доверие достаточно — размер выборки уже большой, погрешность низкая. Если используете Bayesian подход, возьмите prior distribution из исторических данных IPM, длительность теста сократится на %30.
Creative testing — непрерывный цикл. Вы не оптимизируете один раз и не останавливаетесь. Минимум одна итерация в квартал, каждая итерация измеряется явной атрибуцией и приростом IPM. 6-недельный фреймворк делает этот цикл устойчивым — 12 недель ожидания теряют momentum, 4 недели результатов дают false positive. Баланс между статистической строгостью и скоростью достигается здесь.