Quelles cohortes d'acquisition d'app se rentabilisent réellement ? Comparez-les au même âge, sur les proceeds.

Je suis Samet Durgun, fractional Head of UA. Je gère le paid UA pour des apps par abonnement et des jeux mobiles, et j'écris ici ce que je constate dans les comptes que je gère. Cet article fait partie du thème Ingénierie du signal ; en savoir plus sur moi.

Prenez deux semaines d’install de la même campagne, avec 10 000 $ de dépense et 2 000 installs chacune. La semaine la plus ancienne affiche 78 % de ROAS à ce jour et la plus récente 57 %. Un dashboard qui s’arrête là lit la semaine récente comme celle à couper. À chaque âge que les deux semaines ont atteint, la plus récente a environ 30 % d’avance. Le revenu à ce jour vous a dit quel âge avait chaque cohorte. Il ne vous a pas dit laquelle était la meilleure.

Je lis les cohortes payantes de trois façons. Au même âge. Sur les proceeds, après le store, les taxes et les remboursements. Dans des cellules qui comptent assez d’achats pour que le chiffre ait un sens. Les chiffres de comptes ci-dessous viennent d’études que j’ai publiées, chacune portant sur un seul compte. Chaque chiffre de l’exemple est un calcul à partir d’une hypothèse annoncée comme telle.

Pourquoi le revenu à ce jour induit-il en erreur ?

Le revenu s’accumule avec le temps. Une cohorte installée il y a 56 jours a eu 56 jours pour payer, renouveler et regarder des publicités. Une cohorte installée il y a 14 jours en a eu 14. Comparez leurs totaux et vous avez ajouté l’âge à la performance. La solution consiste à indexer chaque cohorte sur le nombre de jours depuis l’install et à ne comparer qu’aux âges que les deux ont atteints.

Les outils fonctionnent déjà ainsi, et c’est pourquoi je me méfie de tout rapport qui ne le fait pas. App Store Connect Analytics d’Apple rapporte, pour chaque cohorte de téléchargement, la conversion du téléchargement au payant au jour 1, au jour 7 et au jour 35. Le dashboard de cohortes d’AppsFlyer regroupe les utilisateurs par date d’acquisition, compte cette date comme le jour 0 et fonde les jours de cohorte sur les jours calendaires, pas sur l’horodatage de l’install. Un utilisateur qui installe à 23 h 50 n’a donc que dix minutes de jour 0. Deux outils peuvent diverger sur le revenu D0 pour cette seule raison.

Les points de mesure sont des conventions. Apple a retenu 35 jours, SKAN s’arrête à 35, beaucoup d’équipes utilisent 28. Ce qui n’est pas une convention, c’est la règle qui les sous-tend. Même âge, ou pas de comparaison. Ma propre routine, c’est D0 et D7 pour la lecture précoce et D28 pour la décision, dans le rapport de cohortes du MMP. D28 est l’âge auquel j’ai comparé le jour 0 dans l’étude à 606K $, où le ROAS jour 0 a classé 38 campagnes Meta presque de la même façon que le ROAS jour 28, avec une corrélation de rang de +0,96, dont une partie est mécanique, puisque le revenu jour 0 fait partie du revenu jour 28. Je fais donc confiance à D0 pour classer les cohortes entre elles, et j’attends D28 pour le chiffre absolu à comparer à la cible.

À quoi ressemble une comparaison au même âge ?

Au même âge, la semaine d’install la plus récente a environ 30 % d’avance à chaque point de mesure qu’elle a atteint, même si son revenu à ce jour paraît moins bon. Chaque chiffre de cette section est illustratif. Deux semaines d’install de la même campagne, 10 000 $ de dépense et 2 000 installs chacune, donc un CPI de 5,00 $. La semaine A a 56 jours aujourd’hui et la semaine B en a 14. Les cellules sont les proceeds cumulés par install, après la commission du store, les taxes et les remboursements.

Semaine d’install D0 D7 D14 D28 D56 À ce jour
Semaine A, âgée de 56 jours 0,90 $ 1,60 $ 2,20 $ 3,00 $ 3,90 $ 7 800 $, 78 % de ROAS
Semaine B, âgée de 14 jours 1,20 $ 2,10 $ 2,85 $ 5 700 $, 57 % de ROAS

La mauvaise lecture, c’est la dernière colonne. La semaine A a rapporté 7 800 $ contre 5 700 $ pour la semaine B, donc la semaine A ressemble à un meilleur ciblage ou à un meilleur créatif, et la semaine B semble être celle qu’on peut couper. La semaine A a eu quatre fois plus de temps pour rapporter.

La bonne lecture, c’est n’importe quelle colonne que les deux semaines ont remplie. À D0, B a 33 % d’avance. À D7, 31 % d’avance. À D14, 2,85 $ contre 2,20 $, 30 % d’avance, soit 57 % de ROAS contre 44 %. La semaine B est la meilleure cohorte à chaque âge qu’elle a atteint, et la lecture naïve donnait le verdict à l’envers.

Cohortes illustratives issues du tableau ci-dessus, CPI de 5,00 $. Le graphique de gauche ajoute l'âge à la performance. Le graphique de droite ne compare que la performance.

La semaine B a 14 jours et mon âge de décision est D28, donc il reste une deuxième question. Qu’est-ce que je fais de sa dépense pendant deux semaines ? Je la projette à partir des cohortes plus anciennes. La semaine A est passée de 2,20 $ à D14 à 3,00 $ à D28, soit un multiplicateur de 1,36. Appliqué aux 2,85 $ de la semaine B, cela donne environ 3,89 $ par install à D28, soit 78 % de ROAS. Une seule cohorte plus ancienne est une supposition, donc je prends la fourchette de ce multiplicateur de D14 à D28 sur plusieurs cohortes plus anciennes. Utilisez des cohortes dont le mix de pays et de créatifs est proche. Disons que la fourchette va de 1,25 à 1,45. La semaine B tombe alors entre 3,56 $ et 4,13 $, soit entre 71 % et 83 % de ROAS à D28.

Savoir si cette fourchette permet de trancher dépend de la cible. Si la cible à D28 est de 70 %, les deux bornes la dépassent et la semaine B peut scaler dès maintenant. Si elle est de 75 %, la fourchette chevauche la ligne, la semaine B reste sous surveillance à dépense stable, et je la relis à D28. Les multiplicateurs ne tiennent que tant que le produit, les prix, le paywall et le mix de canaux restent proches de ceux des cohortes plus anciennes. Après un test de paywall ou sur un nouveau marché, repartez de zéro pour la fourchette.

Quel revenu correspond à l’argent ?

Mesurez les cohortes sur les proceeds pour toute décision de rentabilité ou de payback, c’est-à-dire ce qui vous parvient après la commission du store, les taxes et les remboursements. Pour l’argent, j’utilise les proceeds de RevenueCat. Pour la répartition par campagne, j’utilise le revenu du MMP, et je le traite comme un chiffre brut pour classer, jamais comme du cash.

Apple définit Sales comme le montant total facturé aux clients et Proceeds comme le montant que vous recevez, prévient que les proceeds dans Sales and Trends ne sont pas définitifs, et estime les montants en dollars américains avec les taux de change du mois précédent. L’écart entre les deux correspond à la commission et à la taxe là où le prix l’inclut, et les remboursements se déduisent des deux. J’ai détaillé comment la commission du store, la taxe et les remboursements font chacun varier les proceeds dans l’article sur le plafond de CPA. La commission est de 30 %, de 26 %, de 15 %, ou de 10 % plus 5 % de frais de facturation, selon le store, le programme, la région et l’ancienneté de l’abonné, et la grille de commissions 2026 de Google Play a élargi l’écart.

RevenueCat garde les niveaux séparés. Son graphique de revenu retire d’abord les remboursements puis estime la taxe et la commission pour arriver aux proceeds, et son guide de réconciliation fait correspondre le prix client d’Apple à son chiffre de revenu et la part partenaire d’Apple à ses proceeds. Deux réserves. La taxe et la commission sont des estimations de RevenueCat, pas le relevé du store. Et Charts v3 retire un remboursement le jour où il survient, alors qu’une lecture de cohorte exige de le rattacher à l’achat qu’il a annulé, donc ramenez les remboursements à leur cohorte d’origine avant de comparer les semaines.

Le chiffre du MMP est autre chose. Adjust et AppsFlyer rapportent le revenu tel que le SDK ou le serveur l’a envoyé, brut ou net selon votre configuration, et je le traite comme brut. Ils le rapportent à l’intérieur de leurs propres règles et fenêtres d’attribution. Comparer une LTV de RevenueCat à un ROAS d’Adjust revient à comparer deux bases à la fois. J’ai présenté les trois comparaisons entre Meta, RevenueCat et Adjust et les vérifications qui rendent un écart fiable. Pour cet article, la règle est une seule base, une seule devise, un seul calendrier, à chaque niveau de l’analyse.

Jusqu’où une cellule peut-elle rétrécir avant que le chiffre ne veuille plus rien dire ?

Une cellule a besoin de 50 achats avant que je la lise, parce que chaque découpage supplémentaire multiplie les cellules et divise les utilisateurs de chacune. Une campagne de 2 000 installs répartis sur 10 pays, 2 stores et 5 créatifs, cela fait 100 cellules de 20 installs. Avec un taux de payeurs de 3 %, il reste moins d’un payeur par cellule.

J’ai tiré ce chiffre d’un compte que j’ai mesuré, 1,2M $ sur 22 semaines, où le ROAS d’une publicité sur une semaine prédisait le mieux le ROAS de la semaine suivante dès que la publicité avait 50 achats ou plus cette semaine-là, et même dans ce cas la corrélation était de 0,44. En dessous de 50, je ne lis pas la cellule. Je la regroupe, en fusionnant des semaines ou en rassemblant des pays par tier, jusqu’à ce qu’elle franchisse le seuil.

Les statistiques disent la même chose dans une autre langue. Un taux de payeurs est une proportion, et la formule standard de sa marge d’erreur se comporte mal sur de petits effectifs, c’est pourquoi Brown, Cai et DasGupta recommandent à la place l’intervalle de Wilson. Un taux de payeurs de 3 % sur 1 000 installs, soit 30 payeurs, a un intervalle de Wilson à 95 % d’environ 2,1 à 4,3 %. Les mêmes 3 % sur 100 installs, soit 3 payeurs, vont d’environ 1,0 à 8,5 %. La seconde cellule ne permet pas de distinguer un pays fort d’un pays faible, et la fixer du regard n’y changera rien.

Deux habitudes de plus empêchent les petites cellules de vous mentir. Fixez l’âge de décision avant de regarder, car vérifier chaque jour et agir dès la première fois qu’une cohorte franchit le seuil, c’est le problème de l’arrêt optionnel que connaissent déjà ceux qui pratiquent l’A/B testing. Et traitez un gagnant surprenant dans une petite cellule comme une hypothèse. Gelman et Loken appellent ce problème le jardin aux sentiers qui bifurquent. Avec assez de découpages, une cellule finira par paraître excellente par hasard, et un autre jeu de données aurait fait briller une autre cellule. Un résultat de sous-groupe compte quand il se répète sur la semaine de cohorte indépendante suivante.

Comment faire correctement une analyse de cohortes ?

Partez de l’ensemble de l’activité par semaine d’install, puis descendez uniquement tant que la cellule compte encore 50 achats ou plus.

  1. L’ensemble de l’activité, les proceeds par semaine d’install, au même âge. Réconciliez d’abord avec les totaux du store et de RevenueCat.
  2. Par store. Les grilles de commissions, les régimes d’attribution et les règles de remboursement diffèrent, donc lisez iOS et Android avant de les mélanger.
  3. Par canal, sur la base du MMP, en suivant le ratio entre le chiffre de la plateforme et celui du MMP comme facteur de calibrage.
  4. Par campagne au sein du canal.
  5. Par pays au sein de la campagne, uniquement là où le pays franchit le seuil.
  6. Par créatif, le niveau le plus bruité. Lisez-le comme une indication de direction et regroupez les semaines.

Comment comparer équitablement le ROAS entre pays ?

Comparez les pays au même âge de cohorte, sur les proceeds par install, à l’intérieur d’un seul store, avec le taux de payeurs et son intervalle à côté, car les pays diffèrent par ce que vaut un payeur avant même toute différence d’efficacité des publicités. Apple fixe des prix comparables sur 175 storefronts, avec la taxe et les taux de change intégrés, et les développeurs peuvent modifier chacun de ces prix à la main. Là où le prix inclut la TVA, la commission est calculée une fois la taxe retirée. La commission du store peut différer selon la région. Le mix de plans diffère, donc les proceeds par payeur diffèrent même au même prix.

Vient ensuite le mix. Deux campagnes peuvent se classer dans un sens dans chaque pays et dans l’autre sens en blended, ce qui est le paradoxe de Simpson, du nom d’Edward Simpson et de son article de 1951, appliqué à un plan média. Données illustratives : la campagne X tourne à 70 % de ROAS en Tier 1 sur 8 000 $ et à 130 % en Tier 3 sur 2 000 $, soit 82 % en blended. La campagne Y tourne à 60 % en Tier 1 sur 2 000 $ et à 120 % en Tier 3 sur 8 000 $, soit 108 % en blended. X bat Y dans chaque tier et perd en blended, uniquement à cause de l’endroit où est allée la dépense. La bonne comparaison dépend du mix que vous pouvez réellement acheter à grande échelle, et vous ne le savez qu’en regardant à l’intérieur.

Dans mon audit de 383K $ de dépenses tROAS sur Meta, un pays avait tourné à 28 % de ROAS pendant trois mois dans une campagne qui affichait 70 % en blended, et rien n’avait bougé au niveau de la campagne. J’ai noté chaque pays sur le ROAS D0 et sur le ROAS All face à l’objectif propre à la campagne, j’ai attendu trois mois avant d’exclure quoi que ce soit, et j’ai d’abord fixé un plancher de dépense, car un pays avec 80 $ derrière lui a un ROAS bruité, pas un verdict. Cet audit montre le problème du mix au niveau des pays. Cet article y ajoute la règle du même âge et le seuil.

Et le revenu que le MMP appelle organique ?

Une partie de ce revenu est du revenu payant que le MMP n’a pas pu tracer. Sous ATT, une part du revenu payant iOS n’a aucun clic à tracer, donc elle atterrit en organique, et un tableau de cohortes ne montre que le revenu que vous avez pu attribuer. Dans les installs iOS organiques et payants d’un compte sur 103 jours, les jours où l’on comptait 100 installs iOS payants de plus, environ 28 installs iOS organiques de plus apparaissaient, soit une pente de 0,277 sur iOS contre 0,059 sur Android, où l’install referrer fonctionne encore. Les cohortes payantes iOS de ce compte ressemblaient à un plancher, et l’écart entre les deux pentes est la partie à chiffrer avec un holdout.

SKAN rend le plancher plus bas et plus tardif. Sous SKAN 4, une campagne reçoit au maximum trois postbacks, couvrant les jours 0 à 2, 3 à 7 et 8 à 35, la fine conversion value n’arrive que dans le premier, et au palier d’anonymat de la foule le plus bas aucune valeur n’arrive du tout. Tout revenu au-delà du jour 35 qu’un dashboard assigne à une campagne iOS est modélisé. Meta rapporte selon ses propres fenêtres, et sa documentation pour développeurs indique que Facebook a généralement une fenêtre d’attribution plus large que la plupart des mobile measurement partners. Gardez donc trois couches séparées, sans les fondre en un seul ROAS. Les proceeds attribués de façon déterministe, le plancher du payant. Les proceeds modélisés ou probabilistes, étiquetés avec la méthode. Les proceeds non attribués, rapportés à part et assignés au payant uniquement par une hypothèse déclarée, comme un halo mesuré ou un résultat de holdout.

Le sens de l’interaction avec l’organique n’est pas réglé non plus, et je ne le supposerais pas en votre faveur. Chez eBay, Blake, Nosko et Tadelis ont trouvé des retours de la recherche payante qui ne représentaient qu’une fraction de ce que disait l’attribution, les publicités sur mots-clés de marque ne montrant aucun bénéfice mesurable à court terme. Chez un grand développeur américain de jeux mobiles, Ju, Zhao et Aral ont trouvé le signe inverse. Couper ses publicités dans le monde entier a réduit les installs organiques de 20 à 30 %, et chaque tranche de 100 $ de dépense s’accompagnait d’environ 32 installs payants et de 2 installs organiques, ce qu’ils expliquent par des installs payants qui font monter le classement dans le store. C’est une prépublication portant sur une seule entreprise, révisée en juillet 2026, et les chiffres ont bougé d’une version à l’autre. Autre canal, autre produit, autre réponse. Votre compte a son propre chiffre, et c’est avec les deux rapports de mon article sur l’organique iOS que je commence à le chercher.

À partir de quand une cohorte est-elle assez ancienne pour être jugée ?

Trois tests, et une cohorte doit tous les passer.

Les fenêtres sont fermées. La fenêtre SKAN de 35 jours plus le délai des postbacks, la fenêtre d’attribution de la plateforme, l’essentiel de l’exposition aux remboursements, et la finalisation des proceeds par le store. Avant cela, une partie du chiffre est encore en train d’arriver.

Les événements de revenu ont eu le temps de se produire. Un plan annuel est lisible peu après la conversion de l’essai, et la prochaine inconnue est le renouvellement un an plus tard. Un plan mensuel ne se sera pas encore renouvelé à D28, donc je prends ce revenu sur la courbe des cohortes plus anciennes et je laisse la fourchette ci-dessous trancher. Les jeux avec des achats et des publicités continuent de rapporter, donc la maturité relève du jugement, et c’est le troisième test ci-dessous qui me permet de trancher. Le plafond répond à la question de combien de temps vous pouvez attendre, et il est fixé avant que la cohorte n’existe.

Un revenu ultérieur ne changerait pas la décision. La fourchette de l’exemple chiffré. Si le multiplicateur bas et le multiplicateur haut issus des cohortes plus anciennes placent la jeune cohorte du même côté de la cible, la décision est prise, et attendre ajoute de la précision à un verdict qui ne changera pas. S’ils tombent de part et d’autre de la cible, la cohorte reste sous surveillance.

Que ne peut pas vous dire un tableau de cohortes ?

Il ne peut pas vous dire ce que la dépense a causé. L’attribution est un registre de qui a été rattaché à quoi, selon les règles d’un seul système. Gordon, Zettelmeyer, Bhargava et Chapsky ont comparé 15 expériences publicitaires sur Facebook, 1,6 milliard d’impressions, aux méthodes observationnelles que les équipes utilisent tous les jours, et ont constaté que ces méthodes échouaient souvent à retrouver ce que les expériences mesuraient, même avec un conditionnement poussé. Deux des auteurs travaillaient chez Facebook, les données sont celles de Facebook, et les expériences étaient des campagnes Facebook américaines de 2015, pas des installs d’app, ce qui est une raison de le lire avec soin, pas une raison de l’écarter. Seul un holdout ou une expérience géographique répond à la question causale, et même ceux-là sont bruités. Lewis et Rao ont montré, sur 25 expériences de terrain, que les achats individuels sont si volatils par rapport au coût de la publicité que des intervalles informatifs exigent d’énormes échantillons. J’ai décrit comment je mènerais le test pour un réseau dans l’article sur l’incrémentalité d’AppLovin.

Il ne peut pas vous dire d’où vient le revenu SKAN au-delà du jour 35 ou sous le seuil d’anonymat. Il ne peut pas vous dire ce que fera une cohorte après un changement de prix, un nouveau paywall, un nouveau marché ou une nouvelle grille de commissions, parce que les multiplicateurs supposent que l’avenir ressemble aux cohortes plus anciennes. Et la réconciliation entre systèmes explique les écarts entre eux sans vous dire quelle attribution est la bonne. Chacun a raison pour une question différente : le store pour le cash, RevenueCat pour l’état des abonnements, le MMP pour le crédit entre réseaux, la plateforme publicitaire pour son propre signal d’optimisation. Et si la question est de savoir pourquoi une cohorte s’est dégradée et non quelle cohorte est la meilleure, c’est mon diagnostic pour un CPI qui monte et un ROAS qui stagne, et il part du journal des changements, pas du tableau de cohortes.

Que vérifier avant de déclarer une cohorte rentable ?

  1. Même âge. Chaque comparaison à un jour que les deux cohortes ont atteint, D0 et D7 pour classer, D28 pour décider.
  2. Proceeds. Après commission, taxes et remboursements, avec les remboursements ramenés à la cohorte dont ils viennent, dans une seule devise et un seul calendrier.
  3. Le seuil. 50 achats dans la cellule, sinon regroupez-la.
  4. Le store avant le blend. iOS et Android lus séparément avant tout chiffre combiné.
  5. La vérification du mix. Le gagnant gagne-t-il encore à l’intérieur de chaque tier de pays ?
  6. Réplication. Une cellule surprenante doit se répéter sur la semaine de cohorte suivante.
  7. La fourchette. Pour les jeunes cohortes, un multiplicateur bas et un multiplicateur haut issus des cohortes plus anciennes, et une décision seulement quand les deux tombent du même côté de la cible.
  8. La couche organique. Les proceeds déterministes, modélisés et non attribués gardés séparés.

Si vous ne pouvez pas remplir ces huit lignes pour votre compte, le growth audit est l’endroit où je lis les cohortes et applique les seuils pour un compte, et vous pouvez le réserver seul, quel que soit le niveau de dépense.

Sources et périmètre

Toutes vérifiées le 5 octobre 2026. La documentation des plateformes change sans préavis, donc vérifiez la date avant de citer une fenêtre ou une commission. L’exemple chiffré, l’illustration du paradoxe de Simpson et les intervalles de Wilson sont des calculs à partir d’hypothèses annoncées comme telles, pas un compte réel. Les chiffres de comptes vers lesquels je renvoie viennent chacun d’un seul compte, avec des données observées et non expérimentales.

Questions fréquentes

Comment savoir lesquelles de mes cohortes d'installs payants se rentabilisent réellement ?

Alignez chaque cohorte selon le nombre de jours écoulés depuis l'install et comparez-les seulement aux âges que les deux ont atteints, sur les proceeds après la commission du store, la taxe et les remboursements. Le revenu à ce jour récompense la cohorte plus ancienne pour son ancienneté. Je lis D0 et D7 tôt, je décide à D28, et seulement dans des cellules de 50 achats ou plus. En dessous, je regroupe les semaines ou les pays par tier.

Comment faire correctement une analyse de cohortes pour l'acquisition d'utilisateurs payante ?

Partez de l'ensemble de l'activité par semaine d'install, puis découpez par store, par canal, par campagne, et descendez jusqu'au pays et au créatif seulement là où la cellule compte encore 50 achats ou plus. Comparez les cohortes uniquement au même âge, gardez une seule base de revenu, une seule devise et un seul calendrier à chaque niveau, et traitez un gagnant surprenant dans une petite cellule comme une hypothèse à retester sur la semaine de cohorte suivante.

Dois-je mesurer le ROAS d'une cohorte sur le revenu brut ou sur les proceeds ?

Mesurez le ROAS d'une cohorte sur les proceeds pour toute décision de rentabilité ou de payback. Apple et Google prélèvent leur commission une fois la taxe retirée, là où le prix l'inclut, et les remboursements reprennent ce qui vous est parvenu. Le revenu du MMP et celui des plateformes publicitaires est brut ou net selon ce que le SDK a envoyé, donc je le traite comme brut, j'utilise les proceeds de RevenueCat comme l'argent et le revenu du MMP seulement pour répartir cet argent par campagne.

Comment mesurer le ROAS d'un pays à l'autre sans me raconter d'histoires ?

Comparez les pays au même âge de cohorte, sur les proceeds, à l'intérieur d'un seul store avant de mélanger les stores, et seulement là où le pays franchit le seuil d'achats. Les prix, la taxe, la commission du store et le mix de plans diffèrent tous, donc un chiffre blended cache l'écart. Dans mon audit de 383K $, un pays avait tourné à 28 % de ROAS pendant trois mois dans une campagne qui affichait 70 %.

À partir de quand une cohorte est-elle assez ancienne pour être jugée ?

Une cohorte est assez ancienne pour être jugée quand ses fenêtres de reporting sont fermées, que les événements de revenu qui comptent ont eu le temps de se produire, et que la fourchette des résultats plausibles ne chevauche plus votre cible. Pour un plan annuel, c'est peu après la conversion de l'essai. Pour un plan mensuel, le premier renouvellement tombe après D28, donc ce revenu vient de la courbe des cohortes plus anciennes et la fourchette qu'elle donne doit dépasser la cible. Mon âge de décision est D28, avec D0 pour classer, puisque D0 a classé 38 campagnes presque de la même façon que D28 dans mon étude à 606K $.