Fyra köp under en vecka kan vara värdefulla affärer men ett tunt underlag för att skilja två liknande kampanjupplägg åt. När annonser i ChatGPT ger få konverteringar är den första testfrågan därför om den önskade jämförelsen alls ryms i den tillgängliga trafiken. Ett genomtänkt nej kan spara både budget och veckor av uppföljning som ändå inte kan avgöra beslutet.
Vi rekommenderar att göra en genomförbarhetskalkyl innan testet startar. Kalkylen nedan är intern metodik och beskriver ingen experimentfunktion i annonsplattformen. Den förutsätter att teamet kan skapa en giltig jämförelse med en lämplig tilldelningsmetod. Om det inte går behöver undersökningen beskrivas som observationsbaserad, med motsvarande begränsningar för orsakssamband.
Fem uppgifter som inte får blandas ihop
Stickprovsstorlek är antalet relevanta analysenheter. Det kan vara unika tilldelade besökare i ett eget webbplatstest, men också regioner eller tidsblock i en annan design. Antal konverteringar är antalet positiva utfall, inte automatiskt stickprovsstorleken. Visningar och klick kan dessutom innehålla upprepade exponeringar från samma personer.
Basnivån är den konverteringssannolikhet ni använder för planering. Minsta upptäckbara effekt, MDE, är den effektstorlek som den valda planen dimensioneras för att upptäcka med önskad styrka. Alfa anger testets tillåtna risk för ett falskt positivt utfall under nollhypotesen och modellens villkor. Statistisk styrka är sannolikheten att förkasta nollhypotesen vid en specificerad verklig effekt och dessa villkor.
En styrka på 80 procent är alltså inte 80 procents sannolikhet att hypotesen är sann. Den är inte heller ett kvalitetsbetyg för kampanjen. NIST:s planering av stickprov visar sambandet mellan vald effekt, alfa och styrka. Kontrollera att den faktiska beräkningen avser er design, eftersom ett test av en andel mot en fast referens skiljer sig från två samtidiga grupper.
Översätt en önskad förbättring till besökare
Anta hypotetiskt att ni vill testa två bokningssidor efter klick från annonser i ChatGPT och själva kan slumpa unika besökare korrekt. Planerad basnivå är 2 procent. Ni vill kunna upptäcka en ökning till 3 procent: 1 procentenhet i absolut förändring och 50 procent i relativ förändring. Välj för exemplet tvåsidigt alfa 0,05, styrka 80 procent och lika stora grupper.
En vanlig normalapproximation för två oberoende andelar ger ungefär 3 826 besökare per grupp, totalt 7 652. Beräkningen använder 1,96 för alfa, cirka 0,842 för styrkan och medelandelen 0,025. Uttrycket per grupp är kvadraten av summan 1,96 × √(2 × 0,025 × 0,975) och 0,842 × √(0,02 × 0,98 + 0,03 × 0,97), delat med 0,01².
Detta är en avrundad planeringsapproximation utan kontinuitetskorrektion, inte ett universellt krav från OpenAI. Exakt metod, beroenden, bortfall och osäker basnivå kan ändra behovet. Låt analysansvarig verifiera beräkningen med den metod som faktiskt ska användas. Förbered underlaget med rätt indata till stickprovsberäkningen innan ni accepterar ett resultat från en kalkylator.
Gör kalendern lika tydlig som statistiken
Med 80 behöriga nya besökare per dag totalt tar 7 652 besökare minst cirka 96 insamlingsdagar vid oförändrat inflöde. Det är 40 per grupp och dag, inte 80 i vardera gruppen. Om observationsfönstret är sju dygn behöver de sista besökarna dessutom få sju dygn på sig. Exemplet bortser från helger, bortfall och tekniska avbrott.
Om affärsbeslutet måste fattas efter 28 dagar finns bara cirka 2 240 tilldelningar, alltså 1 120 per grupp, före eventuell förlust av mätbara utfall. Under exemplets planerade sannolikheter motsvarar det i genomsnitt 22,4 respektive 33,6 bokande personer. Det är väntevärden för planering, inte utlovade bokningar. Att fylla ett kalkylblad med fler decimaler gör inte tidshorisonten mer realistisk.
Kontrollera sedan om erbjudande, bemanning och kundbehov kan hållas tillräckligt jämförbara under hela perioden. En lång insamling kan passera ett produktbyte eller en säsong där den ursprungliga frågan inte längre är relevant. Fler dagar är därför ett designbeslut, inte en automatisk lösning på få konverteringar.
Räcker trafik och kalender?
- Behov
Cirka 3 826 unika besökare per grupp = 7 652 totalt.
- Tillgängligt på 28 dagar
80 per dag × 28 = 2 240 totalt, bara 1 120 per grupp.
- Insamlingstid
7 652 / 80 avrundat uppåt = 96 dagar, plus utfallens väntetid.
- Beslut
Pröva om frågan håller i 96 dagar eller välj en tydligt avgränsad mätpilot.
Välj ett alternativ som fortfarande besvarar något användbart
Ett alternativ är att testa en större, affärsmässigt relevant förändring. Det innebär inte att ni får bestämma att effekten kommer vara större. Formulera i stället vilken skillnad testet behöver kunna skilja från noll och bedöm om just den skillnaden skulle påverka beslutet. Guiden om minsta upptäckbara effekt hjälper till att hålla planeringsmålet skilt från en prognos.
Ett annat alternativ är en mätpilot. Kontrollera om rätt besökare inkluderas, om bokningar registreras och hur snabbt utfallen mognar. En sådan pilot kan förbättra framtida indata utan att ge ett svar på vilken sida som ökar försäljningen. Var explicit med att uppgiften har ändrats så att en lyckad teknisk kontroll inte presenteras som bevis för affärseffekt.
Ett tidigare steg i kundresan, exempelvis påbörjad bokning, ger ibland fler utfall. Det kan användas för en separat fråga om beteendet vid det steget. Men en förbättring där bevisar inte fler genomförda bokningar. Byt därför inte primärt mått i efterhand bara för att köpvolymen blev lägre än väntat.
Låt resultatet visa osäkerheten
Efter testet rekommenderar vi effektens skattning och ett korrekt konfidensintervall, inte en beräkning av observerad styrka utifrån samma uppmätta effekt. Ett brett intervall visar redan att flera affärsmässigt olika effekter återstår. Om ytterligare ett test övervägs, planera det framåt med en relevant effekt och uppdaterade antaganden.
Dokumentera till sist beslutet som genomförbart test, avgränsad pilot eller uppskjuten jämförelse. Varje alternativ kan vara rationellt. Det viktiga är att teamet vet vilken kunskap budgeten köper och vilken fråga som fortfarande förblir obesvarad.
Källor och avgränsning
Bedöma om ett planerat konverteringstest är genomförbart vid låg volym och välja en rimlig alternativ kunskapsfråga om det inte är det.
- OpenAI Ads: ReportingLäst
- NIST: Sample sizes requiredLäst
- NIST: Comparing two proportionsLäst
- NIST: Selecting an experimental designLäst
Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.
