Ett lovande resultat från annonser i ChatGPT skapar ofta en brådskande fråga: ska upplägget få mer budget direkt eller först prövas igen? Ett nytt test är särskilt värdefullt när första resultatet kom från många jämförelser, ett litet underlag eller en avvikande kampanjvecka. Uppgiften är att ta reda på hur väl slutsatsen håller när den får möta nya observationer.
Vi rekommenderar en separat plan för upprepningen. Den ska beskriva vad som behöver bekräftas för att nästa affärsbeslut ska vara rimligt. Arbetssättet är annonsörens metodik och förutsätter en genomförbar design; det utlovar ingen inbyggd funktion för replikering eller randomisering i ChatGPT Ads.
Skilj ny data från en ny körning av rapporten
Att hämta samma kampanjperiod igen kan ge ett uppdaterat resultat när fler konverteringar har hunnit registreras. Det är en viktig kontroll av det ursprungliga underlaget, men det är ingen oberoende upprepning. Detsamma gäller att byta diagram, analysverktyg eller person som räknar på samma observationer.
En ny prövning behöver observationer som inte redan har använts för att välja det lovande upplägget. Dokumentera därför vilken data som ledde till valet och vilken data som reserveras för bekräftelse. Om samma personer återkommer måste designen hantera tidigare exponering och kvarstående tilldelning. En ny kalendervecka ger inte automatiskt oberoende deltagare.
Detta ligger nära Center for Open Science:s uppdelning mellan upptäckt och bekräftelse. Ett fynd som uppstår när många varianter undersöks kan vara en bra idé för nästa test. Det bör däremot inte få samma tyngd som en fråga och analys som bestämdes innan just dessa utfall fanns.
Välj mellan upprepning och utvidgning
För en nära upprepning rekommenderar vi att behålla erbjudande, annonsbudskap, destination, primärt mått och centrala behörighetsregler. Nya deltagare och en ny insamlingsperiod tillför nya data. Målet är att se om ungefär samma effekt stöds när så mycket annat som möjligt är jämförbart.
En utvidgning ställer en annan fråga: fungerar upplägget också för ett nytt land, en annan produktkategori eller en annan kundtyp? Det kan vara precis rätt affärsfråga, men resultatet ska då tolkas som prövning i en ny miljö. Om både språk, pris och landningssida ändras samtidigt går det inte att beskriva utfallet som en ren upprepning av den gamla annonsen.
NIST:s vägledning om experimentdesign kopplar designvalet till undersökningens syfte. Skriv därför frågan innan ni kopierar kampanjinställningar. En tekniskt enkel kopia är inte i sig en vetenskapligt jämförbar omgång, och ett metodiskt rimligt test kan behöva mer förberedelse än själva kampanjupplägget.
Gör första resultatets begränsningar synliga
Spara hela sammanhanget för den första omgången: vilka alternativ som prövades, hur det aktuella alternativet valdes och vilka ändringar som gjordes under insamlingen. Om tio idéer utvärderades ska den vinnande idén inte senare beskrivas som den enda planerade frågan. Annars är det lätt att överskatta hur starkt första resultatet var.
Dimensionera nästa test utifrån en relevant effektstorlek och realistiska antaganden. Använd inte första omgångens mest optimistiska punktestimat som ett säkert planeringsvärde. En stark första observation kan delvis bero på slump, särskilt när den valts ut bland många. Kontrollera genomförbarheten med planering vid få konverteringar innan en kort bekräftelseperiod lovas.
Ett hypotetiskt resultat som kräver mer än två etiketter
Anta två separata, korrekt randomiserade webbplatstester efter annonsklick, med oberoende besökare och samma avslutade bokningsfönster. I första omgången bokar 40 av 1 000 besökare i A och 60 av 1 000 i B. Skillnaden är 2 procentenheter. En illustrativ tvåsidig normalapproximation ger ett 95-procentigt intervall på cirka 0,09 till 3,91 procentenheter.
I andra omgången bokar 80 av 2 000 i A och 100 av 2 000 i B. Skillnaden är 1 procentenhet, med ett motsvarande ungefärligt intervall från minus 0,28 till plus 2,28 procentenheter. Den första omgångens intervall utesluter noll och den andras gör det inte. Det bevisar inte att effekten skiljer sig mellan omgångarna eller att den har försvunnit.
Den andra skattningen pekar åt samma håll men lämnar både noll och flera positiva effekter förenliga med modellen. Bedöm om den sammanlagda kunskapen räcker för den planerade affärsåtgärden. En formell jämförelse mellan omgångarnas effekter kräver en egen analys. Konfidensintervallens tolkning hjälper er undvika att skillnaden mellan två signifikansetiketter blir hela argumentet.
Två omgångar, en noggrann jämförelse
- Första omgången
40/1 000 mot 60/1 000: +2 procentenheter; intervall 0,09 till 3,91.
- Ny omgång
80/2 000 mot 100/2 000: +1 procentenhet; intervall −0,28 till 2,28.
- Undvik etikettfällan
Signifikant följt av icke signifikant bevisar inte att effekterna skiljer sig.
- Pröva affärsbeslutet
Bedöm effektstorlek, osäkerhet och jämförbarhet innan större införande.
Behåll spårbarheten genom nästa omgång
Gör en tabell över vad som är lika, ändrat och okänt mellan omgångarna. Ta med kampanjidentiteter, annonsversioner, destination, datakälla och händelsedefinition. OpenAI:s kampanjdokumentation beskriver kampanjer, annonsgrupper och annonser. Använd dessa identiteter för att dokumentera faktiska konfigurationer, utan att anta att lika namn betyder lika innehåll.
Kontrollera särskilt att konverteringshändelsen inte ändrats mellan försöken. Dokumentationen för konverteringsspårning beskriver händelsekopplingen. Er jämförelse behöver dessutom samma affärsdefinition, till exempel om avbokade möten räknas. Ett bättre rapporterat utfall efter en mätändring kan annars misstas för en starkare annons.
Lås sedan primärt mått och analysregel i förväg. Bestäm även hur första omgången ska visas tillsammans med den nya. Slå inte mekaniskt ihop allt underlag om urval, behandling eller mätning skiljer sig, och dölj inte den nya omgången bakom en snygg totalsiffra. Den färska prövningen behöver kunna bedömas för sig.
Avsluta med ett beslut som matchar evidensen: försiktigt införande, ytterligare undersökning av en skillnad eller fortsatt osäkerhet. En upprepning har gjort nytta även om den dämpar ett optimistiskt första resultat. Den har då förbättrat underlaget innan ett större budgetbeslut fattas.
Källor och avgränsning
Utforma en oberoende upprepning som kan bekräfta eller begränsa ett lovande kampanjresultat innan ett större införande.
- OpenAI Ads: Campaign ManagementLäst
- OpenAI Ads: Conversion TrackingLäst
- NIST: Selecting an experimental designLäst
- Center for Open Science: PreregistrationLäst
- NIST: Comparing two proportionsLäst
Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.
