Två budskapsvarianter, tre utfallsmått och flera landsvyer kan skapa många möjligheter att hitta ett gynnsamt resultat i ett test med ChatGPT-annonser. Om bara den starkaste jämförelsen rapporteras döljs sökningen som gav fyndet. Även rimliga enskilda analyser behöver en sammanhängande regel för besluten de tillsammans ska stödja.
Syftet är inte att förbjuda utforskning av data. Det är att skilja underlag som ska bekräfta ett planerat påstående från mönster som upptäcks under granskningen. Utforskning kan ge värdefulla nästa frågor utan att varje intressant resultat blir en utsedd kampanjvinnare.
Räkna valen som kan ändra slutsatsen
Lista varianter, primära utfall, planerade delgruppspåståenden och mellanliggande granskningar som kan leda till införande. Den relevanta familjen följer beslutsprocessen och inte bara antalet rader i en rapportvy. Närliggande test i flera filer kan fortfarande styra samma val av kampanjåtgärd.
I en hypotetisk granskning jämförs två varianter med samma kontroll på tre utfall. Det ger redan sex jämförelser innan länder eller datum undersöks. Om vilket gynnsamt resultat som helst räcker för att kalla testet lyckat får teamet fler möjligheter att välja slumpvariation än vid en enda förutbestämd jämförelse.
Varje beskrivande diagram behöver inte bli ett formellt test. Märk diagnostiska sammanställningar som sådana och förklara hur de används i tolkningen. Den centrala frågan är vilka jämförelser som får motivera påståendet att en viss förändring fungerar bättre.
Hur många chanser fick ett fynd?
- Varianter
2 jämförelser mot samma kontroll.
- Utfall
3 utfall kan ge 6 resultat att välja mellan.
- Segment
Fler segment utökar sökningen ytterligare.
- Beslutsregel
Ange i förväg vilka jämförelser som kan avgöra införandet.
Ge huvudbeslutet en bestämd jämförelsefamilj
Bestäm utfall och jämförelser som avgör huvudbeslutet innan resultaten finns. Om flera varianter kan införas behöver deras underlag bedömas tillsammans enligt en angiven regel. Om flera utfall måste uppfyllas samtidigt ska det sägas i förväg i stället för att det förbättrade utfallet väljs i efterhand.
Använd förhandsregistrering av mått för att bevara ursprungsplanen. Ett enda primärt utfall minskar oklarheten men löser inte automatiskt alla problem när många varianter, delgruppspåståenden eller återkommande granskningar fortfarande kan påverka beslutet.
Visa familjen i slutrapporten, även jämförelser som var ogynnsamma eller oklara. En tabell med enbart godkända resultat hindrar läsaren från att förstå sökningens omfattning. Den kan också få ett svagt underlag att framstå som ovanligt samstämmigt när andra försök har utelämnats.
Välj metod efter beslutets felrisk
Analytikern kan använda en metod som kontrollerar familjevis felrisk när risken för något falskt positivt fynd i den planerade familjen är viktig. Andra uppgifter kan behöva ett annat felkriterium, exempelvis förväntad andel falska upptäckter i ett större urvalsprogram. Garantierna är olika och ska inte beskrivas som utbytbara.
NIST:s Bonferroni-vägledning beskriver en metod för samtidiga jämförelser. En enkel testillustration fördelar en total felbudget på 0,05 över tio planerade giltiga test med 0,005 per test. Det visar avvägningen och är ingen rekommendation att alla annonsprogram ska använda samma metod eller trösklar.
Metoden måste även passa beroenden, utfallsfördelningar och analysdesign. Be analysansvarig dokumentera vald procedur och dess antaganden. Att välja den korrigering som ger mest gynnsam slutsats efter att resultaten blivit kända motverkar syftet med att göra beslutsregeln tydlig från början.
Ta med urval över tid i samma diskussion
Om samma jämförelser körs varje dag uppstår ytterligare en väg till selektivt stopp. En korrigering för tio varianter vid en bestämd slutpunkt hanterar inte automatiskt obegränsade dagliga stoppmöjligheter. Använd guiden om tidiga resultatkontroller när delresultat får ändra beslutet.
Operativ övervakning behövs fortfarande. En bekräftat trasig destination ska rättas även om experimentets planerade analystid ännu inte nåtts. Skilj åtgärden från ett påstående om framgång och dokumentera om avbrottet förändrar möjligheten att tolka försöket enligt ursprungsplanen.
Behåll mätdefinitionen för kampanjdata. OpenAI:s rapportering förklarar attribueringsfönster och rapportfält. Att prova många rapportfönster och bara visa det bästa innebär ett ytterligare analysval som ska redovisas, inte beskrivas som en neutral formateringsändring i rapporten.
Gör utforskande fynd till nästa lärsteg
Anta att totalresultatet är oklart men att en liten geografisk delgrupp verkar lovande. Redovisa mönstret med osäkerhet och upplysningen att det upptäcktes under utforskning. Kalla inte gruppen ett bevisat undantag bara för att dess enskilda resultat passerar en vanlig signifikansgräns.
Kontrollera om gruppen definierades oberoende av behandlingen och om dess skenbara effekt trovärdigt skiljer sig från andra grupper. Ett signifikant resultat i en grupp och ett icke signifikant resultat i en annan visar inte i sig att skillnaden mellan grupperna är signifikant.
Använd en oberoende upprepning för att pröva en lovande upptäckt där det är genomförbart. Bevara den ursprungliga utforskande analysen men ge nästa försök ett tydligt utfall och en bestämd beslutsregel innan nya observationer samlas in.
Slutrapporten bör ange testfamiljen, använd korrigering eller annan kontroll, huvudslutsatsen och de utforskande spåren. Strukturen håller lärandet brett samtidigt som ett stort urval möjliga analyser inte får skapa ett sken av säker annonsfördel som underlaget egentligen inte stödjer.
Källor och avgränsning
Definiera familjen av annonsjämförelser och skilj bekräftande beslut från utforskande fynd.
Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.
