Experiment och utvärdering

När testgrupper blandas i annonser för ChatGPT

Upptäck när testgrupper för annonser i ChatGPT blandas. Bedöm läckor, felaktiga gruppbyten och vilken slutsats experimentet fortfarande kan stödja.

Börja läsa
Bildillustration: Turkos färg har spridit sig över en ljus söm till ett rostfärgat linnefält.
BildillustrationFärg som passerar sömmen gestaltar hur exponering kan läcka mellan avsedda testgrupper.
Arbetsguiden

Det här får du hjälp med.

Experiment och utvärdering
  • Skilj tilldelning, faktisk exponering och registrerat utfall åt.
  • Ta inte bort personer i efterhand bara för att grupperna har blandats.
  • Beskriv vilken jämförelse som fortfarande är möjlig efter en dokumenterad avvikelse.

Ett kampanjtest kan ha korrekta rapporter och ändå jämföra fel saker. Kontrollgruppen kan ha fått samma erbjudande via ett nyhetsbrev, en besökare kan möta båda landningssidorna och ett säljteam kan använda den nya rabatten för alla kunder. Testkontaminering betyder här att den avsedda skillnaden mellan grupperna har försvagats eller förändrats. Frågan blir vilken slutsats ett test av annonser i ChatGPT fortfarande kan bära.

Arbetsgången nedan är vår rekommenderade interna metod. Den förutsätter ingen inbyggd randomisering, användarbaserad kontrollgrupp eller överlappsrapport i ChatGPT Ads. Kontrollera först om er faktiska testdesign går att genomföra med tillgängliga verktyg. Två kampanjer med olika namn skapar inte automatiskt två åtskilda populationer.

Rita tre separata led

Beskriv först tilldelningen: vilken enhet skulle hamna i vilken grupp, och genom vilken regel? Beskriv därefter exponeringen: vilken förändring fick enheten faktiskt möta? Skriv sist utfallet: vad registrerades och under vilken period? De tre leden behöver olika bevis. Ett kampanj-ID visar inte att samma person aldrig sett en annan kampanj.

Om testet gäller en landningssida efter annonsklicket kan er egen webbplats, där det är tekniskt och organisatoriskt möjligt, hålla en besökare kvar i en tilldelad variant. Ett sådant upplägg testar sidans effekt bland den definierade besökarpopulationen. Det visar inte annonseringens inkrementella effekt bland alla potentiella kunder. Om annonserna påverkar vilka som klickar kan en jämförelse enbart bland klickare dessutom besvara en annan fråga än den ursprungliga.

OpenAI beskriver kampanjer, annonsgrupper och annonser i sin dokumentation om kampanjhantering. Använd deras stabila identifierare för att hålla reda på kampanjobjekten. Håll personers eller regioners testtilldelning i ett separat, lämpligt internt register om designen kräver det. Läs förutsättningar för en kontrollgrupp innan ni lovar att exponeringen kan separeras.

Leta där gruppernas upplevelser kan mötas

Gå igenom hela erbjudandets väg. En kopierad kampanj kan behålla fel destination. En gemensam sidmall kan ändras för båda varianterna. En rabattkod kan spridas mellan kunder. En regions kontrollperiod kan sammanfalla med en nationell kampanj i en annan kanal. Det viktiga är om händelsen förändrar den behandling som grupperna skulle skilja sig åt på.

Skilj detta från gemensamma omvärldsförändringar. En helg som påverkar båda grupperna lika är inte automatiskt kontaminering. En webbändring som inför testets nya erbjudande även i kontrollen är däremot en direkt läcka. En ändring som bara påverkar en grupp kan vara en konkurrerande förklaring. Skriv vilken mekanism ni misstänker i stället för att samla alla problem under rubriken databrus.

Händelsemätningen behöver också följa samma definition. Om ena gruppen registrerar köp vid betalning och den andra vid påbörjad kassa jämför ni olika utfall. Det är ett mätfel, även om gruppernas exponering är väl åtskild. OpenAI:s konverteringsdokumentation beskriver hur händelser kopplas till kampanjer. En fungerande koppling löser inte en felaktig experimentdesign.

Kvantifiera det som faktiskt är känt

Anta ett hypotetiskt test med ett separat, verifierbart tilldelningsregister. Kontrollgruppen omfattar 2 000 personer. Av dem vet ni att 160 även fick behandlingen. För ytterligare 250 saknas exponeringsstatus. Den kända sammanblandningen är 160 / 2 000 = 8 procent. Den okända andelen är 250 / 2 000 = 12,5 procent.

Siffrorna avser personer i kontrollgruppen. Dividera inte 160 personer med antalet annonsvisningar. Summera inte heller de okända med de kända och kalla allt bekräftad kontaminering. I detta förenklade exempel ligger den möjliga andelen mellan 8 och 20,5 procent om de 250 är de enda osäkra fallen. Intervallet är en logisk gräns för saknad information, inget statistiskt konfidensintervall.

Gör motsvarande kontroll för behandlingsgruppen. Där kan enheter ha missat behandlingen helt. Dokumentera även när läckan började och om den gäller en viss variant eller kanal. Om ni saknar data som kan visa personöverlapp ska bedömningen heta okänd exponering, inte noll överlapp. Rapportvolym kan inte ersätta bevis för separation.

Arbetsflöde

Spåra läckan innan du tolkar skillnaden

  1. Avsedd kontroll

    2 000 personer tilldelades kontroll enligt den externa testplanen.

  2. Känd sammanblandning

    160 fick också behandlingen: 160 / 2 000 = 8 %.

  3. Okänd exponering

    250 saknar exponeringsstatus: 12,5 %. Redovisa separat från de 160.

  4. Beslut

    Behåll tilldelade grupper i huvudanalysen och utred vad läckan innebär.

Hypotetiskt internt register. Personer, inte annonsvisningar, är enheten i detta exempel.

Rensa inte bort problemet i efterhand

I ett korrekt randomiserat experiment är analys efter ursprunglig tilldelning normalt en central utgångspunkt. Att flytta personer till den grupp vars erbjudande de råkade använda kan bryta randomiseringen: deras beteende kan hänga samman med köpbenägenheten. Detsamma gäller att radera alla som fått båda upplevelserna. En snyggare tabell kan då bli mindre trovärdig.

Vår rekommendation är att bevara huvudanalysen enligt den förhandsbestämda planen och redovisa avvikelsen. En separat känslighetsanalys kan undersöka alternativa antaganden, men ska märkas som sådan. Räkna inte baklänges fram en antagen ren effekt genom att bara dividera den observerade effekten med andelen okontaminerade. Det kräver starka antaganden om vilka som påverkats och hur.

NIST framhåller att experimentdesignen måste väljas efter frågan och faktorerna. Här är den praktiska följden att en större datamängd inte ensam återställer en förlorad jämförelse. Har behandlingen blivit identisk i grupperna behöver upplägget ändras, inte bara köras längre.

Välj ett nästa steg som matchar skadan

En kort, avgränsad avvikelse med dokumenterad start och slut kan ibland hanteras enligt en i förväg beslutad regel. En pågående läcka som gör grupperna otydliga talar för att rätta genomförandet och planera en ny jämförelse. En okänd, omfattande överlappning kan begränsa resultatet till en beskrivning av observerad leverans och tillskrivna utfall.

Avsluta granskningen med en konkret formulering: vilken behandling som var avsedd, vilken avvikelse som upptäcktes, vilka enheter som berördes och vilket beslut underlaget tillåter. Spara detta i experimentloggen. Om den kvarvarande osäkerheten fortfarande rymmer både nytta och skada, följ arbetsgången för ett resultat som inte ger ett tydligt besked. På så sätt blir läckan en synlig begränsning i beslutet i stället för ett dolt antagande.

Källor och avgränsning

Avgöra hur känd och okänd överlappning mellan avsedda testgrupper påverkar ett kampanjtests tolkning och fortsättning.

Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.

Ditt nästa kapitel

Se hur kampanjen följs upp.

Utforska rapporteringen i AthillyAds och hur den passar ihop med din egen mätning av förfrågningar, köp och andra affärsresultat.