Web Analytics
Avancerad

Chi-två test

Chi-två test för goodness-of-fit och oberoende i kontingenstabell.

chi-två test goodness-of-fit kontingenstabell oberoende observerad frekvens

Chi-kvadrat testet är statistikens detektor för avvikelser från det förväntade. Förväntar vi oss lika många pojkar och flickor men får 60/40? Borde olika webbläsare vara lika populära men Chrome dominerar? Chi-kvadrat mäter hur mycket observerad data avviker från vad vi förväntar oss och avgör om skillnaden är för stor för att vara slumpmässig.

Fördjupning

Chi-kvadrat testet används för att testa om observerade frekvenser skiljer sig signifikant från förväntade frekvenser. Det finns flera varianter: goodness-of-fit test (testar om data följer en specifik fördelning), oberoende test (testar om två kategoriska variabler är oberoende), och homogenitet test (testar om flera populationer har samma fördelning). Teststatistikan χ² = Σ(O-E)²/E följer en chi-kvadrat fördelning under nollhypotesen.

Goodness-of-fit test

Testar om observerade data följer en specificerad fördelning. H₀: data följer den angivna fördelningen. Kräver förväntade frekvenser ≥ 5 i varje kategori.

Chi-kvadrat teststatistika
Chi-kvadrat teststatistika

Tärningskast

Kasta tärning 60 gånger. Förväntat: 10 av varje sida. Observerat: [8,12,9,11,10,10]. Är tärningen rättvis?
Chi-kvadrat fördelning för olika frihetsgrader
Chi-kvadrat fördelning för olika frihetsgrader

Test för oberoende

Testar om två kategoriska variabler är oberoende i en korstabell. H₀: variablerna är oberoende. Förväntade frekvenser beräknas från marginalsummor.

Förväntad frekvens i korstabell
Förväntad frekvens i korstabell

Kön och favoritfärg

Korstabell med kön vs färgpreferens. Testar om färgval är oberoende av kön.

Frihetsgrader och kritiska värden

Goodness-of-fit: df = k-1-p (k kategorier, p skattade parametrar). Oberoende test: df = (r-1)(c-1) för r×c tabell.

Kritiska områden för chi-kvadrat test
Kritiska områden för chi-kvadrat test

Korrigering för små stickprov

Yates kontinuitetskorrektion för 2×2 tabeller: χ² = Σ(|O-E|-0.5)²/E. Fishers exakta test när förväntade frekvenser är små.

Små förväntade frekvenser

Om någon förväntad frekvens < 5, överväg att slå samman kategorier eller använda exakt test.

Vanliga misstag

❌ Använda chi-kvadrat på kontinuerliga data

Chi-kvadrat är endast för kategoriska/diskreta data

Exempel: Kan inte testa normalfördelning för kontinuerlig variabel direkt med chi-kvadrat

❌ För små förväntade frekvenser

Regel: alla förväntade frekvenser ≥ 5 för att chi-kvadrat approximation ska gälla

Exempel: 2×2 tabell med förväntad frekvens 2 → använd Fishers exakta test

❌ Använda counts istället för proportioner

Vid jämförelse av grupper med olika storlek

Exempel: Jämför 100 män och 50 kvinnor - normalisera först

❌ Fel frihetsgrader

Glöm att räkna av skattade parametrar

Exempel: Testa normalfördelning med skattade μ och σ: df = k-1-2, inte k-1

Tillämpningar

Genetik

Testa Mendels lagar och arvsfördelningar

Exempel: Förväntat förhållande 3:1, observerat 28:12 → chi-kvadrat test

Marknadsundersökning

Testa om preferenser är oberoende av demografiska faktorer

Exempel: Är produktval oberoende av ålder och kön?

Kvalitetskontroll

Testa om defektfrekvens följer förväntad fördelning

Exempel: Antal defekter per dag ska följa Poisson-fördelning

Övningar

1 Lätt

Tärning kastas 120 gånger. Resultat: [18,22,19,21,20,20]. Är tärningen rättvis? α=0.05

Tips

Förväntad frekvens = 20 för varje sida

Visa facit
  1. Förväntad frekvens: 120/6 = 20
  2. χ² = (18-20)²/20 + (22-20)²/20 + ... = 0.8
  3. df = 5, χ²₀.₀₅ = 11.07, 0.8 < 11.07

Svar: χ² = 0.8, förkasta ej H₀

2 Medel

2×2 tabell: Kön vs Rökning. Män: [30 rökare, 70 icke]. Kvinnor: [20 rökare, 80 icke]. Testa oberoende.

Tips

Beräkna förväntade frekvenser från marginaler

Visa facit
  1. Förväntade: E₁₁ = 50×100/200 = 25
  2. E₁₂ = 50×100/200 = 75, etc.
  3. χ² = (30-25)²/25 + (70-75)²/75 + (20-25)²/25 + (80-75)²/75 = 2.78

Svar: χ² = 2.78, p > 0.05

Sammanfattning

Chi-kvadrat testet jämför observerade och förväntade frekvenser för kategoriska data. Används för goodness-of-fit och oberoende tester. Kräver förväntade frekvenser ≥ 5. Teststatistikan χ² = Σ(O-E)²/E följer chi-kvadrat fördelning.