Linjär regressionskalkylator

Bästa anpassade linje
Resultat

Linjär regression anpassar sig till den enda raka linjen y = mx + b som minimerar summan av kvadraterna av de vertikala avvikelserna i datamängden. Det är det första verktyget man använder när man misstänker att en variabel påverkar en annan – exempelvis reklamutgifter mot registreringar, temperatur mot glassförsäljning eller längd mot skostorlek. Ange (x, y)-par så ger beräkningsverktyget lutning, intercept, R² samt Pearsons korrelationskoefficient.

Hur man anpassar en regressionslinje

  1. 1

    Klistra in datan

    Ett par per rad: x och y separerade med komma, tabb eller mellanslag. Rubrikerna ignoreras.

  2. 2

    Läs av lutning och skärningspunkt

    Lutningen m = förändringen i y för varje enhetsförändring i x. Skärningspunkten b = y när x = 0.

  3. 3

    Granska R²

    R² ∈ [0, 1] – andelen av variansen i y som förklaras av x. Värden över 0,7 är vanligtvis starka i sociala data.

  4. 4

    Förutsäg nya värden

    Sätt in valfritt x i y = m·x + b för att få modellens förutsägelse.

Formlerna bakom anpassningen

Givet N datapunkter (x_i, y_i) är lutningen och skärningspunkten för den vanliga minstakvadratmetoden:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R² – determinationskoefficienten – är andelen av variansen i y som förklaras av x:

R² = 1 − SS_res / SS_tot

där SS_res är summan av kvadraterna av residualerna och SS_tot är summan av kvadraterna av avvikelserna för y från dess medelvärde. Pearson-r är ±√R² och har samma tecken som lutningen.

Exempel med praktisk tillämpning

Fem datapunkter:

x y
1 2
2 4
3 5
4 4
5 6

x = 3, y = 4,2. Kovariansens täljare = (1 – 3)(2 – 4,2) + (2 – 3)(4 – 4,2) + (3 – 3)(5 – 4,2) + (4 – 3)(4 – 4,2) + (5 – 3)(6 – 4,2) = 4,4 + 0,2 + 0 – 0,2 + 3,6 = 8,0. Variansens täljare för x = 4 + 1 + 0 + 1 + 4 = 10.

  • Lutningen m = 8,0 / 10 = 0,8
  • Skärningspunkt b = 4,2 − 0,8 × 3 = 1,8
  • Ekvation: y = 0,8x + 1,8
  • R² ≈ 0,727

Vad siffrorna säger – och vad de inte säger

  • Lutning m betyder “hur mycket y rör sig per enhet av x”. Den har enheten y/x.
  • Skärningspunkt b svarar på frågan “vad är y när x är 0”. Det är endast meningsfullt om x = 0 är möjligt i dina data.
  • mäter anpassningskvaliteten, inte kausaliteten. En hög R² på störningsfri proxydata kan ändå vara meningslös.
  • Pearson-r anger det linjära sambandet. Ett värde på r nära 0, trots ett starkt kurvat samband, betyder fortfarande “ingen linjär anpassning” – inte “inget samband”.

Fallgropar

  • Extremvärden förvränger OLS-anpassningarna kraftigt eftersom förlusten är kvadratisk. En enskild avvikande punkt kan rotera linjen med 20 grader.
  • Icke-linjäritet upptäcks inte enbart med R² – plotta alltid residualerna mot x.
  • Regression är inte symmetrisk: att anpassa y till x ger en annan linje än att anpassa x till y.
  • Extrapolering utanför datamängden är spekulation. Anpassningen känner endast till den intervall som den har observerat.

Vanliga frågor

40 % av variationen i y förklaras av den linjära relationen till x. De återstående 60 % beror på brus, andra variabler eller icke-linjärhet. Inom fysik är detta dåligt; i sociala eller ekonomiska data är det ofta acceptabelt.

Börja med en linjär modell. Om residualdiagrammet visar en tydlig kurva, prova en kvadratisk eller logaritmisk transformation. Att direkt övergå till en polynom av hög grad leder till överanpassning och dålig generalisering på nya data.

Matematiskt sett behöver du 2; i praktiken minst 20. Under detta antal dominerar ett avvikande värde anpassningen. För publicerade resultat rekommenderas att följa riktlinjer för provstorlek som är specifika för ditt område.

Nej. De (x, y)-par du klistrar in anpassas i din webbläsare och lämnar aldrig sidan.

Relaterade verktyg

Verktyget finns på andra språk