مقدمه‌ای بر زیست‌آمار
واحد 11·55 دقیقه

همبستگی و رگرسیون خطی

سنجش قدرت یک همبستگی خطی، برازش یک خط با روش کمترین مربعات، بررسی چهار فرض، و حرکت به سوی رگرسیون چندگانه برای تعدیل و پیش‌بینی، که اهداف متفاوتی هستند و نیازمند قضاوت‌های متفاوتی می‌باشند.

پس از این درس شما قادر خواهید بود

  • ضریب همبستگی پیرسون را محاسبه و تفسیر کنید و شش ویژگی آن را بیان کنید.
  • توضیح دهید چرا همبستگی هم به شیب و هم به پراکندگی بستگی دارد.
  • مدل رگرسیون را بنویسید و هر یک از اجزا را شناسایی کنید.
  • چهار فرض رگرسیون خطی را بیان کنید و هر یک را با یک نمودار بررسی کنید.
  • یک خط رگرسیون را با روش کمترین مربعات به‌صورت دستی و در R برآورد کنید.
  • جدول ANOVA را برای رگرسیون، ضریب تعیین (R²) و آزمون F تفسیر کنید.
  • اثرات تعدیل‌شده را در رگرسیون چندگانه تفسیر کنید و بین تعدیل و پیش‌بینی تمایز قائل شوید.
  • فاصله اطمینان برای میانگین را از فاصله پیش‌بینی برای یک مشاهده جدید متمایز کنید.
  • کدگذاری پیش‌بین‌های دسته‌ای

همبستگی و رگرسیون خطی

همبستگی

واریانس، هم‌واریانس و همبستگی

واریانس اندازه‌گیری می‌کند که یک متغیر تا چه حد با خود تغییر می‌کند:

Var(x)=(xixˉ)2n1\text{Var}(x) = \frac{\sum(x_i - \bar{x})^2}{n-1}

هم‌واری نشان می‌دهد که دو متغیر چگونه با هم تغییر می‌کنند:

Cov(x,y)=(xixˉ)(yiyˉ)n1\text{Cov}(x,y) = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{n-1}

هم‌واری مثبت است وقتی که مقادیر بزرگ xx معمولاً با مقادیر بزرگ yy همراه هستند. مشکل این است که بزرگی آن به واحدها بستگی دارد: هم‌واری در کیلوگرم-سانتی‌متر با هم‌واری در پوند-اینچ قابل مقایسه نیست.

ضریب همبستگی پیرسون این مشکل را با استانداردسازی حل می‌کند:

r(x,y)=Cov(x,y)Sd(x)Sd(y)=Cov(x,y)Var(x)Var(y)=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r(x,y) = \frac{\text{Cov}(x,y)}{Sd(x)\,Sd(y)} = \frac{\text{Cov}(x,y)}{\sqrt{\text{Var}(x)\text{Var}(y)}} = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum(x_i-\bar{x})^2 \sum(y_i - \bar{y})^2}}

cov(x, y); sd(x); sd(y)
cor(x, y)                  # Pearson by default

شش ویژگی rr

1. این تنها همبستگی خطی را اندازه‌گیری می‌کند. یک رابطه درجه دوم کامل می‌تواند دارای r=0r = 0 باشد. همیشه داده‌ها را نمودار کنید.

2. دامنهٔ آن از −1 تا +1 است.

  • مثبت: xx و yy با هم تغییر می‌کنند.
  • منفی: xx و yy در جهت مخالف تغییر می‌کنند.
  • +1+1 یا 1-1: وابستگی خطی کامل
  • 00: هیچ همبستگی خطی وجود ندارد

3. نسبت به واحدها یا هر تبدیل خطی روی xx و yy ناوردا است. تبدیل سلسیوس به فارنهایت مقدار rr را تغییر نمی‌دهد.

4. این متقارن است و هیچ فرضی درباره علل و معلول‌ها ندارد. r(x,y)=r(y,x)r(x,y) = r(y,x). این یک تفاوت کلیدی با رگرسیون است که متقارن نیست.

5. وقتی هر دو متغیر توزیع نرمال داشته باشند، تفسیر آن آسان‌تر است.

6. این به طور همزمان به دو چیز بستگی دارد: شیب خط مستقیم بهترین برازش، و پراکندگی نقاط در اطراف آن خط.

ویژگی ششم همان چیزی است که دردسر ایجاد می‌کند. دو مجموعه داده با شیب‌های یکسان می‌توانند ضریب همبستگی 0.98 و 0.73 داشته باشند و تنها در چگونگی چیدگی فشرده نقاط با هم متفاوت باشند. دو مجموعه داده می‌توانند هر دو r=0r = 0 داشته باشند: یکی واقعاً بدون رابطه و دیگری دارای یک رابطه منحنی قوی که هیچ خط مستقیمی آن را در بر نمی‌گیرد.

همبستگی و تبدیل

چون همبستگی تنها رابطه خطی را می‌سنجد، تبدیل یک متغیر می‌تواند آن را به‌طور قابل‌توجهی تغییر دهد.

یک آزمون تخته پین برای سنجش چابکی دستی در کودکان 4 تا 16 ساله نشان می‌دهد که زمان لازم برای اتمام با افزایش سن کاهش می‌یابد. در مقیاس خام، r=0.75r = -0.75. با تبدیل زمان به سرعت (1/زمان)، رابطه صاف‌تر شده و r=0.81r = 0.81.

درآمد فیلم در مقابل امتیاز منتقدان، r=0.35r = 0.35 را هم به‌صورت خام و هم به‌صورت تبدیل‌شده به لگاریتم ارائه می‌دهد، زیرا در اینجا تبدیل لگاریتمی خطیّت را تغییر نداد، بلکه تنها پراکندگی باقیمانده‌ها را تغییر داد. درس این نیست که تبدیل همیشه کمک می‌کند، بلکه این است که مقیاس مناسب یک مسئله تجربی است.

رگرسیون خطی ساده

مدل

هر مشاهده yiy_i را برای i=1ni = 1 \ldots n تجزیه کنید:

yi=α+βxi+eiy_i = \alpha + \beta x_i + e_i

E(yx)=α+βxiE(y \mid x) = \alpha + \beta x_i

که مقدار مورد انتظار yy با توجه به xx است، میانگین شرطی واقعی yy با توجه به xx.

  • α\alpha عرض از مبدأ جامعه است: مقدار پیش‌بینی‌شده yy وقتی xx برابر 0 است.
  • β\beta شیب جامعه است: تغییر yy به ازای هر 1 واحد تغییر در xx.
  • y^i=α^+β^xi\hat{y}_i = \hat{\alpha} + \hat{\beta}x_i مقدار پیش‌بینی‌شده از پارامترهای برآوردشده است.
  • ei=yiy^ie_i = y_i - \hat{y}_i خطای باقی‌مانده است.

حروف یونانی نشان‌دهندهٔ مقادیر نامعلومی هستند که باید برآورد شوند؛ علامت «hat» نشان‌دهندهٔ برآورد نمونه‌ای یا مقدار پیش‌بینی‌شده است. برخی کتاب‌ها به‌جای آن از y^=a+bx\hat{y} = a + bx استفاده می‌کنند.

توجه کنید که برخلاف همبستگی، رگرسیون متقارن نیست. رگرسیون yy بر xx خط متفاوتی نسبت به رگرسیون xx بر yy می‌دهد. انتخاب اینکه کدام متغیر نتیجه است، تصمیمی مدل‌سازی است که باید از علم نشأت بگیرد.

چهار فرضیه

خطی بودن. میانگین حقیقی yy تابعی خطی از xx است.

خطاهای نرمال. باقی‌مانده‌ها به‌طور نرمال توزیع شده‌اند، eiN(0,σ2)e_i \sim N(0, \sigma^2)، با میانگین 0 و واریانس σ2\sigma^2. توجه داشته باشید که این یک فرض درباره خطاها است، نه درباره yy یا xx به‌طور جداگانه.

واریانس ثابت (هموسکداستیسیتی). σ2\sigma^2 برای همه مقادیر xx یکسان است.

خطاهای مستقل. eie_iها از یکدیگر مستقل هستند.

سه کمیت برآورد می‌شوند: α\alpha، β\beta و σ2\sigma^2.

تخمین به کمترین مربعات

برای به حداقل رساندن مجموع مربعات خطاها، α^\hat{\alpha} و β^\hat{\beta} را انتخاب کنید:

SSe=i=1n(yiy^i)2SS_e = \sum_{i=1}^{n}(y_i - \hat{y}_i)^2

راه حل:

β^=(xixˉ)(yiyˉ)(xixˉ)2α^=yˉβ^xˉ\hat{\beta} = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2} \qquad \hat{\alpha} = \bar{y} - \hat{\beta}\bar{x}

توجه کنید که مخرج β^\hat{\beta} همبستگی و صورت آن واریانس xx است. آن را با فرمول rr مقایسه کنید: آن‌ها صورت مشترکی دارند و تنها در مخرج با هم تفاوت دارند، به همین دلیل ارتباط بسیار نزدیکی با هم دارند.

fit <- lm(bodyfat ~ abdomen, data = d)
summary(fit)
coef(fit)

آزمایش شیب

H0:β=0H_0: \beta = 0

اگر H0H_0 درست باشد، β^\hat{\beta} به صورت tt با np1n - p - 1 درجهٔ آزادی توزیع می‌شود، که در آن nn اندازهٔ نمونه و pp تعداد متغیرهای مستقل است:

t=β^SE(β^)t = \frac{\hat{\beta}}{SE(\hat{\beta})}

خوبی برازش

جدول ANOVA برای رگرسیون

دقیقاً همانند واحد ANOVA، واریانس کل تجزیه می‌شود:

SStot=SSreg+SSeSS_{tot} = SS_{reg} + SS_e

i=1n(yiyˉ)2=i=1n(y^iyˉ)2+i=1n(yiy^i)2\sum_{i=1}^{n}(y_i - \bar{y})^2 = \sum_{i=1}^{n}(\hat{y}_i - \bar{y})^2 + \sum_{i=1}^{n}(y_i - \hat{y}_i)^2

منبع SS دی‌اف MS F
پس‌روی SSregSS_{reg} pp SSreg/dfSS_{reg}/df MSreg/MSeMS_{reg}/MS_e
باقیمانده SSeSS_e np1n - p - 1 SSe/dfSS_e/df
مجموع SStotSS_{tot} n1n - 1

برای رگرسیون دوگان، p=1p = 1.

سه خلاصه تناسب

استفاده از رگرسیون درصد چربی بدن بر محیط شکم در 250 مرد:

واریانس خطاها:

σ^2=MSe=SSenp1=22.2\hat{\sigma}^2 = MS_e = \frac{SS_e}{n - p - 1} = 22.2

پس واحدهای درصدی σ^=4.71\hat{\sigma} = 4.71: اندازهٔ معمول خطای پیش‌بینی.

نسبت واریانس در yy که توسط xx تبیین می‌شود:

R2=SSregSStot=0.6785R^2 = \frac{SS_{reg}}{SS_{tot}} = 0.6785

حدود 68% از واریانس چربی بدن توسط محیط شکم تبیین می‌شود.

ارتباطات با همبستگی:

R2=r(x,y)=r(y,y^)=0.8237\sqrt{R^2} = |r(x,y)| = r(y, \hat{y}) = 0.8237

β^=r(x,y)sd(y)sd(x)=0.824×8.29410.207=0.669\hat{\beta} = r(x,y)\frac{sd(y)}{sd(x)} = 0.824 \times \frac{8.294}{10.207} = 0.669

این هویت‌ها ارزش دانستن را دارند. R2R^2 همبستگی مربعات بین xx و yy است و همچنین همبستگی مربعات بین مقادیر مشاهده‌شده و پیش‌بینی‌شده، تعریفی که به رگرسیون چندگانه تعمیم می‌یابد. شیب نیز همبستگی است که بر اساس نسبت انحراف معیارها مقیاس‌بندی شده است.

آزمون F

H0:β=0or, for multiple regression,H0:β1=β2==βp=0H_0: \beta = 0 \qquad \text{or, for multiple regression,} \qquad H_0: \beta_1 = \beta_2 = \cdots = \beta_p = 0

تحت H0H_0، MSreg/MSeMS_{reg}/MS_e توزیعی F را با df1=pdf_1 = p و df2=np1df_2 = n - p - 1 دنبال می‌کند. با n=250n = 250 و p=1p = 1، p<0.05p < 0.05 به F(1,248)>3.88F(1, 248) > 3.88 نیاز دارد.

برای رگرسیون ساده، آزمون F و آزمون t شیب معادل هستند، با F=t2F = t^2.

بررسی فرضیات

فرض‌ها با نمودارها بررسی می‌شوند، نه با آزمون‌ها.

طبیعی بودن خطاها: نمودار کوانتیل-کوانتیل باقیمانده‌ها. نقاط باید نزدیک به خط مورب قرار گیرند.

واریانس ثابت: باقیمانده‌ها در مقابل پیش‌بین یا مقادیر برازش‌شده ترسیم می‌شوند. نوار نقاط باید عرض ثابتی داشته باشد. شکل قیف‌مانند که با افزایش مقادیر برازش‌شده پهن‌تر می‌شود، نشان کلاسیک واریانس غیرثابت است.

خطی بودن: همان نمودار باقیمانده‌ها. انحنا در باقیمانده‌ها نشان می‌دهد که فرم خطی اشتباه است.

par(mfrow = c(2,2))
plot(fit)             # residuals vs fitted, Q-Q, scale-location, leverage

کارآمد: وقتی تبدیل کمک می‌کند

رگرسیون درآمد ناخالص فیلم بر اساس امتیاز منتقدان هم باقیمانده‌های غیرنرمال (به‌شدت چپ‌پرت) و هم واریانس متغیر (باقیمانده‌ها در امتیازهای بالاتر پراکنده می‌شوند) را نشان می‌دهد. تبدیل لگاریتمی نتیجه هر دو مشکل را برطرف می‌کند: نمودار Q-Q صاف می‌شود و عرض باند باقیمانده‌ها یکنواخت می‌گردد.

متغیر وابسته شیب ت R2R^2
مجموع (میلیون دلار) 1.11 9.10 0.120
لگ (دلار ناخالص میلیون) 0.013 9.17 0.122

توجه کنید که برازش و معناداری تقریباً تغییر نمی‌کنند؛ آنچه تغییر می‌کند این است که آیا فرضیات برقرار هستند یا خیر و در نتیجه آیا می‌توان به خطاهای استاندارد و فواصل اطمینان اعتماد کرد. این دو مدل همچنین پیش‌بینی‌های کاملاً متفاوتی ارائه می‌دهند: مدل بدون تبدیل به یک خط مستقیم اشاره دارد و مدل لگاریتمی به رشد نمایی دلالت می‌کند.

تفسیر نیز تغییر می‌کند. شیب 1.11 در مقیاس خام به معنای یک میلیون دلار درآمد اضافی به ازای هر واحد نمره منتقد است. شیب 0.013 در مقیاس لگاریتمی به معنای افزایش حدود 1.3% درآمد به ازای هر واحد نمره است که این افزایش به‌جای جمع‌شدن، به‌صورت ضرب‌شدن عمل می‌کند.

کار کرد: وقتی تبدیل خطی بودن را اصلاح می‌کند

داده‌های چابکی در پنل پین‌دار نشان می‌دهند که وقتی زمان بر سن رگرسیون می‌شود، باقیمانده‌ها انحنای واضحی دارند. رگرسیون 1/زمان (یعنی سرعت) بر سن، باقیمانده‌هایی بدون الگو می‌دهد. رابطه بین سن و سرعت خطی است؛ اما رابطه بین سن و زمان خطی نیست.

بررسی استقلال

استقلال را نمی‌توان مانند سایر موارد از نمودار بقایای خطا بررسی کرد. باید از خود طرح بررسی شود:

  • آیا داده‌ها اندازه‌گیری‌های تکراری از یک فرد یا شیء هستند؟
  • آیا داده‌ها به‌صورت خوشه‌ای نمونه‌برداری شده‌اند؟
    • کودکان در کلاس‌های درس مدارس
    • جوجه موش‌های صحرایی در یک زایمان
    • بیماران در بیمارستان‌ها
    • هم‌تایان در شبکه‌های اجتماعی

اگر هر یک از این موارد درست باشد، رگرسیون معمولی اشتباه است و به مدل‌های چندسطحی که در دوره رگرسیون پوشش داده شده‌اند نیاز است. پیامد نادیده گرفتن خوشه‌بندی، خطاهای استاندارد بسیار کوچک است، بنابراین فواصل اطمینان باریک و مقادیر p بسیار کوچک می‌شوند.

رگرسیون چندگانه

با متغیرهای مستقل pp:

y=β0+β1x1+β2x2++βpxp+ey = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \cdots + \beta_p x_p + e

  • β0\beta_0 پیش‌بینی زمانی است که همه xxها برابر صفر باشند.
  • β1\beta_1 اثر x1x_1 است وقتی سایر xxها ثابت نگه داشته شوند.
  • β\betaها تأثیراتی هستند که برای سایر xxها در مدل تنظیم شده‌اند.
  • R2R^2 نسبت واریانسی است که توسط همه پیش‌بین‌ها به‌طور مشترک تبیین می‌شود.
  • آزمون F، H0:β1=β2==βp=0H_0: \beta_1 = \beta_2 = \cdots = \beta_p = 0 را آزمایش می‌کند.

تفسیر اثرات تعدیل‌شده

اثرات تعدیل‌شده، اثرات منحصربه‌فرد برآوردشده هستند: بخشی از ارتباط با yy که به x1x_1 تعلق دارد و نه به سایر پیش‌بین‌ها.

سه پیامد به دنبال دارد، و هر سه مردم را شگفت‌زده می‌کنند:

اگر r(x1,x2)0r(x_1, x_2) \neq 0 باشد، آنگاه β^1\hat{\beta}_1 بسته به اینکه x2x_2 در مدل باشد یا نه، متفاوت خواهد بود. چیزی به نام «اثر x1x_1» به‌تنهایی وجود ندارد؛ آنچه هست، اثر x1x_1 در یک مدل مشخص است. افزودن یا حذف یک پیش‌بین همبسته آن را تغییر می‌دهد.

آزمون‌های SSregSS_{reg} ممکن است با آزمون‌های هر یک از β\betaها سازگار نباشند. با دو پیش‌بین بسیار همبسته، مدل می‌تواند به‌طور کلی بسیار معنادار باشد در حالی که هیچ‌یک از ضرایب به‌طور جداگانه معنادار نیستند، زیرا هر یک توسط دیگری «توضیح داده می‌شود».

ممکن است آزمون F رگرسیون با آزمون‌های t β\betas مطابقت نداشته باشد.

دو دایرهٔ همپوشان برای x1x_1 و x2x_2 را در مقابل دایره‌ای برای yy تصور کنید. وقتی پیش‌بین‌ها همبسته نباشند، سهم‌های آن‌ها در yy همپوشانی ندارند و اثرات به‌خوبی قابل تفکیک‌اند. وقتی همبسته هستند، ناحیهٔ هم‌پوشانی به هیچ‌یک به‌طور انحصاری تعلق ندارد و هر ضریب تنها از بخش غیرهم‌پوشان آن برآورد می‌شود.

رگرسیون چندگانه برای تعدیل

نرخ جرایم US بر حسب ایالت، 1960. نتیجه، تعداد جرایم به ازای هر یک میلیون نفر از ساکنان ایالت است.

مدل پیش‌بینی‌کننده‌ها شیب ت p
اثر خام آموزش متوسط 11.16 2.29 0.03
تأثیر تعدیل‌شده آموزش متوسط −0.15 −0.02 0.98
ایالت GDP 0.18 2.22 0.03

به طور کلی، تحصیلات بیشتر با جرم بیشتر ارتباط دارد و این ارتباط به‌طور قابل‌توجهی معنادار است. پس از کنترل ایالت GDP، اثر تحصیلات کاملاً از بین می‌رود.

دو نکته که باید از این برداشت کرد:

GDP به‌عنوان یک عامل عامل مخدوش‌گر عمل می‌کند. ایالت‌های ثروتمندتر هم تحصیلات بیشتری دارند و هم جرایم ثبت‌شده بیشتری. وقتی GDP وارد مدل شود، تحصیلات هیچ همبستگی مستقلی ندارد. این همان پدیده‌ای است که در مثال‌های مهارکننده استیل‌کولین‌استراز و مهارکننده ACE در دوره مبانی مطرح شده بود و اکنون به‌صورت ضریب رگرسیون بیان می‌شود.

این‌ها اثراتی در سطح ایالت هستند، نه در سطح فرد. این تحلیل از میانگین‌های ایالتی استفاده می‌کند و لزومی ندارد که رابطه‌ای میان میانگین‌ها در سطح افراد برقرار باشد. این سوگیری بوم‌شناختی است و مسئله‌ای جدا از آمیختگی (confounding) است. یک ایالت که میانگین تحصیلات در آن بالا است لزوماً ایالتی نیست که در آن افراد تحصیل‌کرده مرتکب جرایم شوند. استنتاج فردی از داده‌های کلان، مغالطه‌ی بوم‌شناختی است.

پرسش «اثربخشی واقعی تحصیلات متوسط بر نرخ جرم چیست؟» بنابراین نیازمند فرضیاتی است: اینکه شکل مدل صحیح است، همه عوامل عامل مخدوش‌گر مرتبط گنجانده شده و به‌خوبی اندازه‌گیری شده‌اند، و اینکه رابطه کلان بازتاب‌دهنده رابطه فردی است.

رگرسیون چندگانه برای پیش‌بینی

پیش‌بینی درآمد ناخالص US به میلیون‌ها دلار:

مدل پیش‌بینی‌کننده‌ها شیب R2R^2
1 بودجه (میلیون دلار) 1.08 0.467
2 بودجه (میلیون دلار) 1.01 0.512
درصد تازگی راتن تومیتوز 0.70
3 بودجه (میلیون دلار) 0.97 0.517
درصد تازگی راتن تومیتوز 0.64
زمان اجرا (دقیقه) 0.39

توجه کنید که ضریب بودجه با اضافه شدن پیش‌بین‌ها از 1.08 به 1.01 و سپس به 0.97 تغییر می‌کند: دقیقاً همان رفتاری که در بالا برای پیش‌بین‌های همبسته توصیف شد.

یک پیش‌بینی کارشده

آیا مدل شما می‌توانست ما را از ساخت فیلم جان کارتر در سال 2012 نجات دهد؟

خام بودجه زمان اجرا % تازه
جان کارتر 73.1 میلیون دلار 250 میلیون دلار 1 ساعت و 39 دقیقه 51%

y^=β^0+β^1(budget)+β^2(%fresh)+β^3(runtime)\hat{y} = \hat{\beta}_0 + \hat{\beta}_1(\text{budget}) + \hat{\beta}_2(\text{\%fresh}) + \hat{\beta}_3(\text{runtime}) =52.37+0.97(250)+0.64(51)+0.39(139)=277= -52.37 + 0.97(250) + 0.64(51) + 0.39(139) = 277

ei=yy^=73.1277=204e_i = y - \hat{y} = 73.1 - 277 = -204

خیر. مدل مقدار 277mgrossforafilmthatmade277m gross for a film that made 73m را پیش‌بینی کرد. باقیمانده برابر −204 است که بیش از سه برابر انحراف معیار باقیمانده است.

مدل به طور کلی چقدر دقیق است؟

با فرض خطاهای توزیع‌شده به صورت نرمال و همگن:

  • R2=0.517R^2 = 0.517: مدل حدود 52% از واریانس در ناخالص را توضیح می‌دهد.
  • σ^2=3314\hat{\sigma}^2 = 3314، پس σ^=3314=57.57\hat{\sigma} = \sqrt{3314} = 57.57
  • انتظار می‌رود 95% از مجموع فروش‌های مشاهده‌شده در بازه‌ای به فاصله ±1.96σ^=±112.8\pm 1.96\hat{\sigma} = \pm 112.8 میلیون دلار از پیش‌بینی قرار گیرند.

R2R^2 برابر با 0.52 به‌نظر قابل‌قبول می‌رسد و همین مدل بازهٔ پیش‌بینی به عرض 226 میلیون دلار دارد. R2R^2 نشان می‌دهد چه میزان واریانس توضیح داده شده است؛ اما نمی‌گوید آیا پیش‌بینی‌ها مفید هستند یا خیر. برای تصمیم‌گیری دربارهٔ سرمایه‌گذاری 250 میلیون دلاری، بازه‌ای به این وسعت بی‌ارزش است.

بررسی نمودار بقایای این مدل نشان می‌دهد که با افزایش درآمدهای پیش‌بینی‌شده، پراکندگی افزایش می‌یابد، بنابراین حتی بازه اعلام‌شده برای فیلم‌های پرهزینه نیز خوش‌بینانه است.

پیش‌بینی یک مشاهده جدید

یک دنباله برنامه‌ریزی شده است: بودجه 50 میلیون دلار، مدت زمان 90 دقیقه، امید به کسب 60% امتیاز تازه.

y^=52.37+0.97(50)+0.64(60)+0.39(90)=69.63\hat{y}^* = -52.37 + 0.97(50) + 0.64(60) + 0.39(90) = 69.63

پیش‌بینی یک مشاهده جدید نامطمئن‌تر از برآورد میانگین است، زیرا واریانس y^\hat{y}^* شامل دو مؤلفه است:

  1. σ2\sigma^2، تغییرپذیری غیرقابل‌کاهش مشاهدات فردی پیرامون خط
  2. واریانس خود خط رگرسیون برآوردی

95% CI=69.63±113.08=(43.5,  182.7)\text{95\% CI} = 69.63 \pm 113.08 = (-43.5,\; 182.7)

این بازه شامل درآمد منفی است که غیرممکن است و نشانه‌ی دیگری است که این مدل نیاز به تحول دارد.

این تمایز ضروری است و اغلب با هم اشتباه گرفته می‌شوند:

پاسخ‌ها رفتار عرض با رشد nn
فاصله اطمینان برای میانگین میانگین yy برای این xx کجاست؟ به سمت صفر کاهش می‌یابد
فاصلهٔ پیش‌بینی برای یک مشاهدهٔ جدید نقطه بعدی yy برای xx کجا خواهد بود؟ به ±1.96σ\pm 1.96\sigma نزدیک می‌شود، هرگز صفر نمی‌شود
predict(fit, newdata = new, interval = "confidence")   # for the mean
predict(fit, newdata = new, interval = "prediction")   # for a new case

فاصله‌های پیش‌بینی برای پیش‌بینی‌هایی که از میانگین متغیرهای پیش‌بین دورتر هستند، وسیع‌تر است و در نمونه‌های کوچک‌تر این وسعت بیشتر می‌شود. برون‌یابی فراتر از محدوده مشاهده‌شده داده‌ها حتی بدتر است، زیرا بر پایبندی شکل خطی در مناطقی استوار است که هیچ مشاهداتی در آنجا صورت نگرفته است.

چه چیزی یک مدل را مفید می‌کند؟

مفیدیت فراتر از تناسب با داده‌ها است:

  • تا چه حد باید دقیق باشید؟ یک R2R^2 برابر با 0.5 برای برخی اهداف عالی است و برای برخی دیگر بی‌فایده.
  • آیا می‌توانید پیش‌بین‌ها را در زمانی که به پیش‌بینی‌ها نیاز دارید اندازه‌گیری کنید؟ مدلی که به نمره نهایی منتقد نیاز دارد نمی‌تواند تصمیمی را که پیش از فیلم‌برداری گرفته می‌شود، راهنمایی کند.
  • آیا لازم است بدانید که متغیرهای پیش‌بین چرا با نتیجه مرتبط هستند؟ برای پیش‌بینی، خیر. برای مداخله، بله، و یک مدل پیش‌بینی این موضوع را فراهم نمی‌کند.
  • آیا محدودیت‌های مدل را می‌فهمید؟

آن نکته سوم بار دیگر تمایز واحد پیش‌بینی در دوره مبانی را مطرح می‌کند. مدلی که برای پیش‌بینی ساخته شده، مدلی از علل نیست. ضریب مربوط به زمان اجرا به این معنا نیست که افزایش طول فیلم درآمد آن را افزایش می‌دهد.

کدگذاری پیش‌بین‌های دسته‌ای

برای دو دسته، از 0 و 1 استفاده کنید.

نرخ جرم و جنایت US در ایالات جنوبی در مقابل ایالات شمالی:

x={0if the state is northern1if the state is southernx = \begin{cases} 0 & \text{if the state is northern} \\ 1 & \text{if the state is southern} \end{cases}

northern:y^=α+β(0)=α\text{northern}: \hat{y} = \alpha + \beta(0) = \alpha southern:y^=α+β(1)=α+β\text{southern}: \hat{y} = \alpha + \beta(1) = \alpha + \beta

پس:

  • α\alpha نرخ متوسط جرم را در شمال برآورد می‌کند.
  • β\beta میانگین اختلاف بین شمال و جنوب را برآورد می‌کند.

یک رگرسیون با یک پیش‌بین باینری دقیقاً معادل آزمون تی دو نمونه‌ای است و مقدار p یکسانی را می‌دهد. این الگوی کلی است: آزمون تی، ANOVA و رگرسیون یک چارچوب واحد هستند که در سه نشانه‌گذاری مختلف بیان شده‌اند.

برای یک متغیر دسته‌ای با kk دسته، از متغیرهای نشانگر k1k - 1 استفاده کنید و یکی را به‌عنوان سطح مرجع باقی بگذارید. هر ضریب سپس مقایسه‌ای در برابر آن مرجع است. R این موضوع را به‌طور خودکار برای فاکتورها مدیریت می‌کند:

d$region <- factor(d$region)
lm(crime ~ region, data = d)   # k-1 indicators created automatically

درک خود را بررسی کنید

  1. دو متغیر دارای مقادیر r=0.6r = 0.6، sd(y)=20sd(y) = 20 و sd(x)=4sd(x) = 4 هستند. شیب رگرسیون yy بر xx را محاسبه کنید، سپس شیب xx بر yy را محاسبه کرده و توضیح دهید چرا این دو شیب با هم متفاوت هستند در حالی که همبستگی آن‌ها یکسان است.
  2. یک نمودار پراکندگی رابطهٔ واضحی به شکل حرف U را نشان می‌دهد و همبستگی گزارش‌شده 0.02 است. توضیح دهید چه اتفاقی افتاده و چه کاری انجام می‌دهید.
  3. یک رگرسیون فشار خون بر سن، ضریب R2=0.31R^2 = 0.31 و باقیمانده SD برابر با 12 میلی‌متر جیوه را می‌دهد. یک پزشک بالینی می‌پرسد آیا مدل می‌تواند فشار خون یک فرد را پیش‌بینی کند؟ پاسخ را با استفاده از هر دو عدد بدهید.
  4. یک رگرسیون خام ضریب 4.2 (p = 0.01) را نشان می‌دهد. با افزودن یک متغیر عامل مخدوش‌گر، این ضریب به 0.3 (p = 0.86) تغییر می‌کند. دو تفسیر متمایز ارائه دهید و بگویید چه اطلاعات بیشتری می‌تواند آن‌ها را از هم متمایز کند.
  5. تفاوت بین فاصله اطمینان برای میانگین در x=50x = 50 و بازه پیش‌بینی برای یک مشاهده جدید در x=50x = 50 را توضیح دهید و بگویید با افزایش حجم نمونه به یک میلیون، هر یک چه تغییری می‌کنند.
  6. یک مطالعه نرخ ابتلا به سرطان در سطح شهرستان را بر درآمد متوسط شهرستان رگرسیون می‌کند و نتیجه می‌گیرد که افراد فقیرتر در معرض خطر بیشتری برای ابتلا به سرطان هستند. مشکل را نام ببرید و توضیح دهید چرا داده‌ها نمی‌توانند از این نتیجه‌گیری پشتیبانی کنند.
  7. نشان دهید که رگرسیونی با یک پیش‌بین دودویی 0/1، برآورد و مقدار p یکسانی با آزمون t دو نمونه‌ای با واریانس‌های برابر دارد.

مطالعه بیشتر

  • Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 11.
  • Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 17 and 18.
  • Draper NR, Smith H. Applied Regression Analysis. 3rd ed.
  • Anscombe FJ. Graphs in statistical analysis. Am Stat. 1973;27(1):17-21. (Four datasets with identical regressions and completely different scatter plots.)

اصطلاحات کلیدی

هم‌واریهمبستگی پیرسونکمترین مربعاتباقیماندهمقطع و شیبتوان-دوهموسکداستیسیتیرگرسیون چندگانهاثر تعدیل‌شدهفاصلهٔ پیش‌بینیتعصب بوم‌شناختیمتغیر شاخص