همبستگی و رگرسیون خطی
سنجش قدرت یک همبستگی خطی، برازش یک خط با روش کمترین مربعات، بررسی چهار فرض، و حرکت به سوی رگرسیون چندگانه برای تعدیل و پیشبینی، که اهداف متفاوتی هستند و نیازمند قضاوتهای متفاوتی میباشند.
پس از این درس شما قادر خواهید بود
- ضریب همبستگی پیرسون را محاسبه و تفسیر کنید و شش ویژگی آن را بیان کنید.
- توضیح دهید چرا همبستگی هم به شیب و هم به پراکندگی بستگی دارد.
- مدل رگرسیون را بنویسید و هر یک از اجزا را شناسایی کنید.
- چهار فرض رگرسیون خطی را بیان کنید و هر یک را با یک نمودار بررسی کنید.
- یک خط رگرسیون را با روش کمترین مربعات بهصورت دستی و در R برآورد کنید.
- جدول ANOVA را برای رگرسیون، ضریب تعیین (R²) و آزمون F تفسیر کنید.
- اثرات تعدیلشده را در رگرسیون چندگانه تفسیر کنید و بین تعدیل و پیشبینی تمایز قائل شوید.
- فاصله اطمینان برای میانگین را از فاصله پیشبینی برای یک مشاهده جدید متمایز کنید.
- کدگذاری پیشبینهای دستهای
همبستگی و رگرسیون خطی
همبستگی
واریانس، همواریانس و همبستگی
واریانس اندازهگیری میکند که یک متغیر تا چه حد با خود تغییر میکند:
همواری نشان میدهد که دو متغیر چگونه با هم تغییر میکنند:
همواری مثبت است وقتی که مقادیر بزرگ معمولاً با مقادیر بزرگ همراه هستند. مشکل این است که بزرگی آن به واحدها بستگی دارد: همواری در کیلوگرم-سانتیمتر با همواری در پوند-اینچ قابل مقایسه نیست.
ضریب همبستگی پیرسون این مشکل را با استانداردسازی حل میکند:
cov(x, y); sd(x); sd(y)
cor(x, y) # Pearson by default
شش ویژگی
1. این تنها همبستگی خطی را اندازهگیری میکند. یک رابطه درجه دوم کامل میتواند دارای باشد. همیشه دادهها را نمودار کنید.
2. دامنهٔ آن از −1 تا +1 است.
- مثبت: و با هم تغییر میکنند.
- منفی: و در جهت مخالف تغییر میکنند.
- یا : وابستگی خطی کامل
- : هیچ همبستگی خطی وجود ندارد
3. نسبت به واحدها یا هر تبدیل خطی روی و ناوردا است. تبدیل سلسیوس به فارنهایت مقدار را تغییر نمیدهد.
4. این متقارن است و هیچ فرضی درباره علل و معلولها ندارد. . این یک تفاوت کلیدی با رگرسیون است که متقارن نیست.
5. وقتی هر دو متغیر توزیع نرمال داشته باشند، تفسیر آن آسانتر است.
6. این به طور همزمان به دو چیز بستگی دارد: شیب خط مستقیم بهترین برازش، و پراکندگی نقاط در اطراف آن خط.
ویژگی ششم همان چیزی است که دردسر ایجاد میکند. دو مجموعه داده با شیبهای یکسان میتوانند ضریب همبستگی 0.98 و 0.73 داشته باشند و تنها در چگونگی چیدگی فشرده نقاط با هم متفاوت باشند. دو مجموعه داده میتوانند هر دو داشته باشند: یکی واقعاً بدون رابطه و دیگری دارای یک رابطه منحنی قوی که هیچ خط مستقیمی آن را در بر نمیگیرد.
همبستگی و تبدیل
چون همبستگی تنها رابطه خطی را میسنجد، تبدیل یک متغیر میتواند آن را بهطور قابلتوجهی تغییر دهد.
یک آزمون تخته پین برای سنجش چابکی دستی در کودکان 4 تا 16 ساله نشان میدهد که زمان لازم برای اتمام با افزایش سن کاهش مییابد. در مقیاس خام، . با تبدیل زمان به سرعت (1/زمان)، رابطه صافتر شده و .
درآمد فیلم در مقابل امتیاز منتقدان، را هم بهصورت خام و هم بهصورت تبدیلشده به لگاریتم ارائه میدهد، زیرا در اینجا تبدیل لگاریتمی خطیّت را تغییر نداد، بلکه تنها پراکندگی باقیماندهها را تغییر داد. درس این نیست که تبدیل همیشه کمک میکند، بلکه این است که مقیاس مناسب یک مسئله تجربی است.
رگرسیون خطی ساده
مدل
هر مشاهده را برای تجزیه کنید:
که مقدار مورد انتظار با توجه به است، میانگین شرطی واقعی با توجه به .
- عرض از مبدأ جامعه است: مقدار پیشبینیشده وقتی برابر 0 است.
- شیب جامعه است: تغییر به ازای هر 1 واحد تغییر در .
- مقدار پیشبینیشده از پارامترهای برآوردشده است.
- خطای باقیمانده است.
حروف یونانی نشاندهندهٔ مقادیر نامعلومی هستند که باید برآورد شوند؛ علامت «hat» نشاندهندهٔ برآورد نمونهای یا مقدار پیشبینیشده است. برخی کتابها بهجای آن از استفاده میکنند.
توجه کنید که برخلاف همبستگی، رگرسیون متقارن نیست. رگرسیون بر خط متفاوتی نسبت به رگرسیون بر میدهد. انتخاب اینکه کدام متغیر نتیجه است، تصمیمی مدلسازی است که باید از علم نشأت بگیرد.
چهار فرضیه
خطی بودن. میانگین حقیقی تابعی خطی از است.
خطاهای نرمال. باقیماندهها بهطور نرمال توزیع شدهاند، ، با میانگین 0 و واریانس . توجه داشته باشید که این یک فرض درباره خطاها است، نه درباره یا بهطور جداگانه.
واریانس ثابت (هموسکداستیسیتی). برای همه مقادیر یکسان است.
خطاهای مستقل. ها از یکدیگر مستقل هستند.
سه کمیت برآورد میشوند: ، و .
تخمین به کمترین مربعات
برای به حداقل رساندن مجموع مربعات خطاها، و را انتخاب کنید:
راه حل:
توجه کنید که مخرج همبستگی و صورت آن واریانس است. آن را با فرمول مقایسه کنید: آنها صورت مشترکی دارند و تنها در مخرج با هم تفاوت دارند، به همین دلیل ارتباط بسیار نزدیکی با هم دارند.
fit <- lm(bodyfat ~ abdomen, data = d)
summary(fit)
coef(fit)
آزمایش شیب
اگر درست باشد، به صورت با درجهٔ آزادی توزیع میشود، که در آن اندازهٔ نمونه و تعداد متغیرهای مستقل است:
خوبی برازش
جدول ANOVA برای رگرسیون
دقیقاً همانند واحد ANOVA، واریانس کل تجزیه میشود:
| منبع | SS | دیاف | MS | F |
|---|---|---|---|---|
| پسروی | ||||
| باقیمانده | ||||
| مجموع |
برای رگرسیون دوگان، .
سه خلاصه تناسب
استفاده از رگرسیون درصد چربی بدن بر محیط شکم در 250 مرد:
واریانس خطاها:
پس واحدهای درصدی : اندازهٔ معمول خطای پیشبینی.
نسبت واریانس در که توسط تبیین میشود:
حدود 68% از واریانس چربی بدن توسط محیط شکم تبیین میشود.
ارتباطات با همبستگی:
این هویتها ارزش دانستن را دارند. همبستگی مربعات بین و است و همچنین همبستگی مربعات بین مقادیر مشاهدهشده و پیشبینیشده، تعریفی که به رگرسیون چندگانه تعمیم مییابد. شیب نیز همبستگی است که بر اساس نسبت انحراف معیارها مقیاسبندی شده است.
آزمون F
تحت ، توزیعی F را با و دنبال میکند. با و ، به نیاز دارد.
برای رگرسیون ساده، آزمون F و آزمون t شیب معادل هستند، با .
بررسی فرضیات
فرضها با نمودارها بررسی میشوند، نه با آزمونها.
طبیعی بودن خطاها: نمودار کوانتیل-کوانتیل باقیماندهها. نقاط باید نزدیک به خط مورب قرار گیرند.
واریانس ثابت: باقیماندهها در مقابل پیشبین یا مقادیر برازششده ترسیم میشوند. نوار نقاط باید عرض ثابتی داشته باشد. شکل قیفمانند که با افزایش مقادیر برازششده پهنتر میشود، نشان کلاسیک واریانس غیرثابت است.
خطی بودن: همان نمودار باقیماندهها. انحنا در باقیماندهها نشان میدهد که فرم خطی اشتباه است.
par(mfrow = c(2,2))
plot(fit) # residuals vs fitted, Q-Q, scale-location, leverage
کارآمد: وقتی تبدیل کمک میکند
رگرسیون درآمد ناخالص فیلم بر اساس امتیاز منتقدان هم باقیماندههای غیرنرمال (بهشدت چپپرت) و هم واریانس متغیر (باقیماندهها در امتیازهای بالاتر پراکنده میشوند) را نشان میدهد. تبدیل لگاریتمی نتیجه هر دو مشکل را برطرف میکند: نمودار Q-Q صاف میشود و عرض باند باقیماندهها یکنواخت میگردد.
| متغیر وابسته | شیب | ت | |
|---|---|---|---|
| مجموع (میلیون دلار) | 1.11 | 9.10 | 0.120 |
| لگ (دلار ناخالص میلیون) | 0.013 | 9.17 | 0.122 |
توجه کنید که برازش و معناداری تقریباً تغییر نمیکنند؛ آنچه تغییر میکند این است که آیا فرضیات برقرار هستند یا خیر و در نتیجه آیا میتوان به خطاهای استاندارد و فواصل اطمینان اعتماد کرد. این دو مدل همچنین پیشبینیهای کاملاً متفاوتی ارائه میدهند: مدل بدون تبدیل به یک خط مستقیم اشاره دارد و مدل لگاریتمی به رشد نمایی دلالت میکند.
تفسیر نیز تغییر میکند. شیب 1.11 در مقیاس خام به معنای یک میلیون دلار درآمد اضافی به ازای هر واحد نمره منتقد است. شیب 0.013 در مقیاس لگاریتمی به معنای افزایش حدود 1.3% درآمد به ازای هر واحد نمره است که این افزایش بهجای جمعشدن، بهصورت ضربشدن عمل میکند.
کار کرد: وقتی تبدیل خطی بودن را اصلاح میکند
دادههای چابکی در پنل پیندار نشان میدهند که وقتی زمان بر سن رگرسیون میشود، باقیماندهها انحنای واضحی دارند. رگرسیون 1/زمان (یعنی سرعت) بر سن، باقیماندههایی بدون الگو میدهد. رابطه بین سن و سرعت خطی است؛ اما رابطه بین سن و زمان خطی نیست.
بررسی استقلال
استقلال را نمیتوان مانند سایر موارد از نمودار بقایای خطا بررسی کرد. باید از خود طرح بررسی شود:
- آیا دادهها اندازهگیریهای تکراری از یک فرد یا شیء هستند؟
- آیا دادهها بهصورت خوشهای نمونهبرداری شدهاند؟
- کودکان در کلاسهای درس مدارس
- جوجه موشهای صحرایی در یک زایمان
- بیماران در بیمارستانها
- همتایان در شبکههای اجتماعی
اگر هر یک از این موارد درست باشد، رگرسیون معمولی اشتباه است و به مدلهای چندسطحی که در دوره رگرسیون پوشش داده شدهاند نیاز است. پیامد نادیده گرفتن خوشهبندی، خطاهای استاندارد بسیار کوچک است، بنابراین فواصل اطمینان باریک و مقادیر p بسیار کوچک میشوند.
رگرسیون چندگانه
با متغیرهای مستقل :
- پیشبینی زمانی است که همه ها برابر صفر باشند.
- اثر است وقتی سایر ها ثابت نگه داشته شوند.
- ها تأثیراتی هستند که برای سایر ها در مدل تنظیم شدهاند.
- نسبت واریانسی است که توسط همه پیشبینها بهطور مشترک تبیین میشود.
- آزمون F، را آزمایش میکند.
تفسیر اثرات تعدیلشده
اثرات تعدیلشده، اثرات منحصربهفرد برآوردشده هستند: بخشی از ارتباط با که به تعلق دارد و نه به سایر پیشبینها.
سه پیامد به دنبال دارد، و هر سه مردم را شگفتزده میکنند:
اگر باشد، آنگاه بسته به اینکه در مدل باشد یا نه، متفاوت خواهد بود. چیزی به نام «اثر » بهتنهایی وجود ندارد؛ آنچه هست، اثر در یک مدل مشخص است. افزودن یا حذف یک پیشبین همبسته آن را تغییر میدهد.
آزمونهای ممکن است با آزمونهای هر یک از ها سازگار نباشند. با دو پیشبین بسیار همبسته، مدل میتواند بهطور کلی بسیار معنادار باشد در حالی که هیچیک از ضرایب بهطور جداگانه معنادار نیستند، زیرا هر یک توسط دیگری «توضیح داده میشود».
ممکن است آزمون F رگرسیون با آزمونهای t s مطابقت نداشته باشد.
دو دایرهٔ همپوشان برای و را در مقابل دایرهای برای تصور کنید. وقتی پیشبینها همبسته نباشند، سهمهای آنها در همپوشانی ندارند و اثرات بهخوبی قابل تفکیکاند. وقتی همبسته هستند، ناحیهٔ همپوشانی به هیچیک بهطور انحصاری تعلق ندارد و هر ضریب تنها از بخش غیرهمپوشان آن برآورد میشود.
رگرسیون چندگانه برای تعدیل
نرخ جرایم US بر حسب ایالت، 1960. نتیجه، تعداد جرایم به ازای هر یک میلیون نفر از ساکنان ایالت است.
| مدل | پیشبینیکنندهها | شیب | ت | p |
|---|---|---|---|---|
| اثر خام | آموزش متوسط | 11.16 | 2.29 | 0.03 |
| تأثیر تعدیلشده | آموزش متوسط | −0.15 | −0.02 | 0.98 |
| ایالت GDP | 0.18 | 2.22 | 0.03 |
به طور کلی، تحصیلات بیشتر با جرم بیشتر ارتباط دارد و این ارتباط بهطور قابلتوجهی معنادار است. پس از کنترل ایالت GDP، اثر تحصیلات کاملاً از بین میرود.
دو نکته که باید از این برداشت کرد:
GDP بهعنوان یک عامل عامل مخدوشگر عمل میکند. ایالتهای ثروتمندتر هم تحصیلات بیشتری دارند و هم جرایم ثبتشده بیشتری. وقتی GDP وارد مدل شود، تحصیلات هیچ همبستگی مستقلی ندارد. این همان پدیدهای است که در مثالهای مهارکننده استیلکولیناستراز و مهارکننده ACE در دوره مبانی مطرح شده بود و اکنون بهصورت ضریب رگرسیون بیان میشود.
اینها اثراتی در سطح ایالت هستند، نه در سطح فرد. این تحلیل از میانگینهای ایالتی استفاده میکند و لزومی ندارد که رابطهای میان میانگینها در سطح افراد برقرار باشد. این سوگیری بومشناختی است و مسئلهای جدا از آمیختگی (confounding) است. یک ایالت که میانگین تحصیلات در آن بالا است لزوماً ایالتی نیست که در آن افراد تحصیلکرده مرتکب جرایم شوند. استنتاج فردی از دادههای کلان، مغالطهی بومشناختی است.
پرسش «اثربخشی واقعی تحصیلات متوسط بر نرخ جرم چیست؟» بنابراین نیازمند فرضیاتی است: اینکه شکل مدل صحیح است، همه عوامل عامل مخدوشگر مرتبط گنجانده شده و بهخوبی اندازهگیری شدهاند، و اینکه رابطه کلان بازتابدهنده رابطه فردی است.
رگرسیون چندگانه برای پیشبینی
پیشبینی درآمد ناخالص US به میلیونها دلار:
| مدل | پیشبینیکنندهها | شیب | |
|---|---|---|---|
| 1 | بودجه (میلیون دلار) | 1.08 | 0.467 |
| 2 | بودجه (میلیون دلار) | 1.01 | 0.512 |
| درصد تازگی راتن تومیتوز | 0.70 | ||
| 3 | بودجه (میلیون دلار) | 0.97 | 0.517 |
| درصد تازگی راتن تومیتوز | 0.64 | ||
| زمان اجرا (دقیقه) | 0.39 |
توجه کنید که ضریب بودجه با اضافه شدن پیشبینها از 1.08 به 1.01 و سپس به 0.97 تغییر میکند: دقیقاً همان رفتاری که در بالا برای پیشبینهای همبسته توصیف شد.
یک پیشبینی کارشده
آیا مدل شما میتوانست ما را از ساخت فیلم جان کارتر در سال 2012 نجات دهد؟
| خام | بودجه | زمان اجرا | % تازه | |
|---|---|---|---|---|
| جان کارتر | 73.1 میلیون دلار | 250 میلیون دلار | 1 ساعت و 39 دقیقه | 51% |
خیر. مدل مقدار 73m را پیشبینی کرد. باقیمانده برابر −204 است که بیش از سه برابر انحراف معیار باقیمانده است.
مدل به طور کلی چقدر دقیق است؟
با فرض خطاهای توزیعشده به صورت نرمال و همگن:
- : مدل حدود 52% از واریانس در ناخالص را توضیح میدهد.
- ، پس
- انتظار میرود 95% از مجموع فروشهای مشاهدهشده در بازهای به فاصله میلیون دلار از پیشبینی قرار گیرند.
برابر با 0.52 بهنظر قابلقبول میرسد و همین مدل بازهٔ پیشبینی به عرض 226 میلیون دلار دارد. نشان میدهد چه میزان واریانس توضیح داده شده است؛ اما نمیگوید آیا پیشبینیها مفید هستند یا خیر. برای تصمیمگیری دربارهٔ سرمایهگذاری 250 میلیون دلاری، بازهای به این وسعت بیارزش است.
بررسی نمودار بقایای این مدل نشان میدهد که با افزایش درآمدهای پیشبینیشده، پراکندگی افزایش مییابد، بنابراین حتی بازه اعلامشده برای فیلمهای پرهزینه نیز خوشبینانه است.
پیشبینی یک مشاهده جدید
یک دنباله برنامهریزی شده است: بودجه 50 میلیون دلار، مدت زمان 90 دقیقه، امید به کسب 60% امتیاز تازه.
پیشبینی یک مشاهده جدید نامطمئنتر از برآورد میانگین است، زیرا واریانس شامل دو مؤلفه است:
- ، تغییرپذیری غیرقابلکاهش مشاهدات فردی پیرامون خط
- واریانس خود خط رگرسیون برآوردی
این بازه شامل درآمد منفی است که غیرممکن است و نشانهی دیگری است که این مدل نیاز به تحول دارد.
این تمایز ضروری است و اغلب با هم اشتباه گرفته میشوند:
| پاسخها | رفتار عرض با رشد | |
|---|---|---|
| فاصله اطمینان برای میانگین | میانگین برای این کجاست؟ | به سمت صفر کاهش مییابد |
| فاصلهٔ پیشبینی برای یک مشاهدهٔ جدید | نقطه بعدی برای کجا خواهد بود؟ | به نزدیک میشود، هرگز صفر نمیشود |
predict(fit, newdata = new, interval = "confidence") # for the mean
predict(fit, newdata = new, interval = "prediction") # for a new case
فاصلههای پیشبینی برای پیشبینیهایی که از میانگین متغیرهای پیشبین دورتر هستند، وسیعتر است و در نمونههای کوچکتر این وسعت بیشتر میشود. برونیابی فراتر از محدوده مشاهدهشده دادهها حتی بدتر است، زیرا بر پایبندی شکل خطی در مناطقی استوار است که هیچ مشاهداتی در آنجا صورت نگرفته است.
چه چیزی یک مدل را مفید میکند؟
مفیدیت فراتر از تناسب با دادهها است:
- تا چه حد باید دقیق باشید؟ یک برابر با 0.5 برای برخی اهداف عالی است و برای برخی دیگر بیفایده.
- آیا میتوانید پیشبینها را در زمانی که به پیشبینیها نیاز دارید اندازهگیری کنید؟ مدلی که به نمره نهایی منتقد نیاز دارد نمیتواند تصمیمی را که پیش از فیلمبرداری گرفته میشود، راهنمایی کند.
- آیا لازم است بدانید که متغیرهای پیشبین چرا با نتیجه مرتبط هستند؟ برای پیشبینی، خیر. برای مداخله، بله، و یک مدل پیشبینی این موضوع را فراهم نمیکند.
- آیا محدودیتهای مدل را میفهمید؟
آن نکته سوم بار دیگر تمایز واحد پیشبینی در دوره مبانی را مطرح میکند. مدلی که برای پیشبینی ساخته شده، مدلی از علل نیست. ضریب مربوط به زمان اجرا به این معنا نیست که افزایش طول فیلم درآمد آن را افزایش میدهد.
کدگذاری پیشبینهای دستهای
برای دو دسته، از 0 و 1 استفاده کنید.
نرخ جرم و جنایت US در ایالات جنوبی در مقابل ایالات شمالی:
پس:
- نرخ متوسط جرم را در شمال برآورد میکند.
- میانگین اختلاف بین شمال و جنوب را برآورد میکند.
یک رگرسیون با یک پیشبین باینری دقیقاً معادل آزمون تی دو نمونهای است و مقدار p یکسانی را میدهد. این الگوی کلی است: آزمون تی، ANOVA و رگرسیون یک چارچوب واحد هستند که در سه نشانهگذاری مختلف بیان شدهاند.
برای یک متغیر دستهای با دسته، از متغیرهای نشانگر استفاده کنید و یکی را بهعنوان سطح مرجع باقی بگذارید. هر ضریب سپس مقایسهای در برابر آن مرجع است. R این موضوع را بهطور خودکار برای فاکتورها مدیریت میکند:
d$region <- factor(d$region)
lm(crime ~ region, data = d) # k-1 indicators created automatically
درک خود را بررسی کنید
- دو متغیر دارای مقادیر ، و هستند. شیب رگرسیون بر را محاسبه کنید، سپس شیب بر را محاسبه کرده و توضیح دهید چرا این دو شیب با هم متفاوت هستند در حالی که همبستگی آنها یکسان است.
- یک نمودار پراکندگی رابطهٔ واضحی به شکل حرف U را نشان میدهد و همبستگی گزارششده 0.02 است. توضیح دهید چه اتفاقی افتاده و چه کاری انجام میدهید.
- یک رگرسیون فشار خون بر سن، ضریب و باقیمانده SD برابر با 12 میلیمتر جیوه را میدهد. یک پزشک بالینی میپرسد آیا مدل میتواند فشار خون یک فرد را پیشبینی کند؟ پاسخ را با استفاده از هر دو عدد بدهید.
- یک رگرسیون خام ضریب 4.2 (p = 0.01) را نشان میدهد. با افزودن یک متغیر عامل مخدوشگر، این ضریب به 0.3 (p = 0.86) تغییر میکند. دو تفسیر متمایز ارائه دهید و بگویید چه اطلاعات بیشتری میتواند آنها را از هم متمایز کند.
- تفاوت بین فاصله اطمینان برای میانگین در و بازه پیشبینی برای یک مشاهده جدید در را توضیح دهید و بگویید با افزایش حجم نمونه به یک میلیون، هر یک چه تغییری میکنند.
- یک مطالعه نرخ ابتلا به سرطان در سطح شهرستان را بر درآمد متوسط شهرستان رگرسیون میکند و نتیجه میگیرد که افراد فقیرتر در معرض خطر بیشتری برای ابتلا به سرطان هستند. مشکل را نام ببرید و توضیح دهید چرا دادهها نمیتوانند از این نتیجهگیری پشتیبانی کنند.
- نشان دهید که رگرسیونی با یک پیشبین دودویی 0/1، برآورد و مقدار p یکسانی با آزمون t دو نمونهای با واریانسهای برابر دارد.
مطالعه بیشتر
- Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 11.
- Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 17 and 18.
- Draper NR, Smith H. Applied Regression Analysis. 3rd ed.
- Anscombe FJ. Graphs in statistical analysis. Am Stat. 1973;27(1):17-21. (Four datasets with identical regressions and completely different scatter plots.)