استنتاج در رگرسیون و حرکت به سوی چند پیشبین
جدول ANOVA برای رگرسیون، آزمونها و فاصلههای اطمینان برای عرض از مبدأ و شیب، و گسترش آن به بیش از یک پیشبین، جایی که ضرایب به اثرات تعدیلشده تبدیل میشوند و بسته به سایر اجزای مدل تعیین میگردند.
پس از این درس شما قادر خواهید بود
- جدول ANOVA را برای یک رگرسیون بسازید و تفسیر کنید.
- مقدار برش و شیب را آزمون و تفسیر کنید و بگویید هر فرضیهٔ صفر چه معنایی دارد.
- تفسیرهای موجود را زمانی که آزمون شیب پذیرفته میشود و زمانی که رد میشود، از هم متمایز کنید.
- مدل را به چند پیشبین گسترش دهید و ضرایب تعدیلشده را تفسیر کنید.
- R-مربع و ضریب همبستگی چندگانه را توضیح دهید و بگویید چرا R-مربع نمیتواند کاهش یابد.
- با افزودن پیشبینها، درجات آزادی را پیگیری کنید.
- حداقل تعداد مشاهدات لازم را توضیح دهید و دلیل اینکه R-مربع در حدّ برابر با یک میشود را توضیح دهید.
استنتاج در رگرسیون و حرکت به سوی چند پیشبین
ادامه دادههای فشار خون سیستولیک از درس قبلی.
جدول ANOVA برای رگرسیون
مجموع تغییرات در Y بهطور دقیق تجزیه میشود:
به عبارت دیگر: مجموع واریانس مشاهدات نسبت به میانگینشان برابر است با واریانسی که مدل توضیح میدهد (فاصله مقادیر برآوردشده از میانگین) بهعلاوه واریانسی که توضیح نمیدهد (فاصله مشاهدات از مقادیر برآوردشده).
| منبع | SS | دیاف | MS | F |
|---|---|---|---|---|
| پسرفت | ||||
| باقیمانده | ||||
| مجموع |
که در آن تعداد پیشبینها است.
برای رگرسیون ساده SBP بر شاخص کوتله:
| منبع | SS | دبلیو اف | MS | F | p |
|---|---|---|---|---|---|
| پسروی | 4,001 | 1 | 4,001.0 | 49.50 | 8.1 × 10⁻⁸ |
| باقیمانده | 2,425 | 30 | 80.8 | ||
| مجموع | 6,426 | 31 |
fit1 <- lm(SBP ~ QUET, data = sbp)
anova(fit1)
میانگین مربعات باقیمانده، 80.8، برابر است با : واریانس برآوردشده خطاها. ریشهٔ مربعات آن، 9.0 میلیمتر جیوه، انحراف معیار باقیمانده است و قابلتفسیرترین معیار برای سنجش میزان دقت پیشبینی مدل برای یک فرد است.
آزمون و برآورد ضرایب
مصادره
این به ندرت جالب است. این پرسش میکند که آیا میانگین Y وقتی X برابر صفر است، برابر صفر است یا خیر، که معمولاً یا بیمعنی است یا آشکارا نادرست. برای دادههای SBP این پرسش مطرح میشود که آیا فردی با شاخص کتوئلت برابر صفر، فشار خون صفر دارد یا خیر.
شیب
این آزمون است که اهمیت دارد. برای رگرسیون خطی ساده، از جدول ANOVA: . این دو آزمون یکسان هستند.
اگر رد شود: شواهدی از رابطه خطی بین X و Y وجود دارد. مدلی که X را در بر دارد بهتر از مدلی است که X را ندارد.
If is not rejected: this does not establish that there is no relationship. Three possibilities remain:
- واقعاً هیچ رابطهای وجود ندارد.
- یک رابطه وجود دارد اما این مطالعه قدرت کافی برای شناسایی آن را نداشت.
- یک رابطه وجود دارد و خطی نیست. یک شکل U کامل شیب را برابر صفر میکند.
امکان سوم همان چیزی است که رگرسیون را از آزمون t متمایز میکند و به همین دلیل است که نمودار پراکندگی باید پیش از مقدار p بررسی شود.
فواصل اطمینان
و به همین ترتیب برای ضریب قطع.
summary(fit1)$coefficients
confint(fit1)
فاصله را گزارش کنید. همانطور که در سراسر این برنامه، این فاصله اندازه و دقت را به شما میگوید، چیزی که مقدار p ارائه نمیکند.
دو نوع پیشبینی
در درس پیشین آمد: فاصله اطمینان برای مقدار میانگین پیشبینیشده در یک مشخص، و فاصله پیشبینی گشادتر برای یک مقدار فردی پیشبینیشده در .
انتقال به چند پیشبین
برای دادههای SBP:
- شاخص کوئتلِت پیشبینیکنندهای قوی برای SBP بود.
- رگرسیون کمی بیش از 60% از واریانس را تبیین کرد.
- کمی کمتر از 40% در نظر گرفته نشده بود.
اکنون میخواهیم سایر پیشبینهای ممکن را در نظر بگیریم: سن و وضعیت سیگار کشیدن.
نخست به دادهها نگاه کنید. رسم SBP بر حسب سن نشان میدهد که، مانند شاخص کتله، SBP با سن بالا میرود. رسم شاخص کتله بر حسب سن هم رابطهای مثبت میان این دو پیشبین را نشان میدهد:
cor(sbp$QUET, sbp$AGE) # 0.838
آن همبستگی 0.84 بالا است و اهمیت خواهد داشت. دو پیشبین که بهشدت با یکدیگر همبسته هستند، اطلاعات مشترکی را منتقل میکنند و پیامدهای آن در ادامه این درس مطرح میشود.
مدل
با یک پیشبین، مدل یک خط در دو بعد بود. با دو پیشبین، یک صفحهٔ هموار در سه بعد است. با پیشبینهای ، یک فراصفحه است که نمیتوان آن را تجسم کرد و در اینجا شهود هندسی از کار میافتد و جبر جای آن را میگیرد.
برآورد اثرات تعدیلشده
- پیشبینی زمانی است که همه Xها برابر صفر باشند.
- اثر است وقتی سایر Xها ثابت نگه داشته شوند.
- هر ضریب، تأثیری است که برای تمام متغیرهای X دیگر در مدل تعدیل شده است.
«نگهداشتن ثابت» گزارهای درباره مدل است، نه درباره یک آزمایش. ضریب پاسخ میدهد: در میان افرادی که مقادیر سایر پیشبینها را یکسان دارند، Y به ازای هر واحد از چقدر متفاوت است؟ اینکه آیا چنین افرادی در دادهها وجود دارند، پرسشی جداگانه است و وقتی پیشبینها بهشدت همبسته باشند، ممکن است بهسختی چنین افرادی یافت شوند.
مدلهای SBP
fit1 <- lm(SBP ~ QUET, data = sbp)
fit2 <- lm(SBP ~ QUET + AGE, data = sbp)
fit3 <- lm(SBP ~ QUET + AGE + SMK, data = sbp)
| مدل | مصادره | QUET | AGE | SMK | |
|---|---|---|---|---|---|
| فقط QUET | 73.04 | 20.89 | 0.623 | ||
| QUET + AGE | 59.90 | 12.40 | 0.79 | 0.666 | |
| QUET + AGE + SMK | 49.79 | 9.47 | 1.08 | 9.24 | 0.767 |
به ضریب کوئتلِت توجه کنید: 20.89، سپس 12.40، سپس 9.47.
اثر خام شاخص کوئتلِت 20.9 میلیمتر جیوه به ازای هر واحد است. پس از تعدیل برای سن، این مقدار 12.4 است. پس از تعدیل برای سن و سیگار کشیدن، این مقدار 9.5 است که کمتر از نصف مقدار خام میباشد.
این دقیقاً همان رفتاری است که در دوره بیومتریک توصیف شده است: وقتی پیشبینها همبسته هستند، ضریب به سایر اجزای مدل بستگی دارد. سن با شاخص کتلهلت همبستگی دارد (r = 0.84) و بهطور مستقل SBP را پیشبینی میکند، بنابراین بخشی از آنچه بهنظر میرسید اثر اندازه بدن باشد، در واقع اثر سن بوده است. هیچ «اثر واحد شاخص کتلهلت» وجود ندارد؛ بلکه اثر آن در یک مدل مشخص است.
نتیجهگیری این است که شما باید گزارش دهید ضریب از کدام مدل آمده است و ضریبی که بدون مدل خود گزارش شود، غیرقابل تفسیر است.
توان دوم رگرسیون
نسبت واریانس در Y که توسط پیشبینها در مدل تبیین شده است.
ضریب همبستگی چندگانه: معیاری برای سنجش همبستگی خطی کلی Y با مجموعه پیشبینها، یا به طور معادل، میزان قدرت همبستگی بین Y و بهترین ترکیب خطی از Xها.
هویتی که تعمیم میدهد:
R همبستگی بین مقادیر مشاهدهشده و مقادیر برازششده است. برای رگرسیون ساده این به تقلیل مییابد و برای رگرسیون چندگانه این تعریف همچنان برقرار است.
R-مربع نمیتواند کاهش یابد.
در مقایسه با مدلی که تنها شامل شاخص کوتله است، افزودن سن را در نظر بگیرید:
- آیا برای مدل بزرگتر بزرگتر خواهد بود؟ بله، یا در بدترین حالت برابر.
- آیا بزرگتر خواهد بود؟ خیر. تنها به Y بستگی دارد و برای هر مدل از همان دادهها یکسان است.
از آنجا که ثابت است و نمیتواند کاهش یابد، نیز وقتی پیشبین اضافه میشود کاهش نمییابد، حتی اگر پیشبین صرفاً نویز باشد. افزودن یک ستون اعداد تصادفی اندکی را افزایش میدهد.
سه پیامد:
- نمیتوان از برای انتخاب بین مدلهای با اندازههای مختلف استفاده کرد. این همیشه مدل بزرگتر را ترجیح میدهد.
- تعدیلشده برای تعداد پیشبینها جریمه در نظر میگیرد و میتواند کاهش یابد:
- مقایسهٔ رسمی مدلهای تو در تو از آزمون F جزئی استفاده میکند که موضوع درس بعدی است.
تفسیر ضریب R^2
توصیف میکند که مدل چه مقدار از واریانس را توضیح میدهد. این آماره به شما نمیگوید:
- اینکه مدل بهدرستی مشخص شده باشد. یک مدل بسیار نادرست میتواند بالایی داشته باشد.
- آیا ضرایب علی هستند؟
- آیا پیشبینیها مفید هستند. همانطور که در دوره بیوستاتستیک نشان داده شد، یک برابر 0.52 با یک بازه پیشبینی به عرض صدها واحد همراه بود.
برای قضاوت در مورد کارایی پیشبینی، انحراف معیار باقیمانده عدد صادقتری است، زیرا در واحدهای خروجی بیان میشود.
درجات آزادی
با سه پارامتر (، ، ) در یک مدل دوپیشبین:
- ، تعداد پیشبینها
آزمون F در جدول ANOVA آزمونی است برای همه پیشبینها بهطور یکجا:
این پرسش با آزمونهای t فردی متفاوت است و پاسخها ممکن است با هم اختلاف داشته باشند. در صورت وجود پیشبینهای بسیار همبسته، F کلی میتواند بسیار معنادار باشد در حالی که هیچ ضریب فردی به سطح معناداری نمیرسد، زیرا هر یک توسط سایر پیشبینها تبیین میشود. این الگو نشانهای از همخطی است و خود یک یافته محسوب میشود.
حداقل تعداد مشاهدات
شما به حداقل مشاهدات نیاز دارید تا پارامترهای را برآورد کنید. دقیقاً با آن تعداد، مدل از هر نقطه عبور میکند، همه باقیماندهها برابر صفر هستند، ، و:
یک تطابق کامل، و هیچ معنایی ندارد. هیچ درجه آزادی برای برآورد واریانس خطا باقی نمانده است، بنابراین هیچ نتیجهگیریای ممکن نیست.
این شدیدترین حالت فراآموزی است و باید شهود شما را دربارهٔ حالت کلی شکل دهد. با 32 مشاهده و 25 پیشبین، مدل به این حد نزدیک است: بالا خواهد بود، ضرایب ناپایدار خواهند بود و هیچیک از نتایج قابل تکرار نخواهد بود.
قواعد کلی برای نسبت حداقل مشاهدهها به پیشبینها بسته به نوع نتیجه متفاوت است: تقریباً 10 تا 20 مشاهده برای هر پیشبین در رگرسیون خطی، و همانطور که در درسهای بعدی توضیح داده خواهد شد، 10 رویداد برای هر پیشبین در مدلهای لجستیک و بقا. این اعداد تقریبی هستند و اصل زیربنایی دقیق است: هر پارامتری که برآورد میکنید یک درجه آزادی را از دست میدهید و دقت از آنچه باقی میماند حاصل میشود.
درک خود را بررسی کنید
- با استفاده از دادههای SBP، جدول ANOVA را برای
SBP ~ QUETبازتولید کنید، شیب را با بررسی کرده و انحراف معیار باقیمانده را بیان کنید. - یک رگرسیون مقدار را برای شیب برمیگرداند. سه تفسیر متمایز را فهرست کنید و بگویید برای تمایز آنها چه چیزی را بررسی میکردید.
- در دادههای SBP، ضریب کوئتلِت از 20.9 به 9.5 کاهش مییابد هرچه پیشبینها بیشتری اضافه شوند. توضیح دهید این بدان معنا چیست و چرا این امر دلیلی بر نادرستی مدل قبلی نیست.
- از طریق تجزیهٔ جمعهای مربعات ثابت کنید که وقتی یک پیشبین اضافه میشود، کاهش نمییابد. سپس توضیح دهید که تعدیلشده در این مورد چه میکند.
- یک مدل دارای 15 مشاهده و 14 پیشبین است و مقدار را گزارش میکند. توضیح دهید چه اتفاقی افتاده و چه نتیجهای میتوان گرفت.
- آزمون F کلی مدل مقدار p را کمتر از 0.001 نشان میدهد، در حالی که هیچ ضریب فردی مقدار p کمتر از 0.20 ندارد. توضیح دهید چه اتفاقی در حال رخ دادن است و گام بعدی شما چیست.
- توضیح دهید چرا تعریف بهتری از ضریب همبستگی چندگانه نسبت به است، هرچند از نظر عددی برابرند.
مطالعه بیشتر
- Kleinbaum DG, Kupper LL, Nizam A, Rosenberg ES. Applied Regression Analysis and Other Multivariable Methods. 5th ed.
- Harrell FE. Regression Modeling Strategies. 2nd ed. (On sample size and overfitting.)
- Babyak MA. What you see may not be what you get: a brief, nontechnical introduction to overfitting in regression-type models. Psychosom Med. 2004;66(3):411-421.