رگرسیون لجستیک
چرا رگرسیون خطی برای یک خروجی دودویی شکست میخورد، چگونه لینک لاجیت آن را حل میکند و چگونه ضرایب لجستیک را بهعنوان لگاریتم نسبت شانسها بخوانیم. پل ارتباطی از این دوره مقدماتی به دوره رگرسیون بعدی.
پس از این درس شما قادر خواهید بود
- سه راهی را که در آنها رگرسیون خطی معمولی در پیشبینی یک نتیجهٔ دودویی شکست میخورد، توضیح دهید.
- تابع پیوند لجستیک و تبدیل لاگیت را توصیف کنید.
- استنتاج کنید که چرا ضریب شیب، نسبت لگاریتم شانس است.
- مقطعی و شیبها را برای پیشبینهای دودویی و پیوسته تفسیر کنید.
- توضیح دهید چرا واریانس خطا برآورد نمیشود و حداکثر احتمال چه چیزی را جایگزین روش کمترین مربعات میکند.
- ضریب لجستیک را به نسبت شانس در یک جدول 2×2 مرتبط کنید.
رگرسیون لجستیک
یک مثال عملی
برنامه بینالمللی نظرسنجی اجتماعی در سال 1994 از 2,079 نروژی نظرسنجی کرد و ثبت نمود که آیا آنها بدون ازدواج با هم زندگی میکنند و آیا در ماه گذشته به کلیسا رفتهاند یا خیر.
| همنشینی: خیر | همزیستی: بله | مجموع | |
|---|---|---|---|
| غیرمذهبی | 1,009 (0.49، ردیف 0.53) | 878 (0.42، ردیف 0.47) | 1,887 (0.91) |
| مذهبی | 168 (0.08، ردیف 0.875) | 24 (0.01، ردیف 0.125) | 192 (0.09) |
| مجموع | 1,177 (0.57) | 902 (0.43) | 2,079 |
نسبت همزیستی در میان پاسخدهندگان مذهبی حدود یکششم نسبت به غیرمذهبیها بود. آزمون کایدو در جدولهای احتمالی واحد، پیش از این به این پرسش پاسخ داده است. هدف این واحد رسیدن به همان پاسخ با مدلی است که همچنین پیشبینهای پیوسته، چندگانه و تنظیم را نیز در بر میگیرد.
چرا رگرسیون خطی شکست میخورد
آیا میتوانیم وقتی است، به سادگی بنویسیم ؟
سه مشکل.
1. مقدار مورد انتظار یک احتمال است که بین 0 و 1 قرار دارد.
یک خط مستقیم نامحدود است. اگر آن را در هر دو جهت به اندازه کافی امتداد دهید، احتمالاتی بالاتر از یک یا پایینتر از صفر پیشبینی میکند که اینها احتمال نیستند. این یک مورد حاشیهای نادر نیست؛ این بهطور معمول در حاشیههای محدوده پیشبینیکننده رخ میدهد.
2. خطاها نرمال نیستند؛ آنها دوجملهای هستند. برای یک نتیجهٔ دودویی، با فرض برازش ، تنها دو باقیماندهٔ ممکن وجود دارد:
بقایای خطا در هر نقطه دقیقاً دو مقدار دارند. آنها نمیتوانند توزیع نرمال داشته باشند که این امر مستقیماً فرض توزیع نرمال خطاها در رگرسیون خطی را نقض میکند.
3. واریانس به میانگین بستگی دارد.
واریانس خطا زمانی بیشینه است که و با نزدیک شدن به 0 یا 1 به سمت صفر کاهش مییابد. این بهطور ساختاری فرض واریانس ثابت را نقض میکند، نه بهطور تصادفی.
این همان واقعیتی است که در واحد نسبتها ذکر شد: برای یک متغیر دوجملهای، میانگین و واریانس با هم مرتبط هستند، برخلاف توزیع نرمال که در آن این دو پارامتر جدا از هم هستند.
تابع پیوند لجستیک
راهحل این است که پیشبین خطی را طوری تبدیل کنیم که در بازهٔ مناسب قرار گیرد.
فرض کنید پیشبین خطی معمولی باشد که میتواند هر مقداری از تا بگیرد. یک تابع پیوند مقدار را به فضای احتمال، ، نگاشت میکند.
تابع لجستیک:
معکوس آن، لاجیت:
تابع لجستیک منحنیای Sشکل است که در به 0 و در به 1 نزدیک میشود و در از 0.5 عبور میکند. شیب آن در وسط بیشترین مقدار را دارد و در دو انتها مسطح میشود، بنابراین هیچ مقدار از پیشبین خطی نمیتواند احتمال ناممکنی تولید کند.
z <- seq(-6, 6, 0.1)
plot(z, exp(z)/(1 + exp(z)), type = "l",
xlab = "Z", ylab = "probability")
توجه کنید که چه چیزی در حال تبدیل شدن است: پیشبینی مدل، نه دادهها. نتیجه همچنان 0 یا 1 باقی میماند.
جبر
تقسیم:
برداشتن لاکها:
لاجیت، لگاریتم احتمال است. مدل میگوید لگاریتم احتمال تابعی خطی از پیشبینهاست، به همین دلیل همهٔ مفاهیم واحد رگرسیون خطی منتقل میشوند: تعدیل، چندپیشبین، تعاملات، کدگذاری دستهای.
تفسیر ضرایب
یک پیشبین دودویی
بگذارید باشد اگر پاسخدهنده ماه گذشته به کلیسا رفته باشد و در غیر این صورت .
تفریق:
مقدار وسط لگاریتم نسبت شانس است. پس:
شیب در رگرسیون لجستیک، نسبت لگاریتم شانس است. آن را به توان برسانید تا نسبت شانس بهدست آید؛ به همین دلیل است که خروجی هر رگرسیون لجستیک پس از تواندادن خوانده میشود.
برای دادههای نروژی، برازش مدل و را میدهد و نسبت شانس جدول 2×2 را دقیقاً بازتولید میکند.
m <- glm(cohabit ~ religious, family = binomial, data = norway)
summary(m)
exp(coef(m)) # odds ratios
exp(confint(m)) # and their confidence intervals
این معادل بودن ارزش دارد که یکبار خودتان آن را بررسی کنید. رگرسیون لجستیک با یک پیشبین دودویی جدول 2×2 است، همانطور که رگرسیون خطی با یک پیشبین دودویی آزمون تی دو نمونهای است.
یک پیشبین پیوسته
آیا سن پاسخدهنده پیشبینیکننده همخانه بودن است؟
شیب، نسبت شانس لگاریتمی است که شانس در را در مقایسه با برآورد میکند: افزایش یکواحدی در پیشبین.
دو پیامد عملی:
واحد اهمیت دارد. نسبت شانس «به ازای هر سال سن» و «به ازای هر دهه سن» در لگاریتم با ضریب 10 تفاوت دارند که در نسبت شانس است. همیشه واحد را مشخص کنید. وقتی واحد طبیعی کوچک است، پیشبین را بازکالیبره کنید تا نسبت شانس گزارششده قابل تفسیر باشد.
اثر در مقیاس لگ-اودس ثابت است، نه در مقیاس احتمال. مدل بیان میکند که حرکت از 40 به 41 همان تأثیر را بر لگ-اودس دارد که حرکت از 70 به 71. در مقیاس احتمال، این تغییرات کاملاً متفاوت هستند، زیرا منحنی لجستیک در وسط شیبدار و در انتهاها صاف است. این یک فرض خطی بودن در مدل لوگیت است و باید بررسی شود، برای مثال با برازش یک اسپلاین یا با دستهبندی متغیر پیشبین و مشاهده اینکه آیا ضرایب بهطور یکنواخت افزایش مییابند یا خیر.
مصادره
لگ اودس زمانی است که همه پیشبینها برابر صفر باشند. اینکه این مقدار معنادار باشد یا نه، بستگی دارد به اینکه آیا صفر یک مقدار معنادار است یا خیر: برای یک شاخص 0/1 بله؛ اما برای سن، «احتمال همنشینی در سن 0 سالگی» کمیتی نیست که کسی بخواهد. متمرکز کردن پیشبینهای پیوسته بر میانگین آنها، ضریب مبدأ را قابل تفسیر میکند.
مدل چگونه برازش میشود
سه نکته رگرسیون لجستیک را از رگرسیون خطی متمایز میکند:
واریانس خطا برآورد نمیشود. در رگرسیون خطی، سه مقدار ، و برآورد شدند. در اینجا مجزایی وجود ندارد، زیرا واریانس یک خروجی دودویی کاملاً توسط میانگین آن تعیین میشود: . چیزی برای برآورد باقی نمانده است.
برآورد بر اساس بیشینهسازی احتمال است، نه کمترین مربعات. هیچ راهحل بستهای وجود ندارد، همانطور که در رگرسیون خطی برای وجود داشت. نرمافزار بهصورت بازگشتی به دنبال مقادیر پارامتری میگردد که دادههای مشاهدهشده را بیشینه محتمل سازند. این فرایند معمولاً بهسرعت همگرا میشود اما ممکن است شکست بخورد: در حالت جداسازی کامل، جایی که یک پیشبین بهطور کامل نتایج را از هم جدا میکند، تابع احتمال بیشینهای ندارد و ضرایب به بینهایت گرایش میکنند. R مدل را برازش میکند و ضرایب بسیار بزرگ با خطاهای استاندارد بسیار بزرگ را گزارش میکند که نشانگر این مشکل است.
آمار برازش مدل بر اساس احتمال است. در رگرسیون خطی هیچ وجود ندارد. در عوض:
- انحراف، که برابر است با برابر لگاریتم احتمال، نقش مجموع مربعات باقیمانده را ایفا میکند. تفاوتهای انحراف بین مدلهای تو در تو با توزیع کایدو مقایسه میشود که آزمون نسبت احتمال است.
- AIC، انحرافی که بر اساس تعداد پارامترها جریمه میشود، برای مقایسه مدلهای غیرمرتبط به کار میرود.
- موارد مختلف شبه وجود دارند؛ آنها نسبتهای واریانس تبیینشده نیستند و در سلسلهدادهها قابل مقایسه نیستند.
- برای مدلی که برای پیشبینی استفاده میشود، تبعیض (آمار c) و کالیبراسیون از همه این موارد اهمیت بیشتری دارد، دقیقاً همانطور که در واحد پیشآگهی دوره مبانی توضیح داده شده است.
خلاصه
- مقدار قطع، لگ odds زمانی است که همه باشند.
- ضرایب شانس خام برای هر تغییر یکواحدی در هستند.
- واریانس خطا تخمین زده نشده است.
- تخمین از روش بیشینه احتمال به جای کمترین مربعات استفاده میکند.
- آمار برازش مدل بر اساس احتمال هستند.
جایی که این قرار میگیرد
رگرسیون لجستیک یکی از اعضای خانواده مدلهای خطی تعمیمیافته است که همگی بر اساس الگوی یکسان ساخته شدهاند: یک پیشبین خطی، یک تابع پیوند که آن را به میانگین خروجی متصل میکند، و یک توزیع برای خروجی.
| نتیجه | توزیع | لینک | ضریب است |
|---|---|---|---|
| پیوسته | طبیعی | هویت | میانگین اختلاف |
| دوگانه | دوجملهای | لاگیت | نسبت شانس لگاریتمی |
| شمردن | پوآسون | لاگ | نسبت نرخ لاگ |
| زمان تا رویداد | (کاکس، نیمهپارامتریک) | لاگ | نسبت خطر لگاریتمی |
شناسایی این الگو مفیدترین چیزی است که میتوان از این دوره با خود به دوره رگرسیون بعدی برد، جایی که هر یک از این موارد بهدرستی همراه با توسعههای چندسطحی و طولی توسعه داده میشوند.
این همچنین یک حلقه را از واحدهای پیشین میبندد. نسبت شانس در واحد جدولهای احتمالاتی معرفی شد، زیرا تنها معیار اثر است که یک مطالعه مورد-شاهدی میتواند برآورد کند، زیرا ضرایب نمونهگیری یکدیگر را خنثی میکنند. این ویژگی به رگرسیون لجستیک منتقل میشود، و به همین دلیل رگرسیون لجستیک تحلیل استاندارد برای دادههای مورد-شاهدی است، هرچند به نظر میرسد احتمال بیماری را با توجه به مواجهه مدلسازی کند.
درک خود را بررسی کنید
- یک رگرسیون لجستیک از یک نتیجه بر یک قرارگیری دودویی، را میدهد. نسبت شانس را محاسبه کنید. سپس، با فرض اینکه نتیجه در 30% از افراد بدون قرارگیری رخ میدهد، خطر در افراد دارای قرارگیری و نسبت خطر را محاسبه کرده و درباره تفاوت آنها توضیح دهید.
- با ارجاع به باقیماندهها توضیح دهید که چرا مدل احتمال خطی بهطور ذاتی و نه بهصورت تصادفی، فرض نرمال بودن را نقض میکند.
- یک مدل نسبت شانس 1.03 به ازای هر سال سن را گزارش میکند (p < 0.001). این را برای هر دهه بازنویسی کنید و توضیح دهید کدام یک برای ارتباط مفیدتر است.
- یک مدل لجستیک برای مرگومیر جراحی شامل یک پیشبین برای یک نشانهی اورژانسی نادر است. هر بیمار با آن نشانهی اورژانسی فوت کرد. توضیح دهید وقتی مدل برازش شود چه اتفاقی میافتد و شما چه کاری انجام میدهید.
- توضیح دهید چرا رگرسیون لجستیک با یک پیشبین باینری، نسبت شانس یکسانی با جدول 2×2 میدهد و چرا این برابری پس از افزودن پیشبین دوم از بین میرود.
- یک پژوهشگر ضریب شباهت ظاهری برابر با 0.18 را گزارش میکند و آن را اینگونه توصیف میکند: «مدل 18% از واریانس را توضیح میدهد.» دو نکته نادرست در این جمله را بیان کنید.
- جدول مدل خطی تعمیمیافته بالا را از روی حافظه پر کنید، سپس بگویید برای مطالعهای که تعداد بستریهای مجدد بیمارستانی را در هر سال-فرد میشمارد، از کدام لینک استفاده میکنید.
مطالعه بیشتر
- Hosmer DW, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed.
- Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 13.
- Agresti A. Categorical Data Analysis. 3rd ed.
- Bland JM, Altman DG. The odds ratio. BMJ. 2000;320:1468.