تحلیل رگرسیون
واحد 3·45 دقیقه

استنتاج در رگرسیون و حرکت به سوی چند پیش‌بین

جدول ANOVA برای رگرسیون، آزمون‌ها و فاصله‌های اطمینان برای عرض از مبدأ و شیب، و گسترش آن به بیش از یک پیش‌بین، جایی که ضرایب به اثرات تعدیل‌شده تبدیل می‌شوند و بسته به سایر اجزای مدل تعیین می‌گردند.

پس از این درس شما قادر خواهید بود

  • جدول ANOVA را برای یک رگرسیون بسازید و تفسیر کنید.
  • مقدار برش و شیب را آزمون و تفسیر کنید و بگویید هر فرضیهٔ صفر چه معنایی دارد.
  • تفسیرهای موجود را زمانی که آزمون شیب پذیرفته می‌شود و زمانی که رد می‌شود، از هم متمایز کنید.
  • مدل را به چند پیش‌بین گسترش دهید و ضرایب تعدیل‌شده را تفسیر کنید.
  • R-مربع و ضریب همبستگی چندگانه را توضیح دهید و بگویید چرا R-مربع نمی‌تواند کاهش یابد.
  • با افزودن پیش‌بین‌ها، درجات آزادی را پیگیری کنید.
  • حداقل تعداد مشاهدات لازم را توضیح دهید و دلیل اینکه R-مربع در حدّ برابر با یک می‌شود را توضیح دهید.

استنتاج در رگرسیون و حرکت به سوی چند پیش‌بین

ادامه داده‌های فشار خون سیستولیک از درس قبلی.

جدول ANOVA برای رگرسیون

مجموع تغییرات در Y به‌طور دقیق تجزیه می‌شود:

SStot=SSreg+SSerrSS_{tot} = SS_{reg} + SS_{err}

(YiYˉ)2=(Y^iYˉ)2+(YiY^i)2\sum(Y_i - \bar{Y})^2 = \sum(\hat{Y}_i - \bar{Y})^2 + \sum(Y_i - \hat{Y}_i)^2

به عبارت دیگر: مجموع واریانس مشاهدات نسبت به میانگینشان برابر است با واریانسی که مدل توضیح می‌دهد (فاصله مقادیر برآوردشده از میانگین) به‌علاوه واریانسی که توضیح نمی‌دهد (فاصله مشاهدات از مقادیر برآوردشده).

منبع SS دی‌اف MS F
پس‌رفت SSregSS_{reg} pp SSreg/pSS_{reg}/p MSreg/MSerrMS_{reg}/MS_{err}
باقیمانده SSerrSS_{err} np1n - p - 1 SSerr/(np1)SS_{err}/(n-p-1)
مجموع SStotSS_{tot} n1n - 1

که در آن pp تعداد پیش‌بین‌ها است.

برای رگرسیون ساده SBP بر شاخص کوتله:

منبع SS دبلیو اف MS F p
پس‌روی 4,001 1 4,001.0 49.50 8.1 × 10⁻⁸
باقیمانده 2,425 30 80.8
مجموع 6,426 31
fit1 <- lm(SBP ~ QUET, data = sbp)
anova(fit1)

میانگین مربعات باقیمانده، 80.8، برابر است با σ^2\hat{\sigma}^2: واریانس برآوردشده خطاها. ریشهٔ مربعات آن، 9.0 میلی‌متر جیوه، انحراف معیار باقیمانده است و قابل‌تفسیرترین معیار برای سنجش میزان دقت پیش‌بینی مدل برای یک فرد است.

آزمون و برآورد ضرایب

مصادره

H0:β0=0H1:β00H_0: \beta_0 = 0 \qquad H_1: \beta_0 \neq 0

این به ندرت جالب است. این پرسش می‌کند که آیا میانگین Y وقتی X برابر صفر است، برابر صفر است یا خیر، که معمولاً یا بی‌معنی است یا آشکارا نادرست. برای داده‌های SBP این پرسش مطرح می‌شود که آیا فردی با شاخص کتوئلت برابر صفر، فشار خون صفر دارد یا خیر.

شیب

H0:β1=0H1:β10H_0: \beta_1 = 0 \qquad H_1: \beta_1 \neq 0

t=β^1SE(β^1),df=n2t = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)}, \qquad df = n - 2

این آزمون است که اهمیت دارد. برای رگرسیون خطی ساده، t2=Ft^2 = F از جدول ANOVA: 7.0362=49.57.036^2 = 49.5. این دو آزمون یکسان هستند.

اگر β1=0\beta_1 = 0 رد شود: شواهدی از رابطه خطی بین X و Y وجود دارد. مدلی که X را در بر دارد بهتر از مدلی است که X را ندارد.

If β1=0\beta_1 = 0 is not rejected: this does not establish that there is no relationship. Three possibilities remain:

  1. واقعاً هیچ رابطه‌ای وجود ندارد.
  2. یک رابطه وجود دارد اما این مطالعه قدرت کافی برای شناسایی آن را نداشت.
  3. یک رابطه وجود دارد و خطی نیست. یک شکل U کامل شیب را برابر صفر می‌کند.

امکان سوم همان چیزی است که رگرسیون را از آزمون t متمایز می‌کند و به همین دلیل است که نمودار پراکندگی باید پیش از مقدار p بررسی شود.

فواصل اطمینان

β^1±tn2,0.975SE(β^1)\hat{\beta}_1 \pm t_{n-2, 0.975}\,SE(\hat{\beta}_1)

و به همین ترتیب برای ضریب قطع.

summary(fit1)$coefficients
confint(fit1)

فاصله را گزارش کنید. همان‌طور که در سراسر این برنامه، این فاصله اندازه و دقت را به شما می‌گوید، چیزی که مقدار p ارائه نمی‌کند.

دو نوع پیش‌بینی

در درس پیشین آمد: فاصله اطمینان برای مقدار میانگین پیش‌بینی‌شده در یک X0X_0 مشخص، و فاصله پیش‌بینی گشادتر برای یک مقدار فردی پیش‌بینی‌شده در X0X_0.

انتقال به چند پیش‌بین

برای داده‌های SBP:

  • شاخص کوئتلِت پیش‌بینی‌کننده‌ای قوی برای SBP بود.
  • رگرسیون کمی بیش از 60% از واریانس را تبیین کرد.
  • کمی کمتر از 40% در نظر گرفته نشده بود.

اکنون می‌خواهیم سایر پیش‌بین‌های ممکن را در نظر بگیریم: سن و وضعیت سیگار کشیدن.

نخست به داده‌ها نگاه کنید. رسم SBP بر حسب سن نشان می‌دهد که، مانند شاخص کتله، SBP با سن بالا می‌رود. رسم شاخص کتله بر حسب سن هم رابطه‌ای مثبت میان این دو پیش‌بین را نشان می‌دهد:

cor(sbp$QUET, sbp$AGE)     # 0.838

آن همبستگی 0.84 بالا است و اهمیت خواهد داشت. دو پیش‌بین که به‌شدت با یکدیگر همبسته هستند، اطلاعات مشترکی را منتقل می‌کنند و پیامدهای آن در ادامه این درس مطرح می‌شود.

مدل

Y=β0+β1X1+β2X2+EY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + E

با یک پیش‌بین، مدل یک خط در دو بعد بود. با دو پیش‌بین، یک صفحهٔ هموار در سه بعد است. با پیش‌بین‌های kk، یک فراصفحه است که نمی‌توان آن را تجسم کرد و در اینجا شهود هندسی از کار می‌افتد و جبر جای آن را می‌گیرد.

Y=β0+β1X1+β2X2++βkXk+EY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k + E

برآورد اثرات تعدیل‌شده

  • β0\beta_0 پیش‌بینی زمانی است که همه Xها برابر صفر باشند.
  • β1\beta_1 اثر X1X_1 است وقتی سایر Xها ثابت نگه داشته شوند.
  • هر ضریب، تأثیری است که برای تمام متغیرهای X دیگر در مدل تعدیل شده است.

«نگه‌داشتن ثابت» گزاره‌ای درباره مدل است، نه درباره یک آزمایش. ضریب پاسخ می‌دهد: در میان افرادی که مقادیر سایر پیش‌بین‌ها را یکسان دارند، Y به ازای هر واحد از X1X_1 چقدر متفاوت است؟ اینکه آیا چنین افرادی در داده‌ها وجود دارند، پرسشی جداگانه است و وقتی پیش‌بین‌ها به‌شدت همبسته باشند، ممکن است به‌سختی چنین افرادی یافت شوند.

مدل‌های SBP

fit1 <- lm(SBP ~ QUET, data = sbp)
fit2 <- lm(SBP ~ QUET + AGE, data = sbp)
fit3 <- lm(SBP ~ QUET + AGE + SMK, data = sbp)
مدل مصادره QUET AGE SMK R2R^2
فقط QUET 73.04 20.89 0.623
QUET + AGE 59.90 12.40 0.79 0.666
QUET + AGE + SMK 49.79 9.47 1.08 9.24 0.767

به ضریب کوئتلِت توجه کنید: 20.89، سپس 12.40، سپس 9.47.

اثر خام شاخص کوئتلِت 20.9 میلی‌متر جیوه به ازای هر واحد است. پس از تعدیل برای سن، این مقدار 12.4 است. پس از تعدیل برای سن و سیگار کشیدن، این مقدار 9.5 است که کمتر از نصف مقدار خام می‌باشد.

این دقیقاً همان رفتاری است که در دوره بیومتریک توصیف شده است: وقتی پیش‌بین‌ها همبسته هستند، ضریب به سایر اجزای مدل بستگی دارد. سن با شاخص کتله‌لت همبستگی دارد (r = 0.84) و به‌طور مستقل SBP را پیش‌بینی می‌کند، بنابراین بخشی از آنچه به‌نظر می‌رسید اثر اندازه بدن باشد، در واقع اثر سن بوده است. هیچ «اثر واحد شاخص کتله‌لت» وجود ندارد؛ بلکه اثر آن در یک مدل مشخص است.

نتیجه‌گیری این است که شما باید گزارش دهید ضریب از کدام مدل آمده است و ضریبی که بدون مدل خود گزارش شود، غیرقابل تفسیر است.

توان دوم رگرسیون

R2=SSregSStotR^2 = \frac{SS_{reg}}{SS_{tot}}

نسبت واریانس در Y که توسط پیش‌بین‌ها در مدل تبیین شده است.

R=R2R = \sqrt{R^2}

ضریب همبستگی چندگانه: معیاری برای سنجش همبستگی خطی کلی Y با مجموعه پیش‌بین‌ها، یا به طور معادل، میزان قدرت همبستگی بین Y و بهترین ترکیب خطی از Xها.

هویتی که تعمیم می‌دهد:

R=r(Y,Y^)R = r(Y, \hat{Y})

R همبستگی بین مقادیر مشاهده‌شده و مقادیر برازش‌شده است. برای رگرسیون ساده این به r(X,Y)|r(X,Y)| تقلیل می‌یابد و برای رگرسیون چندگانه این تعریف همچنان برقرار است.

R-مربع نمی‌تواند کاهش یابد.

در مقایسه با مدلی که تنها شامل شاخص کوتله است، افزودن سن را در نظر بگیرید:

  • آیا SSregSS_{reg} برای مدل بزرگ‌تر بزرگ‌تر خواهد بود؟ بله، یا در بدترین حالت برابر.
  • آیا SStotSS_{tot} بزرگ‌تر خواهد بود؟ خیر. SStotSS_{tot} تنها به Y بستگی دارد و برای هر مدل از همان داده‌ها یکسان است.

از آنجا که SStotSS_{tot} ثابت است و SSregSS_{reg} نمی‌تواند کاهش یابد، R2R^2 نیز وقتی پیش‌بین اضافه می‌شود کاهش نمی‌یابد، حتی اگر پیش‌بین صرفاً نویز باشد. افزودن یک ستون اعداد تصادفی اندکی R2R^2 را افزایش می‌دهد.

سه پیامد:

  1. نمی‌توان از R2R^2 برای انتخاب بین مدل‌های با اندازه‌های مختلف استفاده کرد. این همیشه مدل بزرگ‌تر را ترجیح می‌دهد.
  2. R2R^2 تعدیل‌شده برای تعداد پیش‌بین‌ها جریمه در نظر می‌گیرد و می‌تواند کاهش یابد: Radj2=1SSerr/(np1)SStot/(n1)R^2_{adj} = 1 - \frac{SS_{err}/(n-p-1)}{SS_{tot}/(n-1)}
  3. مقایسهٔ رسمی مدل‌های تو در تو از آزمون F جزئی استفاده می‌کند که موضوع درس بعدی است.

تفسیر ضریب R^2

R2R^2 توصیف می‌کند که مدل چه مقدار از واریانس را توضیح می‌دهد. این آماره به شما نمی‌گوید:

  • اینکه مدل به‌درستی مشخص شده باشد. یک مدل بسیار نادرست می‌تواند R2R^2 بالایی داشته باشد.
  • آیا ضرایب علی هستند؟
  • آیا پیش‌بینی‌ها مفید هستند. همان‌طور که در دوره بیوستاتستیک نشان داده شد، یک R2R^2 برابر 0.52 با یک بازه پیش‌بینی به عرض صدها واحد همراه بود.

برای قضاوت در مورد کارایی پیش‌بینی، انحراف معیار باقیمانده عدد صادق‌تری است، زیرا در واحدهای خروجی بیان می‌شود.

درجات آزادی

با سه پارامتر (β0\beta_0، β1\beta_1، β2\beta_2) در یک مدل دوپیش‌بین:

  • dfreg=pdf_{reg} = p، تعداد پیش‌بین‌ها
  • dferr=np1df_{err} = n - p - 1
  • dftot=n1df_{tot} = n - 1

آزمون F در جدول ANOVA آزمونی است برای همه پیش‌بین‌ها به‌طور یکجا:

H0:β1=β2==βp=0H_0: \beta_1 = \beta_2 = \cdots = \beta_p = 0

این پرسش با آزمون‌های t فردی متفاوت است و پاسخ‌ها ممکن است با هم اختلاف داشته باشند. در صورت وجود پیش‌بین‌های بسیار همبسته، F کلی می‌تواند بسیار معنادار باشد در حالی که هیچ ضریب فردی به سطح معناداری نمی‌رسد، زیرا هر یک توسط سایر پیش‌بین‌ها تبیین می‌شود. این الگو نشانه‌ای از هم‌خطی است و خود یک یافته محسوب می‌شود.

حداقل تعداد مشاهدات

شما به حداقل p+1p + 1 مشاهدات نیاز دارید تا پارامترهای p+1p + 1 را برآورد کنید. دقیقاً با آن تعداد، مدل از هر نقطه عبور می‌کند، همه باقیمانده‌ها برابر صفر هستند، SSerr=0SS_{err} = 0، و:

R2=1R^2 = 1

یک تطابق کامل، و هیچ معنایی ندارد. هیچ درجه آزادی برای برآورد واریانس خطا باقی نمانده است، بنابراین هیچ نتیجه‌گیری‌ای ممکن نیست.

این شدیدترین حالت فراآموزی است و باید شهود شما را دربارهٔ حالت کلی شکل دهد. با 32 مشاهده و 25 پیش‌بین، مدل به این حد نزدیک است: R2R^2 بالا خواهد بود، ضرایب ناپایدار خواهند بود و هیچ‌یک از نتایج قابل تکرار نخواهد بود.

قواعد کلی برای نسبت حداقل مشاهده‌ها به پیش‌بین‌ها بسته به نوع نتیجه متفاوت است: تقریباً 10 تا 20 مشاهده برای هر پیش‌بین در رگرسیون خطی، و همان‌طور که در درس‌های بعدی توضیح داده خواهد شد، 10 رویداد برای هر پیش‌بین در مدل‌های لجستیک و بقا. این اعداد تقریبی هستند و اصل زیربنایی دقیق است: هر پارامتری که برآورد می‌کنید یک درجه آزادی را از دست می‌دهید و دقت از آنچه باقی می‌ماند حاصل می‌شود.

درک خود را بررسی کنید

  1. با استفاده از داده‌های SBP، جدول ANOVA را برای SBP ~ QUET بازتولید کنید، شیب را با t2=Ft^2 = F بررسی کرده و انحراف معیار باقیمانده را بیان کنید.
  2. یک رگرسیون مقدار p=0.31p = 0.31 را برای شیب برمی‌گرداند. سه تفسیر متمایز را فهرست کنید و بگویید برای تمایز آن‌ها چه چیزی را بررسی می‌کردید.
  3. در داده‌های SBP، ضریب کوئتلِت از 20.9 به 9.5 کاهش می‌یابد هرچه پیش‌بین‌ها بیشتری اضافه شوند. توضیح دهید این بدان معنا چیست و چرا این امر دلیلی بر نادرستی مدل قبلی نیست.
  4. از طریق تجزیهٔ جمع‌های مربعات ثابت کنید که R2R^2 وقتی یک پیش‌بین اضافه می‌شود، کاهش نمی‌یابد. سپس توضیح دهید که R2R^2 تعدیل‌شده در این مورد چه می‌کند.
  5. یک مدل دارای 15 مشاهده و 14 پیش‌بین است و مقدار R2=1.00R^2 = 1.00 را گزارش می‌کند. توضیح دهید چه اتفاقی افتاده و چه نتیجه‌ای می‌توان گرفت.
  6. آزمون F کلی مدل مقدار p را کمتر از 0.001 نشان می‌دهد، در حالی که هیچ ضریب فردی مقدار p کمتر از 0.20 ندارد. توضیح دهید چه اتفاقی در حال رخ دادن است و گام بعدی شما چیست.
  7. توضیح دهید چرا R=r(Y,Y^)R = r(Y, \hat{Y}) تعریف بهتری از ضریب همبستگی چندگانه نسبت به R2\sqrt{R^2} است، هرچند از نظر عددی برابرند.

مطالعه بیشتر

  • Kleinbaum DG, Kupper LL, Nizam A, Rosenberg ES. Applied Regression Analysis and Other Multivariable Methods. 5th ed.
  • Harrell FE. Regression Modeling Strategies. 2nd ed. (On sample size and overfitting.)
  • Babyak MA. What you see may not be what you get: a brief, nontechnical introduction to overfitting in regression-type models. Psychosom Med. 2004;66(3):411-421.

اصطلاحات کلیدی

جدول ANOVAمجموع مربعاتمیانگین مربعاتآزمون Fتوان دوم رگرسیونتوان-دو R تعدیل‌شدهضریب همبستگی چندگانهاثر تعدیل‌شدهدرجه آزادی