تحلیل رگرسیون
واحد 4·50 دقیقه

رگرسیون چندگانه، پیش‌بین‌های دسته‌ای و تشخیص‌ها

مقایسه مدل‌های تودرتو با آزمون F جزئی، کدگذاری متغیرهای دسته‌ای با متغیرهای مجازی، استفاده از باقیمانده‌ها برای یافتن داده‌های پرت و نقاط تأثیرگذار، و تبدیل متغیرها در صورت نقض فرضیات.

پس از این درس شما قادر خواهید بود

  • مدل‌های تو در تو را با آزمون F جزئی مقایسه کرده و فرضیات آن را بیان کنید.
  • یک پیش‌بین دسته‌ای را با متغیرهای مجازی کدنویسی کنید و ضرایب را تفسیر کنید.
  • توضیح دهید چرا باید یک مجموعه متغیرهای مجازی را با هم آزمون کرد.
  • داده‌های پرت، ضریب اهرمی و تأثیر را از هم تمایز دهید و معیارهای تشخیصی مرتبط را محاسبه کنید.
  • هر فرض رگرسیون را با نمودار یا آمار مناسب بررسی کنید.
  • یک تبدیل را انتخاب و تفسیر کنید و هزینهٔ آن را بیان کنید.
  • یک ضریب تعاملی را تفسیر کنید.

رگرسیون چندگانه، پیش‌بین‌های دسته‌ای و تشخیص‌ها

آزمون F جزئی

آزمون t روی یک ضریب می‌پرسد آیا همان یک پیش‌بین چیزی می‌افزاید. آزمون F جزئی می‌پرسد آیا یک مجموعه از پیش‌بین‌ها چیزی می‌افزاید، از راه مقایسه دو مدل تودرتو.

دو مدل زمانی در هم نهفته هستند که مدل کوچکتر، مورد ویژه‌ای از مدل بزرگتر باشد که با صفر قرار دادن برخی ضرایب به‌دست می‌آید.

F=(SSerr,reducedSSerr,full)/(dfreduceddffull)SSerr,full/dffullF = \frac{(SS_{err,\text{reduced}} - SS_{err,\text{full}}) / (df_{\text{reduced}} - df_{\text{full}})}{SS_{err,\text{full}} / df_{\text{full}}}

به طور معادل، از نظر R2R^2:

F=(Rfull2Rreduced2)/q(1Rfull2)/(np1)F = \frac{(R^2_{\text{full}} - R^2_{\text{reduced}}) / q}{(1 - R^2_{\text{full}}) / (n - p - 1)}

که در آن qq تعداد پارامترهای اضافی است.

H0:the extra coefficients are all zeroH_0: \text{the extra coefficients are all zero}

با داده‌های SBP کار شد.

آیا وضعیت سیگار کشیدن چیزی به مدلی که پیش از این شامل شاخص کتلته و سن است، اضافه می‌کند؟

fit2 <- lm(SBP ~ QUET + AGE, data = sbp)
fit3 <- lm(SBP ~ QUET + AGE + SMK, data = sbp)
anova(fit2, fit3)
مدل درجه آزادی باقیمانده RSS دی‌اف مجموع مربعات F p
QUET + AGE 29 2,144.0
QUET + AGE + SMK 28 1,499.9 1 644.1 12.02 0.0017

وضعیت سیگار کشیدن به‌طور قابل‌توجهی بر مدل می‌افزاید. با افزودن یک پیش‌بین اضافی، F جزئی برابر با مربع t-آمار برای آن ضریب است، بنابراین این موضوع چیزی فراتر از آزمون t اضافه نمی‌کند. آزمون F جزئی جایگاه خود را زمانی می‌یابد که چندین پارامتر به‌طور هم‌زمان اضافه شوند، که دقیقاً همان کاری است که یک پیش‌بین دسته‌ای انجام می‌دهد.

پیش‌بین‌های دسته‌ای

فرض کنید یک پیش‌بین اسمی با چندین دسته‌بندی داریم، برای مثال تشخیص روان‌پزشکی: اسکیزوفرنی، افسردگی، اختلال شخصیت، سایر.

رویکرد نادرست: آن‌ها را با اعداد 0، 1، 2 و 3 کدگذاری کنید. این کار ساختاری را بر داده‌ها تحمیل می‌کند که در واقع وجود ندارد. این فرض را مطرح می‌کند که دسته‌بندی‌ها مرتب هستند، فاصله‌های آن‌ها برابر است و حرکت از اسکیزوفرنی به افسردگی تأثیر یکسانی بر نتیجه دارد که حرکت از اختلال شخصیت به «سایر» دارد. هیچ‌یک از این موارد برای یک متغیر اسمی معنادار نیست.

کدگذاری دمّی (شاخص)

برای متغیری با دسته‌های kk، متغیرهای مصنوعی k1k - 1 ایجاد کنید. یک دسته به‌عنوان مبنا در نظر گرفته می‌شود.

با شیدایی به‌عنوان مرجع:

دسته‌بندی X1X_1 X2X_2 X3X_3
اسکیزوفرنی 0 0 0
افسردگی 1 0 0
اختلال شخصیت 0 1 0
سایر 0 0 1

مدل به Y=β0+β1X1+β2X2+β3X3+Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 X_3 + \ldots تبدیل می‌شود و:

  • β0\beta_0 میانگین برای دسته‌ی مرجع است (با سایر پیش‌بین‌ها در صفر)
  • β1\beta_1 تفاوت بین افسردگی و اسکیزوفرنی است.
  • β2\beta_2 تفاوت بین اختلال شخصیت و اسکیزوفرنی است.
  • β3\beta_3 تفاوت بین سایر و اسکیزوفرنی است.

هر ضریب، تفاوتی در برابر دسته‌ی مرجع است. دو پیامد:

  • انتخاب معیار مرجع برای تفسیر اهمیت دارد، نه برای برازش یا پیش‌بینی‌های مدل. معیاری را انتخاب کنید که رایج باشد (تا تضادها به‌طور دقیق برآورد شوند) و از نظر بالینی معنادار باشد (تا تضادها همان‌هایی باشند که خواننده می‌خواهد).
  • ضرایب همهٔ مقایسه‌های دو به دو را ارائه نمی‌دهند. تفاوت بین افسردگی و اختلال شخصیت β1β2\beta_1 - \beta_2 است که به خطای استاندارد خود نیاز دارد.

چرا k1k-1 و نه kk؟ شامل کردن تمام دامی‌های kk به‌علاوهٔ ضریب قطع، مدل را غیرقابل شناسایی می‌کند: دامی‌ها جمعاً برابر با 1 می‌شوند که همان ضریب قطع است، بنابراین راه‌حل‌های معادل بی‌شماری وجود دارد. نرم‌افزار به‌طور خودکار یکی را حذف می‌کند یا اجرا را رد می‌کند.

کدگذاری اثر

یک جایگزین:

دسته‌بندی X1X_1 X2X_2 X3X_3
اسکیزوفرنی −1 −1 −1
افسردگی 1 0 0
اختلال شخصیت 0 1 0
سایر 0 0 1

اینجا عرض از مبدأ میانگین کل در همه دسته‌هاست، و هر ضریب انحراف همان دسته از میانگین کل است. وقتی هیچ دسته‌ای مرجع طبیعی نیست به کار می‌آید.

آزمون یک پیش‌بین دسته‌ای

مجموعه متغیرهای مجازی همیشه باید به‌طور هم‌زمان ارزیابی شوند. آزمون جداگانهٔ آن‌ها این پرسش را مطرح می‌کند که آیا هر دسته با دسته مرجع تفاوت دارد، که این پرسش «آیا تشخیص اهمیت دارد؟» نیست. این کار همچنین مشکل چندگانگی را ایجاد می‌کند و پاسخ می‌تواند بسته به اینکه کدام دسته به‌عنوان مرجع انتخاب شده باشد، متفاوت باشد.

از آزمون F جزئی استفاده کنید که مدل را با و بدون کل مجموعه مقایسه می‌کند.

مثال: آیا زیرمقیاس سلامت روان SF-36 بر اساس نوع اختلال روان‌پزشکی متفاوت است، با کنترل سن؟

  • مدل 1: SF36^=β0+β1(Age)\widehat{SF36} = \beta_0 + \beta_1(\text{Age})
  • مدل 2: SF36^=β0+β1(Age)+β2X1+β3X2+β4X3\widehat{SF36} = \beta_0 + \beta_1(\text{Age}) + \beta_2 X_1 + \beta_3 X_2 + \beta_4 X_3

یک آزمون F جزئی با 3 درجه آزادی در مخرج.

d$dx <- factor(d$dx, levels = c("Schizophrenia","Depression",
                                "Personality","Other"))
m1 <- lm(sf36 ~ age, data = d)
m2 <- lm(sf36 ~ age + dx, data = d)
anova(m1, m2)          # partial F on 3 df

R به‌طور خودکار دامی‌ها را برای یک عامل ایجاد می‌کند و از سطح اول به‌عنوان مرجع استفاده می‌کند. مرجع را عمداً با relevel() تنظیم کنید، نه اینکه ترتیب الفبایی را بپذیرید.

تعامل

تعامل به معنای این است که اثر یک پیش‌بیننده به سطح پیش‌بینندهٔ دیگر بستگی دارد. این به صورت یک عبارت حاصل‌ضرب گنجانده می‌شود:

Y=β0+β1X1+β2X2+β3(X1×X2)+EY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 (X_1 \times X_2) + E

با باینری X2X_2:

  • وقتی X2=0X_2 = 0: شیب روی X1X_1 برابر β1\beta_1 است.
  • وقتی X2=1X_2 = 1: شیب روی X1X_1 برابر β1+β3\beta_1 + \beta_3 است.

پس β3\beta_3 اختلاف شیب‌ها است، و با آزمون β3=0\beta_3 = 0 بررسی می‌شود که آیا اثر X1X_1 با X2X_2 متفاوت است یا خیر.

سه قانون:

  1. همیشه اثرهای اصلی را وارد کنید وقتی یک اثر متقابل در مدل هست. مدلی که X1X2X_1 X_2 دارد اما X1X_1 و X2X_2 ندارد، قیدی را تحمیل می‌کند که هیچ‌کس قصدش را ندارد.
  2. وقتی یک تعامل وجود دارد، اثرات اصلی به‌تنهایی قابل تفسیر نیستند. β1\beta_1 اثر X1X_1 در حضور X2=0X_2 = 0 است، نه یک اثر میانگین.
  3. متمرکز کردن پیش‌بین‌های پیوسته قبل از تشکیل حاصل‌ضرب، اثرات اصلی را در نقطه‌ای معنادار قابل تفسیر می‌کند و هم‌خطی بین حاصل‌ضرب و اجزای آن را کاهش می‌دهد.

این همان پدیده‌ای است که در دوره مبانی به «تغییر اثر» و در دوره زیست‌آمار به «تعامل دوطرفه ANOVA» معروف است. مخلوط‌کننده عاملی مزاحم است که باید با تنظیم آن حذف شود؛ تعامل یافته‌ای است که باید گزارش شود.

m <- lm(SBP ~ QUET * SMK, data = sbp)   # includes QUET, SMK, and their product
summary(m)

بقایای آماری و تشخیصی

داده پرت هر مشاهده نادر یا غیرعادی است. سه مفهوم متمایز در کارند و به‌طور معمول با هم اشتباه گرفته می‌شوند.

مفهوم معنی تشخیصی
مورد استثنایی در Y یک باقی‌مانده بزرگ: مدل این نقطه را به‌خوبی پیش‌بینی نمی‌کند. بقایای دانش‌آموزی
اهرم یک مقدار افراطی در فضای X: پیش‌بین‌های غیرمعمول ارزش کلاه hih_i
نفوذ حذف این نقطه مدل را به‌طور قابل‌توجهی تغییر می‌دهد. فاصلهٔ کُک

رابطه: یک نقطه برای تأثیرگذار بودن به هر دو مقدار باقیماندهٔ بزرگ و اهرم بالا نیاز دارد. نقطه‌ای که از خط دور است اما در مرکز بازهٔ X قرار دارد، تأثیر بسیار کمی بر خط دارد. نقطه‌ای که در انتهای دور بازهٔ X قرار دارد و دقیقاً روی خط است، اهرم بالایی دارد اما تأثیری ندارد. نقطه‌ای که هم باقیماندهٔ بزرگ و هم اهرم بالا دارد، نقطهٔ خطرناک است.

انواع باقیمانده

باقیمانده خام: E^i=YiY^i\hat{E}_i = Y_i - \hat{Y}_i

طبق مدل EiN(0,σ2)E_i \sim N(0, \sigma^2)، تقریباً 95% باید در محدوده ±2σ^\pm 2\hat{\sigma} قرار گیرند.

بقایای استانداردشده: بقایای خام تقسیم‌شده بر σ^\hat{\sigma}. بقایا را روی یک مقیاس مشترک قرار می‌دهد.

بقایای دانش‌آموزی: بر برآوردی از خطای استاندارد خودِ باقیمانده تقسیم می‌شود، که به دلیل وابستگی واریانس باقیمانده به اهرم، در هر نقطه متفاوت است.

ri=E^iσ^1hir_i = \frac{\hat{E}_i}{\hat{\sigma}\sqrt{1 - h_i}}

باقیماندهٔ استانداردشدهٔ حذف‌شده (studentized deleted residual): باقیماندهٔ استانداردشده‌ای که با σ^\hat{\sigma} محاسبه شده و از مدلی برآورد شده که بدون مشاهدهٔ ii برازش شده است. این کار مانع از آن می‌شود که یک نقطهٔ به‌شدت انحرافی، برآورد خطا را که برای قضاوت دربارهٔ آن استفاده می‌شود، تحت تأثیر قرار دهد؛ بنابراین، نقاط پرت را که خود را پنهان می‌کنند، شناسایی می‌کند. در SPSS به آن «بقایای حذف‌شدهٔ دانشجویی» گفته می‌شود و با rstudent() در R به‌دست می‌آید.

ضریب hih_i نشان می‌دهد که مشاهدهٔ ii در فضای پیش‌بین‌ها تا چه حد شدید است. این ضریب از 1/n1/n تا 1 متغیر است، میانگین آن (p+1)/n(p+1)/n است و پرچم رایج hi>2(p+1)/nh_i > 2(p+1)/n است.

فاصلهٔ کوک تأثیر یک مشاهدهٔ منفرد را بر همهٔ مقادیر برازش‌شده به‌طور هم‌زمان می‌سنجد. یک پرچم رایج Di>1D_i > 1 است، یا به‌سادگی جستجوی نقاطی که به‌طور قابل‌توجهی بالاتر از بقیه قرار دارند.

fit <- lm(SBP ~ QUET + AGE + SMK, data = sbp)
rstudent(fit)          # jackknife residuals
hatvalues(fit)         # leverage
cooks.distance(fit)    # influence
plot(fit)              # the four standard diagnostic plots

در مورد یک نقطهٔ تأثیرگذار چه باید کرد؟

به‌طور خودکار آن را حذف نکنید. به ترتیب:

  1. داده‌ها را بررسی کنید. بسیاری از نقاط نامتعارف ناشی از خطاهای رونویسی هستند و اصلاح آن‌ها پاسخ درست است.
  2. بپرسید آیا این نقطه به جامعه‌ای تعلق دارد که مدل درباره آن است. بیماری با یک وضعیت نادر ممکن است به‌درستی کنار گذاشته شود، مشروط به اینکه این کنارگذاری اعلام شود.
  3. بدون در نظر گرفتن نکته‌ی اصلی، هر دو نتیجه را گزارش کنید. اگر نتایج با هم مطابقت داشتند، این را بگویید و نکته‌ی اصلی را حفظ کنید. اگر نتایج متفاوت بودند، گزارش صادقانه این است که نتیجه‌گیری بر یک مشاهده استوار است.
  4. فرض کنید مدل اشتباه است؛ این نکته مهم نیست. نکته‌ای که در مدل خطی مانند یک داده‌ی پرت به نظر می‌رسد، ممکن است در مدل منحنی کاملاً معمولی باشد.

حذف مشاهدات نامطلوب بدون گزارش آن، دستکاری داده‌ها است.

بررسی هر فرضیه

فرض چگونه بررسی کنیم
مطابقت زیستی آیا یک رابطه خطی در اینجا معقول است؟
خطی بودن نمودار پراکندگی داده‌های خام؛ باقیمانده‌ها در مقابل مقادیر برازش‌شده (باید هیچ الگویی نشان ندهد)؛ افزودن ضرایب غیرخطی و آزمون معناداری آن‌ها
طبیعی بودن خطاها نمودار Q-Q یا P-P باقیمانده‌ها (باید یک خط مستقیم باشد)؛ آمارهای برازش
واریانس ثابت بقایای مشاهدات در مقابل مقادیر برآوردی (باند با عرض ثابت)
استقلال رویهٔ جمع‌آوری داده‌ها: بدون داده‌های خوشه‌ای، خواهر-برادر یا اندازه‌گیری‌های مکرر
تناسب کلی R2R^2، انحراف معیار باقیمانده، آمار برازش

توجه داشته باشید که استقلال از طرح بررسی می‌شود، نه از نمودار. این فرضیه‌ای است که پس از وقوع قابل تشخیص نیست و نقض آن توسط مدل‌های چندسطحی در واحد 11 مدیریت می‌شود.

وقتی خطی بودن شکست می‌خورد

  1. داده‌های خاص را بررسی کنید. نمودار باقیمانده‌ی منحنی ممکن است ناشی از چند مشاهدۀ معدود باشد.
  2. یک جمله درجه دو بیفزایید (X2X^2)، و جمله خطی را نگه دارید.
  3. تبدیلی را در نظر بگیرید روی X، روی Y، یا روی هر دو.
  4. یک رویکرد رگرسیونی جایگزین را در نظر بگیرید: اسپلاین‌ها، چندجمله‌ای کسری یا مدل افزودنی تعمیم‌یافته.

تبدیل‌ها

تبدیل Y می‌تواند بسته به نوع تبدیل، به رفع عدم نرمال بودن خطاها، واریانس غیرثابت یا غیرخطی بودن کمک کند.

تبدیل وضعیت هدف
لگاریتم طبیعی، Y=ln(Y)Y' = \ln(Y) تمام y>0y > 0 انحراف مثبت را اصلاح کنید؛ واریانس به‌طور قابل‌توجهی رو به افزایش را تثبیت کنید.
ریشهٔ مربع، Y=YY' = \sqrt{Y} تمام y0y \geq 0 واریانس را زمانی که واریانس به میانگین متناسب است، تثبیت کنید (داده‌های شماری)
تلافی، Y=1/YY' = 1/Y تمام y>0y > 0 واریانس را تثبیت کنید؛ دم‌های شدید را جذب کنید
اسکوئر، Y=Y2Y' = Y^2 واریانس کاهشی را تثبیت کنید؛ کجی منفی را نرمال کنید.
کمان‌سین، Y=arcsinYY' = \arcsin\sqrt{Y} نسبت‌ها واریانس نرخ‌ها و نسبت‌ها را تثبیت کنید

تبدیل لگاریتمی بی‌شک مفیدترین تبدیل در پژوهش‌های سلامت است، زیرا بسیاری از نتایج مثبت و چپ‌پرت هستند: هزینه، مدت اقامت، بار ویروسی، غلظت نشانگرهای زیستی، زمان.

هزینه‌ها

تبدیل‌های Y ممکن است تفسیرشان دشوار باشد. ضرایب دیگر معنایی واضح در واحدهای اصلی ندارند و این یک هزینه واقعی است که اغلب نادیده گرفته می‌شود.

تبدیل لگاریتم یک استثنا است و دانستن دلیل آن ارزشمند است. در مقیاس لگاریتم، یک اثر جمعی در مقیاس اصلی به منزله یک اثر ضرب در مقیاس اصلی است:

ln(Y)=β0+β1XY=eβ0(eβ1)X\ln(Y) = \beta_0 + \beta_1 X \quad \Longrightarrow \quad Y = e^{\beta_0}(e^{\beta_1})^X

پس eβ1e^{\beta_1} تغییر ضربه‌ای Y در ازای هر واحد X است و 100(eβ11)100(e^{\beta_1} - 1) تغییر درصدی آن است. ضریب 0.08 به معنای افزایش حدود 8% در ازای هر واحد است. این کاملاً قابل تفسیر است، به همین دلیل تبدیل لگاریتمی انتخاب پیش‌فرض برای نتایج مثبت با توزیع نامتقارن است.

بازگرداندن تبدیل یک میانگین، میانگین نمی‌دهد. نمایی‌کردن میانگین لگاریتم‌ها میانگین هندسی می‌دهد، نه میانگین حسابی. این خلاصه‌ای معتبر و در عین حال متفاوت است، و گزارش باید بگوید کدام‌یک ارائه شده است.

ممکن است فرضیات رگرسیون برای YY' برقرار باشند و برای YY برقرار نباشند، که هدف این تمرین است، و این بدان معناست که مدل مربوط به YY' است. این را بیان کنید.

مدل‌های چندجمله‌ای ساده اغلب کارهایی را انجام می‌دهند که شما قصدشان را ندارید. یک مدل درجه دوم که با داده‌ها با یک ناحیهٔ هموار برازش شده باشد، فراتر از داده‌ها رو به کاهش می‌رود و افتی را پیش‌بینی می‌کند که هیچ‌چیز از آن پشتیبانی نمی‌کند. اسپلاین‌ها معمولاً برای انحنای واقعی انتخاب بهتری هستند زیرا موضعی هستند.

همخطی

وقتی دو پیش‌بیننده همبستگی بالایی با یکدیگر دارند، اساساً اطلاعات یکسانی را منتقل می‌کنند. پیامدها:

  • ضرایب ناپایدار می‌شوند: تغییرات کوچک در داده‌ها، تغییرات بزرگی در برآوردها ایجاد می‌کند.
  • خطاهای استاندارد بزرگ‌نمایی می‌شوند، بنابراین ضرایب فردی حتی زمانی که مجموعه به‌وضوح پیش‌بین است، اهمیت خود را از دست می‌دهند.
  • ممکن است آزمون F کلی به‌طور قوی معنادار باشد در حالی که هیچ ضریب فردی معنادار نباشد؛ الگویی که در درس قبلی به آن اشاره شد.
  • ضرایب می‌توانند نشانه‌های غیرمحتمل داشته باشند.

تشخیص:

  • همبستگی‌ها میان پیش‌بین‌ها. در داده‌های SBP، r(QUET,AGE)=0.84r(\text{QUET}, \text{AGE}) = 0.84 که بالا است.
  • عامل تورم واریانس (VIF)، که میزان تورم واریانس یک ضریب را به‌واسطه هم‌خطی نشان می‌دهد. VIF=1/(1Rj2)\text{VIF} = 1/(1 - R^2_j)، که در آن Rj2R^2_j از رگرسیون پیش‌بین jj بر سایر پیش‌بین‌ها به‌دست می‌آید. ارزش‌های بالاتر از 5 یا بالاتر از 10 معمولاً به‌عنوان پرچم (هشدار) استفاده می‌شوند.
  • تحمل، که 1/VIF1/\text{VIF} است.
car::vif(lm(SBP ~ QUET + AGE + SMK, data = sbp))

چه باید کرد:

  • هیچ مشکلی نیست اگر پیش‌بین‌های هم‌خطی متغیرهای کنترل باشند که برای آن‌ها تعدیل می‌کنید و ضریب مورد نظر پایدار باشد. هم‌خطی هیچ چیزی را منحرف نمی‌کند؛ فقط دقت را کاهش می‌دهد.
  • یکی را حذف کنید، اگر آن‌ها یک سازه‌ی یکسان را می‌سنجند.
  • آنها را ترکیب کنید در قالب یک شاخص.
  • متمرکزسازی به هم‌خطی خاص بین یک عبارت تعاملی و اجزای آن کمک می‌کند.
  • داده‌های بیشتری جمع‌آوری کنید، که تنها چیزی است که واقعاً آن را حل می‌کند.

توجه داشته باشید که هم‌خطی مشکلی برای تفسیر ضرایب فردی است، نه برای پیش‌بینی. مدلی که متغیرهای پیش‌بین آن هم‌خطی دارند می‌تواند به‌خوبی پیش‌بینی کند.

درک خود را بررسی کنید

  1. با استفاده از داده‌های SBP، آزمون F جزئی را برای افزودن وضعیت سیگار کشیدن به مدل با QUET و AGE اجرا کنید و تأیید کنید که F برابر با مربع آماره t برای SMK است.
  2. یک متغیر پیش‌بین دارای 5 دسته است. به چند متغیر مجازی نیاز است، هر ضریب چه معنایی دارد و چگونه می‌توان آزمود که آیا این متغیر به‌طور کلی اهمیت دارد؟
  3. توضیح دهید چرا کدگذاری یک متغیر اسمی چهار‌دسته‌ای به صورت 0، 1، 2 و 3 نادرست است و شرح دهید ضریب حاصل در واقع چه چیزی را برآورد می‌کند.
  4. یک داده‌ی پرت، یک نقطه‌ی با اهرم بالا و یک نقطه‌ی تأثیرگذار را از هم متمایز کنید. مثالی از نقطه‌ای بیاورید که پرت باشد اما از دو مورد دیگر نباشد.
  5. یک مدل یک مشاهده با فاصله کوک برابر 4.2 دارد و سایر مشاهدات زیر 0.1 هستند. چهار گام بعدی خود را به ترتیب توضیح دهید.
  6. توزیع هزینه‌ها به‌شدت چپ‌پرت است. تحلیل آن در مقیاس خام را با تحلیل آن در مقیاس لگاریتمی مقایسه کنید: معیار تأثیر هر یک را بیان کنید و بگویید کدام را به یک نظام سلامت گزارش خواهید کرد.
  7. دو پیش‌بین دارای VIF برابر با 12 هستند. ضریبی که برای شما اهمیت دارد مربوط به متغیر سوم است که VIF آن برابر با 1.1 است. چه کاری، اگر کاری هست، باید انجام دهید؟
  8. یک مدل شامل X1X2X_1 X_2 است اما X1X_1 را شامل نمی‌شود. توضیح دهید این محدودیت چه الزامی را تحمیل می‌کند و چرا تقریباً هرگز منظور نیست.

مطالعه بیشتر

  • Kleinbaum DG, Kupper LL, Nizam A, Rosenberg ES. Applied Regression Analysis and Other Multivariable Methods. 5th ed.
  • Bland JM, Altman DG. Transforming data. BMJ. 1996;312:770.
  • Bland JM, Altman DG. Transformations, means, and confidence intervals. BMJ. 1996;312:1079.
  • Harrell FE. Regression Modeling Strategies. 2nd ed. (On splines and fractional polynomials.)
  • Fox J, Weisberg S. An R Companion to Applied Regression. 3rd ed.

اصطلاحات کلیدی

آزمون F جزئیمدل‌های تو در تومتغیر مجازیدسته‌بندی مرجعکدگذاری اثرمورد استثناییاهرمفاصلهٔ کُکباقیماندهٔ دانشجوییتبدیلتعاملهم‌خطی