تحلیل رگرسیون
واحد 11·45 دقیقه

مدل‌های چندسطحی و طولی

چه باید کرد وقتی فرض استقلال برقرار نباشد. داده‌های خوشه‌ای و اندازه‌گیری‌های مکرر، مقاطع تصادفی و شیب‌های تصادفی، همبستگی درون‌کلاسی، و انتخاب بین مدل‌های ترکیبی و GEE.

پس از این درس شما قادر خواهید بود

  • داده‌های خوشه‌ای و تکراری را شناسایی کنید و بیان کنید اگر استقلال فرض شود چه اتفاقی می‌افتد.
  • همبستگی درون‌گروهی و اثر طراحی را تفسیر کنید.
  • یک مدل برش تصادفی و یک مدل شیب تصادفی را مشخص کنید و اجزای واریانس را تفسیر کنید.
  • تأثیرات درون خوشه‌ای را از تأثیرات بین خوشه‌ای متمایز کنید و از خلط آن‌ها خودداری کنید.
  • بین مدل ترکیبی و GEE یکی را انتخاب کنید و تفاوت در برآوردهای آن‌ها را توضیح دهید.
  • مدل‌های ترکیبی را به نتایج دودویی و شمارشی تعمیم دهید.
  • مدیریت داده‌های گمشده در تحلیل طولی.

مدل‌های چندسطحی و طولی

مشکل

هر مدل در این دوره بر مبنای مشاهدات مستقل فرض شده است. در پژوهش‌های سلامت این فرض به‌طور مداوم نقض می‌شود:

داده‌های خوشه‌ای، جایی که مشاهدات گروه‌بندی شده‌اند:

  • کودکان در کلاس‌های درس مدارس
  • جوجه موش‌های صحرایی در یک زایمان
  • بیماران در بیمارستان‌ها یا مطب‌های عمومی
  • دندان‌ها در دهان‌ها، چشم‌ها در بیماران، مفاصل در انسان‌ها
  • هم‌تایان در شبکه‌های اجتماعی

داده‌های تکراری، جایی که یک واحد یکسان بیش از یک بار اندازه‌گیری می‌شود:

  • فشار خون اندازه‌گیری‌شده در شروع، ماه‌های 3، 6 و 12
  • دفترچه‌های روزانهٔ علائم
  • چندین نوبت مراقبت برای یک بیمار

در هر دو مورد، مشاهدات از یک خوشه یا فرد مشابه‌تر از مشاهدات از خوشه‌ها یا افراد مختلف هستند. این شباهت اطلاعاتی است و در نظر گرفتن مشاهدات به‌عنوان مستقل، آن را دور می‌ریزد و در عین حال وانمود می‌کند که دقت بیشتری از آنچه داده‌ها پشتیبانی می‌کنند، دارد.

چه چیزی اشتباه پیش می‌رود

خطاهای استاندارد خیلی کوچک هستند. مقدار مؤثر اطلاعات مستقل کمتر از آن است که تعداد سطرها نشان می‌دهد، بنابراین فواصل اطمینان خیلی باریک و مقادیر p خیلی کوچک هستند. مطالعه‌ای روی 40 بیمار با 10 اندازه‌گیری برای هر بیمار، 400 سطر دارد اما به هیچ وجه به اندازه 400 مشاهده اطلاعات ندارد.

این اثر کوچک نیست. با خوشه‌های 20 تایی و همبستگی درون‌طبقه‌ای 0.05، واریانس واقعی تقریباً دو برابر مقداری است که تحلیل ساده‌لوحانه گزارش می‌کند، بنابراین مقادیر p می‌توانند تا حد زیادی اشتباه باشند.

یک هشدار که مردم را شگفت‌زده می‌کند: برای پیش‌بین‌کننده‌ای که درون خوشه‌ها تغییر می‌کند (مانند یک درمان متقاطع یا زمان)، نادیده گرفتن خوشه‌بندی خطاهای استاندارد را بیش از حد بزرگ می‌کند، نه کم. جهت آن بستگی به سطحی دارد که پیش‌بین‌کننده در آن تغییر می‌کند. در هر صورت، عدم قطعیت گزارش‌شده نادرست است.

همبستگی درون‌کلاسی

ICC=ρ=σbetween2σbetween2+σwithin2\text{ICC} = \rho = \frac{\sigma^2_{\text{between}}}{\sigma^2_{\text{between}} + \sigma^2_{\text{within}}}

نسبت واریانس کل که بین خوشه‌ها قرار دارد. به طور معادل، همبستگی بین دو مشاهده از یک خوشه.

  • ρ=0\rho = 0: عضویت در خوشه هیچ اطلاعاتی را منتقل نمی‌کند و رگرسیون معمولی کافی است.
  • ρ=1\rho = 1: تمام مشاهدات درون یک خوشه یکسان هستند، بنابراین هر خوشه معادل یک مشاهده اطلاعات ارائه می‌دهد.

اثر طراحی، مشاهده‌شده در طول آزمایش‌ها:

DE=1+(m1)ρ\text{DE} = 1 + (m - 1)\rho

با mm اندازهٔ متوسط خوشه. اندازهٔ نمونهٔ مؤثر برابر است با اندازهٔ اسمی تقسیم بر ضریب طراحی.

معمولاً ضریب‌های همبستگی درون‌مجموعه‌ای (ICC) در پژوهش‌های سلامت کوچک هستند: 0.01 تا 0.05 برای نتایج بالینی درون مطب‌ها، بالاتر برای معیارهای فرآیند و بسیار بالاتر (0.5 یا بیشتر) برای اندازه‌گیری‌های مکرر روی یک فرد. توجه داشته باشید که ضریب ICC کوچک نیز وقتی خوشه‌ها بزرگ هستند، همچنان اثر طراحی بزرگی ایجاد می‌کند.

مدل‌های برش تصادفی

ساده‌ترین مدل چندسطحی به هر خوشه ضریب برش خود اختصاص می‌دهد.

Yij=β0+β1Xij+uj+eijY_{ij} = \beta_0 + \beta_1 X_{ij} + u_j + e_{ij}

کجا:

  • ii مشاهده را نمایه می‌کند، jj خوشه را.
  • β0,β1\beta_0, \beta_1 دارای اثرات ثابت است: برای همه یکسان است.
  • ujN(0,σu2)u_j \sim N(0, \sigma^2_u) is the random effect for cluster jj: how much that cluster's intercept differs from the overall one
  • eijN(0,σe2)e_{ij} \sim N(0, \sigma^2_e) باقیمانده است.

دو مؤلفهٔ واریانس برآورد می‌شوند، σu2\sigma^2_u و σe2\sigma^2_e، و

ρ=σu2σu2+σe2\rho = \frac{\sigma^2_u}{\sigma^2_u + \sigma^2_e}

library(lme4)
m <- lmer(outcome ~ treatment + age + (1 | clinic), data = d)
summary(m)

اصطلاح (1 | clinic) چنین خوانده می‌شود: یک برداشت تصادفی که بسته به کلینیک متفاوت است.

اثرات ثابت یا تصادفی برای خوشه‌ها؟

می‌توانید به‌جای آن برای هر خوشه یک متغیر مجازی در نظر بگیرید: رویکرد اثرات ثابت.

اثرات ثابت (دمِی‌ها) اثرات تصادفی
پارامترها یک به ازای هر خوشه یک انحراف
با خوشه‌های فراوان اسراف‌آمیز و در صورت فراوانی خوشه‌ها غیرقابل استفاده کارآمد
پیش‌بین‌های سطح خوشه‌ای قابل برآورد نیست قابل برآورد است
استنتاج به این خوشه‌ها فقط جمعیت خوشه‌ها
فرض هیچ‌چیز دربارهٔ اثرات خوشه‌ای اثرات خوشه‌ای طبیعی و بی‌ارتباط با پیش‌بین‌ها
توده‌های کوچک برآوردها ناپایدار هستند برآوردها به سمت میانگین کاهش یافتند

کاهش‌پذیری ویژگی متمایز مدل‌های اثرات تصادفی و یک مزیت واقعی است. اثر برآوردشده یک خوشه به سمت میانگین کلی کشیده می‌شود و هرچه خوشه کوچک‌تر یا داده‌های آن نویزدارتر باشد، این کشش بیشتر می‌شود. بنابراین بیمارستانی با 4 بیمار و نرخ نتایج نگران‌کننده، گزارش نمی‌شود که ده برابر میانگین مرگ‌ومیر را داشته باشد؛ برآورد آن به سمت میانگین کشیده می‌شود، به میزانی که نشان‌دهنده کم‌اطلاعی درباره آن است. به همین دلیل مدل‌های اثرات تصادفی استاندارد مقایسه سازمانی و جدول‌های رتبه‌بندی هستند.

فرض بر این است که اثرات خوشه‌ای با متغیرهای پیش‌بین بی‌ارتباط هستند؛ فرضیهٔی که ممکن است نادرست از آب درآید و وقتی چنین شود، اثرات ثابت انتخاب امن‌تری هستند. این جوهر بحث دیرپای میان دو رویکرد در اقتصادسنجی است.

مدل‌های شیب تصادفی

عرض از مبدأ تصادفی می‌گوید خوشه‌ها در سطح میانگین خود تفاوت دارند. شیب تصادفی می‌گوید اثر یک پیش‌بین در خوشه‌های مختلف تفاوت دارد.

Yij=β0+β1Xij+u0j+u1jXij+eijY_{ij} = \beta_0 + \beta_1 X_{ij} + u_{0j} + u_{1j}X_{ij} + e_{ij}

اکنون هر خوشه دارای معادله‌ی عرض و شیب خاص خود است. مدل واریانس شیب‌ها و همبستگی آن‌ها با معادله‌ی عرض را برآورد می‌کند.

m2 <- lmer(outcome ~ time + (time | patient), data = d)

خواندن خروجی:

  • اثر ثابت زمان، میانگین شیب در همه بیماران است.
  • واریانس شیب تصادفی می‌گوید بیماران در مسیرهای خود چقدر تفاوت دارند.
  • کوواریانس عرض از مبدأ و شیب می‌گوید آیا بیمارانی که از سطح بالاتری آغاز می‌کنند به شکل متفاوتی تغییر می‌کنند. کوواریانس منفی رایج است و اغلب بازتاب بازگشت به میانگین یا یک اثر سقفی است.

واریانس بزرگ در شیب تصادفی یک یافته است: این نشان می‌دهد که اثر میانگین تنها تعداد کمی از افراد را به‌خوبی توصیف می‌کند و به جست‌وجویی برای یافتن آنچه این تغییرپذیری را توضیح می‌دهد، یعنی تعامل میان‌سطحی، دعوت می‌کند.

وقتی پیش‌بین درون خوشه‌ها متغیر است و اثر آن احتمالاً در میان آن‌ها متفاوت است، شیب‌های تصادفی را برازش کنید. زمان در یک مطالعه طولی مورد استاندارد است: مسیرهای افراد واقعاً متفاوت‌اند. مشکلات همگرایی با چندین شیب تصادفی شایع‌اند و واکنش معمول، ساده‌سازی ساختار تصادفی است نه اجبار آن.

درون و میان اثرات

یک ظرافت است که به‌راحتی نادیده گرفته می‌شود و پاسخ‌های نادرست به همراه دارد.

وقتی یک متغیر پیش‌بین هم درون خوشه‌ها و هم بین آن‌ها تغییر می‌کند، ضریب آن در یک مدل ترکیبی ترکیبی از دو اثر متفاوت است که ممکن است در جهت‌های مخالف باشند.

مثال زیر آن را ملموس می‌کند: در یک مطالعه طولی درباره ورزش و فشار خون، اثر درون‌فردی (آیا فشار خون یک فرد در هفته‌هایی که بیشتر ورزش می‌کند کاهش می‌یابد؟) و اثر بین‌فردی (آیا افرادی که بیشتر ورزش می‌کنند فشار خون پایین‌تری نسبت به کسانی دارند که کمتر ورزش می‌کنند؟) مقادیر متفاوتی هستند. اولی به علت نزدیک‌تر است؛ دومی به‌شدت تحت تأثیر همه عواملی است که افراد را از هم متمایز می‌کند.

راه‌حل این است که آن‌ها را به‌طور صریح از هم جدا کنید: میانگین خوشه پیش‌بین و انحراف هر مشاهده از میانگین خوشه‌اش را درج کنید.

Yij=β0+βW(XijXˉj)+βBXˉj+uj+eijY_{ij} = \beta_0 + \beta_W(X_{ij} - \bar{X}_j) + \beta_B\bar{X}_j + u_j + e_{ij}

اکنون βW\beta_W اثر درون خوشه‌ای و βB\beta_B اثر بین خوشه‌ای است و می‌توانید ببینید آیا با هم تفاوت دارند یا خیر. این تفکیک هیچ هزینه‌ای ندارد و هرگاه پیش‌بین در هر دو سطح متغیر باشد، باید به‌صورت روتین انجام شود.

d$x_mean <- ave(d$x, d$id)
d$x_dev  <- d$x - d$x_mean
lmer(y ~ x_dev + x_mean + (1 | id), data = d)

داده‌های طولی

مشاهدات مکرر نوعی خاص از خوشه‌بندی هستند که در آن مشاهدات مربوط به هر فرد به ترتیب زمانی مرتب شده‌اند. دو ویژگی آن‌ها را متمایز می‌کند.

زمان یک پیش‌بین است و معمولاً شکل مسیر حرکت مورد توجه است: خطی، درجه دوم یا اسپلاین.

ساختار همبستگی دارای ترتیب زمانی است. مشاهدات نزدیک به هم در زمان معمولاً همبستگی بیشتری نسبت به مشاهدات دور از هم دارند، که این موضوع توسط یک برش تصادفی ساده (که فرض می‌کند همبستگی در تمام تأخیرها برابر است) در نظر گرفته نمی‌شود.

ساختارهای همبستگی رایج:

ساختار فرض
استقلال هیچ همبستگی وجود ندارد. در اینجا اشتباه است.
قابل تعویض (تقارن مرکب) همبستگی برابر در تمام تأخیرها. آنچه یک برش تصادفی ایجاب می‌کند.
خودبازگشتی AR(1) همبستگی با افزایش فاصله زمانی به‌طور هندسی کاهش می‌یابد.
بدون ساختار یک همبستگی مجزا برای هر جفت نقطه زمانی. انعطاف‌پذیرترین، بیشترین پارامترها، نیازمند داده‌های متعادل و نمونه‌ای بزرگ.

برای اندازه‌گیری‌های با فاصلهٔ برابر در یک دورهٔ کوتاه، قابل تعویض بودن اغلب کافی است. برای پیگیری طولانی‌تر، AR(1) معمولاً بهتر است.

مزایای مدل ترکیبی نسبت به اندازه‌گیری‌های مکرر ANOVA، که تا حد زیادی جایگزین آن شده است:

  • این **داده‌های نامتعادل **را مدیریت می‌کند: تعداد مشاهده‌های متفاوت برای هر فرد در زمان‌های مختلف.
  • این داده‌های گمشده را در مدل MAR بدون برآورد جایگزین، با استفاده از تمامی مشاهدات موجود، مدیریت می‌کند.
  • این متغیرهای همبستهٔ متغیر در زمان را مدیریت می‌کند.
  • به کروییت نیاز ندارد.

مدل‌های ترکیبی و GEE

دو چارچوب برای داده‌های همبسته که چیزهای متفاوتی را برآورد می‌کنند.

مدل‌های ترکیبی (چندسطحی، با اثرات تصادفی) مشروط یا مختص هر فرد هستند. ضریب پاسخ می‌دهد: برای یک خوشه یا فرد معین، تغییر X چه تأثیری دارد؟

معادلات برآوردی تعمیم‌یافته (GEE) مرزی یا میانگین‌گیری‌شده بر *کل *جمعیت هستند. ضریب پاسخ می‌دهد: در *کل *جمعیت، میانگین نتیجه به ازای هر واحد افزایش X چقدر متفاوت است؟

library(geepack)
geeglm(y ~ x, id = clinic, family = binomial,
       corstr = "exchangeable", data = d)

این تفاوت اهمیت دارد و تنها برای مدل‌های غیرخطی صدق می‌کند.

برای یک مدل خطی، این دو با هم هم‌خوانی دارند. میانگین یک تابع خطی، همان تابع خطی از میانگین است.

برای مدل‌های لجستیک و دیگر مدل‌های غیرخطی این دو تفاوت دارند، و ضریب حاشیه‌ای (GEE) نسبت به ضریب شرطی (مدل آمیخته) تضعیف می‌شود، گاهی به میزان چشمگیر. این باز همان تجمیع‌ناپذیری نسبت شانس است، و اختلاف نظری درباره داده‌ها نیست؛ این دو کمیت‌های متفاوتی را برآورد می‌کنند.

انتخاب آن بستگی به پرسش دارد:

  • مدل ترکیبی زمانی به کار می‌رود که بخواهید اثر یک فرد را محاسبه کنید، زمانی که به تغییرات بین خوشه‌ها علاقه‌مند هستید، یا زمانی که نیاز به پیش‌بینی برای یک خوشه خاص دارید.
  • GEE زمانی که می‌خواهید اثر میانگین جمعیت را، مانند در یک مسئله بهداشت عمومی یا سیاست‌گذاری، بررسی کنید و ساختار همبستگی بیشتر یک مزاحمت است تا موضوع مورد علاقه.

دو نکته عملی دیگر:

GEE حتی وقتی ساختار همبستگی نادرست تصریح شده باشد خطاهای استاندارد معتبر می‌دهد، از راه برآوردگر واریانس مقاوم (ساندویچی). این مزیتی واقعی است و برای اینکه خوب کار کند به خوشه‌های کافی نیاز دارد، تقریباً 40 خوشه یا بیشتر.

مدل GEE تنها در چارچوب MCAR از داده‌های گمشده پشتیبانی می‌کند، مگر اینکه وزن‌دهی بر اساس احتمال معکوس اضافه شود. مدل‌های ترکیبی تحت MAR معتبر هستند. برای داده‌های طولی با ترک نمونه، که در بهترین حالت تقریباً همیشه MAR است، این موضوع به نفع مدل‌های ترکیبی است.

نتایج غیرخطی

همه چیز تعمیم می‌یابد. یک مدل خطی مختلط تعمیم‌یافته (GLMM) تابع پیوند واحدهای لجستیک و پواسون را با اثرات تصادفی ترکیب می‌کند:

glmer(event ~ treatment + (1 | clinic), family = binomial, data = d)
glmer(count ~ time + (1 | patient), family = poisson, data = d)

دو هشدار:

برآورد دشوارتر است. احتمال‌پذیری شامل انتگرالی بر روی اثرات تصادفی است که فرمول بسته ندارد. از تقریب‌های عددی (لاپلاس، کوادراتور گاوس تا هرمیت تطبیقی) استفاده می‌شود و شکست‌های همگرایی رایج است. نیمه‌احتمال مجازات‌شده، روشی قدیمی‌تر که هنوز در برخی نرم‌افزارها یافت می‌شود، برای نتایج دودویی با خوشه‌های کوچک دارای سوگیری شناخته شده و باید از آن اجتناب کرد.

ICC به همان شیوه تعریف نشده است، زیرا واریانس باقیمانده توسط توزیع تعیین می‌شود و برآورد نمی‌شود. تعاریف متعددی برای نتایج دودویی وجود دارد که اعداد متفاوتی ارائه می‌دهند، بنابراین مشخص کنید از کدام یک استفاده شده است.

اندازه نمونه

دو عدد اهمیت دارند و عدد دوم بیش از آنچه مردم انتظار دارند اهمیت دارد.

تعداد خوشه‌ها دقت اثرات در سطح خوشه و برآورد واریانس بین‌خوشه‌ای را تعیین می‌کند. داشتن کمتر از حدود 30 خوشه منجر به برآوردهای ضعیف اجزای واریانس و آزمون‌های غیرمحافظه‌کارانه می‌شود و باید از اصلاح کوچک‌نمونه‌ای (Kenward-Roger یا Satterthwaite) استفاده کرد.

اندازه خوشه دقت اثرات درون‌خوشه‌ای را تعیین می‌کند.

برای یک اندازهٔ کل نمونهٔ ثابت، تعداد خوشه‌های بیشتر تقریباً همیشه بهتر از خوشه‌های بزرگ‌تر است وقتی اثر موردنظر در سطح خوشه قرار دارد. بیست خوشهٔ ده‌تایی بهتر از پنج خوشهٔ چهل‌تایی است.

اثر طراحی تورم را برای یک مقایسه ساده نشان می‌دهد:

nrequired=nindependent×[1+(m1)ρ]n_{\text{required}} = n_{\text{independent}} \times [1 + (m-1)\rho]

گزارش‌دهی

  • ساختار داده‌ها: سطوح، تعداد واحدها در هر سطح، و اندازه خوشه‌ها.
  • مدل، شامل اینکه کدام اثرات ثابت و کدام تصادفی هستند.
  • مؤلفه‌های واریانس و ICC.
  • ساختار همبستگی برای داده‌های طولی.
  • روش برآورد و هر مشکل هم‌گرایی.
  • الگوی داده‌های گمشده و مفروضه‌ای که گذاشته شده است.
  • برآوردهای اثر ثابت همراه با فواصل اطمینان و روشی که برای درجه‌های آزادی در نمونه‌های کوچک به کار می‌رود.

درک خود را بررسی کنید

  1. یک مطالعه شش دندان را در هر یک از 200 بیمار اندازه‌گیری می‌کند و با رگرسیون معمولی 1200 دندان را تحلیل می‌کند. توضیح دهید چه اشتباهی رخ داده و اگر ICC برابر 0.3 باشد، اثر طراحی را برآورد کنید.
  2. توضیح دهید چرا نادیده گرفتن خوشه‌بندی باعث می‌شود خطاهای استاندارد برای پیش‌بین در سطح خوشه خیلی کوچک و برای پیش‌بین درون‌خوشه‌ای خیلی بزرگ شوند.
  3. یک کارآزمایی تصادفی‌شده‌شده‌شده‌شده‌شده خوشه‌ای شامل 12 خوشه با 100 شرکت‌کننده است. بحث کنید که آیا 12 خوشه کافی است و در تحلیل چه اقدامی انجام خواهید داد.
  4. تفاوت بین برش تصادفی و شیب تصادفی را توضیح دهید و یک مثال در پژوهش‌های بهداشتی ارائه کنید که در آن شیب تصادفی بخش جالب باشد.
  5. توضیح دهید که کاهش (shrinkage) چه تأثیری بر بیمارستانی با 4 بیمار و نرخ نتایج نگران‌کننده دارد و چرا این ویژگی برای جدول رتبه‌بندی مطلوب است.
  6. در یک مطالعه طولی درباره ورزش و فشار خون، توضیح دهید چگونه اثر درون‌فردی را از اثر بین‌فردی جدا می‌کنید و چرا این دو ممکن است از نظر علامت با هم متفاوت باشند.
  7. یک مدل ترکیبی لجستیک نسبت شانس 1.8 را نشان می‌دهد و GEE بر روی همان داده‌ها نسبت 1.5 را می‌دهد. توضیح دهید چرا این دو با هم متفاوت هستند و کدام یک را برای ارائه توصیه بهداشت عمومی گزارش می‌کنید.
  8. توضیح دهید چرا در یک مطالعه طولی، در صورت وجود افت‌داده‌ها، مدل‌های ترکیبی نسبت به GEE ارجحیت دارند.

مطالعه بیشتر

  • Goldstein H. Multilevel Statistical Models. 4th ed.
  • Twisk JWR. Applied Mixed Model Analysis: A Practical Guide. 2nd ed.
  • Zeger SL, Liang KY. Longitudinal data analysis for discrete and continuous outcomes. Biometrics. 1986;42(1):121-130.
  • Snijders TAB, Bosker RJ. Multilevel Analysis: An Introduction to Basic and Advanced Multilevel Modeling. 2nd ed.
  • Bates D, Machler M, Bolker B, Walker S. Fitting linear mixed-effects models using lme4. J Stat Softw. 2015;67(1):1-48.
  • Hubbard AE, Ahern J, Fleischer NL, et al. To GEE or not to GEE: comparing population average and mixed models for estimating the associations between neighborhood risk factors and health. Epidemiology. 2010;21(4):467-474.

اصطلاحات کلیدی

داده‌های خوشه‌ایمقیاس‌های تکراریهمبستگی درون‌گروهیمقطع تصادفیشیب تصادفیاجزای واریانساثر ثابتاثر تصادفیGEEمدل حاشیه‌ایمدل شرطیهمبستگی قابل تعویض