سنتز پیشرفته شواهد
واحد 3·50 دقیقه

مدل‌ها و برآوردگرهای فراتحلیل در عمل

انتخاب‌های پنهان در پس یک برآورد تجمیعی: اثر ثابت یا اثرات تصادفی، کدام روش واریانس، کدام یک از شانزده روش برآورد واریانس بین‌مطالعه‌ای، و کدام فاصله. روی یک مجموعه واحد از پنج کارآزمایی، این انتخاب‌ها پاسخ را از 0.83 به 0.66 و فاصله را از باریک به بی‌نتیجه تغییر می‌دهند.

پس از این درس شما قادر خواهید بود

  • بیان کنید مدل اثر ثابت و مدل اثرات تصادفی هر کدام چه چیزی را فرض می‌کنند و چه چیزی را برآورد می‌کنند.
  • توضیح دهید وزن‌ها در دو مدل چه تفاوتی دارند و این تفاوت با مطالعات کوچک چه می‌کند.
  • برای یک پیامد دووجهی میان روش عکس واریانس، مانتل-هنزل و پتو انتخاب کنید.
  • خانواده‌های اصلی برآوردگر واریانس بین‌مطالعه‌ای را توصیف کنید و بگویید روش دِرسیمونیان-لِرد کجا شکست می‌خورد.
  • از فاصله هارتونگ-کناپ-سیدیک-یونکمن استفاده کنید و بگویید چه زمانی مناسب نیست.
  • پیش از تحلیل، معیار اثر را انتخاب و آن را توجیه کنید.
  • یک فراتحلیل را چنان گزارش کنید که تحلیل‌گر دیگری بتواند همان عدد را بازتولید کند.

مدل‌ها و برآوردگرهای فراتحلیل در عمل

موضوع این واحد

دوره مرور نظام‌مند، برآورد تجمیعی را چنان آموزش داد که گویی یک چیز واحد است. چنین نیست. میان داده استخراج‌شده و عددی که در چکیده می‌آید، چهار تصمیم قرار دارد:

  1. کدام مدل. اثر ثابت (fixed effect) یا اثرات تصادفی (random effects).
  2. کدام روش واریانس. عکس واریانس (inverse variance)، مانتل-هنزل (Mantel-Haenszel)، پتو (Peto).
  3. کدام برآوردگر واریانس بین‌مطالعه‌ای، اگر مدل اثرات تصادفی باشد. دست‌کم شانزده مورد وجود دارد.
  4. کدام فاصله. والد، هارتونگ-کناپ-سیدیک-یونکمن، درست‌نمایی نیمرخی.

نرم‌افزار برای هر چهار مورد یک پیش‌فرض برمی‌گزیند و عددی چاپ می‌کند. موضوع این واحد آن است که این پیش‌فرض‌ها چه می‌کنند، و اینکه روی داده‌های یکسان با هم توافق ندارند.

اصلاً چرا تجمیع می‌کنیم

سه دلیل، و این‌ها یک دلیل واحد نیستند.

توان آماری (power). بیشتر کارآزمایی‌های منفرد برای آشکارسازی یک اثر بزرگ روی یک پیامد اولیه حجم‌گذاری شده‌اند. آن‌ها برای اثرهای کوچکی که اهمیت دارند کم‌توان‌اند و برای آسیب‌ها به‌شدت کم‌توان. تجمیع اغلب تنها راه دیدن اثری است که هیچ کارآزمایی منفردی نمی‌توانست ببیند.

دقت (precision). حتی وقتی هر کارآزمایی به‌تنهایی قطعی باشد، برآوردی که بر اطلاعات بیشتر بنا شده، برآورد بهتری است.

ناهمگنی (heterogeneity). این همان موردی است که فراموش می‌شود. فراتحلیل به شما اجازه می‌دهد پرسش‌هایی بپرسید که مطالعات منفرد نپرسیده‌اند: نتایج واقعاً چقدر با هم اختلاف دارند، و چه چیزی آن را توضیح می‌دهد؟ دو کارآزمایی که در یک سرمقاله متناقض به نظر می‌رسند، ممکن است پس از رسم فاصله‌هایشان روی یک محور کاملاً سازگار باشند. کمی‌سازی این تعارض، خودش یک نتیجه است و گاهی تنها نتیجه صادقانه.

میانگین وزنی

هر مدلی در این واحد، میانگین وزنی برآوردهای مطالعات است. آنچه تغییر می‌کند، وزن است.

SE(\hat{\theta}) = \sqrt{\frac{1}{\sum_i w_i}}$$ چرا بر اساس حجم نمونه وزن ندهیم؟ چون حجم نمونه جانشینی است برای چیزی که واقعاً اهمیت دارد، یعنی اینکه مطالعه اثر را با چه دقتی برآورد کرده است. کارآزمایی‌ای با 600 نفر و 4 رویداد، کمتر از آنچه حجم نمونه‌اش نشان می‌دهد به شما می‌گوید. پس وزن، عکس واریانس برآورد است: $$w_i = \frac{1}{\text{Var}(\hat{\theta_i})} = \frac{1}{SE_i^2}$$ باقی همه چیز از آنچه در $\text{Var}(\hat{\theta_i})$ می‌گذارید نتیجه می‌شود. ## دو مدل ### اثر ثابت **فرض: یک اثر واقعی وجود دارد و هر مطالعه در حال برآورد همان است.** مطالعات فقط به دلیل خطای نمونه‌گیری با هم فرق دارند. این فرض را فرض اثر مشترک یا فرض اثرهای برابر هم می‌نامند، و هر سه نام یک معنا دارند. $$w_i^{FE} = \frac{1}{v_i}$$ که در آن $v_i$ واریانس درون‌مطالعه‌ای است. پرسشی که پاسخ می‌دهد این است: *اثر در این مجموعه از مطالعات چقدر است؟* ### اثرات تصادفی **فرض: اثر واقعی میان مطالعات متفاوت است و مطالعات نمونه‌ای از یک توزیع از اثرهای واقعی هستند.** یک واریانس درون‌مطالعه‌ای $v_i$ و یک واریانس بین‌مطالعه‌ای $\tau^2$ وجود دارد و وزن هر دو را در بر می‌گیرد: $$w_i^{RE} = \frac{1}{v_i + \tau^2}$$ پرسشی که پاسخ می‌دهد این است: *میانگین توزیع اثرهای واقعی چقدر است؟* توجه کنید که این پرسش دیگری است، نه پاسخی محتاطانه‌تر به همان پرسش. اثر ثابت حالت خاص $\tau^2 = 0$ است. ### مقایسه‌ای که اهمیت دارد | | اثر ثابت | اثرات تصادفی | |---|---|---| | **از نظر مفهومی** | اثر را در همین نمونه از مطالعات برآورد می‌کند | میانگین اثر را در جامعه‌ای که مطالعات از آن آمده‌اند برآورد می‌کند | | **فرض می‌کند** | اثر در همه مطالعات یکسان است | اثرها متفاوت‌اند؛ میانگین چقدر است؟ | | **واریانس خطا** | فقط درون‌مطالعه‌ای | درون و بین‌مطالعه‌ای | | **فاصله** | باریک‌تر | گسترده‌تر | | **وزن‌دهی** | مطالعات بزرگ غالب می‌شوند | وزن‌ها به سمت برابری کشیده می‌شوند | سطر آخر پیامد عملی است و مرتباً نادیده گرفته می‌شود. افزودن $\tau^2$ به هر مخرج، تفاوت میان وزن‌ها را فشرده می‌کند، چون $\tau^2$ نسبت به $v_i$ کوچک یک کارآزمایی بزرگ، بزرگ است و نسبت به $v_i$ بزرگ یک کارآزمایی کوچک، کوچک. **اثرات تصادفی مطالعات کوچک را ارتقا می‌دهد.** اگر مطالعات کوچک همان‌هایی باشند که سوگیری دارند (و سوگیری انتشار (publication bias) این را محتمل می‌کند)، برآورد اثرات تصادفی همان برآوردی است که بیشتر سوگیری دارد. ## یک مثال حل‌شده پنج کارآزمایی از یک مداخله، با پیامد دووجهی. | کارآزمایی | رویداد / n (مداخله) | رویداد / n (شاهد) | نسبت خطر | |---|---|---|---| | A | 9 / 120 | 24 / 118 | 0.369 | | B | 8 / 90 | 15 / 92 | 0.545 | | C | 62 / 600 | 58 / 590 | 1.051 | | D | 4 / 60 | 13 / 62 | 0.318 | | E | 31 / 210 | 29 / 205 | 1.044 | سه کارآزمایی سود بزرگی را نشان می‌دهند و دو کارآزمایی هیچ. آن دو که هیچ نشان می‌دهند، دو کارآزمایی بزرگ‌ترند. ```r library(meta) d <- data.frame( study = c("A", "B", "C", "D", "E"), ee = c(9, 8, 62, 4, 31), ne = c(120, 90, 600, 60, 210), ec = c(24, 15, 58, 13, 29), nc = c(118, 92, 590, 62, 205)) metabin(ee, ne, ec, nc, data = d, sm = "RR", method = "Inverse", common = TRUE, random = TRUE, method.tau = "DL") ``` ### انتخاب‌های مختلف چه می‌دهند | مدل و روش | نسبت خطر | فاصله 95% | |---|---|---| | اثر ثابت، عکس واریانس | 0.832 | 0.656 تا 1.056 | | اثر ثابت، مانتل-هنزل | 0.810 | 0.642 تا 1.024 | | اثرات تصادفی، دِرسیمونیان-لِرد | 0.671 | 0.420 تا 1.070 | | اثرات تصادفی، REML | 0.662 | 0.404 تا 1.085 | | اثرات تصادفی، REML با HKSJ | 0.662 | 0.332 تا 1.322 | **همان پنج کارآزمایی. برآورد نقطه‌ای از کاهش خطر 17% به کاهش خطر 34% جابه‌جا می‌شود، و فاصله از حالتی که تقریباً مقدار صفر را کنار می‌گذارد به حالتی می‌رسد که هم کاهش دوسوم و هم افزایش 32% را در بر می‌گیرد.** هیچ‌کس خطایی مرتکب نشده است. هر سطر، پیش‌فرضی قابل دفاع در یکی از بسته‌های نرم‌افزاری است. ناهمگنی: $Q = 11.79$ با 4 درجه آزادی، $p = 0.019$، $I^2 = 66.1\%$، و $\hat{\tau}^2 = 0.173$ با دِرسیمونیان-لِرد و $0.203$ با REML. ### این جابه‌جایی از کجا می‌آید وزن‌ها: | کارآزمایی | اثر ثابت | اثرات تصادفی | |---|---|---| | A | 10.9% | 18.4% | | B | 8.7% | 16.6% | | C | **49.4%** | **28.0%** | | D | 5.0% | 12.2% | | E | 26.0% | 24.7% | کارآزمایی C، یعنی کارآزمایی بزرگی که هیچ اثری نشان نمی‌دهد، نیمی از تحلیل اثر ثابت و کمی بیش از یک‌چهارم تحلیل اثرات تصادفی را حمل می‌کند. کارآزمایی D با 60 بیمار و 4 رویداد، نفوذ خود را بیش از دو برابر می‌کند. تمام تفاوت میان 0.83 و 0.66 همین است. **پس پرسش هرگز این نیست که «کدام مدل پاسخ درست را می‌دهد».** پرسش این است: با توجه به اینکه این کارآزمایی‌ها واقعاً با هم اختلاف دارند، آیا میانگینی می‌خواهم که بزرگ‌ترین کارآزمایی بر آن غلبه کند، یا میانگینی که هر کارآزمایی را مشاهده‌ای از یک توزیع بداند؟ و پس از پاسخ به آن، آیا آن‌قدر به کارآزمایی‌های کوچک اعتماد دارم که یک‌سوم نتیجه را حمل کنند؟ ### فاصله پیش‌بینی فاصله اطمینان اثرات تصادفی، یعنی 0.404 تا 1.085، فاصله‌ای برای **میانگین** توزیع اثرهای واقعی است. این فاصله‌ای برای اثر در یک بافتار جدید نیست. آن، فاصله پیش‌بینی (prediction interval) است و اینجا از **0.241 تا 1.822** امتداد دارد. ```r library(metafor) m <- rma(yi = TE, sei = seTE, data = ..., method = "REML") predict(m, transf = exp) ``` پزشکی که تصمیم می‌گیرد آیا این مداخله را در بیمارستان خودش به کار ببرد، پرسش فاصله پیش‌بینی را می‌پرسد، نه پرسش فاصله اطمینان را. هرگاه $\tau^2 > 0$ باشد هر دو را گزارش کنید. ## انتخاب روش واریانس برای پیامدهای دووجهی | روش | چه زمانی به کار می‌رود | مراقب چه باشید | |---|---|---| | **عکس واریانس** | پیش‌فرض عمومی؛ برای هر معیار اثری از جمله معیارهایی که خودتان محاسبه کرده‌اید کار می‌کند | با خانه‌های صفر و رویدادهای نادر بد رفتار می‌کند | | **مانتل-هنزل** | پیامدهای دووجهی، به‌ویژه با داده‌های تُنُک | فقط برای داده خام 2 در 2، نه برای برآوردهای از پیش محاسبه‌شده | | **نسبت شانس پتو** | رویدادهای نادر، بازوهای تقریباً متعادل، اثرهای کوچک | وقتی اثرها بزرگ یا بازوها به‌شدت نامتعادل‌اند سوگیری دارد | مانتل-هنزل پیش‌فرض معمول نرم‌افزارها برای پیامدهای دووجهی است و در میان این سه، هنگام تُنُک بودن داده‌ها معمولاً مقاوم‌ترین است؛ برخلاف عکس واریانس، برای یک خانه صفر به تصحیح پیوستگی نیاز ندارد. در مثال بالا 0.810 در برابر 0.832 عکس واریانس می‌دهد، و با نادرتر شدن رویدادها این شکاف بزرگ‌تر می‌شود. پتو کاربرد باریکی دارد و به‌گستردگی نادرست به کار می‌رود. برای رویدادهای نادر در کارآزمایی‌های متعادل عالی است و بیرون از آن غیرقابل‌اتکا، و چه بخواهید چه نخواهید یک نسبت شانس برآورد می‌کند. ## برآورد واریانس بین‌مطالعه‌ای اگر از مدل اثرات تصادفی استفاده کنید، باید $\tau^2$ را برآورد کنید، و این انتخاب ظاهری نیست: هر وزنی در تحلیل را تعیین می‌کند. دست‌کم شانزده برآوردگر در پنج خانواده وجود دارد. | خانواده | اعضا | |---|---| | **گشتاوری** | دِرسیمونیان-لِرد، DL مثبت، هجز-اولکین، هارتونگ-ماکامبی، هانتر-اشمیت، DL دومرحله‌ای، HO دومرحله‌ای، پاول-مندل | | **بیشینه درست‌نمایی** | ML، REML، REML تقریبی | | **واریانس خطای مدل** | سیدیک-یونکمن | | **بیزی** | مُد بیزی، بیز روخین، بیزی کامل | | **بوت‌استرپ** | بوت‌استرپ ناپارامتری DL | آنچه درباره رفتار آن‌ها می‌دانیم: - **دِرسیمونیان-لِرد $\tau^2$ را کم‌برآورد می‌کند** وقتی تعداد مطالعات کم است و وقتی رویدادها نادرند. این برآوردگر پیش‌فرض تاریخی تقریباً همه بسته‌های نرم‌افزاری است، و مهم‌ترین پیش‌فرض تک‌گانه در فراتحلیل است. - **DL مثبت، هارتونگ-ماکامبی، بیز روخین، مُد بیزی و سیدیک-یونکمن $\tau^2$ را بیش‌برآورد می‌کنند.** - **سیدیک-یونکمن و مُد بیزی از بقیه بدتر عمل می‌کنند**؛ هانتر-اشمیت و ML ساده سوگیری زیادی دارند. - **REML کمتر از DL و ML به سمت پایین سوگیری دارد** و برای پیامدهای پیوسته خوب عمل می‌کند. **پاول-مندل** برای پیامدهای دووجهی خوب عمل می‌کند. در مثال حل‌شده، DL مقدار $\hat{\tau}^2 = 0.173$ و REML مقدار $0.203$ می‌دهد؛ یعنی 17% تفاوت روی پنج مطالعه. این اندازه معمول این اختلاف است، نه اندازه‌ای غیرعادی. **با کمتر از ده مطالعه، و به‌ویژه با مطالعات کوچک یا رویدادهای نادر، $\tau^2$ با هر برآوردگری که استفاده کنید کم‌دقت برآورد می‌شود.** پاسخ درست، جستجو برای بهترین برآوردگر نیست. پاسخ این است که $\hat{\tau}^2$ را دیگر کمیتی معلوم نپندارید: برای آن فاصله گزارش کنید و تحلیل را با بیش از یک برآوردگر به‌عنوان تحلیل حساسیت اجرا کنید. ## فاصله‌ها برای برآورد تجمیعی فاصله استاندارد اثرات تصادفی با $\hat{\tau}^2$ چنان رفتار می‌کند که گویی همان $\tau^2$ واقعی است. چنین نیست، و با تعداد کم مطالعات، فاصله حاصل بیش از حد باریک و آزمون بیش از حد آزادمنشانه می‌شود. **فاصله هارتونگ-کناپ-سیدیک-یونکمن** این را با استفاده از توزیع $t$ با $k-1$ درجه آزادی و برآورد واریانسی که پراکندگی مشاهده‌شده را بازتاب می‌دهد تصحیح می‌کند. در مثال، فاصله را از 0.404 تا 1.085 به **0.332 تا 1.322** گسترش می‌دهد. روی پنج کارآزمایی ناهمگن، این فاصله صادقانه است. ```r metabin(ee, ne, ec, nc, data = d, sm = "RR", method.tau = "REML", method.random.ci = "HK") ``` HKSJ و درست‌نمایی نیمرخی عموماً از فاصله والد بهتر عمل می‌کنند، با این هشدارها: - **HKSJ برای پیامدهای دووجهی با رویدادهای نادر بهینه نیست.** - **با کمتر از پنج مطالعه با اندازه‌های نابرابر با احتیاط به کار ببرید.** - **برای $k$ بسیار کوچک، به‌ویژه $k = 2$، و $\tau^2$ کوچک، HKSJ بیش از حد محافظه‌کار است** و می‌تواند فاصله‌ای گسترده‌تر از گسترده‌ترین مطالعه بدهد. دست‌کم هفت راه هم برای ساختن فاصله اطمینان برای خود $\tau^2$ وجود دارد: HKSJ، درست‌نمایی نیمرخی، نوع والد، بیگراستاف-توییدی و جکسون، نیمرخ Q، بوت‌استرپ، و فاصله‌های باورپذیر بیزی. نیمرخ Q و درست‌نمایی نیمرخی توصیه‌های معمول‌اند. ## معیارهای اثر آماره خلاصه را **در پروتکل** و پیش از دیدن داده‌ها انتخاب کنید. این یکی از ساده‌ترین جاهایی است که تحلیل می‌تواند به سمت پاسخی که تحلیل‌گر انتظارش را داشته منحرف شود. ### پیامدهای دووجهی | معیار | نوع | نکته | |---|---|---| | نسبت خطر | نسبی | تفسیرش آسان است؛ وقتی خطر گروه شاهد صفر باشد تعریف‌نشده است | | نسبت شانس | نسبی | از نظر ریاضی راحت است؛ وقتی پیامد شایع باشد اثر را بزرگ‌نمایی می‌کند | | نسبت مخاطره | نسبی | از زمان تا رویداد استفاده می‌کند؛ کارآزمایی‌ها باید آن را گزارش کرده باشند | | تفاوت خطر | مطلق | به‌شدت به خطر پایه وابسته است، پس میان جمعیت‌ها بد منتقل می‌شود | | تعداد لازم برای درمان | مطلق | $1 / |RD|$؛ راهی برای ارائه تفاوت خطر است، نه تحلیلی جداگانه | با $$\text{risk} = \frac{\text{odds}}{1+\text{odds}}, \qquad \text{odds} = \frac{\text{risk}}{1-\text{risk}}$$ **روی مقیاس نسبی تجمیع کنید، روی مقیاس مطلق ارائه دهید.** اثرهای نسبی میان جمعیت‌ها یکنواخت‌ترند، پس بهتر تجمیع می‌شوند؛ اثرهای مطلق همان چیزی هستند که یک تصمیم به آن نیاز دارد. رویکرد استاندارد این است که نسبت خطر را تجمیع کنید و سپس آن را روی یک خطر پایه منتخب اعمال کنید تا اثر مطلق به دست آید، که دقیقاً همان کاری است که جدول خلاصه یافته‌های GRADE انجام می‌دهد. ### پیامدهای پیوسته | معیار | چه زمانی | |---|---| | **تفاوت میانگین** | همه مطالعات از یک ابزار و یک واحد استفاده کرده‌اند | | **تفاوت میانگین استانداردشده** | مطالعات یک سازه را با ابزارهای متفاوت اندازه‌گیری کرده‌اند | | **نسبت میانگین‌ها** | مطالعات واحدهای متفاوت به کار برده‌اند و پیامد صفر معناداری دارد | به‌محض اینکه مقیاس‌ها فرق کنند تفاوت میانگین نامناسب است، و این برای درد، عملکرد، کیفیت زندگی و افسردگی امری معمول است. تفاوت میانگین استانداردشده، تفاوت میانگین‌ها را نسبت به انحراف معیار بین‌فردی بیان می‌کند و همین ابزارهای متفاوت را قابل مقایسه می‌سازد، اما به بهایی: **نتیجه تجمیعی اکنون در واحد انحراف معیار است، که هیچ‌کس نمی‌تواند بر پایه آن عمل کند.** پیش از ارائه، آن را به واحدهای یک ابزار آشنا بازگردانید. و مراقب فرض زیربنایی باشید: اگر یک کارآزمایی جمعیتی باریک و دیگری جمعیتی گسترده جذب کرده باشد، انحراف معیارهایشان به دلایلی که هیچ ربطی به مداخله ندارد فرق می‌کند، و استانداردسازی بر پایه آن‌ها به جای حذف ناهمگنی، ناهمگنی وارد می‌کند. ## ارزیابی ناهمگنی در دوره مرور نظام‌مند به‌طور کامل پوشش داده شد؛ سه یادآوری که اینجا اهمیت دارند. **$Q$ آزمونی با توان پایین است وقتی $k$ کوچک است**، پس یک $Q$ غیرمعنادار روی پنج مطالعه شاهدی بر همگنی نیست. در مثال $p = 0.019$ بود، اما همان $I^2$ روی سه مطالعه به معناداری نمی‌رسید. **$I^2$ یک نسبت است، نه یک مقدار.** سهم تغییرپذیری کل است که به تفاوت‌های بین‌مطالعه‌ای نسبت داده می‌شود. با مطالعات بسیار دقیق، یک $\tau^2$ ناچیز می‌تواند $I^2$ بالایی بدهد؛ با مطالعات کم‌دقت، یک $\tau^2$ بزرگ می‌تواند $I^2$ پایینی بدهد. $\tau^2$ یا $\tau$ را در کنار آن گزارش کنید، روی مقیاس اثر، جایی که بتوان آن را با آنچه از نظر بالینی اهمیت دارد مقایسه کرد. **درباره ناهمگنی پیش از تجمیع تصمیم بگیرید، نه پس از آن.** انتخاب اثرات تصادفی به این دلیل که $I^2$ بالا درآمد، تصمیمی وابسته به داده است و چیزی نیست که هیچ‌کدام از دو مدل فرض می‌کنند. مدل باید از آنچه درباره مطالعات باور دارید نتیجه شود. ## چه چیزی را گزارش کنیم آن‌قدر که تحلیل‌گر دیگری بتواند عدد شما را دقیقاً بازتولید کند: - مدل، اثر ثابت یا اثرات تصادفی، **و چرا** - روش واریانس: عکس واریانس، مانتل-هنزل، پتو - برآوردگر $\tau^2$، با نام - روش فاصله، با نام - معیار اثر، و اینکه آیا از پیش تعیین شده بود - $\hat{\tau}^2$ یا $\hat{\tau}$، مقدار $Q$ با درجه آزادی و $p$ آن، و $I^2$ - فاصله پیش‌بینی هرگاه $\hat{\tau}^2 > 0$ باشد - نرم‌افزار و نسخه آن «یک فراتحلیل اثرات تصادفی انجام شد» یک روش نیست. توصیف خانواده‌ای از روش‌هاست که روی داده‌های بالا پاسخ‌هایی میان 0.66 و 0.83 با فاصله‌هایی از باریک تا بی‌نتیجه تولید می‌کنند. ## سنجش آموخته‌ها 1. پرسشی را که مدل اثر ثابت پاسخ می‌دهد و پرسشی را که مدل اثرات تصادفی پاسخ می‌دهد بیان کنید، و توضیح دهید چرا «اثرات تصادفی محافظه‌کارانه‌تر است» توصیف گمراه‌کننده‌ای از این تفاوت است. 2. در مثال حل‌شده، وزن کارآزمایی C با تغییر مدل از 49.4% به 28.0% می‌رسد. به‌صورت جبری توضیح دهید چرا افزودن $\tau^2$ به هر مخرج چنین اثری دارد. 3. یک فراتحلیل از 4 کارآزمایی، نسبت خطر اثرات تصادفی 0.62 با فاصله 95% از 0.44 تا 0.87 گزارش می‌کند و از دِرسیمونیان-لِرد و فاصله والد استفاده کرده است. دو نگرانی مشخص خود و دو تحلیلی را که درخواست می‌کنید نام ببرید. 4. توضیح دهید روش پتو چه زمانی مناسب است و دو موقعیت را نام ببرید که در آن‌ها گمراه‌کننده خواهد بود. 5. یک مرور، 9 کارآزمایی از یک برنامه توان‌بخشی را که با چهار مقیاس عملکرد متفاوت اندازه‌گیری شده‌اند تجمیع می‌کند و تفاوت میانگین استانداردشده 0.34 (فاصله 95% از 0.11 تا 0.57) گزارش می‌کند. جمله‌ای را که برای قابل‌فهم کردن این نتیجه برای یک پزشک اضافه می‌کنید بنویسید و بگویید به چه اطلاعات اضافی نیاز دارید. 6. یک تحلیل تجمیعی $I^2 = 0\%$ را روی 3 کارآزمایی کوچک گزارش می‌کند و نویسندگان نتیجه می‌گیرند مطالعات همگن‌اند. اشکال را بیان کنید. 7. فاصله اطمینان یک اثر تجمیعی 0.404 تا 1.085 و فاصله پیش‌بینی 0.241 تا 1.822 است. برای هر کدام یک جمله تفسیری بنویسید و بگویید کمیته دارویی یک بیمارستان باید کدام را بخواند. 8. مدل اثر ثابت را از پیش تعیین کرده بودید. داده‌ها با $I^2 = 78\%$ بازمی‌گردند. توصیف کنید چه می‌کنید و چه گزارش می‌کنید، و توضیح دهید چرا تغییر خاموش به اثرات تصادفی مشکل‌ساز است. ## مطالعه بیشتر - Veroniki AA, Jackson D, Viechtbauer W, et al. Methods to estimate the between-study variance and its uncertainty in meta-analysis. *Res Synth Methods*. 2016;7(1):55-79. - IntHout J, Ioannidis JPA, Borm GF. The Hartung-Knapp-Sidik-Jonkman method for random effects meta-analysis is straightforward and considerably outperforms the standard DerSimonian-Laird method. *BMC Med Res Methodol*. 2014;14:25. - Riley RD, Higgins JPT, Deeks JJ. Interpretation of random effects meta-analyses. *BMJ*. 2011;342:d549. - Langan D, Higgins JPT, Jackson D, et al. A comparison of heterogeneity variance estimators in simulated random-effects meta-analyses. *Res Synth Methods*. 2019;10(1):83-98. - Deeks JJ, Higgins JPT, Altman DG. Analysing data and undertaking meta-analyses. In: *Cochrane Handbook for Systematic Reviews of Interventions*. - Borenstein M, Hedges LV, Higgins JPT, Rothstein HR. *Introduction to Meta-Analysis*. Chapters 11 to 13.

اصطلاحات کلیدی

مدل اثر ثابتمدل اثرات تصادفیوزن‌دهی عکس واریانسمانتل-هنزلنسبت شانس پتوواریانس بین‌مطالعه‌ایدِرسیمونیان-لِردبیشینه درست‌نمایی محدودشدههارتونگ-کناپ-سیدیک-یونکمنفاصله پیش‌بینیتفاوت میانگین استانداردشدهنسبت میانگین‌ها