روش‌های مرور نظام‌مند
واحد 10·50 دقیقه

تفسیر نتایج و GRADE

یک برآورد تجمیع‌شده تا زمانی که ندانید چقدر باید به آن اعتماد کنید، پاسخ محسوب نمی‌شود. تبدیل اثرات نسبی به اثرات مطلق، و پنج حوزه‌ای که اطمینان را کاهش می‌دهند و سه حوزه‌ای که آن را افزایش می‌دهند.

پس از این درس شما قادر خواهید بود

  • یک اثر نسبی را با استفاده از خطر پایه به یک اثر مطلق تبدیل کنید و توضیح دهید چرا این کار ضروری است.
  • چهار سطح اطمینان را بیان کنید و معنای هر یک را توضیح دهید.
  • توضیح دهید شواهد تصادفی و غیرتصادفی از کجا آغاز می‌شوند.
  • پنج حوزه‌ای را که می‌توانند قطعیت را کاهش دهند، اعمال کنید.
  • سه حوزه‌ای را که می‌توانند آن را افزایش دهند، اعمال کنید و بدانید چه زمانی باید از آن‌ها استفاده کنید.
  • به یک رتبه کلی قطعیت برای هر نتیجه دست یابید و آن را توجیه کنید.
  • نتیجه‌گیری‌هایی بنویسید که با قطعیت شواهد مطابقت داشته باشند.

تفسیر نتایج و GRADE

ما کجا هستیم

نه گام یک مرور، از واحد 1: تعریف پرسش، برنامه‌ریزی معیارهای واجد شرایط بودن، برنامه‌ریزی روش‌ها، جستجو، غربالگری، جمع‌آوری داده‌ها، ارزیابی خطر سوگیری، تحلیل و ارائه نتایج، و تفسیر نتایج و استنتاج.

آخرین مرحله GRADE است.

یک اثر نسبی پاسخ نیست.

مروری درباره محافظ‌های لگن برای پیشگیری از شکستگی لگن در سالمندان را در نظر بگیرید. شش کارآزمایی تصادفی‌شده‌شده‌شده‌شده‌شده‌شده، 1,426 شرکت‌کننده، و نسبت خطر تلفیق‌شده 0.84 (فاصله اطمینان 95 درصد 0.52 تا 1.36).

این به خواننده چه می‌گوید؟ تقریباً هیچ چیز به‌کارآمدی. تعیین اینکه بر سر مردم چه خواهد آمد، تنها با نگاه به یک اثر نسبی دشوار است.

آن را بر یک خطر پایه اعمال کنید. در جمعیتی با خطر 20% شکستگی لگن:

خطر بدون محافظ لگن خطر با محافظ‌های لگن تفاوت
به ازای هر 100 20 17 (از 10 تا 27) 3 کمتر (از 10 کمتر تا 7 بیشتر)

اعداد: 20×0.84=16.81720 \times 0.84 = 16.8 \approx 17؛ محدوده‌های بازه 20×0.52=10.420 \times 0.52 = 10.4 و 20×1.36=27.220 \times 1.36 = 27.2 هستند.

اکنون می‌توان بیان کرد:

شش کارآزمایی تصادفی‌شده‌شده‌شده‌شده‌شده‌شده شامل 1,426 شرکت‌کننده اثر محافظ لگن را در برابر نبود آن بر شکستگی لگن گزارش کردند. نسبت خطر محاسبه‌شده 0.84 بود (فاصله اطمینان 95 درصد 0.52 تا 1.36). این یعنی در 100 نفر با خطر پایه 20 درصدی شکستگی لگن، هنگام استفاده از محافظ لگن ممکن است 3 نفر کمتر دچار شکستگی شوند (از 10 نفر کمتر تا 7 نفر بیشتر).

دو چیز اکنون دیده می‌شوند که قبلاً دیده نمی‌شدند:

  • فایده مطلق اندک است: 3 شکستگی کمتر در هر 100 نفر.
  • فاصله بین فواید و مضرات قرار دارد: از 10 مورد کمتر تا 7 مورد بیشتر. این مرور نشان نداده است که محافظ‌های لگن کمک‌کننده هستند.

انتخاب یک خطر پایه

اثر نسبی از فراتحلیل به‌دست می‌آید؛ خطر پایه باید از جایی تأمین شود و این انتخاب باید ذکر گردد.

گزینه‌ها، به ترتیب تقریبی اولویت:

  1. میانگین خطر گروه کنترل در مطالعات واردشده، که معمولاً گزینهٔ پیش‌فرض است.
  2. یک برآورد خارجی از یک گروه نمونه، ثبت یا مطالعه پیش‌آگهی نماینده که در مواقعی که جمعیت‌های آزمایشی غیرنماینده هستند، بهتر است.
  3. چندین خطر پایه که به‌صورت ردیف‌های جداگانه برای گروه‌های کم‌خطر، متوسط‌خطر و پرخطر ارائه شده‌اند. این مفیدترین شکل ارائه است وقتی خطر پایه به‌طور چشمگیری متفاوت باشد و نشان می‌دهد که یک اثر نسبی یکسان می‌تواند منافع مطلق بسیار متفاوتی ایجاد کند.

منبع خطر پایه را در پاورقی ذکر کنید. این انتخابی است که تیم بازبینی انجام می‌دهد و اعدادی را تعیین می‌کند که خواننده به خاطر خواهد سپرد.

آیا واقعاً باید به این باور داشته باشیم؟

پس از داشتن یک برآورد، پرسش بعدی این است که چه میزان اعتماد باید به آن داشت. این امر نیازمند معیارهایی است که به‌طور سیستماتیک اعمال شوند. GRADE همان سیستم است.

GRADE قطعیت یک مجموعه شواهد را برای هر نتیجه ارزیابی می‌کند. نه برای هر مطالعه و نه یک‌بار برای مرور. یک مرور شامل شش نتیجه، شش رتبه قطعیت تولید می‌کند که با هم متفاوت خواهند بود.

چهار سطح

سطح معنی
بالا ما اطمینان زیادی داریم که اثر واقعی به برآورد نزدیک است.
متوسط ما تا حدی مطمئن هستیم: اثر واقعی احتمالاً به برآورد نزدیک است، اما این امکان وجود دارد که به طور قابل توجهی متفاوت باشد.
پایین اطمینان ما محدود است: اثر واقعی ممکن است به طور قابل توجهی با برآورد متفاوت باشد.
بسیار کم ما اطمینان بسیار کمی داریم: اثر واقعی احتمالاً به طور قابل توجهی با برآورد متفاوت خواهد بود.

توجه کنید که این عبارت‌بندی درباره جایی است که اثر واقعی قرار دارد، نه درباره اینکه آیا مطالعات خوب بودند. کیفیت مطالعه یکی از ورودی‌هاست.

نقاط شروع

کارآزمایی‌های تصادفی‌شده از HIGH آغاز می‌شوند.

مطالعات مداخله‌ای غیرتصادفی از LOW آغاز می‌شوند، به دلیل وجود عوامل عامل مخدوش‌گر.

از آنجا، پنج دامنه می‌توانند رتبه‌بندی را کاهش دهند و سه دامنه می‌توانند آن را افزایش دهند.

رتبه A نمی‌تواند به کمتر از «بسیار کم» برسد و شواهد رصدی درجه‌بندی‌شده نمی‌توانند از «بالا» فراتر روند.

پنج حوزه‌ای که قطعیت را کاهش می‌دهند

هر یک با درجه‌ی نه جدی، جدی (−1) یا بسیار جدی (−2) ارزیابی می‌شود.

1. خطر سوگیری

آیا مطالعات به‌خوبی انجام نشده‌اند؟

از ارزیابی‌های واحدهای 5 و 6 استفاده می‌کند که در مطالعات مختلف مؤثر بر این نتیجه گردآوری شده و بر اساس سهمشان وزن‌دهی شده‌اند.

قضاوت مکانیکی نیست. بپرسید: اگر مطالعات با خطر بالای سوگیری حذف شوند، آیا برآورد تغییر خواهد کرد؟ تحلیل حساسیت از واحد 5 مستقیماً به این پرسش پاسخ می‌دهد و بهترین شواهد برای درجه‌بندی است.

  • بیشتر وزن مطالعات با خطر پایین: جدی نیست.
  • وزن قابل‌توجهی از مطالعات با محدودیت‌های جدی: −1.
  • بیشتر وزن از مطالعات با محدودیت‌های بسیار جدی: −2.

2. عدم ثبات

آیا نتایج در مطالعات مختلف با هم سازگار نیستند؟

چهار چیز هست که باید به آن‌ها نگاه کرد، و هیچ‌یک به‌تنهایی تعیین‌کننده نیست:

  • برآوردهای نقطه‌ای با تغییرات گسترده
  • همپوشانی حداقلی فواصل اطمینان
  • آزمون Q با معنا از نظر آماری
  • یک I2I^2 بالا

فقط به‌خاطر I2I^2 بالا، نمره را پایین ندهید. همان‌طور که واحد 9 نشان داد، I2I^2 یک نسبت است، نه یک مقدار. عدم‌همخوانی زمانی اهمیت دارد که برآوردها به‌گونه‌ای متفاوت باشند که به تصمیمات بالینی متفاوتی منجر شوند: برخی بالاتر و برخی پایین‌تر از آستانه‌ای از اهمیت، یا برآوردهایی در دو سوی عدم‌تأثیر.

اگر ناهمگنی با یک تحلیل زیرگروه معتبر توضیح داده شود، به‌جای کاهش نرخ، نرخ را به‌طور جداگانه در هر زیرگروه مشخص کنید.

با یک مطالعهٔ واحد، هیچ ناسازگاری‌ای برای ارزیابی وجود ندارد. به جای اینکه آن را غیرجدی ارزیابی کنید، همین را بگویید.

3. غیرمستقیم بودن

آیا نتایج واقعاً به پرسش من مربوط نمی‌شوند؟

چهار نوع:

  • جمعیت: مطالعات افراد متفاوتی را نسبت به پرسشی که مطرح است، دربر می‌گیرند.
  • مداخله: دوز، شکل یا روش تجویز متفاوت.
  • مقایسه‌گر: وقتی پرسش مربوط به یک جایگزین فعال است، با دارونما مقایسه می‌شود.
  • پیامد: یک جانشین به جای پیامدی که اهمیت دارد، یا ابزار یا نقطه زمانی متفاوت.

نوع پنجم: مقایسه غیرمستقیم، جایی که A و B هرگز به‌طور مستقیم مقایسه نشده‌اند و مقایسه از طریق یک معیار مشترک استنباط می‌شود. این اساس فراتحلیل شبکه‌ای است که در دوره پیشرفته پوشش داده می‌شود و همواره تا حدی غیرمستقیم است.

نتایج جانشین شایع‌ترین دلیل کاهش نمره به‌خاطر غیرمستقیم بودن هستند و ارتباط آن‌ها با دوره مبانی مستقیم است: مرور گزارش‌کننده اثر بر تراکم استخوان وقتی پرسش درباره شکستگی‌هاست، به پرسش پاسخ نداده است.

4. عدم دقت

آیا تعداد افراد خیلی کم است؟

حوزه‌ای که بیشترین راهنمایی‌های صریح را دارد و اغلب به‌اشتباه به‌کار می‌رود.

حکم بر این است که آیا فاصله اطمینان از آستانه‌ای در تصمیم‌گیری بالینی عبور می‌کند یا خیر:

  • اگر بازه به‌طور کامل در یک سمت آستانه قرار گیرد، به‌طوری‌که تصمیم در سراسر آن یکسان باشد، دقت کافی است.
  • اگر فاصله از آستانه عبور کند، طوری که یک انتها به درمان و انتهای دیگر به عدم درمان منجر شود، نرخ را کاهش دهید.

همچنین اندازه اطلاعات بهینه را در نظر بگیرید: تعداد شرکت‌کنندگانی که یک کارآزمایی منفرد با توان کافی به آن نیاز دارد. اگر حجم نمونه کل در همه مطالعات کمتر از آن باشد، رتبه را پایین بیاورید، حتی وقتی فاصله باریک به نظر می‌رسد.

قواعد کلی برای اندازهٔ بهینهٔ اطلاعات حدود 400 رویداد برای نتایج دودویی و حدود 400 شرکت‌کننده برای نتایج پیوسته است، و این‌ها تخمین هستند، نه آستانه‌ها.

برای مثال محافظ لگن: این بازه از 10 مورد شکستگی کمتر تا 7 مورد شکستگی بیشتر در هر 100 نفر متغیر است. فردی که تصمیم می‌گیرد محافظ لگن ببندد، در این دو انتها تصمیم متفاوتی خواهد گرفت. به دلیل عدم دقت، امتیاز را کاهش دهید.

به ساختار عمدی این حوزه توجه کنید: این حوزه نمی‌پرسد که آیا نتیجه از نظر آماری معنادار است. فاصله‌ای که نبود اثر را کنار می‌گذارد باز هم می‌تواند کم‌دقت باشد اگر از منفعت ناچیز تا منفعت مهم را در بر بگیرد، و فاصله‌ای که نبود اثر را در بر می‌گیرد می‌تواند دقیق باشد اگر هر اثر مهمی را در هر دو جهت کنار بگذارد.

5. سوگیری انتشار

آیا مطالعاتی را از دست می‌دهیم یا مطالعات منتشرشده گزینش شده‌اند؟

به صورت شناسایی‌نشده یا به‌شدت مظنون (−1) رتبه‌بندی می‌شود.

نامتقارن بودن در عبارت‌بندی عمدی است: به ندرت می‌توان سوگیری انتشار را نشان داد، بنابراین حالت پیش‌فرض «کشف‌نشده» است و شما تنها زمانی که دلیل موجهی برای شک به آن وجود دارد، امتیاز را کاهش می‌دهید.

دلایل سوءظن:

  • نامتقارنی نمودار قیف، همراه با ملاحظات واحد 8 دربارهٔ سایر عواملی که آن را ایجاد می‌کنند.
  • تمام مطالعات کوچک هستند و همگی توسط صنعت تأمین مالی شده‌اند.
  • آزمایش‌های ثبت‌شده بدون نتایج منتشرشده
  • مطالعات اندک، همگی مثبت

فقط به این دلیل که آزمون نمودار قیف انجام نشده است، نمره را پایین ندهید. وقتی تعداد مطالعات کمتر از ده است، نباید انجام می‌شد.

سه قلمرویی که یقین را افزایش می‌دهند

این موارد تنها برای شواهد مشاهده‌ای اعمال می‌شوند که قبلاً امتیازشان کاهش نیافته است. ارتقای سطح یک مجموعه شواهد با خطر جدی سوگیری مجاز نیست.

1. تأثیر بزرگ (+1 یا +2)

به نظر نمی‌رسد که تنها به‌دلیل همبستگی گمراه‌کننده، اثر بزرگی ایجاد شود.

  • +1 برای اثر نسبی حدود 2 یا 0.5، که در مطالعات مختلف ثابت باشد.
  • +2 برای یک اثر نسبی در حدود 5 یا 0.2، بدون عوامل عامل مخدوش‌گر محتمل.

مثال‌های کلاسیک مداخلاتی هستند که در آن‌ها هیچ کارآزمایی وجود ندارد و هیچ‌کس در مورد اثرشان تردید ندارد: تعویض مفصل ران برای آرتروز، انسولین برای دیابت نوع 1، چتر نجات.

2. شیب دوز-پاسخ (+1)

یک شیب اثر ثابت با افزایش مواجهه، از علیت حمایت می‌کند، همان‌طور که در ملاحظات برادفورد هیل در دوره مبانی مطرح شده است.

3. مخالفت با سنتز محتمل (+1)

تمام مداخله‌های احتمالی می‌توانستند اثر مشاهده‌شده را کاهش دهند، اما با این حال اثری دیده شد. بنابراین احتمالاً اثر واقعی بزرگ‌تر از برآوردشده است.

همچنین زمانی که مداخله متغیرهای عامل مخدوش‌گر می‌توانست اثر کاذب ایجاد کند و هیچ اثری یافت نشد، نیز صدق می‌کند.

رتبه‌بندی در عمل

یک ساختار کارشده که در GRADEpro و در پروفایل شواهد استاندارد استفاده می‌شود:

دامنه امتیاز
خطر سوگیری غیرجدی / جدی (−1) / بسیار جدی (−2)
نبود سازگاری غیرجدی / جدی (−1) / بسیار جدی (−2)
غیرمستقیم بودن غیرجدی / جدی (−1) / بسیار جدی (−2)
دقت نداشتن غیرجدی / جدی (−1) / بسیار جدی (−2)
تفاوت‌انگاری در انتشار تشخیص داده نشده / به شدت مشکوک (−1)
ارتقا اثر بزرگ (+1 یا +2) / پاسخ دوز (+1) / مداخله متضاد (+1)
قطعیت بالا / متوسط / پایین / بسیار پایین

پانوشت‌هایی که هر داوری را توضیح می‌دهند الزامی‌اند. رتبه‌ای بدون استدلالش ارزیابی‌پذیر نیست، و داوران مرور شما آن را خواهند خواست. پانوشت باید بگوید چه چیزی مشاهده شد و چه داوری‌ای از آن برآمد، برای نمونه: «یک سطح برای عدم دقت پایین آورده شد: فاصله اطمینان 95 درصد هم منفعتی مهم (10 نفر کمتر در هر 100 نفر) و هم آسیبی مهم (7 نفر بیشتر در هر 100 نفر) را در بر می‌گیرد.»

برای مثال محافظ لگن

  • خطر سوگیری: به شش کارآزمایی بستگی دارد؛ کورسازی غیرممکن است و شکستگی یک نتیجه نسبتاً عینی است، بنابراین احتمالاً برای حوزه‌های مرتبط با پایبندی جدی است.
  • عدم ثبات: بستگی به نمودار جنگلی دارد.
  • غیرمستقیم بودن: در صورتی که جمعیت و نتیجه با پرسش مطابقت داشته باشند، جدی نیست.
  • عدم دقت: جدی، به دلیل دلیل ذکر شده در بالا.
  • تحریف انتشار: شناسایی‌نشده، با تنها شش مطالعه.

با درجه‌بندی اولیه در سطح بالا و کاهش آن به‌خاطر عدم‌دقت و احتمال خطر سوگیری، اطمینان پایینی به‌دست می‌آید. نتیجه‌گیری باید چنین باشد: «محافظ‌های لگن ممکن است منجر به کاهش اندکی در شکستگی‌های لگن شوند» و نه «محافظ‌های لگن شکستگی‌های لگن را کاهش می‌دهند.»

مطابقت زبان با یقین

GRADE عبارت‌های استاندارد را ارائه می‌دهد و استفادهٔ یکسان از آن‌ها باعث خوانایی جدول خلاصهٔ یافته‌ها می‌شود.

قطعیت واژه‌پردازی
بالا «X منجر به ... می‌شود» / «X کاهش می‌دهد ...»
متوسط ایکس احتمالاً منجر به ... می‌شود. ایکس احتمالاً ... را کاهش می‌دهد.
پایین «X ممکن است منجر به ... شود.» / «X ممکن است ... را کاهش دهد.»
بسیار کم شواهد دربارهٔ تأثیر X بسیار نامطمئن است.

دو قاعده زیر:

هرگز نتیجه‌ای را با اطمینانی بیش از آنچه شواهد ایجاب می‌کند بیان نکنید. «محافظ‌های لگن شکستگی‌ها را کاهش می‌دهند» بر اساس شواهد کم‌اطمینان، یک بیان نادرست است، نه یک ترجیح سبک نگارشی.

اطمینان بسیار پایین به این معناست که شما نمی‌دانید. بیان درست این است که شواهد بسیار نامطمئن هستند، نه اینکه مداخله مؤثر نیست. عدم وجود شواهد، دلیلی بر عدم وجود نیست و این همان جایی است که مرورها اغلب از حد خود فراتر می‌روند.

خطاهای رایج

  • امتیازدهی بر اساس هر بازخورد به جای هر نتیجه.
  • دو بار کاهش رتبه به‌خاطر یک مشکل مشابه، برای مثال، شمردن یک نتیجهٔ ذهنی بدون کورسازی تحت هر دو مؤلفهٔ خطر سوگیری و غیرمستقیم بودن.
  • کاهش امتیاز برای یک I2I^2 بالا بدون پرسیدن اینکه آیا این تفاوت‌ها از نظر بالینی مهم هستند یا خیر.
  • در نظر گرفتن عدم دقت به‌عنوان معناداری آماری.
  • بالا دادن امتیاز شواهد مشاهداتی که قبلاً امتیازشان پایین آمده است.
  • حذف پاورقی‌ها، که هر رأی را غیرقابل حسابرسی می‌کند.
  • استنتاج «عدم تأثیر» از شواهد کم‌قطعیت با فاصله اطمینان گسترده.

بعد چه کنیم؟

  1. شما باید بخش روش‌های نقد خود را تدوین کرده باشید.
  2. شما باید داده‌های خود را در نرم‌افزار فراتحلیل وارد کرده و آن را تأیید می‌کردید.
  3. شما باید فراتحلیلها، از جمله تحلیل‌های زیرگروهی و حساسیت را بررسی کرده باشید.
  4. GRADE را به هر یک از نتایج حیاتی و مهم خود اعمال کنید.

درک خود را بررسی کنید

  1. یک مرور گزارش می‌دهد که نسبت خطر استانداردشده وزنی (RR) ترکیبی برابر با 0.72 (0.55 تا 0.94) برای نتیجه‌ای با خطر کنترل‌شده 8% است. اثر مطلق را به ازای هر 1000 نفر همراه با فاصله اطمینان آن محاسبه کنید و یک جمله ساده به زبان plain-language بنویسید.
  2. توضیح دهید چرا تنها یک اثر نسبی برای اتخاذ تصمیم کافی نیست و شرح دهید چه زمانی بیش از یک خطر پایه ارائه خواهید داد.
  3. مجموعه‌ای از شواهد مقدار I2=78%I^2 = 78\% را نشان می‌دهد، اما برآورد هر مطالعه بین RR 0.60 و RR 0.75 قرار دارد. آیا به دلیل عدم‌همخوانی نمره منفی می‌دهید؟ توجیه کنید.
  4. یک بررسی دارو اثر آن بر HbA1c را گزارش می‌کند وقتی پرسش مربوط به عوارض دیابت است. حوزه را نام ببرید، رتبه را بیان کنید و پاورقی را بنویسید.
  5. میانگین ترکیبی RR برابر 0.88 (0.79 تا 0.98) است، بر اساس 12,000 شرکت‌کننده و 900 رویداد. آیا این برآورد imprecise است؟ دلیل خود را به‌جای استفاده از سطح معناداری، بر اساس آستانه‌های تصمیم‌گیری توضیح دهید.
  6. توضیح دهید چرا عدم دقت با عدم معناداری آماری یکسان نیست و مثالی از یک نتیجه معنادار اما غیر دقیق و یک نتیجه غیر معنادار اما دقیق ارائه دهید.
  7. یک مطالعهٔ گروهی مداخله‌ای خطر نسبی 0.15 را نشان می‌دهد که در پنج مطالعه سازگار است و هیچ متغیر مخدوشی معقولی که بتواند آن را ایجاد کند وجود ندارد. مسیر امتیازدهی GRADE را از نقطهٔ شروع توصیف کنید.
  8. این نتیجه‌گیری را طوری بازنویسی کنید که با شواهد کم‌قطعیت مطابقت داشته باشد: «مصرف مکمل ویتامین D خطر زمین‌خوردن در سالمندان را کاهش می‌دهد.»

مطالعه بیشتر

  • Guyatt G et al. Users' Guides to the Medical Literature, 3rd ed., Chapter 23.
  • The GRADE guidelines series in the Journal of Clinical Epidemiology, particularly guidelines 1 to 9.
  • Guyatt G, Oxman AD, Kunz R, et al. GRADE guidelines 6. Rating the quality of evidence: imprecision. J Clin Epidemiol. 2011;64:1283-1293.
  • Guyatt GH, Oxman AD, Sultan S, et al. GRADE guidelines: 9. Rating up the quality of evidence. J Clin Epidemiol. 2011;64(12):1311-1316.
  • Santesso N, Carrasco-Labra A, Brignardello-Petersen R, et al. Hip protectors for preventing hip fractures in older people. Cochrane Database Syst Rev. 2014;(3):CD001255.
  • The GRADE Handbook, at gdt.gradepro.org.

اصطلاحات کلیدی

GRADEقطعیت مدرکخط‌مقدم خطراثر مطلقخطر سوگیریناسازگاریغیرمستقیم بودنبی‌دقتیتفاوت در انتشارتأثیر بزرگدُز-پاسخمخالف هم‌آمیختگی