تفسیر نتایج و GRADE
یک برآورد تجمیعشده تا زمانی که ندانید چقدر باید به آن اعتماد کنید، پاسخ محسوب نمیشود. تبدیل اثرات نسبی به اثرات مطلق، و پنج حوزهای که اطمینان را کاهش میدهند و سه حوزهای که آن را افزایش میدهند.
پس از این درس شما قادر خواهید بود
- یک اثر نسبی را با استفاده از خطر پایه به یک اثر مطلق تبدیل کنید و توضیح دهید چرا این کار ضروری است.
- چهار سطح اطمینان را بیان کنید و معنای هر یک را توضیح دهید.
- توضیح دهید شواهد تصادفی و غیرتصادفی از کجا آغاز میشوند.
- پنج حوزهای را که میتوانند قطعیت را کاهش دهند، اعمال کنید.
- سه حوزهای را که میتوانند آن را افزایش دهند، اعمال کنید و بدانید چه زمانی باید از آنها استفاده کنید.
- به یک رتبه کلی قطعیت برای هر نتیجه دست یابید و آن را توجیه کنید.
- نتیجهگیریهایی بنویسید که با قطعیت شواهد مطابقت داشته باشند.
تفسیر نتایج و GRADE
ما کجا هستیم
نه گام یک مرور، از واحد 1: تعریف پرسش، برنامهریزی معیارهای واجد شرایط بودن، برنامهریزی روشها، جستجو، غربالگری، جمعآوری دادهها، ارزیابی خطر سوگیری، تحلیل و ارائه نتایج، و تفسیر نتایج و استنتاج.
آخرین مرحله GRADE است.
یک اثر نسبی پاسخ نیست.
مروری درباره محافظهای لگن برای پیشگیری از شکستگی لگن در سالمندان را در نظر بگیرید. شش کارآزمایی تصادفیشدهشدهشدهشدهشدهشده، 1,426 شرکتکننده، و نسبت خطر تلفیقشده 0.84 (فاصله اطمینان 95 درصد 0.52 تا 1.36).
این به خواننده چه میگوید؟ تقریباً هیچ چیز بهکارآمدی. تعیین اینکه بر سر مردم چه خواهد آمد، تنها با نگاه به یک اثر نسبی دشوار است.
آن را بر یک خطر پایه اعمال کنید. در جمعیتی با خطر 20% شکستگی لگن:
| خطر بدون محافظ لگن | خطر با محافظهای لگن | تفاوت | |
|---|---|---|---|
| به ازای هر 100 | 20 | 17 (از 10 تا 27) | 3 کمتر (از 10 کمتر تا 7 بیشتر) |
اعداد: ؛ محدودههای بازه و هستند.
اکنون میتوان بیان کرد:
شش کارآزمایی تصادفیشدهشدهشدهشدهشدهشده شامل 1,426 شرکتکننده اثر محافظ لگن را در برابر نبود آن بر شکستگی لگن گزارش کردند. نسبت خطر محاسبهشده 0.84 بود (فاصله اطمینان 95 درصد 0.52 تا 1.36). این یعنی در 100 نفر با خطر پایه 20 درصدی شکستگی لگن، هنگام استفاده از محافظ لگن ممکن است 3 نفر کمتر دچار شکستگی شوند (از 10 نفر کمتر تا 7 نفر بیشتر).
دو چیز اکنون دیده میشوند که قبلاً دیده نمیشدند:
- فایده مطلق اندک است: 3 شکستگی کمتر در هر 100 نفر.
- فاصله بین فواید و مضرات قرار دارد: از 10 مورد کمتر تا 7 مورد بیشتر. این مرور نشان نداده است که محافظهای لگن کمککننده هستند.
انتخاب یک خطر پایه
اثر نسبی از فراتحلیل بهدست میآید؛ خطر پایه باید از جایی تأمین شود و این انتخاب باید ذکر گردد.
گزینهها، به ترتیب تقریبی اولویت:
- میانگین خطر گروه کنترل در مطالعات واردشده، که معمولاً گزینهٔ پیشفرض است.
- یک برآورد خارجی از یک گروه نمونه، ثبت یا مطالعه پیشآگهی نماینده که در مواقعی که جمعیتهای آزمایشی غیرنماینده هستند، بهتر است.
- چندین خطر پایه که بهصورت ردیفهای جداگانه برای گروههای کمخطر، متوسطخطر و پرخطر ارائه شدهاند. این مفیدترین شکل ارائه است وقتی خطر پایه بهطور چشمگیری متفاوت باشد و نشان میدهد که یک اثر نسبی یکسان میتواند منافع مطلق بسیار متفاوتی ایجاد کند.
منبع خطر پایه را در پاورقی ذکر کنید. این انتخابی است که تیم بازبینی انجام میدهد و اعدادی را تعیین میکند که خواننده به خاطر خواهد سپرد.
آیا واقعاً باید به این باور داشته باشیم؟
پس از داشتن یک برآورد، پرسش بعدی این است که چه میزان اعتماد باید به آن داشت. این امر نیازمند معیارهایی است که بهطور سیستماتیک اعمال شوند. GRADE همان سیستم است.
GRADE قطعیت یک مجموعه شواهد را برای هر نتیجه ارزیابی میکند. نه برای هر مطالعه و نه یکبار برای مرور. یک مرور شامل شش نتیجه، شش رتبه قطعیت تولید میکند که با هم متفاوت خواهند بود.
چهار سطح
| سطح | معنی |
|---|---|
| بالا | ما اطمینان زیادی داریم که اثر واقعی به برآورد نزدیک است. |
| متوسط | ما تا حدی مطمئن هستیم: اثر واقعی احتمالاً به برآورد نزدیک است، اما این امکان وجود دارد که به طور قابل توجهی متفاوت باشد. |
| پایین | اطمینان ما محدود است: اثر واقعی ممکن است به طور قابل توجهی با برآورد متفاوت باشد. |
| بسیار کم | ما اطمینان بسیار کمی داریم: اثر واقعی احتمالاً به طور قابل توجهی با برآورد متفاوت خواهد بود. |
توجه کنید که این عبارتبندی درباره جایی است که اثر واقعی قرار دارد، نه درباره اینکه آیا مطالعات خوب بودند. کیفیت مطالعه یکی از ورودیهاست.
نقاط شروع
کارآزماییهای تصادفیشده از HIGH آغاز میشوند.
مطالعات مداخلهای غیرتصادفی از LOW آغاز میشوند، به دلیل وجود عوامل عامل مخدوشگر.
از آنجا، پنج دامنه میتوانند رتبهبندی را کاهش دهند و سه دامنه میتوانند آن را افزایش دهند.
رتبه A نمیتواند به کمتر از «بسیار کم» برسد و شواهد رصدی درجهبندیشده نمیتوانند از «بالا» فراتر روند.
پنج حوزهای که قطعیت را کاهش میدهند
هر یک با درجهی نه جدی، جدی (−1) یا بسیار جدی (−2) ارزیابی میشود.
1. خطر سوگیری
آیا مطالعات بهخوبی انجام نشدهاند؟
از ارزیابیهای واحدهای 5 و 6 استفاده میکند که در مطالعات مختلف مؤثر بر این نتیجه گردآوری شده و بر اساس سهمشان وزندهی شدهاند.
قضاوت مکانیکی نیست. بپرسید: اگر مطالعات با خطر بالای سوگیری حذف شوند، آیا برآورد تغییر خواهد کرد؟ تحلیل حساسیت از واحد 5 مستقیماً به این پرسش پاسخ میدهد و بهترین شواهد برای درجهبندی است.
- بیشتر وزن مطالعات با خطر پایین: جدی نیست.
- وزن قابلتوجهی از مطالعات با محدودیتهای جدی: −1.
- بیشتر وزن از مطالعات با محدودیتهای بسیار جدی: −2.
2. عدم ثبات
آیا نتایج در مطالعات مختلف با هم سازگار نیستند؟
چهار چیز هست که باید به آنها نگاه کرد، و هیچیک بهتنهایی تعیینکننده نیست:
- برآوردهای نقطهای با تغییرات گسترده
- همپوشانی حداقلی فواصل اطمینان
- آزمون Q با معنا از نظر آماری
- یک بالا
فقط بهخاطر بالا، نمره را پایین ندهید. همانطور که واحد 9 نشان داد، یک نسبت است، نه یک مقدار. عدمهمخوانی زمانی اهمیت دارد که برآوردها بهگونهای متفاوت باشند که به تصمیمات بالینی متفاوتی منجر شوند: برخی بالاتر و برخی پایینتر از آستانهای از اهمیت، یا برآوردهایی در دو سوی عدمتأثیر.
اگر ناهمگنی با یک تحلیل زیرگروه معتبر توضیح داده شود، بهجای کاهش نرخ، نرخ را بهطور جداگانه در هر زیرگروه مشخص کنید.
با یک مطالعهٔ واحد، هیچ ناسازگاریای برای ارزیابی وجود ندارد. به جای اینکه آن را غیرجدی ارزیابی کنید، همین را بگویید.
3. غیرمستقیم بودن
آیا نتایج واقعاً به پرسش من مربوط نمیشوند؟
چهار نوع:
- جمعیت: مطالعات افراد متفاوتی را نسبت به پرسشی که مطرح است، دربر میگیرند.
- مداخله: دوز، شکل یا روش تجویز متفاوت.
- مقایسهگر: وقتی پرسش مربوط به یک جایگزین فعال است، با دارونما مقایسه میشود.
- پیامد: یک جانشین به جای پیامدی که اهمیت دارد، یا ابزار یا نقطه زمانی متفاوت.
نوع پنجم: مقایسه غیرمستقیم، جایی که A و B هرگز بهطور مستقیم مقایسه نشدهاند و مقایسه از طریق یک معیار مشترک استنباط میشود. این اساس فراتحلیل شبکهای است که در دوره پیشرفته پوشش داده میشود و همواره تا حدی غیرمستقیم است.
نتایج جانشین شایعترین دلیل کاهش نمره بهخاطر غیرمستقیم بودن هستند و ارتباط آنها با دوره مبانی مستقیم است: مرور گزارشکننده اثر بر تراکم استخوان وقتی پرسش درباره شکستگیهاست، به پرسش پاسخ نداده است.
4. عدم دقت
آیا تعداد افراد خیلی کم است؟
حوزهای که بیشترین راهنماییهای صریح را دارد و اغلب بهاشتباه بهکار میرود.
حکم بر این است که آیا فاصله اطمینان از آستانهای در تصمیمگیری بالینی عبور میکند یا خیر:
- اگر بازه بهطور کامل در یک سمت آستانه قرار گیرد، بهطوریکه تصمیم در سراسر آن یکسان باشد، دقت کافی است.
- اگر فاصله از آستانه عبور کند، طوری که یک انتها به درمان و انتهای دیگر به عدم درمان منجر شود، نرخ را کاهش دهید.
همچنین اندازه اطلاعات بهینه را در نظر بگیرید: تعداد شرکتکنندگانی که یک کارآزمایی منفرد با توان کافی به آن نیاز دارد. اگر حجم نمونه کل در همه مطالعات کمتر از آن باشد، رتبه را پایین بیاورید، حتی وقتی فاصله باریک به نظر میرسد.
قواعد کلی برای اندازهٔ بهینهٔ اطلاعات حدود 400 رویداد برای نتایج دودویی و حدود 400 شرکتکننده برای نتایج پیوسته است، و اینها تخمین هستند، نه آستانهها.
برای مثال محافظ لگن: این بازه از 10 مورد شکستگی کمتر تا 7 مورد شکستگی بیشتر در هر 100 نفر متغیر است. فردی که تصمیم میگیرد محافظ لگن ببندد، در این دو انتها تصمیم متفاوتی خواهد گرفت. به دلیل عدم دقت، امتیاز را کاهش دهید.
به ساختار عمدی این حوزه توجه کنید: این حوزه نمیپرسد که آیا نتیجه از نظر آماری معنادار است. فاصلهای که نبود اثر را کنار میگذارد باز هم میتواند کمدقت باشد اگر از منفعت ناچیز تا منفعت مهم را در بر بگیرد، و فاصلهای که نبود اثر را در بر میگیرد میتواند دقیق باشد اگر هر اثر مهمی را در هر دو جهت کنار بگذارد.
5. سوگیری انتشار
آیا مطالعاتی را از دست میدهیم یا مطالعات منتشرشده گزینش شدهاند؟
به صورت شناسایینشده یا بهشدت مظنون (−1) رتبهبندی میشود.
نامتقارن بودن در عبارتبندی عمدی است: به ندرت میتوان سوگیری انتشار را نشان داد، بنابراین حالت پیشفرض «کشفنشده» است و شما تنها زمانی که دلیل موجهی برای شک به آن وجود دارد، امتیاز را کاهش میدهید.
دلایل سوءظن:
- نامتقارنی نمودار قیف، همراه با ملاحظات واحد 8 دربارهٔ سایر عواملی که آن را ایجاد میکنند.
- تمام مطالعات کوچک هستند و همگی توسط صنعت تأمین مالی شدهاند.
- آزمایشهای ثبتشده بدون نتایج منتشرشده
- مطالعات اندک، همگی مثبت
فقط به این دلیل که آزمون نمودار قیف انجام نشده است، نمره را پایین ندهید. وقتی تعداد مطالعات کمتر از ده است، نباید انجام میشد.
سه قلمرویی که یقین را افزایش میدهند
این موارد تنها برای شواهد مشاهدهای اعمال میشوند که قبلاً امتیازشان کاهش نیافته است. ارتقای سطح یک مجموعه شواهد با خطر جدی سوگیری مجاز نیست.
1. تأثیر بزرگ (+1 یا +2)
به نظر نمیرسد که تنها بهدلیل همبستگی گمراهکننده، اثر بزرگی ایجاد شود.
- +1 برای اثر نسبی حدود 2 یا 0.5، که در مطالعات مختلف ثابت باشد.
- +2 برای یک اثر نسبی در حدود 5 یا 0.2، بدون عوامل عامل مخدوشگر محتمل.
مثالهای کلاسیک مداخلاتی هستند که در آنها هیچ کارآزمایی وجود ندارد و هیچکس در مورد اثرشان تردید ندارد: تعویض مفصل ران برای آرتروز، انسولین برای دیابت نوع 1، چتر نجات.
2. شیب دوز-پاسخ (+1)
یک شیب اثر ثابت با افزایش مواجهه، از علیت حمایت میکند، همانطور که در ملاحظات برادفورد هیل در دوره مبانی مطرح شده است.
3. مخالفت با سنتز محتمل (+1)
تمام مداخلههای احتمالی میتوانستند اثر مشاهدهشده را کاهش دهند، اما با این حال اثری دیده شد. بنابراین احتمالاً اثر واقعی بزرگتر از برآوردشده است.
همچنین زمانی که مداخله متغیرهای عامل مخدوشگر میتوانست اثر کاذب ایجاد کند و هیچ اثری یافت نشد، نیز صدق میکند.
رتبهبندی در عمل
یک ساختار کارشده که در GRADEpro و در پروفایل شواهد استاندارد استفاده میشود:
| دامنه | امتیاز |
|---|---|
| خطر سوگیری | غیرجدی / جدی (−1) / بسیار جدی (−2) |
| نبود سازگاری | غیرجدی / جدی (−1) / بسیار جدی (−2) |
| غیرمستقیم بودن | غیرجدی / جدی (−1) / بسیار جدی (−2) |
| دقت نداشتن | غیرجدی / جدی (−1) / بسیار جدی (−2) |
| تفاوتانگاری در انتشار | تشخیص داده نشده / به شدت مشکوک (−1) |
| ارتقا | اثر بزرگ (+1 یا +2) / پاسخ دوز (+1) / مداخله متضاد (+1) |
| قطعیت | بالا / متوسط / پایین / بسیار پایین |
پانوشتهایی که هر داوری را توضیح میدهند الزامیاند. رتبهای بدون استدلالش ارزیابیپذیر نیست، و داوران مرور شما آن را خواهند خواست. پانوشت باید بگوید چه چیزی مشاهده شد و چه داوریای از آن برآمد، برای نمونه: «یک سطح برای عدم دقت پایین آورده شد: فاصله اطمینان 95 درصد هم منفعتی مهم (10 نفر کمتر در هر 100 نفر) و هم آسیبی مهم (7 نفر بیشتر در هر 100 نفر) را در بر میگیرد.»
برای مثال محافظ لگن
- خطر سوگیری: به شش کارآزمایی بستگی دارد؛ کورسازی غیرممکن است و شکستگی یک نتیجه نسبتاً عینی است، بنابراین احتمالاً برای حوزههای مرتبط با پایبندی جدی است.
- عدم ثبات: بستگی به نمودار جنگلی دارد.
- غیرمستقیم بودن: در صورتی که جمعیت و نتیجه با پرسش مطابقت داشته باشند، جدی نیست.
- عدم دقت: جدی، به دلیل دلیل ذکر شده در بالا.
- تحریف انتشار: شناسایینشده، با تنها شش مطالعه.
با درجهبندی اولیه در سطح بالا و کاهش آن بهخاطر عدمدقت و احتمال خطر سوگیری، اطمینان پایینی بهدست میآید. نتیجهگیری باید چنین باشد: «محافظهای لگن ممکن است منجر به کاهش اندکی در شکستگیهای لگن شوند» و نه «محافظهای لگن شکستگیهای لگن را کاهش میدهند.»
مطابقت زبان با یقین
GRADE عبارتهای استاندارد را ارائه میدهد و استفادهٔ یکسان از آنها باعث خوانایی جدول خلاصهٔ یافتهها میشود.
| قطعیت | واژهپردازی |
|---|---|
| بالا | «X منجر به ... میشود» / «X کاهش میدهد ...» |
| متوسط | ایکس احتمالاً منجر به ... میشود. ایکس احتمالاً ... را کاهش میدهد. |
| پایین | «X ممکن است منجر به ... شود.» / «X ممکن است ... را کاهش دهد.» |
| بسیار کم | شواهد دربارهٔ تأثیر X بسیار نامطمئن است. |
دو قاعده زیر:
هرگز نتیجهای را با اطمینانی بیش از آنچه شواهد ایجاب میکند بیان نکنید. «محافظهای لگن شکستگیها را کاهش میدهند» بر اساس شواهد کماطمینان، یک بیان نادرست است، نه یک ترجیح سبک نگارشی.
اطمینان بسیار پایین به این معناست که شما نمیدانید. بیان درست این است که شواهد بسیار نامطمئن هستند، نه اینکه مداخله مؤثر نیست. عدم وجود شواهد، دلیلی بر عدم وجود نیست و این همان جایی است که مرورها اغلب از حد خود فراتر میروند.
خطاهای رایج
- امتیازدهی بر اساس هر بازخورد به جای هر نتیجه.
- دو بار کاهش رتبه بهخاطر یک مشکل مشابه، برای مثال، شمردن یک نتیجهٔ ذهنی بدون کورسازی تحت هر دو مؤلفهٔ خطر سوگیری و غیرمستقیم بودن.
- کاهش امتیاز برای یک بالا بدون پرسیدن اینکه آیا این تفاوتها از نظر بالینی مهم هستند یا خیر.
- در نظر گرفتن عدم دقت بهعنوان معناداری آماری.
- بالا دادن امتیاز شواهد مشاهداتی که قبلاً امتیازشان پایین آمده است.
- حذف پاورقیها، که هر رأی را غیرقابل حسابرسی میکند.
- استنتاج «عدم تأثیر» از شواهد کمقطعیت با فاصله اطمینان گسترده.
بعد چه کنیم؟
- شما باید بخش روشهای نقد خود را تدوین کرده باشید.
- شما باید دادههای خود را در نرمافزار فراتحلیل وارد کرده و آن را تأیید میکردید.
- شما باید فراتحلیلها، از جمله تحلیلهای زیرگروهی و حساسیت را بررسی کرده باشید.
- GRADE را به هر یک از نتایج حیاتی و مهم خود اعمال کنید.
درک خود را بررسی کنید
- یک مرور گزارش میدهد که نسبت خطر استانداردشده وزنی (RR) ترکیبی برابر با 0.72 (0.55 تا 0.94) برای نتیجهای با خطر کنترلشده 8% است. اثر مطلق را به ازای هر 1000 نفر همراه با فاصله اطمینان آن محاسبه کنید و یک جمله ساده به زبان plain-language بنویسید.
- توضیح دهید چرا تنها یک اثر نسبی برای اتخاذ تصمیم کافی نیست و شرح دهید چه زمانی بیش از یک خطر پایه ارائه خواهید داد.
- مجموعهای از شواهد مقدار را نشان میدهد، اما برآورد هر مطالعه بین RR 0.60 و RR 0.75 قرار دارد. آیا به دلیل عدمهمخوانی نمره منفی میدهید؟ توجیه کنید.
- یک بررسی دارو اثر آن بر HbA1c را گزارش میکند وقتی پرسش مربوط به عوارض دیابت است. حوزه را نام ببرید، رتبه را بیان کنید و پاورقی را بنویسید.
- میانگین ترکیبی RR برابر 0.88 (0.79 تا 0.98) است، بر اساس 12,000 شرکتکننده و 900 رویداد. آیا این برآورد imprecise است؟ دلیل خود را بهجای استفاده از سطح معناداری، بر اساس آستانههای تصمیمگیری توضیح دهید.
- توضیح دهید چرا عدم دقت با عدم معناداری آماری یکسان نیست و مثالی از یک نتیجه معنادار اما غیر دقیق و یک نتیجه غیر معنادار اما دقیق ارائه دهید.
- یک مطالعهٔ گروهی مداخلهای خطر نسبی 0.15 را نشان میدهد که در پنج مطالعه سازگار است و هیچ متغیر مخدوشی معقولی که بتواند آن را ایجاد کند وجود ندارد. مسیر امتیازدهی GRADE را از نقطهٔ شروع توصیف کنید.
- این نتیجهگیری را طوری بازنویسی کنید که با شواهد کمقطعیت مطابقت داشته باشد: «مصرف مکمل ویتامین D خطر زمینخوردن در سالمندان را کاهش میدهد.»
مطالعه بیشتر
- Guyatt G et al. Users' Guides to the Medical Literature, 3rd ed., Chapter 23.
- The GRADE guidelines series in the Journal of Clinical Epidemiology, particularly guidelines 1 to 9.
- Guyatt G, Oxman AD, Kunz R, et al. GRADE guidelines 6. Rating the quality of evidence: imprecision. J Clin Epidemiol. 2011;64:1283-1293.
- Guyatt GH, Oxman AD, Sultan S, et al. GRADE guidelines: 9. Rating up the quality of evidence. J Clin Epidemiol. 2011;64(12):1311-1316.
- Santesso N, Carrasco-Labra A, Brignardello-Petersen R, et al. Hip protectors for preventing hip fractures in older people. Cochrane Database Syst Rev. 2014;(3):CD001255.
- The GRADE Handbook, at gdt.gradepro.org.