ارزیابی دقت آزمون تشخیصی
حساسیت و ویژگی یک آزمون را توصیف میکنند؛ مقادیر پیشبینیکننده مربوط به یک بیمار هستند و با شیوع تغییر میکنند. نسبتهای احتمال این دو را به هم پیوند میدهند و به شما امکان میدهند احتمال پیشآزمون را به احتمال پسآزمون برای فردی که مقابل شماست تبدیل کنید.
پس از این درس شما قادر خواهید بود
- آزمون تشخیصی را از آزمون غربالگری متمایز کنید و توضیح دهید چرا نیازمندیها متفاوت هستند.
- همخوانی را از دقت متمایز کنید و همخوانی خام و کاپا را محاسبه کنید.
- یک جدول 2×2 را بر اساس یک استاندارد مرجع بسازید و حساسیت، اختصاصیت و مقادیر پیشبینی را محاسبه کنید.
- توضیح دهید چرا مقادیر پیشبینیکننده به شیوع بستگی دارند، اما حساسیت و اختصاصیت چنین نیستند.
- نسبتهای احتمال را محاسبه و تفسیر کنید و از قضیه بیز برای انتقال از احتمال پیشآزمون به احتمال پسآزمون استفاده کنید.
- یک مطالعه صحت تشخیصی را از نظر اعتبار، نتایج و کاربردپذیری ارزیابی کنید.
ارزیابی دقت آزمون تشخیصی
تشخیص و غربالگری یکسان نیستند
این دو اغلب با هم مورد بحث قرار میگیرند و نیازهای متفاوتی دارند.
یک آزمایش تشخیصی روی افراد بیمار انجام میشود. بیمار علائمی دارد، شیوع بیماری در آن جمعیت بالا است و برخی خطرها، ناراحتیها و هزینهها قابل قبول هستند زیرا بیمار از قبل مشکلی دارد که نیاز به حل شدن دارد.
یک آزمون غربالگری روی افراد بدون علامت و ظاهراً سالم انجام میشود تا شکل زودهنگام بیماری را شناسایی کند، زمانی که درمان ممکن است بهتر عمل کند. شیوع بیماری پایین است و بنابراین آزمون باید خطر کم، ناراحتی اندک و هزینهٔ پایین داشته باشد، زیرا اکثریت قریب به اتفاق افراد مورد آزمون بیمار نیستند و تنها ممکن است در اثر این فرایند آسیب ببینند.
این تفاوت در شیوع تصادفی نیست. همانطور که این درس نشان خواهد داد، این موضوع معنای نتیجه مثبت را تغییر میدهد.
یک «آزمایش» میتواند چیزهای زیادی باشد:
- یک پرسش (درد قفسه سینه در سکته قلبی مشکوک)
- یک نشانهٔ فیزیکی (دما، در عفونت مشکوک)
- آزمایشگاهی (نمونه برداری از گلو برای استرپتوکوک)
- یک آزمایش تصویربرداری (شکستگی در عکس رادیوگرافی)
- ترکیبی از موارد (پرسشنامه CAGE برای اختلال مصرف الکل)
- یک الگوریتم کامل (پروتکل تشخیص ترومبوز ورید عمقی)
آزمایشها نیز نقشهای متفاوتی ایفا میکنند و یک فناوری زیربنایی میتواند چندین نقش را بر عهده داشته باشد. با استفاده از آزمایش HIV بهعنوان مثال: پیشسنجی (آزمایش سریع آنتیبادی در محل مراقبت)، تشخیص و تریاژ (آزمونهای آنتیبادی/آنتیژن)، تأیید تکمیلی (آزمایشهای اختصاصی HIV-1)، پیشآگهی (بار ویروسی، شمارش CD4) و پیشبینی پاسخ به درمان (آزمایش مقاومت). دقت مورد نیاز برای هر نقش متفاوت است.
دو ویژگی هر آزمون
هر آزمون دو ویژگی متمایز دارد و اشتباه گرفتن آنها یک خطای رایج است.
توافق (که به آن قابلیت تکرار یا دقت نیز گفته میشود): آیا آزمون هنگام تکرار پاسخ یکسانی میدهد؟ این مربوط به سازگاری است، نه درستی.
دقت (که اعتبار نیز نامیده میشود): آیا آزمون پاسخ درست را در مقایسه با حقیقت میدهد؟
یک آزمون میتواند کاملاً قابل تکرار باشد و در عین حال بهطور مداوم اشتباه عمل کند. ترازویی که بهدرستی کالیبره نشده و همیشه 3 کیلوگرم بیشتر نشان میدهد، از نظر توافق عالی اما از نظر دقت ضعیف است. توافق سقف دقت است: آزمونی که نتواند نتیجهٔ خود را تکرار کند، نمیتواند دقیق باشد.
توافقنامه
برای نتیجه حضور/غیاب
دو مقدار را میتوان محاسبه کرد: توافق خام و توافق فراتر از شانس.
رضایت خام نسبت مواردی است که هر دو مشاهدهگر در آنها توافق دارند.
| مشاهدۀ اول مثبت | منفی دوربین 1 | مجموع | |
|---|---|---|---|
| مشاهدۀ دوم مثبت | 20 | 10 | 30 |
| منفی اُبزرور 2 | 10 | 60 | 70 |
| مجموع | 30 | 70 | 100 |
موافق خام = (20 + 60) / 100 = 0.80، یا 80%.
مشکل توافق خام این است که دو ناظر که بهطور تصادفی حدس میزنند، گاهی با هم توافق خواهند داشت. کاپا این موضوع را اصلاح میکند.
موافقت مورد انتظار از روی مجموعهای حاشیهای محاسبه میشود، گویی که دو ناظر مستقل هستند:
- هر دو مثبت بهطور تصادفی: 0.30 × 0.30 × 100 = 9
- هر دو بهطور تصادفی منفی هستند: 0.70 × 0.70 × 100 = 49
موافقیت مورد انتظار = (9 + 49) / 100 = 0.58، یا 58%.
کاپا نسبت توافق ممکن فراتر از تصادف است که در واقع بهدست آمده است.
اکنون مثال دوم را در نظر بگیرید که در آن شرط نادر است:
| آزمایش اول مثبت | آزمایش اول منفی | مجموع | |
|---|---|---|---|
| آزمایش دوم مثبت | 2 | 5 | 7 |
| آزمایش دوم منفی است | 3 | 990 | 993 |
| مجموع | 5 | 995 | 1000 |
میزان توافق خام 99.2% است که عالی به نظر میرسد. میزان توافق مورد انتظار 98.8% است، زیرا تقریباً همه موارد منفی هستند و دو ناظر تقریباً همیشه تنها به طور تصادفی با هم توافق خواهند کرد. کاپا برابر با 0.33 است که ضعیف محسوب میشود.
این درس ضروری درباره کاپا است: وقتی شرط نادر باشد، توافق خام بیاطلاعات است و کاپا عدد صادق است. گزارش توافق 99.2% برای جدول بالا گمراهکننده خواهد بود.
دامنههای تفسیری رایج برای کاپا تقریباً به این صورت هستند: کمتر از 0.20 ضعیف، 0.21 تا 0.40 متوسط، 0.41 تا 0.60 متوسط رو به بالا، 0.61 تا 0.80 قابل توجه، بیش از 0.80 تقریباً کامل. اینها قراردادی هستند، نه واقعیت، و سطح قابلقبول بستگی به پیامد بالینی اختلاف دارد.
برای یک اندازه پیوسته
اندازهگیری را چندین بار (مثلاً 20 بار) روی همان نمونه تکرار کرده و گزارش دهید:
- انحراف معیار اندازهگیریهای مکرر
- ضریب تغییر، که برابر است با SD تقسیم بر میانگین، بیانشده بهصورت درصد
برای مثال، بار ویروسی HIV برابر با 4.1 لگ با انحراف معیار 0.5 لگ کپیها ضریب تغییر حدود 13% دارد. این عدد نشان میدهد که تغییر بین دو اندازهگیری باید چقدر بزرگ باشد تا معنادار شود.
دقت
دقت بر اساس یک استاندارد مرجع ارزیابی میشود، بهترین روش موجود برای تعیین اینکه آیا وضعیت واقعاً وجود دارد: یک آزمون تأییدی HIV، بیوپسی جراحی و کالبدشکافی. استاندارد مرجع لزوماً کامل نیست؛ بهترین روش موجود است. وقتی ناقص باشد، دقت ظاهری آزمون شاخص تحریف میشود، گاهی بهطور قابلتوجهی.
جدول 2×2 را طوری تنظیم کنید که استاندارد مرجع در بالا و آزمون شاخص در کنار آن قرار گیرد:
| مراجع مثبت | منفی مرجع | |
|---|---|---|
| آزمایش شاخص مثبت است | TP (الف) | FP (ب) |
| آزمایش شاخص منفی است | FN (c) | TN (d) |
شیوع = (TP + FN) / کل. توجه داشته باشید که شیوع از مجموع ستون استاندارد مرجع محاسبه میشود، زیرا آن حقیقت است.
حساسیت
حساسیت، مثبت بودن در بیماری است: نسبت افراد مبتلا به بیماری که نتیجه آزمایششان مثبت است. در حالت ایدهآل 100%.
اختصاصیت
ویژگی، منفی بودن در غیاب بیماری است: نسبت افراد غیربیمار که نتیجه آزمایششان منفی است. در حالت ایدهآل 100%.
هر دو در ستونها، در میان گروههایی که توسط استاندارد مرجع تعریف شدهاند، محاسبه میشوند. به همین دلیل به شیوع بستگی ندارند: هر یک در یک گروه وضعیت بیماری واحد محاسبه میشود.
دو مثال عملی
دیپاستیک ادرار برای عفونت دستگاه ادراری:
| مراجع مثبت | منفی مرجع | |
|---|---|---|
| نتیجهٔ میلهای مثبت است | 80 | 20 |
| دیپاستیک منفی | 10 | 90 |
- شیوع = 90/200 = 45%
- حساسیت = 80/90 = 89%
- ویژگی = 90/110 = 82%
سروولوژی COVID-19، روز 14 و بعد:
| مراجع مثبت | منفی مرجع | |
|---|---|---|
| سِرولوژی مثبت | 90 | 1 |
| سروولوژی منفی | 10 | 99 |
- شیوع = 100/200 = 50%
- حساسیت = 90/100 = 90%
- ویژگی = 99/100 = 99%
اسپیان و اسانناوت
دو حافظهنما نشان میدهند چگونه حساسیت و اختصاصیت را بهطور نامتقارن بهکار ببرید.
SnNout: وقتی آزمونی حساسیت (Sn) بالایی دارد، نتیجه منفی (N) بیماری را کنار میگذارد (out). آزمون بسیار حساس، منفی کاذب کمی تولید میکند، پس نتیجه منفی آن قابل اعتماد است.
SpPin: وقتی یک آزمایش دارای Specificity بالا باشد، نتیجه مثبت، بیماری را قطعی میکند. یک آزمایش بسیار اختصاصی تعداد اندکی نتیجه مثبت کاذب تولید میکند، بنابراین نتیجه مثبت قابل اعتماد است.
نتیجهگیری جانبی است که اینها را مفید میسازد: یک آزمون بسیار حساس که نتیجه مثبت میدهد، اطلاعات چندانی در اختیار شما قرار نمیدهد، و یک آزمون بسیار اختصاصی که نتیجه منفی میدهد، نیز اطلاعات چندانی در اختیار شما قرار نمیدهد.
ارزشهای پیشبینیکننده
حساسیت به شما احتمال مثبت شدن آزمایش در صورت وجود بیماری را نشان میدهد. آنچه یک پزشک بالینی نیاز دارد، معکوس آن است: احتمال وجود بیماری در صورت مثبت بودن نتیجه آزمایش.
ارزش پیشبینی مثبت، احتمال وجود بیماری در صورت مثبت بودن آزمایش است:
ارزش پیشبینی منفی، احتمال عدم وجود بیماری در صورت منفی بودن آزمایش است:
اینها در سراسر سطرها و در گروههایی که بر اساس نتیجهٔ آزمون تعریف شدهاند، محاسبه میشوند. دقیقاً به همین دلیل است که به شیوع بستگی دارند.
برای مثال میلهٔ اندازهگیری: PPV = 80/100 = 80%، NPV = 90/100 = 90%.
برای مثال سِروولوژی COVID: PPV = 90/91 = 99%، NPV = 99/109 = 90%.
وقتی شیوع تغییر میکند چه اتفاقی میافتد؟
همان آزمایش را با همان حساسیت و ویژگی اختصاصی حفظ کنید و آن را در جمعیتی با شیوع کمتر به کار ببرید.
دیپاستیک، در جمعیتی با شیوع 7%:
| مراجع مثبت | منفی مرجع | |
|---|---|---|
| آزمایش چوبک مثبت | 80 | 200 |
| دیپاستیک منفی | 10 | 900 |
- شیوع = 90/1190 = 7%
- حساسیت همچنان 80/900 = 89% است؛ اختصاصیت همچنان 900/1100 = 82% است.
- PPV = 80/280 = 29%
- NPV = 900/910 = 99%
سروولوژی COVID، در جمعیتی با شیوع 1%:
| مراجع مثبت | منفی مرجع | |
|---|---|---|
| سِرولوژی مثبت | 90 | 100 |
| سروولوژی منفی | 10 | 9,900 |
- شیوع = 100/10,100 = 1%
- حساسیت همچنان 90% است؛ اختصاصیت همچنان 99% است.
- PPV = 90/190 = 47%
- NPV = 9,900/9,910 = 99.9%
این مهمترین نتیجهٔ درس است. آزمایشی با ویژگیسنجی 99% که در جایی با شیوع 1% بهکار میرود، نتیجهای مثبت میدهد که بیش از نیمی از مواقع نادرست است. هیچ چیز در مورد آزمایش تغییر نکرده است. تنها جمعیت تغییر کرده است.
پیامدهای عملی:
- آزمایشی که در یک کلینیک تخصصی اعتبارسنجی شده است، در مراقبتهای اولیه عملکرد متفاوتی خواهد داشت و حتی ضعیفتر عمل میکند.
- скриنینگ جمعیتهای بدون علامت، تعداد زیادی نتیجه مثبت کاذب تولید میکند و هر یک از آنها وارد چرخهای از آزمایشهای تأییدیه، اضطراب و گاهی درمان میشود.
- گزارش PPV یک آزمون بدون ذکر شیوعی که در آن اندازهگیری شده، تقریباً بیمعنی است.
نسبتهای احتمال
ارزشهای پیشبینیکننده مسئله درست را حل میکنند اما به یک شیوع بستگی دارند. نسبتهای احتمال همان مسئله را به شکلی حل میکنند که قابل انتقال است.
دو ماده لازم است:
- حساسیت و اختصاصیت، که با هم در قالب نسبت احتمال به کار میروند.
- برآوردی از احتمال پیشآزمون، از دادههای شیوع یا از قضاوت بالینی.
نتیجهٔ بیز سپس چنین است:
تبدیل بین احتمال و شانس:
نسبت احتمال مثبت
LR+ نسبت افراد بیمار با نتیجه آزمایش مثبت است، تقسیم بر نسبت افراد غیربیمار با نتیجه آزمایش مثبت:
نتیجه: یک بیمار با احتمال پیشآزمون 50% (نسبت شانس پیشآزمون 1:1) آزمایشی با LR+ برابر با 9 دارد.
نسبت شانس پس از آزمون = 1 × 9 = 9:1، که احتمال پس از آزمون را 9/10 = 90% نشان میدهد.
تفسیر بزرگی LR+ برای تشخیص بیماری:
| LR+ | مفیدیت |
|---|---|
| 1.0 تا 1.9 | مفید نیست |
| 2.0 تا 4.9 | تا حدی مفید |
| 5.0 تا 9.9 | مفید |
| ده یا بالاتر | بسیار مفید |
نسبت احتمال منفی
عمل کرد: احتمال پیشآزمون 50% (نسبت شانس 1:1)، LR- = 0.1.
نسبت شانس پس از آزمون = 1 × 0.1 = 0.1:1، که احتمال پس از آزمون برابر است با 0.1/1.1 = 9%.
تفسیر مقیاس LR برای رد بیماری:
| LR- | مفیدیت |
|---|---|
| 0.5 تا 1.0 | مفید نیست |
| 0.2 تا 0.5 | تا حدی مفید |
| 0.1 تا 0.2 | مفید |
| زیر 0.1 | بسیار مفید |
یک LR دقیقاً برابر با 1.0 به این معنی است که نتیجه آزمون هیچ تغییری ایجاد نمیکند: احتمال پس از آزمون با احتمال پیش از آزمون برابر است و آزمون بیفایده بود.
چرا نسبتهای احتمال ارزش زحمت را دارند
- آنها را میتوان به یک بیمار منفرد اعمال کرد، با استفاده از احتمال پیشآزمون آن بیمار به جای شیوع جمعیت مطالعه.
- آنها را میتوان با چندین نقطهی برش بهکار برد، نه فقط یک دوگانگی مثبت/منفی ساده. یک آزمون پیوسته را میتوان به چند باند تقسیم کرد، هر باند با نسبت احتمال خاص خود، بهطوریکه نتیجهی قویاً مثبت وزن بیشتری نسبت به نتیجهی اندکی مثبت داشته باشد. این کار اطلاعاتی را حفظ میکند که دوگانهسازی دور میریزد.
- آنها حساسیت و اختصاصیت را در هر سطح نتیجه در یک عدد ترکیب میکنند.
نوموگرام فاگان امکان انجام محاسبه بهصورت نموداری را فراهم میکند، بدون اینکه لازم باشد بهصورت دستی به شانس تبدیل شود.
آزمونها با نتایج پیوسته یا چندسطحی
اکثر آزمونها پاسخ بله یا خیر نمیدهند. آنها یک عدد تولید میکنند و کسی یک نقطهٔ برش را انتخاب میکند.
جابهجا کردن نقطه برش، حساسیت را با ویژگی معاوضه میکند: آستانه پایینتر بیماری بیشتری را میگیرد (حساسیت بالاتر) به بهای مثبت کاذب بیشتر (ویژگی پایینتر). منحنی مشخصه عملکرد گیرنده حساسیت را در برابر 1 منهای ویژگی در سراسر نقاط برش رسم میکند، و سطح زیر آن، تفکیکپذیری را در کل دامنه خلاصه میکند.
انتخاب نقطهٔ برش یک مسئلهٔ آماری نیست. این موضوع بستگی به هزینههای نسبی مثبت کاذب و منفی کاذب دارد که قضاوتهایی بالینی و گاهی اخلاقی هستند. یک آزمون غربالگری برای یک بیماری کشندهٔ قابل درمان باید حساسیت را در اولویت قرار دهد؛ آزمونی که منجر به انجام یک روش تشخیصی تهاجمی تأییدی میشود باید ویژگی را در اولویت قرار دهد.
تقسیم نتیجه به چندین بازه، هر یک با نسبت احتمال خاص خود، عموماً بهتر از انتخاب یک نقطهٔ برش واحد است، زیرا این روش اطلاعاتی را حفظ میکند که یک مقدار بسیار فراتر از آستانه، نسبت به مقداری که اندکی از آن عبور کرده است، اطلاعات بیشتری ارائه میدهد.
ارزیابی یک مطالعه صحت تشخیصی
رویکرد پزشکی مبتنی بر شواهد از سه پرسش استفاده میکند: آیا نتایج معتبر هستند؟ نتایج چیست؟ و چگونه آنها را به کار ببرم؟
بخش 1: آیا نتایج معتبر هستند؟
- آیا بیماران شرکتکننده واقعاً یک معضل تشخیصی واقعی را مطرح میکردند؟ مطالعهای که بیماران مبتلا به بیماری پیشرفته آشکار را با داوطلبان سالم مقایسه میکند، دقت خیرهکنندهای را گزارش خواهد کرد که در عمل ناپدید میشود. این سوگیری طیف است و رایجترین نقص در مطالعات تشخیصی محسوب میشود. ایدهآل آن است که یک گروه از بیماران پشت سر هم و تشخیصنشده باشد که در آنها آزمون واقعاً به کار رود.
- آیا آزمون شاخص با یک استاندارد مرجع مناسب و مستقل مقایسه شد؟
- آیا افرادی که آزمون شاخص و استاندارد مرجع را تفسیر میکردند از نتیجهٔ یکدیگر کور بودند؟ بدون این، دو آزمون مستقل نیستند و میزان توافق بیش از حد برآورد میشود.
- آیا همه بیماران، صرفنظر از نتیجه آزمون شاخص، همان استاندارد مرجع را دریافت کردند؟ وقتی بیماران با آزمون شاخص منفی کمتر احتمال دارد استاندارد مرجع را دریافت کنند، نتیجه سوگیری تأیید است که گاهی سوگیری بررسی نیز نامیده میشود و حساسیت را افزایش میدهد.
- آیا میتوان آماری شاخص را با توافقپذیری قابلقبول انجام داد؟ دقت اندازهگیریشده یکبار در یک محیط پژوهشی هیچچیز درباره عملکرد آن هنگام که اپراتورهای متعدد بهطور معمول از آن استفاده میکنند، نمیگوید.
بخش 2: نتایج چیست؟
- چه نسبتهای احتمالاتی با دامنه نتایج ممکن آزمون مرتبط بودند؟
- حساسیت و اختصاصیت، با فواصل اطمینان 95%. این نسبتها از نمونههای محدود برآورد شدهاند و دارای عدم قطعیتی هستند که اغلب گزارش نمیشوند.
- توافق برای آزمون شاخص و بهطور ایدهآل برای آزمون مرجع نیز.
- گزارشدهی مناسب دادههای گمشده، نتایج نامشخص و هرگونه برملا شدن وضعیت مخفی. STARD راهنمای گزارشدهی برای مطالعات صحت تشخیصی است.
توجه کنید که اگر یک جدول 2×2 یا حساسیت و اختصاصیت در اختیار داشته باشید، میتوانید نسبتهای احتمال را خودتان محاسبه کنید. مقالهای که آنها را ذکر نکرده باشد، چیزی را پنهان نکرده است که نتوانید بازیابی کنید.
بخش 3: آیا میتوانم نتایج را اعمال کنم؟
- آیا قابلیت تکرارپذیری آزمون و تفسیر آن در شرایط من رضایتبخش خواهد بود؟
- آیا بیماران مورد مطالعه مشابه بیماران من هستند و بهویژه آیا شیوع مشابه است؟ اگر این شیوع بسیار کمتر باشد، مقادیر پیشبینیشده گزارششده قابل اعمال نخواهند بود.
- آیا نتیجهٔ آزمایش مدیریت من را تغییر خواهد داد؟ آزمایشی که نتیجهاش به هر حال به همان اقدام منتهی میشود، نباید درخواست شود.
- آیا بیماران با انجام آزمایش وضعیت بهتری خواهند داشت؟ این پرسشی است که مطالعات دقت به آن پاسخ نمیدهند. یک آزمایش میتواند کاملاً دقیق باشد و با این حال مضر باشد، اگر بیماریای که تشخیص میدهد هرگز باعث بروز علامت نمیشد و درمان آن خطرناک باشد. اثبات اینکه آزمایش نتایج را بهبود میبخشد نیازمند یک کارآزمایی دربارهٔ استراتژی آزمایش است، نه یک مطالعهٔ دقت.
درک خود را بررسی کنید
- یک آزمایش سریع جدید دارای حساسیت 95% و ویژگی 90% است. این آزمایش در بخش اورژانس که شیوع 30% است و در یک برنامه غربالگری جامعه که شیوع 2% است، استفاده میشود. PPV را در هر محیط محاسبه کرده و یک جمله بنویسید که تفاوت آن را برای یک پزشک توضیح دهد.
- دو رادیولوژیست 500 فیلم قفسهٔ سینه را برای یافتن یک ناهنجاری که در 3% آنها وجود داشت، خواندند و در 96% موارد توافق داشتند. آیا این توافق خوب است؟ شما چه چیزی را محاسبه میکنید و تقریباً انتظار دارید چه نتیجهای نشان دهد؟
- یک بیمار با احتمال پیشآزمون آمبولی ریوی 20% دارد. یک آزمایش نتیجه مثبت با LR+ = 6 میدهد. احتمال پسآزمون را محاسبه کنید. سپس برای بیمار دیگری که احتمال پیشآزمونش 2% بوده است، همین فرایند را تکرار کرده و توضیح دهید آیا همان نتیجه آزمایش در هر دو بیمار مستلزم اتخاذ اقدام یکسان است یا خیر.
- یک مطالعه درباره یک نشانگر جدید سرطان شامل 100 بیمار با سرطان پیشرفته تأییدشده و 100 اهداکننده خون سالم بود و حساسیت 98% و ویژگی 97% را گزارش کرد. نام سوگیری را بگویید و توضیح دهید چگونه هر دو رقم را بزرگنمایی کرد.
- توضیح دهید چرا آزمایشی با LR+ = 1.3 و LR- = 0.8 ارزش سفارش دادن را ندارد، حتی اگر تفاوت آن با 1.0 از نظر آماری معنادار باشد.
- در چه شرایطی ترجیح میدهید بهجای یک حساسیت و اختصاصیت واحد، سه نسبت احتمال را برای یک آزمون پیوسته گزارش کنید و با دودوییسازی چه چیزی را از دست میدهید؟
مطالعه بیشتر
- Jaeschke R, Guyatt G, Sackett DL. Users' guides to the medical literature: how to use an article about a diagnostic test. JAMA. 1994;271(5):389-391 and 271(9):703-707.
- Bossuyt PM, Reitsma JB, Bruns DE, et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ. 2015;351:h5527.
- Guyatt G, Rennie D, Meade MO, Cook DJ, eds. Users' Guides to the Medical Literature, 3rd ed., Chapters 16 to 18.
- Whiting PF, Rutjes AWS, Westwood ME, et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Ann Intern Med. 2011;155(8):529-536.