مقدمه‌ای بر زیست‌آمار
واحد 9·35 دقیقه

روش‌های غیرپارامتریک

آزمون‌هایی مبتنی بر رتبه‌ها به‌جای نمره‌های خام، برای زمانی که فرضیات توزیع‌ای شکست می‌خورند. آزمون رتبه‌ای نشان‌دار ویلکاکسون برای داده‌های جفتی، آزمون مجموع رتبه‌ها برای گروه‌های مستقل، و گزارشی صادقانه از آنچه فدا می‌کنید.

پس از این درس شما قادر خواهید بود

  • توضیح دهید چه چیزی یک آزمون را پارامتریک می‌کند و آزمون غیرپارامتریک چه محدودیت‌هایی را کاهش می‌دهد.
  • آزمون رتبه‌بندی نشان‌دار ویلکاکسون را برای داده‌های جفتی اجرا کرده و نتایج آن را تفسیر کنید.
  • آزمون ویلکاکسون رتبه‌بندی‌شده (من-ویتنی) را برای گروه‌های مستقل اجرا کرده و نتایج آن را تفسیر کنید.
  • فرض‌هایی را که آزمون‌های غیرپارامتریک همچنان به آن‌ها نیاز دارند، بیان کنید.
  • هزینه‌های روش‌های غیرپارامتریک را فهرست کنید و تصمیم بگیرید چه زمانی پرداخت آن‌ها ارزش دارد.
  • بشناسید که آزمون‌های غیرپارامتریک درمان کمبود حجم نمونه نیستند.

روش‌های غیرپارامتریک

معنای «پارامتریک»

یک تحلیل پارامتریک فرض می‌کند که برای جامعه یک مدل احتمال نظری وجود دارد که معمولاً توزیع نرمال است. این مدل نیازمند برآورد پارامترهای ناشناخته‌ای است که معنای آن‌ها وابسته به درستی مدل است: نوشتن yN(μ,σ2)y \sim N(\mu, \sigma^2) شما را به هم شکل توزیع و هم دو پارامتری که آن را توصیف می‌کنند، متعهد می‌سازد.

اگر مدل به‌خوبی برازش نشود، آمار آزمون گمراه‌کننده است. نه صرفاً مبهم، بلکه گمراه‌کننده، زیرا توزیع مرجعی که برای تبدیل آمار به مقدار p به‌کار می‌رود، توزیع نادرستی است.

یک تحلیل غیرپارامتریک وابستگی به فرضیات توزیع را کاهش داده است. این تحلیل بر اساس میانه و رتبه‌ها است نه میانگین و نمره‌های خام، که آن را برای موارد زیر مناسب می‌سازد:

  • داده‌های ترتیبی، جایی که اعداد خام به هر حال معنایی فاصله‌ای ندارند.
  • داده‌ها با داده‌های پرت
  • داده‌های مغرضانه

ایدهٔ اصلی: هر مشاهده را با جایگاهش در فهرست مرتب‌شده جایگزین کنید و جایگاه‌ها را تحلیل کنید. یک دادهٔ پرت 200 در مجموعه‌ای که بزرگ‌ترین مقدار بعدی 40 است، به‌سادگی «بزرگ‌ترین» با رتبهٔ nn نام‌گذاری می‌شود. این مقدار افراطی همراه با توانایی‌اش در تحریف کنار گذاشته می‌شود.

آزمون رتبه علامت‌دار ویلکاکسون

جایگزین غیرپارامتریک آزمون تی جفتی.

انگیزه

اکسیژناسیون غشایی خارج‌بدنی (ECMO) درمانی برای نوزادان مبتلا به نارسایی تنفسی است. یک مطالعه ابعاد بطن چپ را قبل و حین ECMO در همان نوزادان مقایسه کرد.

اولین پرسشی که باید مطرح شود این است که آیا ابعاد بطن‌ها توزیع نرمال دارند یا خیر. با یک نمونهٔ کوچک از اندازه‌گیری‌های فیزیولوژیکی ممکن است چنین نباشد و آزمون تی جفتی بر این فرض استوار است که تفاوت‌ها تقریباً نرمال باشند.

روند کار

این آزمون هم علامت و هم اندازهٔ تفاوت‌ها را با استفاده از رتبه‌ها در نظر می‌گیرد:

  1. جوفت‌ها را بر اساس قدر مطلق اختلافشان مرتب کنید و رتبه‌بندی کنید، و در صورت وجود تساوی با محاسبه میانگین آن‌ها را حل کنید.
  2. تفاوت‌های جفتی را بر اساس علامت جدا کنید، صفرها را حذف کرده و nn را به تبع آن کاهش دهید.
  3. رتبه‌ها را برای اختلافات مثبت جمع کنید. این را TT بنامید.

طبق H0H_0، میانهٔ اختلافات جمعیت برابر صفر است، یا به عبارت دیگر توزیع اختلافات به‌طور متقارن حول صفر است. اگر این درست باشد، اختلافات مثبت و منفی باید رتبه‌های مشابهی داشته باشند و TT باید نزدیک به وسط بازهٔ ممکن خود باشد.

آمار آزمون

برای اختلاف‌های غیرصفر nn، با TT مجموع رتبه‌های اختلاف‌های مثبت، تحت H0H_0:

z=TE(T)σz = \frac{T - E(T)}{\sigma}

E(T)=n(n+1)4E(T) = \frac{n(n+1)}{4}

σ=n(n+1)(2n+1)24\sigma = \sqrt{\frac{n(n+1)(2n+1)}{24}}

E(T)E(T) نیمی از n(n+1)/2n(n+1)/2 است، یعنی مجموع همه رتبه‌ها، که همان چیزی است که اگر تفاوت‌های مثبت و منفی در هر رتبه به طور مساوی نمایش داده می‌شدند، انتظار می‌رفت.

تحت H0H_0، ZZ تقریباً نرمال استاندارد است اگر n16n \geq 16.

پالایش‌ها

  • گاهی یک اصلاح پیوستگی برابر با 0.5 از مخرج کسر می‌شود، زیرا یک آمار گسسته با یک توزیع پیوسته تقریب زده می‌شود.
  • خطای استاندارد زمانی که رتبه‌های مساوی وجود داشته باشند تغییر می‌کند، زیرا تساوی‌ها واریانس آماره را کاهش می‌دهند.
  • برای نمونه‌هایی با n<16n < 16 که تقریب نرمال کافی نیست، جداول ویژه‌ای وجود دارد. R توزیع دقیق را به‌طور خودکار برای مقادیر کوچک nn بدون مقادیر مساوی محاسبه می‌کند.
  • آزمون علامت جایگزینی ساده‌تر است که تنها علامت‌ها را می‌شمارد و رتبه‌ها را کاملاً نادیده می‌گیرد. این آزمون اطلاعات بیشتری را کنار می‌گذارد و در نتیجه قدرت کمتری دارد، اما فرضیات کمتری دارد: نیازی ندارد که توزیع اختلاف‌ها متقارن باشد.

در R

wilcox.exact <- wilcox.test(during, before, paired = TRUE)
wilcox.exact

# with a confidence interval for the location shift
wilcox.test(during, before, paired = TRUE, conf.int = TRUE)

# the sign test, via the binomial
binom.test(sum(during > before), sum(during != before))

آزمون ویلکاکسون رتبه‌جمعی

جایگزین ناپارامتری آزمون t برای گروه‌های مستقل. به آن آزمون U مان-ویتنی هم می‌گویند؛ این دو از نظر جبری معادل‌اند و تنها در مقیاس‌بندی آماره تفاوت دارند.

فرض‌ها

این آزمون فرض می‌کند که توزیع‌های دو گروه شکل‌های مشابهی دارند، هرچند لزوماً نرمال نیستند.

H0:the medians are equalH_0: \text{the medians are equal}

آن فرض اول از آنچه معمولاً مردم متوجه می‌شوند محدودکننده‌تر است. اگر دو گروه توزیع‌هایی با اشکال متفاوت داشته باشند، یک نتیجه معنادار به شما می‌گوید که توزیع‌ها با هم متفاوت‌اند اما نه اینکه میانه آن‌ها متفاوت است، و گزارش آن به‌عنوان تفاوت در میانه اشتباه است.

روند کار

  1. دو گروه را ترکیب کرده و همهٔ مشاهدات را با هم رتبه‌بندی کنید و در صورت وجود تساوی، با میانگین‌گیری آن‌ها را مرتب کنید.
  2. دوباره گروه‌ها را جدا کنید و مجموع رتبه‌ها را در هر کدام محاسبه کنید.
  3. طبق H0H_0، میانگین رتبه در هر گروه باید برابر باشد.

فرض کنید WW کوچک‌ترین مجموع رتبه‌ای باشد، و nsn_s و nLn_L اندازه‌های نمونه گروه‌هایی باشند که مجموع‌های کوچک‌تر و بزرگ‌تر را دارند. تحت H0H_0:

Z=WE(W)σZ = \frac{W - E(W)}{\sigma}

E(W)=ns(ns+nL+1)2E(W) = \frac{n_s(n_s + n_L + 1)}{2}

σ=nsnL(ns+nL+1)12\sigma = \sqrt{\frac{n_s n_L (n_s + n_L + 1)}{12}}

اگر nsn_s و nLn_L هر دو بزرگ‌تر از 10 باشند، ZZ تقریباً توزیع نرمال استاندارد است.

پالایش‌ها

  • گاهی یک اصلاح پیوستگی برابر با 0.5 از مخرج کسر می‌شود.
  • محاسبهٔ واقعی به تنظیم برای تساوی‌ها بستگی دارد.
  • جدول‌های جایگزین برای nsn_s و nLn_L زیر 10 وجود دارند.

در R

wilcox.test(value ~ group, data = d)

# with a Hodges-Lehmann estimate of the shift and its interval
wilcox.test(value ~ group, data = d, conf.int = TRUE)

استدلال conf.int = TRUE ارزش استفاده دارد. این تابع برآوردگر هاجز-لهمان، یعنی میانهٔ تمام اختلافات جفتی بین گروه‌ها، را همراه با یک بازه بازمی‌گرداند. این تا حدی به انتقاد زیر پاسخ می‌دهد که آزمون‌های غیرپارامتریک تنها مقدار p را ارائه می‌کنند و هیچ برآوردی از اثر ندارند.

کاربرد آزمون‌های غیرپارامتریک چیست؟

  • آنها نیازی به فرضیات درباره مدل احتمال نظری حاکم بر داده‌ها ندارند.
  • برای دو گروه، آن‌ها تنها توزیع‌هایی با شکل مشابه را فرض می‌کنند.
  • آنها نسبت به داده‌های پرت حساسیت کمتری دارند، زیرا یک مقدار افراطی تنها رتبهٔ خود را وارد می‌کند.
  • آنها در کار با داده‌های ترتیبی آسان‌تر هستند، جایی که میانگین‌ها از اساس معنایی ندارند.

هزینه‌ی آنها

این فهرست به همان اندازه فهرست قبلی شایسته توجه است، زیرا روش‌های غیرپارامتریک اغلب به‌طور بی‌ملاحظه توصیه می‌شوند.

قدرت کمتر زمانی که فرضیات پارامتریک برقرار باشند. اگر داده‌ها واقعاً نرمال باشند، آزمون مبتنی بر رتبه‌بندی قدرت کمتری نسبت به آزمون t دارد. این کاهش قدرت اندک است (کارایی نسبی اسیمپتوتیک آزمون مجموع رتبه‌ها در مقایسه با آزمون t تحت نرمال بودن حدود 0.955 است، بنابراین تقریباً به 5% شرکت‌کننده بیشتری نیاز است)، اما واقعی است.

نظریه ضعیف‌تر بر استنتاج‌ها حاکم است. نظریه توزیع کمتر توسعه یافته است، به‌ویژه برای طرح‌های پیچیده.

فواصل اطمینان به‌خوبی تعریف نشده‌اند. خروجی پیش‌فرض یک مقدار p است و ساخت یک فاصله نیازمند سازوکار اضافی است که همیشه در دسترس نیست.

محاسبهٔ حجم نمونه دشوار است. هیچ معادل واضحی از فرمول توان در واحد حجم نمونه وجود ندارد. روش معمول این است که حجم نمونهٔ پارامتریک را محاسبه کرده و حدود 15% به آن اضافه کنید.

هیچ پارامتری با قابلیت تفسیر بالینی یا علمی وجود ندارد. این جدی‌ترین هزینه است. آزمون t میانگین اختلاف را در واحدهای اصلی به شما می‌دهد که یک پزشک می‌تواند آن را در برابر حداقل اختلاف مهم بسنجد. آزمون جمع رتبه‌ای مقدار p را درباره رتبه‌ها به شما می‌دهد. «رتبه‌ها متفاوت بودند، p = 0.03» چیزی نیست که کسی بتواند بر اساس آن اقدام کند.

دامنه محدودی از تحلیل‌های غیرپارامتریک در دسترس است. برای طرح‌های ساده معادل‌های مبتنی بر رتبه‌بندی وجود دارد، اما هرچه بیشتر به رگرسیون، تعدیل و مدل‌سازی چندمتغیره بپردازید، گزینه‌ها کمتر می‌شوند.

سه نکته‌ای که به راحتی اشتباه گرفته می‌شوند

آزمون‌های غیرپارامتریک راه‌حلی برای مشکلات مربوط به فرضیات توزیع هستند. آن‌ها راه‌حلی برای حجم نمونهٔ کوچک نیستند. این سردرگمی گسترده است. نمونه‌ی کوچک مسئله‌ای اطلاعاتی است و هیچ آزمونی نمی‌تواند اطلاعاتی را که وجود ندارد بازیابی کند. اگر چیزی باشد، نمونه‌های کوچک وضعیت غیرپارامتریک را بدتر می‌کنند، زیرا تقریب‌های نرمال برای ZZ نیازمند n16n \geq 16 یا n>10n > 10 در هر گروه هستند و در زیر آن باید از روش‌های دقیق با وضوح بسیار محدود استفاده کرد. با 5 مشاهده در هر گروه، کوچکترین مقدار p دوطرفه قابل دستیابی از یک آزمون مجموع رتبه‌ای 0.016 است، بنابراین برخی نتایج صرف‌نظر از بزرگی اثر، به سادگی نمی‌توانند به سطح معناداری برسند.

آزمون رتبه‌مجموع مقادیر p مشابهی با اجرای آزمون t بر روی رتبه‌ها به‌جای نمرات می‌دهد. این روش راه مفیدی برای درک نحوه عملکرد آزمون است: این آزمون یک مقایسه معمولی میانگین‌هاست که بر روی داده‌های تبدیل‌شده انجام می‌شود.

آزمون t تا حد متوسط در برابر انحراف از توزیع نرمال مقاوم است، به‌ویژه وقتی اندازه‌های نمونه برابر باشند. قضیه حد مرکزی درباره میانگین نمونه صدق می‌کند، نه درباره داده‌ها، بنابراین با یک nn معقول، آزمون t روی داده‌های غیرنرمال عملکرد خوبی دارد. مواردی که واقعاً شکست می‌خورد، انحراف شدید با nn کوچک و داده‌های پرت شدید هستند.

انتخاب کردن

وضعیت ملاحظه کنید
داده‌های پیوسته، تقریباً متقارن، nn معقول آزمون تی
داده‌های پیوسته، کجی شدید، nn کوچک آزمون مبتنی بر رتبه‌بندی، یا تبدیل داده‌ها
نتیجهٔ مرتبی آزمون مبتنی بر رتبه
مقادیر بسیار دور از حد که به آن‌ها اعتماد ندارید آزمون مبتنی بر رتبه‌بندی و بررسی داده‌های پرت
شما به اندازهٔ تأثیر قابل تفسیر نیاز دارید. آزمون تی، یا آزمون رتبه‌ای با برآورد هاجس-لهمان
طراحی پیچیده با متغیرهای همبسته مدل پارامتریک، احتمالاً بر روی داده‌های تبدیل‌شده

یک گزینهٔ چهارم شایستهٔ ذکر است: تبدیل داده‌ها. مقادیر مثبت نامتوازن (مدت اقامت، هزینه، بار ویروسی، غلظت نشانگرهای زیستی) اغلب در مقیاس لگاریتمی رفتار مناسبی دارند و آزمون t بر داده‌های تبدیل‌شده به لگاریتم نسبت میانگین‌های هندسی را ارائه می‌دهد که هم تحلیلی معتبر است و هم اندازهٔ اثر قابل تفسیر. این اغلب بهتر از آزمون تی خام یا آزمون رتبه‌ای است.

درک خود را بررسی کنید

  1. ده بیمار قبل و بعد از درمان اندازه‌گیری می‌شوند. تفاوت‌ها عبارتند از −2، 1، 4، −1، 8، 3، 0، 5، −3، 6. آزمون رتبه‌بندی نشان‌دار ویلکاکسون را به‌صورت دستی انجام دهید: اختلافات مطلق را رتبه‌بندی کنید، صفر را مدیریت کنید، رتبه‌های مثبت را جمع کنید و E(T)E(T) و σ\sigma را بیان کنید. در R تأیید کنید.
  2. توضیح دهید چرا اختلاف صفر نادیده گرفته می‌شود و nn به جای اینکه رتبه‌بندی شود، کاهش داده می‌شود.
  3. دو گروه 12 نفره توزیع‌هایی با میانه یکسان اما پراکندگی‌های بسیار متفاوت دارند. آزمون مجموع رتبه‌ای معنادار است. چه نتیجه‌ای می‌توان گرفت و چه نتیجه‌ای نمی‌توان گرفت؟
  4. یک داور پیشنهاد می‌کند از آزمون غیرپارامتریک استفاده شود زیرا مطالعه در هر گروه تنها 8 بیمار دارد. توضیح دهید چرا این استدلال اشتباه است و مشکل واقعی چیست.
  5. طول مدت بستری در بیمارستان به‌شدت راست‌پرتاب است. سه استراتژی تحلیلی را مقایسه کنید: آزمون t بر روی مقادیر خام، آزمون مجموع رتبه‌ای و آزمون t بر روی مقادیر لگاریتم. معیار اثر هر یک را بیان کنید و بگویید کدام را به مدیر بیمارستان گزارش خواهید داد.
  6. توضیح دهید چرا آزمون رتبه‌مجموع در مقایسه با آزمون t حدود 5% کارایی خود را از دست می‌دهد وقتی داده‌ها واقعاً نرمال هستند، و چرا ممکن است با این وجود آن کاهش را بپذیرید.

مطالعه بیشتر

  • Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapter 13.
  • Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 9.
  • Conover WJ. Practical Nonparametric Statistics. 3rd ed.
  • Bland JM, Altman DG. Transforming data. BMJ. 1996;312:770.

اصطلاحات کلیدی

پارامتریکغیرپارامتریکرتبهآزمون رتبه علامت‌دار ویلکاکسونآزمون ویلکاکسون رتبه‌جمعیمن-ویتنی یوآزمون علامتپیوندهااصلاح پیوستگی