توزیعهای احتمال
سه توزیع بیشتر پژوهشهای سلامت را پوشش میدهند. توزیع دوجملهای برای شمارش رویدادها در یک مجموعه ثابت از آزمایشها، توزیع پوآسون برای نرخ رویدادها در زمان یا مکان، و توزیع نرمال برای اندازهگیریهای پیوسته. هر یک بر فرضیاتی استوار است که باید آنها را بررسی کنید.
پس از این درس شما قادر خواهید بود
- فرضهای توزیع دوجملهای را بیان کنید و احتمالهای دوجملهای را بهصورت دستی و در R محاسبه کنید.
- فرضهای توزیع پوآسون را بیان کنید و احتمالات پوآسون را محاسبه کنید.
- توضیح دهید که چه زمانی توزیع پوآسون توزیع دوجملهای را تقریب میزند.
- ویژگیهای توزیع نرمال را بیان کنید و به نمرات نرمال استاندارد تبدیل کنید.
- از تبدیل زی برای یافتن احتمالها برای بازهها استفاده کنید.
- تشخیص دهید که فرض استقلال چه زمانی شکست میخورد و این امر چه تأثیری بر پاسخ شما دارد.
توزیعهای احتمال
توزیع احتمال نشان میدهد که هر مقدار ممکن یک متغیر چقدر محتمل است. سه توزیع بیشتر آنچه را در تحقیقات سلامت با آن مواجه میشوید پوشش میدهند و هر یک با تعداد کمی فرضیه تعریف میشوند. دانستن فرضیهها مفیدتر از حفظ فرمولهاست، زیرا فرمولها در نرمافزار موجودند اما فرضیهها نیستند.
توزیع دوجملهای
یک پرسش انگیزشی
نظرسنجی سلامت جامعه کانادا نشان داد که 25% از جوانان انتاریو در سنین 12 تا 19 سال مصرفکننده سنگین الکل بودند، که به معنای نوشیدن پنج یا بیشتر نوشیدنی الکلی در یک نوبت در طول دوازده ماه گذشته است.
یک نمونهی تصادفی از 10 جوان انتخاب کنید. چند نفر احتمالاً مصرفکنندهی سنگین الکل هستند؟
در اینجا احتمال واقعی در جمعیت است و ما از جمعیت به یک نمونه تعمیم میدهیم. این جهتگیری قابل توجه است: استدلال احتمالاتی از یک جمعیت شناختهشده به یک نمونه ناشناخته است، و استنتاج (بقیه این درس) در جهت مخالف است.
فرضها
- نتیجه یک رویداد گسسته است که در هر یک از آزمایشهای یا رخ میدهد (موفقیت، بله) یا رخ نمیدهد (شکست، خیر).
- احتمال واقعی وقوع رویداد برای هر آزمون ثابت است.
- آزمونها مستقل هستند.
اگر آن شرایط برقرار باشند، تعداد کل موفقیتها توزیعی دوجملهای دارد که با نشان داده میشود.
فرمول
جایی که . برای مثال، .
فرمول سه بخش دارد و خواندن جداگانهٔ آنها باعث میشود بهخاطر بماند:
- احتمال بهدستآوردن موفقیتها است.
- احتمال شکست بودن آزمونهای باقیمانده است.
- تعداد ترتیبهای مختلفی را که این اتفاق میتواند در آنها رخ دهد، میشمارد.
خواص
برای 10 جوان با : میانگین 2.5، واریانس 1.875، SD 1.37.
با دست
احتمال اینکه دقیقاً دو نفر از میان ده جوان، نوشندهٔ سنگین الکل باشند، چقدر است؟
واژه ترکیبی: .
و .
در R
dbinom(2, size = 10, prob = 0.25) # 0.2816 exactly 2
round(dbinom(0:10, 10, 0.25), 4)
# 0 1 2 3 4 5 6 7 8 9 10
# 0.0563 0.1877 0.2816 0.2503 0.1460 0.0584 0.0162 0.0031 0.0004 0.0000 0.0000
barplot(dbinom(0:10, 10, 0.25), names.arg = 0:10,
xlab = "number of heavy drinkers", ylab = "probability")
توزیع در مقدار 2 به اوج میرسد، نزدیک به میانگین 2.5، و به دلیل دارای انحراف به راست است.
یک پرسش دوم سختتر
یک واحد بهداشت عمومی از یک جامعهٔ خاص در انتاریو نمونهبرداری میکند و 15 نفر را مصرفکنندهٔ سنگین الکل مییابد.
اگر این یک جامعهٔ معمولی باشد، میانگین مورد انتظار چیست؟
این جامعه چقدر غیرعادی است؟
مقدار مربوطه احتمال مشاهده 15 یا بیشتر است، زیرا نتیجه 16 یا 20 نیز دستکم به همان اندازه شگفتآور خواهد بود:
1 - pbinom(14, size = 45, prob = 0.25) # 0.1327
توجه کنید که pbinom(14, ...) مقدار را میدهد، بنابراین مکمل آن مقدار را میدهد. خطاهای یکعددی در اینجا شایعترین اشتباه در این محاسبه هستند.
احتمال 13%. یافتن 15 نوشندهٔ سنگین در حالی که انتظار میرفت 11.25 نفر باشند، غیرعادی نیست؛ چنین جمعیتی تقریباً یکبار از هر هشت بار بهطور تصادفی رخ میدهد. این در اصل یک آزمون فرضیهای یکطرفه است و منطق واحد بعدی را پیشنمایش میکند.
چه فرضیاتی را باید در نظر بگیریم؟ هر سه فرض دوجملهای. در اینجا بحثبرانگیزترین فرض، استقلال است. جوانان در یک جامعه نمونههای مستقل نیستند: آنها در مدارس یکسان تحصیل میکنند، گروههای همسالان مشترکی دارند و تابع همان دسترسیها و هنجارهای محلی هستند. رفتار نوشیدن الکل بهصورت اجتماعی خوشهای است. اگر مشاهدات همبستگی مثبت داشته باشند، واریانس واقعی بزرگتر از است، بنابراین 0.133 کمتر از میزان واقعی نشان میدهد که چنین نتیجهای چند وقت یکبار رخ میدهد و جامعه غیرعادیتر از آنچه هست به نظر میرسد.
این همان مشکل خوشهبندی است که در کارآزماییهای خوشهبندی تصادفی مشاهده شد و از جنبه توزیع بررسی میشود.
احتمال به صورت مساحت
برای مقادیر بزرگتر ، توزیع دوجملهای آنقدر متراکم میشود که احتمال یک بازهٔ مقادیر بهطور طبیعی بهعنوان مساحت کل میلهها در آن بازه خوانده میشود. با افزایش ، آن شکل پلهای به یک منحنی پیوسته نزدیک میشود که همان توزیع نرمال است و به همین دلیل تقریب نرمال برای توزیع دوجملهای کار میکند.
توزیع پوآسون
یک پرسش انگیزشی
در یک مکان خاص، نرخ خودکشی 2.75 در ماه است.
- احتمال وقوع صفر مورد خودکشی در یک ماه چقدر است؟
- حداکثر 4 تا؟
- شش تا یا بیشتر؟
بینومینال کاربرد ندارد، زیرا تعداد آزمایشها ثابت نیست. هیچ معناداری وجود ندارد: تعداد خودکشیها در یک ماه از هیچ چیزی «بیرون» نیست.
فرضها
- میزان رویدادهای گسسته در واحد زمان (یا حجم، مساحت، نفر-سال)، یا رویدادهای بسیار نادر را مدل میکند.
- تعداد آزمایشها ثابت نیست، بنابراین شمارش در واحد زمان از نظر اصولی نامحدود است.
- نرخ رویداد در واحد زمان، ، ثابت است.
- رویدادها در طول زمان مستقل هستند.
فرمول
که در آن ، با تعداد مورد انتظار رویدادها در واحد ، و است.
خواص
این ویژگی متمایزکننده و یک معیار تشخیصی مفید است. اگر دادههای شمارشی شما واریانسی بسیار بزرگتر از میانگینشان داشته باشند، دادهها بیشپراکندهاند و مدل پواسون مناسب نیست، معمولاً به این دلیل که نرخ ثابت نیست یا رویدادها مستقل نیستند. این موضوع در دوره رگرسیون اهمیت دارد، جایی که بیشپراکندگی مدل منفی دوجملهای را توجیه میکند.
توزیع پوشه همچنین در حدس توزیع دوجملهای خوب عمل میکند وقتی بزرگ و کوچک باشد، یعنی برای رویدادهای نادر. در این صورت .
با دست
با در ماه و ماه، پس :
احتمال صفر خودکشی:
( را به خاطر بسپارید و هر عددی به توان 0 برابر با 1 است، بنابراین همیشه .)
احتمال حداکثر 4:
احتمال 6 یا بیشتر:
در R
dpois(0, lambda = 2.75) # 0.0639 exactly 0
ppois(4, lambda = 2.75) # 0.8554 4 or fewer
1 - ppois(5, lambda = 2.75) # 0.0608 6 or more
بار دیگر به مرز توجه کنید: «6 یا بیشتر» مکمّل «5 یا کمتر» است، نه مکمّل «6 یا کمتر».
تغییر بازه زمانی
زیرا ، همان نرخ در دورهای متفاوت صرفاً مقیاسبندی میشود. در طول یک سال، :
1 - ppois(39, lambda = 2.75 * 12) # probability of 40+ suicides in a year
این همان چیزی است که توزیع پوآسون را به توزیع طبیعی برای نرخهای وقوع تبدیل میکند، جایی که مخرج عبارت از نفر-زمان است.
توزیع نرمال
یک پرسش انگیزشی
آزمونهای IQ استاندارد شدهاند بهطوریکه میانگین آنها برابر با 100 و انحراف معیارشان برابر با 15 باشد و فرض میشود که از توزیع نرمال پیروی میکنند. در یک نمونه تصادفی از جامعه:
- چه نسبتی از نمرات بین 110 و 120 قرار میگیرند؟
- چه درصدی از جمعیت نمره کمتر از 70 میگیرند؟
- اگر میانگین IQ یک کلاس از دانشآموزان 116 باشد، چه احتمال دارد که آنها نمونهای تصادفی از جامعه باشند؟
خواص
- دادهها از تا بهصورت پیوسته در نظر گرفته میشوند و حول میانگین متقارن هستند.
- اسپرد با واریانس اندازهگیری میشود.
- میانگین = میانه = فراوانی
- میانگین و واریانس پارامترهای مستقلی هستند: دانستن یکی هیچ اطلاعاتی دربارهٔ دیگری در اختیار شما قرار نمیدهد. این برخلاف توزیع دوجملهای (واریانس به بستگی دارد) و توزیع پواسون (واریانس برابر با میانگین) است و همین موضوع توزیع نرمال را بسیار مناسب میسازد.
- از آنجا که متغیر پیوسته است، احتمال هر مقدار دقیق برابر صفر است. ما احتمال اینکه در یک بازه قرار گیرد را پیشبینی میکنیم.
تابع چگالی احتمال:
شما هرگز نیازی نخواهید داشت که این فرمول را مستقیماً استفاده کنید. آنچه اهمیت دارد، محصول آن است.
قاعده تجربی
برای هر توزیع نرمال:
| فاصله | نسبت مشاهدات |
|---|---|
| حدود 68% | |
| حدود 95% | |
| حدود 99.7% |
این سه عدد در آمار کاربردی کاربرد زیادی دارند و ارزش حفظ کردن را دارند.
توزیع نرمال استاندارد
هر توزیع نرمال را میتوان به یک توزیع مرجع واحد تبدیل کرد. را به ، توزیع نرمال استاندارد، با استفاده از:
امتیاز z عددی است که نشان میدهد یک مشاهده چند انحراف معیار از میانگین فاصله دارد. وقتی روی مقیاس z قرار گرفت، یک جدول (یا یک تابع) برای همه توزیعهای نرمال کافی است.
مثال عملی: IQ بین 110 و 120
با استفاده از جداول نرمال استاندارد، مساحت بالای هر نقطه:
حدود 16% جمعیت.
pnorm(120, mean = 100, sd = 15) - pnorm(110, mean = 100, sd = 15)
# 0.1613
pnorm(1.33) - pnorm(0.67) # 0.1597 using rounded z-scores
پاسخ دقیق 0.1613 است و محاسبه دستی 0.1596 را میدهد. این اختلاف کاملاً ناشی از گرد کردن امتیازات z به دو اعشار است، همانطور که جداول چاپی ایجاب میکنند. این یادآوری مفیدی است که روش جدولی، تقریب محاسبهای است که نرمافزار آن را دقیقاً انجام میدهد.
مثال کارشده: IQ زیر 70
بر اساس قاعده تجربی، 95% توزیع در فاصله دو انحراف معیار از میانگین قرار دارد، بنابراین 5% خارج از آن است و به دلیل تقارن، 2.5% زیر قرار میگیرد.
pnorm(70, mean = 100, sd = 15) # 0.0228
مقدار دقیق 2.28% است که به 2.5% پیشنهادی قاعده تجربی نزدیک است، زیرا «95% در محدوده 2 SD» خود گردشدهٔ 95.45% است.
دو قاعده برای اسکورهای زی
- توزیع نرمال استاندارد حول صفر متقارن است. اگر بتوانید مساحت یک سمت را محاسبه کنید، با استفاده از تقارن میتوانید مساحت سمت دیگر را بهدست آورید. .
- امتیازهای Z میتوانند منفی باشند و علامت اهمیت دارد. حذف علامت منفی «زیر 70» را به «بالای 130» تبدیل میکند، که پرسشی متفاوت است با همان پاسخ عددی، تنها بهخاطر تقارن. در یک بازه نامتقارن این کار بهسادگی اشتباه است.
پرسش سوم
اگر میانگین IQ یک کلاس 20 نفره 116 باشد، چه احتمال دارد که آنها نمونهای تصادفی از جمعیت کلی باشند؟
این پرسش را نمیتوان با ابزارهای این درس پاسخ داد و نکته اصلی در همین است. انحراف معیار فردی برابر با 15 است، اما پرسش مربوط به میانگین نمونهای است و میانگینهای نمونهای کمتر از افراد تغییر میکنند. کمیسازی این موضوع نیازمند خطای استاندارد و توزیع نمونهبرداری میانگین است که موضوع واحد بعدی است.
انتخاب از میان سه
| دوجملهای | پوآسون | طبیعی | |
|---|---|---|---|
| نوع متغیر | شمار موفقیتها | شمارش رویدادها | اندازهگیری پیوسته |
| محدوده | صفر تا | 0 تا | به |
| پارامترها | , | , | |
| متوسط | |||
| واریانس | |||
| فرض کلیدی | ثابت ، ثابت ، آزمایشهای مستقل | نرخ ثابت، رویدادهای مستقل، بدون ثابت | تقارن حول میانگین |
| کاربرد معمول | نسبت بیماران پاسخدهنده | نرخ وقوع به ازای هر نفر-سال | فشار خون، وزن، مقادیر آزمایشگاهی |
فرض استقلال در هر سه مورد وجود دارد و در دادههای سلامت بیش از همه نقض میشود: بیماران در یک کلینیک، اندازهگیریهای مکرر روی یک فرد، خواهر و برادرها و رویدادهای متمرکز در زمان. وقتی این فرض برقرار نباشد، برآوردهای نقطهای معمولاً باقی میمانند اما واریانس اشتباه است، که به معنای نادرست بودن فواصل اطمینان و مقادیر p است.
درک خود را بررسی کنید
- یک درمان دارای نرخ پاسخ 30% است. در یک کارآزمایی روی 12 بیمار، احتمال اینکه دقیقاً 4 نفر پاسخ دهند را بهصورت دستی محاسبه کنید و سپس در R تأیید کنید. میانگین و انحراف معیار مورد انتظار چیست؟
- یک بخش اورژانس بهطور متوسط در هر هفته 4.2 ایست قلبی را تجربه میکند. احتمال وقوع یک هفتهای که هیچ ایست قلبی در آن رخ ندهد و یک هفتهای که 8 ایست یا بیشتر در آن رخ دهد را محاسبه کنید. بگویید با کدام فرضیه راحت نیستید و چرا.
- کلسترول سرم در یک جمعیت توزیع نرمال دارد با میانگین 5.2 میلیمول بر لیتر و ضریب استاندارد SD برابر با 1.1. چه نسبت از افراد از 6.5 فراتر میروند؟ آن را بهصورت دستی با استفاده از نمره z انجام دهید و در R تأیید کنید.
- یک متغیر شماری میانگین 3.1 و واریانس 14.8 دارد. آیا توزیع پواسون مناسب است؟ این الگو چه چیزی دربارهٔ فرآیند تولید دادهها پیشنهاد میکند؟
- توضیح دهید چرا احتمال اینکه یک متغیر توزیعشده به صورت نرمال دقیقاً مقدار 100 را بگیرد، صفر است و چرا این موضوع توزیع نرمال را بیفایده نمیکند.
- یک پژوهشگر از توزیع دوجملهای برای شمار سقوطهای 60 ساکن خانه سالمندان در طول یک ماه استفاده میکند. دو فرضیهای را که احتمالاً نقض شدهاند نام ببرید و بگویید هر یک در چه جهتی مقدار p بهدستآمده از مدل را متمایل میکند.
مطالعه بیشتر
- Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 4 (discrete distributions) and Chapter 5 (continuous distributions).
- Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 7 and 8.