مقدمه‌ای بر زیست‌آمار
واحد 4·45 دقیقه

استنتاج آماری و آزمون فرضیه

نظریهٔ حد مرکزی، خطای استاندارد و دو کاری که می‌توانید با آن‌ها انجام دهید: ساخت فاصلهٔ اطمینان و آزمون فرضیه. شامل توضیح اینکه فاصلهٔ اطمینان و مقدار p هر یک چه معنایی ندارند، جایی که بیشتر سوءاستفاده‌ها از آن ناشی می‌شود.

پس از این درس شما قادر خواهید بود

  • اصل نظریهٔ حد مرکزی را بیان کنید و توضیح دهید چرا خطای استاندارد با انحراف معیار متفاوت است.
  • یک فاصله اطمینان بسازید و آن را به‌درستی تفسیر کنید.
  • چهار برداشت نادرست استاندارد از یک فاصله اطمینان را بشناسید.
  • فرضیات صفر و جایگزین را بیان کنید و یک آزمون یک‌نمونه‌ای دوطرفه را اجرا کنید.
  • رابطه بین فاصله اطمینان و آزمون فرض را توضیح دهید.
  • توضیح دهید چه زمانی باید از توزیع تی به جای توزیع نرمال استفاده کرد و این موضوع چه تفاوتی ایجاد می‌کند.
  • سه برداشت نادرست استاندارد از مقدار p را بشناسید.

استنباط آماری و آزمون فرضیه

مشکل

یک نمونه متشکل از 10 زن مبتلا به دیابت در سنین 30 تا 34 سال، دارای میانگین فشار خون سیستولیک 130 میلی‌متر جیوه است. فرض کنید واریانس معمول فشار خون سیستولیک برابر σ=11.8\sigma = 11.8 میلی‌متر جیوه باشد.

دو پرسش زیر مطرح می‌شوند و این‌ها دو پرسش استنتاج آماری هستند:

  1. برآورد. میانگین واقعی برای زنان دیابتی 30 تا 34 ساله چقدر است و این برآورد تا چه حد دقیق است؟
  2. آزمایش. آیا این با میانگین برای زنان بدون دیابت متفاوت است؟

هر دو با یک ایده پاسخ داده می‌شوند.

توزیع نمونه‌برداری میانگین

تصور کنید بتوانید بارها و بارها نمونه‌ای از nn مشاهده از یک جامعه بگیرید و هر بار میانگین xˉ\bar{x} را محاسبه کنید. این میانگین‌ها توزیع خاص خود را می‌سازند: توزیع نمونه‌گیری میانگین.

در واقع شما نمی‌توانید این کار را انجام دهید، چون تنها یک نمونه دارید. نکته این است که نظریهٔ آماری به شما می‌گوید آن توزیع بدون نیاز به ساختن آن چگونه به نظر می‌رسد.

نظریهٔ حد مرکزی

اگر جامعه به‌صورت توزیع نرمال با میانگین μ\mu و انحراف معیار σ\sigma باشد، آنگاه توزیع میانگین‌های نمونه برای هر اندازه نمونه nn به صورت زیر است:

  • توزیع نرمال
  • با میانگین = μ\mu، میانگین جامعه
  • با خطای استاندارد =σ/n= \sigma / \sqrt{n}

و بخش اساسی: این تقریباً برای هر شکلی از توزیع جمعیت کار می‌کند، به شرطی که nn به اندازه کافی بزرگ باشد.

آن بند آخر است که آمار نظریهٔ نرمال را برای داده‌های واقعی با توزیع نامتقارن و دسته‌دسته‌ای قابل‌اعمال می‌کند. شما فرض نمی‌کنید داده‌ها نرمال هستند. شما بر این تکیه می‌کنید که میانگین نمونه‌ای تقریباً نرمال است، و همین‌طور هم هست حتی وقتی داده‌ها نرمال نیستند.

«کافی بودن اندازه» بستگی دارد به میزان انحراف جمعیت از توزیع نرمال. برای داده‌های اندکی نامتقارن، n=30n = 30 یک قاعدهٔ سرانگشتی رایج است؛ اما برای داده‌های شدیداً نامتقارن یا دارای داده‌های پرت شدید، به مقدار بسیار بیشتری نیاز است.

انحراف معیار و خطای استاندارد

این‌ها همواره با هم اشتباه گرفته می‌شوند و معانی متفاوتی دارند.

انحراف معیار خطای استاندارد میانگین
توصیف می‌کند تغییرپذیری مشاهدات فردی تغییرپذیری میانگین نمونه
فرمول s=(xixˉ)2n1s = \sqrt{\frac{\sum(x_i - \bar{x})^2}{n-1}} SE=s/nSE = s / \sqrt{n}
رفتار با رشد nn به جمعیت σ\sigma همگرا می‌شود کاهش به سمت صفر
استفاده کنید توصیف گسترش داده‌ها مقدارسنجی عدم قطعیت در برآورد

خطای استاندارد با افزایش n\sqrt{n} کاهش می‌یابد، که پیامد عملی ارزشمندی دارد: نصف کردن عدم‌قطعیت شما مستلزم چهار برابر کردن حجم نمونه است. این موضوع بر جنبه‌های اقتصادی طراحی مطالعه حاکم است.

گزارش دادن خطای استاندارد به‌جای انحراف معیار (برای مثال در جدولی از ویژگی‌های پایه) باعث می‌شود داده‌ها بسیار کم‌متغیرتر از آنچه هستند به نظر برسند و این یک خطای رایج در مقالات منتشرشده است.

دو برنامه

  • اگر میانگین و انحراف معیار یک جامعه را بدانیم، یک میانگین نمونه خاص چقدر غیرعادی است؟ این آزمون فرضیه است.
  • اگر یک نمونه برداریم، میانگین واقعی جمعیت چیست و این برآورد چقدر خوب است؟ این یک فاصله اطمینان است.

آن‌ها دو کاربرد یک توزیع هستند.

فواصل اطمینان

ساختمان‌سازی

چهار مرحله:

  1. میانگین را برآورد کنید: μ^=xˉ\hat{\mu} = \bar{x}
  2. امتیاز Z را برای سطح اطمینان مورد نظر محاسبه کنید. برای 95%، Z0.025=1.96Z_{0.025} = -1.96 و Z0.975=1.96Z_{0.975} = 1.96.
  3. خطای استاندارد توزیع نمونه‌گیری را در اندازه نمونه nn: σ/n\sigma/\sqrt{n} بیابید.
  4. فاصلهٔ اطراف xˉ\bar{x} را بسازید:

xˉZσntoxˉ+Zσn\bar{x} - Z\frac{\sigma}{\sqrt{n}} \quad \text{to} \quad \bar{x} + Z\frac{\sigma}{\sqrt{n}}

با دست انجام شد

SE=11.810=11.83.162=3.73SE = \frac{11.8}{\sqrt{10}} = \frac{11.8}{3.162} = 3.73

130±(1.96)(3.73)=130±7.31130 \pm (1.96)(3.73) = 130 \pm 7.31

95% CI=(122.7,  137.3)\text{95\% CI} = (122.7,\; 137.3)

در R

xbar <- 130; sigma <- 11.8; n <- 10
se <- sigma / sqrt(n)                       # 3.73
xbar + c(-1, 1) * qnorm(0.975) * se         # 122.7 137.3

تفسیر صحیح آن

  • اگر بارها نمونه‌برداری کنیم و هر بار یک بازه بسازیم، 95% از آن بازه‌ها μ\mu را پوشش می‌دهند.
  • قبل از اینکه نمونه را بکشیم، ما 95% احتمال داریم که یک بازه بسازیم که μ\mu را پوشش دهد.
  • این بازه نشان‌دهنده محدوده مقادیر محتمل برای μ\mu است.
  • این بازه عدم قطعیت ناشی از خطای نمونه‌برداری در برآورد μ\mu را کمی‌سازی می‌کند.

سه پرسش که شهود را پرورش می‌دهند:

  • اگر nn بزرگ‌تر باشد چه اتفاقی می‌افتد؟ بازه باریک‌تر می‌شود، مانند n\sqrt{n}.
  • اگر سطح اطمینان مورد نظر کمتر باشد چه؟ بازهٔ 90% باریک‌تر است؛ بازهٔ 99% پهن‌تر. برای دستیابی به اطمینان بیشتر باید پهنای بازه را افزایش داد.
  • اگر xx کمتر متغیر باشد چه؟ σ\sigma کوچکتر بازه باریک‌تری می‌دهد.

تفسیر نادرست آن

چهار جمله‌ای که درباره یک فاصله اطمینان 95% درست نیستند:

  1. «μ\mu دارای 95% احتمال است که در این بازهٔ خاص قرار گیرد.» در چارچوب فراوانی‌گرایی، μ\mu یک ثابت ثابت است، نه یک متغیر تصادفی. یا در این بازه قرار دارد یا ندارد. این 95% عملکرد بلندمدت این روش را توصیف می‌کند، نه این بازه را.
  2. «اگر بارها نمونه‌برداری کنید، 95% میانگین‌های نمونه در این بازه قرار می‌گیرند.» خیر. تقریباً 83% در یک بازهٔ 95% قرار می‌گیرند، زیرا میانگین‌های آینده هم در اطراف μ\mu و هم در اطراف xˉ\bar{x} متغیر هستند.
  3. میانگین یک نمونهٔ آینده با احتمال 95% در این بازه قرار خواهد گرفت. این یک بازهٔ پیش‌بینی است که مفهومی متفاوت و گسترده‌تر دارد.
  4. «95% از داده‌ها در این بازه قرار دارند.» قطعاً این‌طور نیست. در اینجا این بازه 14.6 میلی‌متر جیوه‌ای عرض دارد در حالی که داده‌ها انحراف معیار 11.8 دارند؛ تقریباً 95% از فشارهای خون فردی حدود 46 میلی‌متر جیوه‌ای را در بر می‌گیرند. فاصله‌های اطمینان برای میانگین با افزایش nn به طور دلخواه باریک‌تر می‌شوند، در حالی که داده‌ها کمتر متغیر نمی‌شوند.

اولین سوءتعبیر رایج‌ترین و قابل‌عفوترین است، زیرا اکثر مردم می‌خواهند فاصله معنایی همین را داشته باشد. فواصل باورپذیر بایهٔی در واقع همین تفسیر را دارند، اما این کار مستلزم تعیین یک توزیع پیشین است.

آزمون فرضیه

پرسش

همان ده زن مبتلا به دیابت دارای میانگین SBP برابر 130 میلی‌متر جیوه هستند. مشخص است زنانی که دیابت ندارند و تحت شرایط مشابه آزمایش شده‌اند، میانگین SBP برابر μ0=122\mu_0 = 122 دارند. برای هر دو گروه مقدار σ=11.8\sigma = 11.8 را فرض کنید.

آیا میانگین SBP در میان زنان دیابتی این گروه سنی متفاوت است؟

فرضیه‌ها

فرضیه‌ی صفر: نمونه‌ها از یک جمعیت یکسان آمده‌اند.

H0:μ1=μ0H_0: \mu_1 = \mu_0

فرضیه‌ی جایگزین: نمونه‌ها از جمعیت‌های مختلف آمده‌اند.

H1:μ1μ0H_1: \mu_1 \neq \mu_0

پرسشی که آزمون به آن پاسخ می‌دهد این است: اگر H0H_0 درست باشد، احتمال اینکه یک SBP دیابتی متوسط دست‌کم به این حد در هر دو جهت شدید باشد، چقدر است؟

با دقت توجه کنید که بر چه چیزی شرط‌بندی شده است. مقدار p فرض می‌کند فرضیهٔ صفر درست است و دربارهٔ داده‌ها پرسش می‌کند. این مقدار فرض نمی‌کند داده‌ها درست باشند و دربارهٔ فرضیه پرسش کند. این دقیقاً معکوس شدن احتمال شرطی از واحد احتمال است و منبع بیشتر سوءتعبیرهای مقدار p است.

روند کار

  1. امتیاز Z میانگین نمونه را با فرض اینکه از توزیع نمونه‌گیری زنان غیر دیابتی آمده است، محاسبه کنید:

Z=xˉμ0σ/nZ = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}}

  1. مساحت‌های زیر منحنی نرمال استاندارد را از نقطه ZZ به سمت راست و از نقطه Z-Z به سمت چپ، یعنی در هر دو دم، جمع کنید.

  2. آن مجموع، مقدار p است: احتمال به دست آوردن میانگین نمونه‌ای دست‌کم به همین اندازه حدی، در هر دو جهت، اگر H0H_0 درست باشد.

با دست انجام شد

Z=13012211.8/10=83.73=2.14Z = \frac{130 - 122}{11.8/\sqrt{10}} = \frac{8}{3.73} = 2.14

P(Z<2.14)+P(Z>2.14)=0.0162+0.0162=0.032P(Z < -2.14) + P(Z > 2.14) = 0.0162 + 0.0162 = 0.032

در R

z <- (130 - 122) / (11.8 / sqrt(10))    # 2.144
2 * (1 - pnorm(z))                      # 0.032

سه روش معادل برای رسیدن به یک نتیجه‌گیری

1. مقدار p را با یک آستانه مقایسه کنید. p=0.032<0.05p = 0.032 < 0.05.

2. آمار آزمون را با یک مقدار بحرانی مقایسه کنید. مقدار z را که احتمال (p-value) آن برابر 0.05 است، بیابید: Z10.05/2=1.96Z_{1 - 0.05/2} = 1.96. برای اینکه xˉ\bar{x} از نظر آماری به‌طور معناداری با μ0\mu_0 متفاوت باشد، آمار آزمون باید از 1.96 فراتر رود یا به زیر −1.96 برود. در اینجا 2.14 > 1.96.

3. بررسی کنید که آیا فاصله اطمینان، مقدار صفر را رد می‌کند یا خیر. فاصله اطمینان 95% برای CI برابر است با (122.7، 137.3)، که مقدار 122.0 را شامل نمی‌شود.

این سه روش از نظر جبری یکسان هستند. درک این معادل بودن ارزش دارد، زیرا نشان می‌دهد که فاصله اطمینان همه چیزهایی را که مقدار p دارد و حتی بیشتر را در بر می‌گیرد: همچنین بزرگی و دقت را نیز نشان می‌دهد. هرگاه مجبور به انتخاب یکی باشید، بازه را گزارش کنید.

آزمایش یک‌طرفه

یک آزمون یک‌طرفه تنها بررسی می‌کند که آیا میانگین بزرگ‌تر است (یا تنها اینکه آیا کوچک‌تر است)، و تمام 5% را در یک سمت قرار می‌دهد. در اینجا مقدار p یک‌طرفه برابر 0.016 خواهد بود.

شرط: جهت باید قبل از مشاهده داده‌ها مشخص شود و دلیلی وجود داشته باشد که چرا تفاوت در جهت مخالف باید به‌طور یکسان با عدم وجود تفاوت در نظر گرفته شود. تغییر به آزمون یک‌طرفه پس از مشاهده جهت داده‌ها، مقدار p شما را نصف و نرخ خطای نوع اول را دو برابر می‌کند. در عمل، آزمون‌های یک‌طرفه به ندرت در پژوهش‌های سلامت موجه هستند و مجلات نسبت به آن‌ها با شک و تردید برخورد می‌کنند.

وقتی σ\sigma ناشناخته است

مثال بالا فرض کرد که σ=11.8\sigma = 11.8 از خارج مطالعه شناخته شده است. معمولاً واریانس جمعیت را نمی‌دانیم.

سپس انحراف معیار نمونه SS را به جای σ\sigma به کار می‌بریم. این کار خطای افزوده‌ای وارد می‌کند، چون SS خود برآورد شده است و در نمونه کوچک، بد برآورد می‌شود. برای در نظر گرفتن آن عدم قطعیت اضافی، به جای توزیع نرمال از توزیع t استفاده کنید:

t(n1)=xˉμ0S/nt_{(n-1)} = \frac{\bar{x} - \mu_0}{S/\sqrt{n}}

شکل tt از طریق درجات آزادی خود، n1n - 1، به اندازه نمونه بستگی دارد. توزیع t نسبت به توزیع نرمال دم‌های سنگین‌تری دارد که باعث می‌شود مقادیر بحرانی آن بزرگ‌تر شده و آزمون محافظه‌کارتر شود. با افزایش nn، tt به zz همگرا می‌شود.

توزیع مقدار بحرانی در p=0.975p = 0.975
ZZ 1.96
tt با n=120n = 120 1.98
tt با n=30n = 30 2.05
tt با n=10n = 10 2.26
qnorm(0.975)      # 1.96
qt(0.975, df = 119)  # 1.98
qt(0.975, df = 29)   # 2.05
qt(0.975, df = 9)    # 2.26

چه تفاوتی دارد؟

مثال فشار خون را طوری دوباره انجام دهید که 11.8 را به‌عنوان انحراف معیار نمونه در نظر بگیرید، نه به‌عنوان مقدار جمعیت شناخته‌شده:

t_stat <- (130 - 122) / (11.8 / sqrt(10))   # 2.144, same statistic
2 * (1 - pt(t_stat, df = 9))                # 0.0606

# and the interval
130 + c(-1, 1) * qt(0.975, 9) * (11.8/sqrt(10))   # 121.6  138.4

آمار آزمون یکسان است، و با این حال:

σ\sigma شناخته‌شده (z) σ\sigma تخمین زده شده (t)
ارزش p 0.032 0.061
95% CI (122.7, 137.3) (121.6, 138.4)
122 را حذف می‌کند؟ بله خیر

همان داده‌ها تحت یک فرض نتیجهٔ معنادار و تحت فرض دیگر نتیجهٔ غیرمعنادار می‌دهند. هیچ چیز در مورد اندازه‌گیری‌ها تغییر نکرده است؛ تنها چیزی که تغییر کرده، ادعای ما دربارهٔ واریانس جمعیت است. با n=10n = 10 این تمایز قاطع است و با n=200n = 200 ناچیز خواهد بود.

درس این نیست که یک پاسخ درست باشد. بلکه این است که با یک نمونهٔ کوچک، ادعا کردن اینکه σ\sigma را می‌دانیم، فرضیه‌ای قوی برای انجام کار واقعی است و باید اثبات شود نه صرفاً فرض.

تفسیر مقدار p

اگر p<0.05p < 0.05:

  • این داده‌ها در صورتی که H0H_0 درست باشد، بعید هستند.
  • احتمال رد H0H_0 وقتی که در واقع درست است (خطای نوع اول) در 5% نگه داشته می‌شود.
  • قوت شواهد به نفع H0H_0 کم است.

تفسیر نادرست مقدار p

ارزش p نیست:

  1. احتمال اینکه H0H_0 درست باشد. مقدار p برابر است با P(dataH0)P(\text{data} \mid H_0)؛ این ادعا P(H0data)P(H_0 \mid \text{data}) است. آن‌ها از طریق قاعده بیز به هم مرتبط‌اند و برابر نیستند. در نظر گرفتن آن‌ها به‌عنوان برابر، مغالطه دادستان از واحد احتمال است که در لباس آماری ارائه شده است.
  2. احتمال پذیرش H0H_0 وقتی که نادرست است (نوع خطای II). یعنی β\beta، و این موضوع واحد توان است.
  3. احتمال اینکه H1H_1 درست باشد.

سه نکتهٔ دیگر که به دنبال می‌آید:

  • ارزش p بزرگ دلیلی بر عدم وجود اثر نیست. این نشان‌دهنده عدم شناسایی اثر است که در یک مطالعه کوچک حتی در صورت وجود اثر بزرگ کاملاً انتظار می‌رود. «عدم وجود شواهد، دلیلی بر عدم وجود نیست.»
  • اهمیت آماری به معنای اهمیت بالینی نیست. با نمونه‌ای به اندازهٔ کافی بزرگ، یک تفاوت پیش‌پاافتاده به p<0.05p < 0.05 می‌رسد. با نمونه‌ای کوچک، یک تفاوت مهم به آن نمی‌رسد.
  • آستانهٔ 0.05 یک قراردادی است، نه ویژگی‌ای از طبیعت. مقدار p برابر 0.049 و مقدار p برابر 0.051 اساساً یکسان هستند.

خطای نوع I و نوع II

H0H_0 درست است H0H_0 نادرست است
H0H_0 را رد کنید خطای نوع I (احتمال α\alpha) درست (احتمال 1β1 - \beta، توان)
H0H_0 را رد نکنید صحیح (احتمال 1α1 - \alpha) نوع خطای II (احتمال β\beta)

طبق قرارداد α=0.05\alpha = 0.05 و β=0.20\beta = 0.20، با توان 80%. به عدم تقارن توجه کنید: ما تحمل می‌کنیم که 20% احتمال از دست دادن یک اثر واقعی و 5% احتمال هشدار کاذب وجود داشته باشد. این عدم تقارن یک قضاوت ارزشی است درباره اینکه کدام خطا بدتر است، و همیشه درست نیست.

درک خود را بررسی کنید

  1. یک نمونهٔ 25 نفره با میانگین کراتینین 92 میکرومول بر لیتر و نمونهٔ SD 20. فاصله اطمینان 95% را به‌صورت دستی با استفاده از توزیع مناسب بسازید و در R تأیید کنید. توضیح دهید چرا t یا z را انتخاب کرده‌اید.
  2. در هر جمله به‌طور جداگانه توضیح دهید چرا موارد زیر نادرست هستند: (الف) «ما 95% اطمینان داریم که 95% بیماران در این بازه قرار می‌گیرند.» (ب) «مقدار p برابر 0.03 به این معنی است که 3% احتمال دارد فرضیهٔ صفر درست باشد.»
  3. یک مطالعه روی 2000 بیمار تفاوت میانگین 0.4 میلی‌متر جیوه در فشار خون را گزارش می‌کند، p = 0.004. یک مطالعه روی 20 بیمار تفاوت میانگین 9 میلی‌متر جیوه‌ای را گزارش می‌کند، p = 0.21. کدام نتیجه از نظر بالینی مفیدتر است و برای هر کدام چه چیزی را مایلید گزارش شود؟
  4. به‌صورت جبری نشان دهید که فاصله اطمینان 95% که مقدار صفر را شامل نمی‌شود، معادل یک آزمون دوطرفه با سطح معناداری کمتر از 0.05 است.
  5. با استفاده از مثال فشار خون، مقدار p و فاصله اطمینان را با فرض n برابر 40 به‌جای 10 بازمحاسبه کنید، در حالی که سایر موارد بدون تغییر باقی می‌مانند. درباره آنچه تغییر کرده و آنچه تغییر نکرده است توضیح دهید.
  6. یک پژوهشگر آزمایش دوطرفه را اجرا می‌کند، مقدار p برابر 0.08 به‌دست می‌آید، سپس مقدار p یک‌طرفه 0.04 را معنادار گزارش می‌کند. دقیقاً توضیح دهید چه اشتباهی رخ داده و این کار چه تأثیری بر نرخ خطای نوع اول دارد.

مطالعه بیشتر

  • Rosner B. Fundamentals of Biostatistics. 8th ed. Chapters 6 and 7.
  • Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 9 and 10.
  • Greenland S, Senn SJ, Rothman KJ, et al. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. Eur J Epidemiol. 2016;31(4):337-350.
  • Wasserstein RL, Lazar NA. The ASA statement on p-values: context, process, and purpose. Am Stat. 2016;70(2):129-133.

اصطلاحات کلیدی

توزیع نمونه‌بردارینظریهٔ حد مرکزیخطای استانداردفاصله اطمینانفرضیهٔ صفرفرضیه‌ی جایگزینارزش پیخطای نوع اولنوع خطای IIتوزیع تیدرجه آزادی