مقدمه‌ای بر زیست‌آمار
واحد 1·35 دقیقه

توصیف داده‌ها

واژگان آمار، چهار نوع متغیر، نمودارهای نمایشی که شکل توزیع را آشکار می‌کنند، و نحوه انتخاب میان میانگین و میانه هنگامی که داده‌ها متقارن نیستند.

پس از این درس شما قادر خواهید بود

  • متغیر، نمونه، جامعه آماری، توزیع و استنتاج آماری را تعریف کنید و ببینید چگونه با یکدیگر مرتبط هستند.
  • یک متغیر را به‌عنوان اسمی، ترتیبی، فاصله‌ای یا نسبت‌گونه طبقه‌بندی کنید و بگویید این طبقه‌بندی چه امکاناتی فراهم می‌کند.
  • هیستوگرام، نمودار ساقه و برگ، نمودار جعبه‌ای و نمودار پراکندگی را تفسیر کنید.
  • میانگین، میانه و مد را محاسبه کرده و بین آن‌ها انتخاب کنید.
  • واریانس، انحراف معیار، دامنه و دامنه بین‌کوارتیل را محاسبه کرده و بین آن‌ها انتخاب کنید.
  • تأثیر مقادیر نامتعارف و چندمدی بودن را بر هر خلاصه توضیح دهید.

توصیف داده‌ها

واژگان

پنج مفهوم و روابط میان آن‌ها کل منطق این موضوع است.

متغیر. یک بردار از اندازه‌گیری‌ها. یک مجموعه داده ممکن است شامل یک یا چند متغیر باشد، به‌طوری‌که مقدار هر متغیر برای هر فرد یا شیء مشاهده‌شده اندازه‌گیری می‌شود. ماتریس حاصل از شیء در برابر متغیر، خودِ مجموعه داده است.

نمونه. یک گروه محدود از افراد یا اشیاء که برای یک یا چند متغیر در آن‌ها مشاهده انجام شده است. این همان چیزی است که شما دارید.

توزیع. توصیفی از فراوانی یا احتمال مشاهده یک مقدار، یا یک بازه از مقادیر، برای یک متغیر.

جمعیت. مجموعه‌ای ناشناخته، گاهی بی‌نهایت بزرگ، از اشیاء که نمونه از آن برگرفته شده است. گاهی یک گروه واقعی از افراد؛ اغلب سازنده‌ای که فرایند تصادفی تولید داده‌های نمونه را نشان می‌دهد. این همان چیزی است که شما می‌خواهید درباره‌اش بدانید.

استنتاج آماری. روش‌هایی برای استفاده از داده‌های نمونه جهت برآورد ویژگی‌های یک جامعه آماری، همراه با برآوردی از میزان دقت آن برآورد.

جملهٔ آخر همان چیزی است که آمار را از حساب جدا می‌کند. هر کسی می‌تواند میانگین را محاسبه کند. آمار رشته‌ای است که می‌گوید آن میانگین تا چه حد ممکن است از حقیقت فاصله داشته باشد.

شکل سوژه

عملکرد آماری به دو بخش تقسیم می‌شود.

توضیحات مربوط به توزیع داده‌های نمونه‌ای است که در واقع در اختیار دارید. این توضیحات به خلاصه‌های عددی (گرایش مرکزی، پراکندگی) و نمایش‌های نموداری (توزیع‌ها، روابط) تقسیم می‌شود.

استنتاج به تعمیم از نمونه به جامعه آماری می‌پردازد. این فرایند به برآورد (فواصل اطمینان) و آزمون (مقادیر p) تقسیم می‌شود.

این درس کاملاً دربارهٔ توصیف است. هر آنچه در ادامهٔ دوره می‌آید استنتاج است و استنتاج تنها زمانی قابل‌اعتماد است که توصیف ابتدا ارائه شده باشد. آزمون فرض بر روی داده‌هایی که آن‌ها را ندیده‌اید، راهی رایج برای رسیدن به پاسخی با اطمینان اشتباه است.

سه پرسش پیش از خلاصه‌سازی

این متغیر چه نوع است؟ اسمی، ترتیبی، فاصله‌ای یا نسبت. این تعیین می‌کند که کدام خلاصه‌ها معنادار هستند.

برای چه هدفی؟ درک یک توزیع، مقایسه گروه‌ها و نشان دادن یک همبستگی، وظایف متفاوتی هستند که به نمایش‌های متفاوتی نیاز دارند.

چقدر خلاصه‌سازی؟ هر خلاصه‌ای برای سادگی، اطلاعات را فدا می‌کند. میانگین، 200 عدد را با یک عدد جایگزین می‌کند؛ این هم نکته‌ی اصلی و هم هزینه‌ی آن است. بپرسید این خلاصه چه فرضیاتی را می‌طلبد و آیا این فرضیات برقرار هستند یا خیر.

انواع متغیر

نوع تعریف مثال‌ها
اسمی متفاوت اما مرتب نشده جنسیت، استان محل سکونت، مقطع تحصیلات تکمیلی
ترتیبی تفاوت‌های مرتب‌شده، اما فاصله‌های بین مقادیر مجاور لزوماً برابر نیستند. قرارگیری شغلی در معرض سرب (کم، متوسط، زیاد)؛ شدت آسیب سر (خفیف، متوسط، شدید)
فاصله فواصل برابر بین مقادیر مجاور مقیاس، اما نقطهٔ صفر دلخواه است. دمای بدن به سانتی‌گراد؛ مقیاس وضعیت سلامت SF-36؛ نگرش‌ها در مقیاس لیکرت 1 تا 7
نسبت فواصل برابر و صفر ثابت و قابل تفسیر، بنابراین نسبت‌های دو اندازه‌گیری معنادار هستند. هر درصدی از 0 تا 100%؛ هزینه‌های مراقبت‌های بهداشتی به دلار؛ تلفات ترافیکی ماهانه؛ وزن بدن به کیلوگرم

تفاوت بین متغیرهای فاصله‌ای و نسبت در یک جنبه خاص اهمیت دارد. برای یک متغیر نسبت، 40 کیلوگرم دو برابر 20 کیلوگرم است. برای یک متغیر فاصله‌ای، 40 درجه سانتی‌گراد دو برابر گرم‌تر از 20 درجه نیست، زیرا صفر مقیاس سانتی‌گراد دلخواهی است.

مهم‌ترین تمایزی که در عمل وجود دارد، بین مقیاس ترتیبی و فاصله‌ای است، زیرا داده‌های ترتیبی معمولاً طوری تحلیل می‌شوند که گویی فاصله‌ای هستند. در نظر گرفتن یک مورد لیکت به‌عنوان فاصله‌ای، مستلزم این فرض است که فاصله بین «کاملاً مخالفم» و «مخالفم» برابر فاصله بین «خنثی» و «موافقم» باشد. این فرض اغلب برای یک مقیاس جمع‌شده شامل چندین مورد قابل دفاع است، اما به‌ندرت برای یک مورد واحد قابل دفاع است.

یک مجموعه دادهٔ قابل‌کار

بیست نمره IQ که در سراسر متن از آن‌ها استفاده خواهیم کرد:

شخص IQ شخص IQ
1 93 11 95
2 104 12 102
3 99 13 106
4 110 14 86
5 122 15 113
6 115 16 131
7 107 17 96
8 106 18 91
9 89 19 122
10 97 20 110
iq <- c(93, 104, 99, 110, 122, 115, 107, 106, 89, 97,
        95, 102, 106,  86, 113, 131,  96,  91, 122, 110)

نمایشگرهای گرافیکی

هیستوگرام

مقادیر در فواصل برابر گروه‌بندی شده و بر اساس فراوانی ترسیم می‌شوند. هیچ بازه‌ای حذف نشده است: یک بازه با صفر مشاهده همچنان نمایش داده می‌شود که همین امر شکل را قابل‌خواندن می‌کند.

هیستوگرام مقداری از اطلاعات را از دست می‌دهد، زیرا دیگر نمی‌توان مقادیر فردی را بازیابی کرد. مزیت آن این است که شکل توزیع را می‌توان در یک نگاه مشاهده کرد: آیا متقارن است، مایل است، تک‌قله است یا چندقله؟

hist(iq, breaks = seq(85, 135, by = 5),
     main = "IQ scores", xlab = "IQ")

عرض سطل یک انتخاب است و تصویر را تغییر می‌دهد. اگر خیلی باریک باشد، هیستوگرام پر از نویز می‌شود؛ اگر خیلی پهن باشد، ساختار ناپدید می‌شود. چند مورد را امتحان کنید.

نمود ساقه و برگ

 Frequency    Stem &  Leaf

      2.00        8 |  69
      6.00        9 |  135679
      5.00       10 |  24667
      4.00       11 |  0035
      2.00       12 |  22
      1.00       13 |  1

 Stem width: 10
 Each leaf:  1 case

اعداد پیشرو ساقه را تشکیل می‌دهند و ارقام نهایی برگ‌ها هستند. داده‌ها بر اساس ساقه گروه‌بندی می‌شوند، مانند هیستوگرام، اما تمام اطلاعات اصلی حفظ می‌شود: خواندن ردیف دوم دقیقاً اعداد 91، 93، 95، 96، 97 و 99 را بازمی‌گرداند.

این نمایش به‌طور هم‌زمان مرکز، پراکندگی و شکل را نشان می‌دهد و متراکم‌ترین نمایش از نظر اطلاعات برای یک مجموعه دادهٔ کوچک است. برای بیش از چند صد مشاهده، کار با آن دشوار می‌شود.

نمود جعبه‌ای

نمودار جعبه‌ای پنج عدد را نمایش می‌دهد و داده‌های پرت را مشخص می‌کند:

  • این جعبه از ربع اول (Q1) تا ربع سوم (Q3) را در بر می‌گیرد. ارتفاع آن فاصله بین ربع‌ها است که شامل 50% میانی داده‌ها می‌شود.
  • خط داخل کادر میانه است.
  • ریشه‌ها تا دورترین مشاهدات امتداد می‌یابند که هنوز در محدوده 1.5 برابر IQR فراتر از هر ربع قرار دارند.
  • نقطه‌ها فراتر از خطوط شکاف به‌صورت جداگانه به‌عنوان خروجی‌های احتمالی ترسیم شده‌اند.
boxplot(iq, ylab = "IQ", main = "IQ scores")

نمودارهای جعبه‌ای بهترین نمایش برای مقایسهٔ چند گروه در کنار هم هستند، برای مثال حجم بازدمی اجباری اندازه‌گیری‌شده در سه مرکز پزشکی. آن‌ها در نشان دادن چند قلّه ضعیف هستند، زیرا توزیع دو‌مدی و توزیع یکنواخت می‌توانند جعبه‌های یکسانی تولید کنند.

نمودار پراکندگی

برای توصیف رابطه بین دو متغیر پیوسته، یکی بر هر محور. هیچ چیز دیگری به‌طور مستقیم شکل رابطه را نشان نمی‌دهد: خطی، منحنی یا عدم وجود رابطه، با یا بدون داده‌های پرت.

plot(vital_capacity, fev, xlab = "Vital capacity",
     ylab = "Forced expiratory volume")

گرایش مرکزی

میانگین (aritmetic): میانگین حسابی.

xˉ=xin\bar{x} = \frac{\sum x_i}{n}

برای داده‌های IQ، مقادیر جمعاً به 2,094 می‌رسند:

xˉ=209420=104.7\bar{x} = \frac{2094}{20} = 104.7

میانه: مقداری که 50% از مشاهدات مرتب‌شده بالاتر و پایین‌تر از آن قرار دارند. داده‌ها را مرتب کنید:

86, 89, 91, 93, 95, 96, 97, 99, 102, 104, 106, 106, 107, 110, 110, 113, 115, 122, 122, 131

با n = 20 (فرد)، میانه میانگین دهمین و یازدهمین مقدار است:

median=104+1062=105\text{median} = \frac{104 + 106}{2} = 105

مد: رایج‌ترین مقدار. در اینجا 106، 110 و 122 هر کدام دو بار رخ داده‌اند و هیچ مقداری بیشتر از این تکرار نشده است، بنابراین داده‌ها چندمدی هستند. این موضوع از قبل نشان می‌دهد که مد برای این مجموعه داده خلاصه‌ای مفید نیست.

mean(iq)      # 104.7
median(iq)    # 105
table(iq)[table(iq) > 1]   # 106 110 122, each twice

تغییرپذیری

واریانس:

s2=(xixˉ)2n1s^2 = \frac{\sum (x_i - \bar{x})^2}{n - 1}

مخرج برابر با −1 است نه n، زیرا استفاده از میانگین نمونه‌ای برای محاسبه انحرافات یک درجه آزادی را از بین می‌برد. تقسیم بر n به‌طور سیستماتیک واریانس جمعیت را دست‌کم برآورد می‌کند.

انحراف معیار ریشهٔ دوم واریانس است که مقدار را به واحدهای اصلی بازمی‌گرداند:

s=s2s = \sqrt{s^2}

برای داده‌های IQ، s² = 143.17 و s = 11.97.

دو واقعیت، انحراف معیار را قابل تفسیر می‌کنند:

  • برای داده‌های یک‌مود و متقارن، تقریباً 68% مشاهدات در فاصله یک انحراف معیار از میانگین قرار می‌گیرند و تقریباً 95% در فاصله دو انحراف معیار.
  • برای هر شکلی، نابرابری چبیشف تضمین می‌کند که دست‌کم 1−1/k² از مشاهدات در فاصله k انحراف معیار از میانگین قرار دارند. برای k=2 این مقدار دست‌کم 75% است که ضعیف‌تر از 95% است اما هیچ فرضی را ایجاب نمی‌کند.

دامنه: max(x) − min(x) = 131 − 86 = 45. این تنها از دو مشاهده استفاده می‌کند و با افزایش اندازه نمونه افزایش می‌یابد، که آن را به یک خلاصه ضعیف تبدیل می‌کند.

دامنه بین‌کوارتیلی: Q3 − Q1، شامل 50% مشاهدات میانی.

var(iq)   # 143.17
sd(iq)    # 11.97
range(iq) # 86 131
IQR(iq)   # 15

هشداری دربارهٔ کوارتیل‌ها

راه‌های مختلفی برای محاسبهٔ کوارتایل‌ها وجود دارد و نرم‌افزارهای مختلف برای یک داده‌ستون پاسخ‌های متفاوتی می‌دهند. برای این داده‌ستون:

روش Q1 Q3 IQR
R پیش‌فرض (نوع 7) 95.75 110.75 15
SPSS و دیگران (نوع 6) 95.25 112.25 17
quantile(iq)                    # R default
quantile(iq, c(.25,.75), type = 6)   # SPSS convention

هیچ‌کدام اشتباه نیستند. این روش‌ها در نحوه میان‌یابی بین آمارهای مرتبه‌ای با هم تفاوت دارند و این اختلاف با افزایش n کاهش می‌یابد. نرم‌افزاری را که استفاده کرده‌اید گزارش کنید و نگران نباشید اگر اعداد همکارتان کمی متفاوت باشند.

خلاصه داده‌های IQ

آمار ارزش
متوسط 104.7
واریانس (SD) 143.2 (11.97)
میانه 105
حالت‌ها 106، 110، 122 (هر کدام دو بار)
Q1 95.25
Q3 112.25
حداقل 86
حداکثر 131
IQR 17
محدوده 45

انتخاب یک خلاصه

چهار عامل در این انتخاب نقش دارند:

  1. نوع داده
  2. تقارن توزیع
  3. وجود مقادیر شدید
  4. تعداد قله‌ها

نوع داده

برای داده‌های اسمی هیچ معیاری از پراکندگی وجود ندارد و مد تنها معیار معنادار گرایش مرکزی است. شمارش و درصدها خلاصهٔ مناسب هستند. در کلاسی متشکل از 27 پزشک و 42 غیرپزشک، «میانگین حرفه» بی‌معنی است.

برای داده‌های ترتیبی، میانه و کوارتیل‌ها مناسب هستند؛ میانگین به‌طور دقیق مناسب نیست، زیرا فواصل بین دسته‌بندی‌ها تعریف نشده‌اند. قرارگیری شغلی در معرض سرب که به صورت «بدون» (175)، «کم» (72)، «متوسط» (42) و «زیاد» (23) ثبت شده است، با توزیع و دسته میانه آن خلاصه می‌شود، نه با میانگین.

برای داده‌های بازه‌ای و نسبت، همهٔ خلاصه‌ها در دسترس هستند و پرسش‌ها باقی‌مانده انتخاب را تعیین می‌کنند.

مقادیر شدید

این ملاحظهٔ تعیین‌کننده است و با تغییر یک عدد به‌سادگی قابل مشاهده است. فرض کنید IQ موضوع 16 به‌جای 131 به‌عنوان 200 ثبت شده باشد:

IQ موضوع 16 میانگین (SD) میانه (IQR)
131 104.7 (12.0) 105 (15)
200 108.2 (23.9) 105 (15)

یک مشاهدهٔ تغییر یافته میانگین را 3.5 واحد جابه‌جا می‌کند و انحراف معیار را دو برابر می‌کند. میانه و IQR اصلاً تغییر نمی‌کنند.

این ویژگی کلی است: میانگین و انحراف معیار از هر مشاهده محاسبه می‌شوند و بنابراین نسبت به هر یک از آن‌ها حساس هستند. میانه و IQR به ترتیب مشاهده‌ها بستگی دارند تا به مقادیرشان و در برابر تغییرات مقاوم هستند.

همچنین توجه کنید که مد در اینجا کمکی نمی‌کند. با افزودن یک مقدار بسیار بزرگ، مدها بدون تغییر باقی می‌مانند، اما از ابتدا برای این مجموعه داده هرگز آموزنده نبوده‌اند.

ویژگی‌های کلیدی

میانگین و انحراف معیار:

  • مفید برای داده‌های فاصله‌ای یا نسبت
  • مناسب برای توزیع‌های متقارن
  • به‌راحتی توسط مقادیر افراطی تحریف می‌شود
  • میانگین زمانی که توزیع متقارن باشد، شبیه به میانه است.

میانه، کوارتیل‌ها و IQR:

  • مفید برای داده‌های ترتیبی، فاصله‌ای و نسبت، صرف‌نظر از شکل توزیع
  • بسیار کمتر تحت تأثیر داده‌های پرت
  • انتخاب مناسب برای توزیع‌های لتی

داده‌های اسمی:

  • هیچ معیاری برای سنجش پراکندگی وجود ندارد.
  • این حالت توصیف‌کنندهٔ گرایش مرکزی است.

یک قاعدهٔ عملی: اگر میانگین و میانه تفاوت قابل‌توجهی داشته باشند، توزیع نامتقارن یا دارای مقادیر شدید است و گزارش صرف میانگین گمراه‌کننده خواهد بود. هر دو را گزارش کنید، یا میانه و IQR را گزارش کنید.

درک خود را بررسی کنید

  1. هر متغیر را طبقه‌بندی کرده و بیان کنید کدام معیارهای گرایش مرکزی و پراکندگی مناسب هستند: (a) گروه خونی؛ (b) مرحله تومور I تا IV؛ (c) سدیم سرم به میلی‌مول بر لیتر؛ (d) نمره در پرسشنامه افسردگی 20-موردی؛ (e) تعداد مراجعات اورژانسی در یک سال.
  2. یک مطالعه میانگین طول اقامت در بیمارستان را 8.2 روز (SD 14.1) با میانه 4 روز گزارش می‌کند. شکل توزیع را توصیف کنید، توضیح دهید چگونه به این نتیجه رسیده‌اید و بگویید کدام مقدار را به مدیر بیمارستان که در حال برنامه‌ریزی ظرفیت تخت‌ها است، پیشنهاد می‌کنید.
  3. برای داده‌های IQ در بالا، انحراف فرد شمارهٔ 5 (IQ 122) از میانگین را به‌صورت دستی محاسبه کنید و توضیح دهید چرا فرمول واریانس این انحراف‌ها را به‌جای جمع مستقیم آن‌ها به توان دو می‌رساند.
  4. نمود جعبهٔ دو گروه درمانی، جعبه‌ها و میانهٔ یکسان اما طول ویسکرهای بسیار متفاوت را نشان می‌دهد. چه چیزی ممکن است در حال رخ دادن باشد و برای بررسی از چه نموداری استفاده می‌کنید؟
  5. دو بسته نرم‌افزاری مقدار Q1 را به‌ترتیب 95.25 و 95.75 برای همان 20 مشاهدۀ یکسان گزارش می‌کنند. آیا یکی از آن‌ها اشتباه است؟ شما چه مقداری را گزارش می‌کردید و با افزایش n این اختلاف چه تغییری می‌کند؟
  6. نامساوات چبیشف تضمین می‌کند که حداقل 75% از هر توزیعی در فاصلهٔ 2 انحراف معیار از میانگین قرار دارد، در حالی که توزیع نرمال 95% را تضمین می‌کند. توضیح دهید چرا ممکن است از این حد ضعیف‌تر استفاده کنید.

مطالعه بیشتر

  • Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 2: Descriptive statistics.
  • Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 2 and 3.
  • Tukey JW. Exploratory Data Analysis. (The origin of the stem-and-leaf plot and the box plot.)

اصطلاحات کلیدی

متغیرنمونه‌جمعیتتوزیعاستنباط آماریاسمی، ترتیبی، فاصله‌ای، نسبتهیستوگرامنمودار ساقه و برگنمود جعبه‌ایمیانگین، میانه، مدواریانسانحراف معیاردامنه بین‌کوارتیلی