توصیف دادهها
واژگان آمار، چهار نوع متغیر، نمودارهای نمایشی که شکل توزیع را آشکار میکنند، و نحوه انتخاب میان میانگین و میانه هنگامی که دادهها متقارن نیستند.
پس از این درس شما قادر خواهید بود
- متغیر، نمونه، جامعه آماری، توزیع و استنتاج آماری را تعریف کنید و ببینید چگونه با یکدیگر مرتبط هستند.
- یک متغیر را بهعنوان اسمی، ترتیبی، فاصلهای یا نسبتگونه طبقهبندی کنید و بگویید این طبقهبندی چه امکاناتی فراهم میکند.
- هیستوگرام، نمودار ساقه و برگ، نمودار جعبهای و نمودار پراکندگی را تفسیر کنید.
- میانگین، میانه و مد را محاسبه کرده و بین آنها انتخاب کنید.
- واریانس، انحراف معیار، دامنه و دامنه بینکوارتیل را محاسبه کرده و بین آنها انتخاب کنید.
- تأثیر مقادیر نامتعارف و چندمدی بودن را بر هر خلاصه توضیح دهید.
توصیف دادهها
واژگان
پنج مفهوم و روابط میان آنها کل منطق این موضوع است.
متغیر. یک بردار از اندازهگیریها. یک مجموعه داده ممکن است شامل یک یا چند متغیر باشد، بهطوریکه مقدار هر متغیر برای هر فرد یا شیء مشاهدهشده اندازهگیری میشود. ماتریس حاصل از شیء در برابر متغیر، خودِ مجموعه داده است.
نمونه. یک گروه محدود از افراد یا اشیاء که برای یک یا چند متغیر در آنها مشاهده انجام شده است. این همان چیزی است که شما دارید.
توزیع. توصیفی از فراوانی یا احتمال مشاهده یک مقدار، یا یک بازه از مقادیر، برای یک متغیر.
جمعیت. مجموعهای ناشناخته، گاهی بینهایت بزرگ، از اشیاء که نمونه از آن برگرفته شده است. گاهی یک گروه واقعی از افراد؛ اغلب سازندهای که فرایند تصادفی تولید دادههای نمونه را نشان میدهد. این همان چیزی است که شما میخواهید دربارهاش بدانید.
استنتاج آماری. روشهایی برای استفاده از دادههای نمونه جهت برآورد ویژگیهای یک جامعه آماری، همراه با برآوردی از میزان دقت آن برآورد.
جملهٔ آخر همان چیزی است که آمار را از حساب جدا میکند. هر کسی میتواند میانگین را محاسبه کند. آمار رشتهای است که میگوید آن میانگین تا چه حد ممکن است از حقیقت فاصله داشته باشد.
شکل سوژه
عملکرد آماری به دو بخش تقسیم میشود.
توضیحات مربوط به توزیع دادههای نمونهای است که در واقع در اختیار دارید. این توضیحات به خلاصههای عددی (گرایش مرکزی، پراکندگی) و نمایشهای نموداری (توزیعها، روابط) تقسیم میشود.
استنتاج به تعمیم از نمونه به جامعه آماری میپردازد. این فرایند به برآورد (فواصل اطمینان) و آزمون (مقادیر p) تقسیم میشود.
این درس کاملاً دربارهٔ توصیف است. هر آنچه در ادامهٔ دوره میآید استنتاج است و استنتاج تنها زمانی قابلاعتماد است که توصیف ابتدا ارائه شده باشد. آزمون فرض بر روی دادههایی که آنها را ندیدهاید، راهی رایج برای رسیدن به پاسخی با اطمینان اشتباه است.
سه پرسش پیش از خلاصهسازی
این متغیر چه نوع است؟ اسمی، ترتیبی، فاصلهای یا نسبت. این تعیین میکند که کدام خلاصهها معنادار هستند.
برای چه هدفی؟ درک یک توزیع، مقایسه گروهها و نشان دادن یک همبستگی، وظایف متفاوتی هستند که به نمایشهای متفاوتی نیاز دارند.
چقدر خلاصهسازی؟ هر خلاصهای برای سادگی، اطلاعات را فدا میکند. میانگین، 200 عدد را با یک عدد جایگزین میکند؛ این هم نکتهی اصلی و هم هزینهی آن است. بپرسید این خلاصه چه فرضیاتی را میطلبد و آیا این فرضیات برقرار هستند یا خیر.
انواع متغیر
| نوع | تعریف | مثالها |
|---|---|---|
| اسمی | متفاوت اما مرتب نشده | جنسیت، استان محل سکونت، مقطع تحصیلات تکمیلی |
| ترتیبی | تفاوتهای مرتبشده، اما فاصلههای بین مقادیر مجاور لزوماً برابر نیستند. | قرارگیری شغلی در معرض سرب (کم، متوسط، زیاد)؛ شدت آسیب سر (خفیف، متوسط، شدید) |
| فاصله | فواصل برابر بین مقادیر مجاور مقیاس، اما نقطهٔ صفر دلخواه است. | دمای بدن به سانتیگراد؛ مقیاس وضعیت سلامت SF-36؛ نگرشها در مقیاس لیکرت 1 تا 7 |
| نسبت | فواصل برابر و صفر ثابت و قابل تفسیر، بنابراین نسبتهای دو اندازهگیری معنادار هستند. | هر درصدی از 0 تا 100%؛ هزینههای مراقبتهای بهداشتی به دلار؛ تلفات ترافیکی ماهانه؛ وزن بدن به کیلوگرم |
تفاوت بین متغیرهای فاصلهای و نسبت در یک جنبه خاص اهمیت دارد. برای یک متغیر نسبت، 40 کیلوگرم دو برابر 20 کیلوگرم است. برای یک متغیر فاصلهای، 40 درجه سانتیگراد دو برابر گرمتر از 20 درجه نیست، زیرا صفر مقیاس سانتیگراد دلخواهی است.
مهمترین تمایزی که در عمل وجود دارد، بین مقیاس ترتیبی و فاصلهای است، زیرا دادههای ترتیبی معمولاً طوری تحلیل میشوند که گویی فاصلهای هستند. در نظر گرفتن یک مورد لیکت بهعنوان فاصلهای، مستلزم این فرض است که فاصله بین «کاملاً مخالفم» و «مخالفم» برابر فاصله بین «خنثی» و «موافقم» باشد. این فرض اغلب برای یک مقیاس جمعشده شامل چندین مورد قابل دفاع است، اما بهندرت برای یک مورد واحد قابل دفاع است.
یک مجموعه دادهٔ قابلکار
بیست نمره IQ که در سراسر متن از آنها استفاده خواهیم کرد:
| شخص | IQ | شخص | IQ |
|---|---|---|---|
| 1 | 93 | 11 | 95 |
| 2 | 104 | 12 | 102 |
| 3 | 99 | 13 | 106 |
| 4 | 110 | 14 | 86 |
| 5 | 122 | 15 | 113 |
| 6 | 115 | 16 | 131 |
| 7 | 107 | 17 | 96 |
| 8 | 106 | 18 | 91 |
| 9 | 89 | 19 | 122 |
| 10 | 97 | 20 | 110 |
iq <- c(93, 104, 99, 110, 122, 115, 107, 106, 89, 97,
95, 102, 106, 86, 113, 131, 96, 91, 122, 110)
نمایشگرهای گرافیکی
هیستوگرام
مقادیر در فواصل برابر گروهبندی شده و بر اساس فراوانی ترسیم میشوند. هیچ بازهای حذف نشده است: یک بازه با صفر مشاهده همچنان نمایش داده میشود که همین امر شکل را قابلخواندن میکند.
هیستوگرام مقداری از اطلاعات را از دست میدهد، زیرا دیگر نمیتوان مقادیر فردی را بازیابی کرد. مزیت آن این است که شکل توزیع را میتوان در یک نگاه مشاهده کرد: آیا متقارن است، مایل است، تکقله است یا چندقله؟
hist(iq, breaks = seq(85, 135, by = 5),
main = "IQ scores", xlab = "IQ")
عرض سطل یک انتخاب است و تصویر را تغییر میدهد. اگر خیلی باریک باشد، هیستوگرام پر از نویز میشود؛ اگر خیلی پهن باشد، ساختار ناپدید میشود. چند مورد را امتحان کنید.
نمود ساقه و برگ
Frequency Stem & Leaf
2.00 8 | 69
6.00 9 | 135679
5.00 10 | 24667
4.00 11 | 0035
2.00 12 | 22
1.00 13 | 1
Stem width: 10
Each leaf: 1 case
اعداد پیشرو ساقه را تشکیل میدهند و ارقام نهایی برگها هستند. دادهها بر اساس ساقه گروهبندی میشوند، مانند هیستوگرام، اما تمام اطلاعات اصلی حفظ میشود: خواندن ردیف دوم دقیقاً اعداد 91، 93، 95، 96، 97 و 99 را بازمیگرداند.
این نمایش بهطور همزمان مرکز، پراکندگی و شکل را نشان میدهد و متراکمترین نمایش از نظر اطلاعات برای یک مجموعه دادهٔ کوچک است. برای بیش از چند صد مشاهده، کار با آن دشوار میشود.
نمود جعبهای
نمودار جعبهای پنج عدد را نمایش میدهد و دادههای پرت را مشخص میکند:
- این جعبه از ربع اول (Q1) تا ربع سوم (Q3) را در بر میگیرد. ارتفاع آن فاصله بین ربعها است که شامل 50% میانی دادهها میشود.
- خط داخل کادر میانه است.
- ریشهها تا دورترین مشاهدات امتداد مییابند که هنوز در محدوده 1.5 برابر IQR فراتر از هر ربع قرار دارند.
- نقطهها فراتر از خطوط شکاف بهصورت جداگانه بهعنوان خروجیهای احتمالی ترسیم شدهاند.
boxplot(iq, ylab = "IQ", main = "IQ scores")
نمودارهای جعبهای بهترین نمایش برای مقایسهٔ چند گروه در کنار هم هستند، برای مثال حجم بازدمی اجباری اندازهگیریشده در سه مرکز پزشکی. آنها در نشان دادن چند قلّه ضعیف هستند، زیرا توزیع دومدی و توزیع یکنواخت میتوانند جعبههای یکسانی تولید کنند.
نمودار پراکندگی
برای توصیف رابطه بین دو متغیر پیوسته، یکی بر هر محور. هیچ چیز دیگری بهطور مستقیم شکل رابطه را نشان نمیدهد: خطی، منحنی یا عدم وجود رابطه، با یا بدون دادههای پرت.
plot(vital_capacity, fev, xlab = "Vital capacity",
ylab = "Forced expiratory volume")
گرایش مرکزی
میانگین (aritmetic): میانگین حسابی.
برای دادههای IQ، مقادیر جمعاً به 2,094 میرسند:
میانه: مقداری که 50% از مشاهدات مرتبشده بالاتر و پایینتر از آن قرار دارند. دادهها را مرتب کنید:
86, 89, 91, 93, 95, 96, 97, 99, 102, 104, 106, 106, 107, 110, 110, 113, 115, 122, 122, 131
با n = 20 (فرد)، میانه میانگین دهمین و یازدهمین مقدار است:
مد: رایجترین مقدار. در اینجا 106، 110 و 122 هر کدام دو بار رخ دادهاند و هیچ مقداری بیشتر از این تکرار نشده است، بنابراین دادهها چندمدی هستند. این موضوع از قبل نشان میدهد که مد برای این مجموعه داده خلاصهای مفید نیست.
mean(iq) # 104.7
median(iq) # 105
table(iq)[table(iq) > 1] # 106 110 122, each twice
تغییرپذیری
واریانس:
مخرج برابر با −1 است نه n، زیرا استفاده از میانگین نمونهای برای محاسبه انحرافات یک درجه آزادی را از بین میبرد. تقسیم بر n بهطور سیستماتیک واریانس جمعیت را دستکم برآورد میکند.
انحراف معیار ریشهٔ دوم واریانس است که مقدار را به واحدهای اصلی بازمیگرداند:
برای دادههای IQ، s² = 143.17 و s = 11.97.
دو واقعیت، انحراف معیار را قابل تفسیر میکنند:
- برای دادههای یکمود و متقارن، تقریباً 68% مشاهدات در فاصله یک انحراف معیار از میانگین قرار میگیرند و تقریباً 95% در فاصله دو انحراف معیار.
- برای هر شکلی، نابرابری چبیشف تضمین میکند که دستکم 1−1/k² از مشاهدات در فاصله k انحراف معیار از میانگین قرار دارند. برای k=2 این مقدار دستکم 75% است که ضعیفتر از 95% است اما هیچ فرضی را ایجاب نمیکند.
دامنه: max(x) − min(x) = 131 − 86 = 45. این تنها از دو مشاهده استفاده میکند و با افزایش اندازه نمونه افزایش مییابد، که آن را به یک خلاصه ضعیف تبدیل میکند.
دامنه بینکوارتیلی: Q3 − Q1، شامل 50% مشاهدات میانی.
var(iq) # 143.17
sd(iq) # 11.97
range(iq) # 86 131
IQR(iq) # 15
هشداری دربارهٔ کوارتیلها
راههای مختلفی برای محاسبهٔ کوارتایلها وجود دارد و نرمافزارهای مختلف برای یک دادهستون پاسخهای متفاوتی میدهند. برای این دادهستون:
| روش | Q1 | Q3 | IQR |
|---|---|---|---|
| R پیشفرض (نوع 7) | 95.75 | 110.75 | 15 |
| SPSS و دیگران (نوع 6) | 95.25 | 112.25 | 17 |
quantile(iq) # R default
quantile(iq, c(.25,.75), type = 6) # SPSS convention
هیچکدام اشتباه نیستند. این روشها در نحوه میانیابی بین آمارهای مرتبهای با هم تفاوت دارند و این اختلاف با افزایش n کاهش مییابد. نرمافزاری را که استفاده کردهاید گزارش کنید و نگران نباشید اگر اعداد همکارتان کمی متفاوت باشند.
خلاصه دادههای IQ
| آمار | ارزش |
|---|---|
| متوسط | 104.7 |
| واریانس (SD) | 143.2 (11.97) |
| میانه | 105 |
| حالتها | 106، 110، 122 (هر کدام دو بار) |
| Q1 | 95.25 |
| Q3 | 112.25 |
| حداقل | 86 |
| حداکثر | 131 |
| IQR | 17 |
| محدوده | 45 |
انتخاب یک خلاصه
چهار عامل در این انتخاب نقش دارند:
- نوع داده
- تقارن توزیع
- وجود مقادیر شدید
- تعداد قلهها
نوع داده
برای دادههای اسمی هیچ معیاری از پراکندگی وجود ندارد و مد تنها معیار معنادار گرایش مرکزی است. شمارش و درصدها خلاصهٔ مناسب هستند. در کلاسی متشکل از 27 پزشک و 42 غیرپزشک، «میانگین حرفه» بیمعنی است.
برای دادههای ترتیبی، میانه و کوارتیلها مناسب هستند؛ میانگین بهطور دقیق مناسب نیست، زیرا فواصل بین دستهبندیها تعریف نشدهاند. قرارگیری شغلی در معرض سرب که به صورت «بدون» (175)، «کم» (72)، «متوسط» (42) و «زیاد» (23) ثبت شده است، با توزیع و دسته میانه آن خلاصه میشود، نه با میانگین.
برای دادههای بازهای و نسبت، همهٔ خلاصهها در دسترس هستند و پرسشها باقیمانده انتخاب را تعیین میکنند.
مقادیر شدید
این ملاحظهٔ تعیینکننده است و با تغییر یک عدد بهسادگی قابل مشاهده است. فرض کنید IQ موضوع 16 بهجای 131 بهعنوان 200 ثبت شده باشد:
| IQ موضوع 16 | میانگین (SD) | میانه (IQR) |
|---|---|---|
| 131 | 104.7 (12.0) | 105 (15) |
| 200 | 108.2 (23.9) | 105 (15) |
یک مشاهدهٔ تغییر یافته میانگین را 3.5 واحد جابهجا میکند و انحراف معیار را دو برابر میکند. میانه و IQR اصلاً تغییر نمیکنند.
این ویژگی کلی است: میانگین و انحراف معیار از هر مشاهده محاسبه میشوند و بنابراین نسبت به هر یک از آنها حساس هستند. میانه و IQR به ترتیب مشاهدهها بستگی دارند تا به مقادیرشان و در برابر تغییرات مقاوم هستند.
همچنین توجه کنید که مد در اینجا کمکی نمیکند. با افزودن یک مقدار بسیار بزرگ، مدها بدون تغییر باقی میمانند، اما از ابتدا برای این مجموعه داده هرگز آموزنده نبودهاند.
ویژگیهای کلیدی
میانگین و انحراف معیار:
- مفید برای دادههای فاصلهای یا نسبت
- مناسب برای توزیعهای متقارن
- بهراحتی توسط مقادیر افراطی تحریف میشود
- میانگین زمانی که توزیع متقارن باشد، شبیه به میانه است.
میانه، کوارتیلها و IQR:
- مفید برای دادههای ترتیبی، فاصلهای و نسبت، صرفنظر از شکل توزیع
- بسیار کمتر تحت تأثیر دادههای پرت
- انتخاب مناسب برای توزیعهای لتی
دادههای اسمی:
- هیچ معیاری برای سنجش پراکندگی وجود ندارد.
- این حالت توصیفکنندهٔ گرایش مرکزی است.
یک قاعدهٔ عملی: اگر میانگین و میانه تفاوت قابلتوجهی داشته باشند، توزیع نامتقارن یا دارای مقادیر شدید است و گزارش صرف میانگین گمراهکننده خواهد بود. هر دو را گزارش کنید، یا میانه و IQR را گزارش کنید.
درک خود را بررسی کنید
- هر متغیر را طبقهبندی کرده و بیان کنید کدام معیارهای گرایش مرکزی و پراکندگی مناسب هستند: (a) گروه خونی؛ (b) مرحله تومور I تا IV؛ (c) سدیم سرم به میلیمول بر لیتر؛ (d) نمره در پرسشنامه افسردگی 20-موردی؛ (e) تعداد مراجعات اورژانسی در یک سال.
- یک مطالعه میانگین طول اقامت در بیمارستان را 8.2 روز (SD 14.1) با میانه 4 روز گزارش میکند. شکل توزیع را توصیف کنید، توضیح دهید چگونه به این نتیجه رسیدهاید و بگویید کدام مقدار را به مدیر بیمارستان که در حال برنامهریزی ظرفیت تختها است، پیشنهاد میکنید.
- برای دادههای IQ در بالا، انحراف فرد شمارهٔ 5 (IQ 122) از میانگین را بهصورت دستی محاسبه کنید و توضیح دهید چرا فرمول واریانس این انحرافها را بهجای جمع مستقیم آنها به توان دو میرساند.
- نمود جعبهٔ دو گروه درمانی، جعبهها و میانهٔ یکسان اما طول ویسکرهای بسیار متفاوت را نشان میدهد. چه چیزی ممکن است در حال رخ دادن باشد و برای بررسی از چه نموداری استفاده میکنید؟
- دو بسته نرمافزاری مقدار Q1 را بهترتیب 95.25 و 95.75 برای همان 20 مشاهدۀ یکسان گزارش میکنند. آیا یکی از آنها اشتباه است؟ شما چه مقداری را گزارش میکردید و با افزایش n این اختلاف چه تغییری میکند؟
- نامساوات چبیشف تضمین میکند که حداقل 75% از هر توزیعی در فاصلهٔ 2 انحراف معیار از میانگین قرار دارد، در حالی که توزیع نرمال 95% را تضمین میکند. توضیح دهید چرا ممکن است از این حد ضعیفتر استفاده کنید.
مطالعه بیشتر
- Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 2: Descriptive statistics.
- Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapters 2 and 3.
- Tukey JW. Exploratory Data Analysis. (The origin of the stem-and-leaf plot and the box plot.)