مقایسه میانگین دو گروه
آزمون تی تکنمونهای، آزمون تی نمونههای مستقل و آزمون تی جفتی، فرضیات آنها و دلیل اینکه طرح جفتی بر روی همان دادهها میتواند یک نتیجه غیرمعنادار را به نتیجهای بسیار معنادار تبدیل کند.
پس از این درس شما قادر خواهید بود
- آزمون تی تکنمونهای را اجرا کرده و نتایج آن را تفسیر کنید.
- فرضهای آزمون تی نمونههای مستقل را بیان کنید و دو برآورد واریانس را تجمیع کنید.
- آزمون تی نمونههای مستقل را بهصورت دستی و در R انجام دهید و نتایج آن را تفسیر کنید.
- فرضهای آزمون تی جفتی را بیان کرده و آن را اجرا کنید.
- برای هر دو طرح، فاصلههای اطمینان را بسازید.
- به صورت جبری توضیح دهید که چرا جفتسازی واریانس را کاهش میدهد و چه زمانی کمکی نمیکند.
- بدانید وقتی واریانسها نابرابر هستند چه باید کرد.
مقایسه میانگین دو گروه
مرور: آزمون تی تکنمونهای
فشار خون سیستولیک در 10 زن پس از یک سال مصرف قرص ضد بارداری خوراکی:
- میانگین نمونه SBP = 120.4
- نمونه SD،
- فرض کنید میانگین SBP در زنان مشابهی که از قرصهای ضدبارداری خوراکی استفاده نمیکنند، است.
- همان SD را در نظر بگیرید
اگر درست باشد، آنگاه و :
با ، مقدار بحرانی است. از به بعد، را رد نمیکنیم.
t_stat <- (120.4 - 115) / (13.23 / sqrt(10)) # 1.291
2 * (1 - pt(t_stat, df = 9)) # p = 0.229
توجه کنید که این طراحی چه فرضی را در نظر گرفته است: اینکه از خارج از مطالعه شناخته شده بود. این فرض قوی است و بقیه این درس درباره طرحهایی است که از آن اجتناب میکنند.
دو گروه مستقل
اکنون دو گروه را که در خود مطالعه اندازهگیری شدهاند، مقایسه کنید:
| گروه | |||
|---|---|---|---|
| از قرص ضدبارداری خوراکی استفاده نکنید | 10 | 115.6 | 10.31 |
| قرص ضدبارداری خوراکی | 10 | 120.4 | 13.23 |
فرضها
- SBP در گروهها توزیع نرمال دارد.
- دو مقدار مجهول و وجود دارد. هیچیک از آنها از قبل معلوم نیست.
- یک واریانس ناشناختهی مشترک به نام وجود دارد.
- مشاهدات بین گروهها مستقل هستند.
فرضیات:
طبق قضیهٔ حد مرکزی، توزیعی نرمال با میانگین و خطای استاندارد دارد:
مجموع واریانسها
با فرض اینکه برای هر دو گروه مشترک باشد، ما دو برآورد مستقل از آن داریم: و . آنها را با وزندهی بر اساس درجات آزادی با هم ترکیب کنید:
وزندهی به این معناست که گروهی که مشاهدات بیشتری دارد، سهم بیشتری در برآورد تلفیقی دارد، که دقیقاً همان چیزی است که میخواهید.
آمار آزمون
تحت ، ، بنابراین:
با دست انجام شد
انحراف معیار وزنی:
آمار آزمون:
مقدار بحرانی و است، بنابراین آماره آزمون به مقدار بحرانی نمیرسد.
ما نمیتوانیم را رد کنیم. هیچ شواهدی وجود ندارد که گروهها از جمعیتهایی با میانگین SBP متفاوت آمده باشند.
در R
n1 <- 10; n2 <- 10
m1 <- 115.6; m2 <- 120.4
s1 <- 10.31; s2 <- 13.23
sp <- sqrt(((n1-1)*s1^2 + (n2-1)*s2^2) / (n1+n2-2)) # 11.86
t <- (m1 - m2) / (sp * sqrt(1/n1 + 1/n2)) # -0.905
2 * pt(t, df = n1+n2-2) # p = 0.377
با دادههای خام، R همه کارها را انجام میدهد:
t.test(sbp ~ group, data = d, var.equal = TRUE)
فاصله اطمینان
این فاصله زمانی بسیار آموزندهتر از مقدار p است. این نشان میدهد که تفاوت واقعی میتواند بهطور محتمل کاهش 16 میلیمتر جیوهای یا افزایش 6 میلیمتر جیوهای با مصرف قرصهای ضدبارداری خوراکی باشد. این مطالعه نشان نداده است که اثری وجود ندارد؛ بلکه نتوانسته است اثرات در هر دو جهت را که از نظر بالینی مهم هستند، رد کند. این همان معنایی است که «معنادار نیست» در مطالعهای با این حجم کوچک دارد.
واریانسهای نابرابر
اگر فرض یک مشترک از بین برود چه؟
- آزمون t اگر حجم نمونهها برابر باشد مقاوم است. با گروههای متعادل، نابرابری واریانسها دردسر چندانی ایجاد نمیکند.
- اگر اندازههای نمونه معکوس با واریانسها مرتبط باشند (گروه کوچکتر واریانس بزرگتری دارد)، آماره آزمون بیش از حد بزرگ و مقدار p بسیار کوچک خواهد بود. این جهت خطرناک است: منجر به نتایج مثبت کاذب میشود.
- اگر اندازههای نمونه بهطور مستقیم با واریانسها مرتبط باشند (هرچه گروه بزرگتر باشد، واریانس آن نیز بزرگتر است)، آماره آزمون بسیار کوچک خواهد بود و آزمون محافظهکارانه است.
راهحل، درجههای آزادی تعدیلشدهای است که به اصلاح ولش معروف است، که فرض برابری واریانسها را نمیکند و درجههای آزادی را برای جبران کاهش میدهد:
t.test(sbp ~ group, data = d) # var.equal = FALSE is the R default
توجه داشته باشید که ولف تنظیم پیشفرض نرمافزار R است و بهطور کلی یک پیشفرض معقول محسوب میشود. وقتی واریانسها برابر باشند، تقریباً هیچ هزینهای ندارد و وقتی برابر نباشند، از شما محافظت میکند. انجام آزمون برابری واریانسها ابتدا و سپس انتخاب آزمون، یک روش دو مرحلهای با ویژگیهای نامطلوب است و توصیه نمیشود.
گروههای جفتی
اکنون طراحی را تغییر دهید. به جای دو گروه مجزای زنان، یک گروه را انتخاب کرده و آنها را دو بار اندازهگیری کنید.
- 10 زن در خط پایه، بدون استفاده از قرص ضدبارداری خوراکی
- پس از 12 ماه مصرف قرص ضدبارداری، مجدداً ارزیابی شد.
- 10 جفت مشاهدات
| خط مبنا، بدون OC | 10 | 115.6 | 10.31 |
| پس از 12 ماه از OC | 10 | 120.4 | 13.23 |
آمارهای خلاصه از نظر عددی با مثال گروههای مستقل یکسان هستند. تنها طرح تغییر کرده است. ببینید این چه تأثیری دارد.
فرضها
- نمونهها جفت شدهاند.
- امتیازات پیگیری تا حدی به امتیازات پایه بستگی دارند. این وابستگی خودِ نکتهٔ اصلی است: همان چیزی است که آزمون نمونههای مستقل آن را منع میکند و آزمون جفتی از آن بهره میبرد.
- هیچ میانیگینی مشخص نیست.
- در خط پایه، ؛ در پیگیری، .
- را تخمین بزنید با فرض اینکه تغییر نکند.
آزمون
برای جفتهای تطبیقیافته و ، با تفاوتها کار کنید:
تحت ، و ، درجات آزادی دارد.
توجه کنید که این صرفاً آزمون t یکنمونهای اعمالشده بر تفاوتهاست. بهمحض آنکه تفاوتها را بسازید، مسئله دوگروهی به مسئلهای یکگروهی تبدیل میشود.
با دست انجام شد
مقدار بحرانی و است.
ما را رد میکنیم.
dbar <- 4.80; sd_d <- sqrt(187.6/9); n <- 10
t <- dbar / (sd_d / sqrt(n)) # 3.325
2 * (1 - pt(t, df = 9)) # p = 0.0089
# with raw data:
t.test(after, before, paired = TRUE)
فاصله اطمینان
چرا طراحی جفتی برنده شد
دو تحلیل را از اعدادی که در آمار خلاصه یکسان هستند، مقایسه کنید:
| مستقل | جفت شده | |
|---|---|---|
| تفاوت تخمینی | −4.8 | +4.80 |
| خطای استاندارد | 5.30 | 1.44 |
| −0.91 | 3.32 | |
| 18 | 9 | |
| ارزش پی | 0.38 | 0.009 |
| 95% CI | (−15.9, 6.3) | (1.53, 8.07) |
همان روشها، همان انحرافهای معیار، نتیجههای متضاد.
(علامت تنها به این دلیل متفاوت است که محاسبه نمونههای مستقل به صورت no-OC منهای OC و محاسبه جفتی به صورت بعد منهای قبل تنظیم شده بود. مقدار مطلق، 4.8 میلیمتر جیوه، یکسان است.)
جبر
برای اندازه نمونه و واریانس برابر، واریانس اختلاف برای گروههای مستقل عبارت است از:
واریانس اختلافات جفتی عبارت است از:
که در آن همبستگی درونجفتی است. واریانس به تناسب کاهش مییابد.
این تمام توضیح است:
- اگر (خط پایه هیچ اطلاعاتی درباره پیگیری به شما نمیدهد)، جفتسازی هیچ سودی ندارد و شما بدون دلیل درجات آزادی را از دست دادهاید.
- اگر باشد، جفتسازی واریانس را نصف میکند.
- اگر باشد، جفتسازی واریانس را به یکدهم کاهش میدهد.
برای اندازهگیریهای مکرر روی یک فرد، معمولاً بالا است. فردی که در خط پایه فشار خون بالایی دارد، چه درمانی انجام شود، معمولاً یک سال بعد هم فشار خون بالایی دارد. جفتسازی تمام آن تغییرپذیری بینفردی را از مقایسه حذف میکند.
مبادله
جفتسازی درجات آزادی را کاهش میدهد: در اینجا 9 به جای 18، که مقدار بحرانی را بزرگتر میکند (2.26 به جای 2.10). این هزینه در مقایسه با کاهش واریانس وقتی قابلتوجه است ناچیز است، و وقتی نزدیک صفر است پرداخت آن ارزش ندارد.
درس طراحی که فراتر از این دوره اهمیت دارد: یک طرح جفتی یا متقاطع میتواند با کسری از شرکتکنندگان به همان پرسش پاسخ دهد، به همین دلیل طرح متقاطع در دوره مبانی وجود دارد و شرایط محدودکنندهاش (وضعیت مزمن پایدار، اثر برگشتپذیر، عدم انتقال اثر) وقتی قابل اجرا باشند، ارزش دارد که دور زده شوند.
هشدار مربوطه: دادههای جفتی را طوری تحلیل نکنید که گویی مستقل هستند. این کار همبستگی را از بین میبرد و بازهای بیدلیل وسیع ایجاد میکند که در اینجا میتوانست یک یافتهی واقعی را به یافتهای بیاهمیت تبدیل کند. خطای معکوس، یعنی تحلیل دادههای مستقل بهصورت جفتی، بدتر است: بازههای بهطور کاذب باریک و نتایج مثبت کاذب تولید میکند.
کدام آزمون، چه زمانی
| طراحی | آزمایش | درجات آزادی |
|---|---|---|
| یک نمونه در برابر یک مقدار شناختهشده | آزمون تی یکنمونهای | |
| دو گروه مستقل، واریانسهای برابر | آزمون تی مستقل، با واریانسهای برابر | |
| دو گروه مستقل، واریانسهای نابرابر | آزمون تی وِچ | تنظیمشده (کسر اعشاری) |
| دو اندازهگیری با واحدهای یکسان | آزمون تی جفتی |
همهٔ آنها فرض میکنند که مقدار مربوطه تقریباً توزیعی نرمال دارد: مشاهدات یا در آزمون جفتی، اختلافها. وقتی این فرض بهشدت نقض شود و کوچک باشد، در واحد بعدی از جایگزینهای غیرپارامتریک استفاده میشود.
درک خود را بررسی کنید
- یک کارآزمایی یک دارو (n = 15، میانگین 8.2، SD 3.1) را با دارونما (n = 18، میانگین 6.9، SD 4.4) مقایسه میکند. SD تجمیعشده، آماره t، درجه آزادی و فاصله اطمینان 95% را بهصورت دستی محاسبه کنید. سپس در R آن را بررسی کنید.
- در پرسش اول، گروهی که مشاهدات بیشتری دارد، واریانس بزرگتری نیز دارد. اگر فرض واریانس برابر نادرست باشد، آزمون t ترکیبی در چه جهتی دچار سوگیری میشود و آیا این امر احتمال تولید نتیجه مثبت کاذب را بیشتر میکند یا کمتر؟
- یک مطالعه 30 بیمار را قبل و بعد از یک مداخله اندازهگیری میکند و دادهها را با آزمون t نمونههای مستقل تحلیل میکند. توضیح دهید چه چیزی از دست رفته است و جهت خطا در مقدار p را پیشبینی کنید.
- با استفاده از فرمول ، محاسبه کنید یک طرح جفتی به چند شرکتکننده نیاز دارد تا دقت آن با طرح مستقل با 100 شرکتکننده در هر گروه () برابر شود.
- یک کارآزمایی متقاطع نتایج را طوری گزارش میکند که گویی دو دوره گروههای مستقل هستند. آیا این محافظهکارانه است یا ضدمحافظهکارانه؟ توضیح دهید.
- چرا آزمون t جفتی دارای درجههای آزادی است نه ، و این چه هزینهای برای شما دارد؟
مطالعه بیشتر
- Rosner B. Fundamentals of Biostatistics. 8th ed. Chapter 8.
- Pagano M, Gauvreau K. Principles of Biostatistics. 2nd ed. Chapter 11.
- Bland JM, Altman DG. Matching. BMJ. 1994;309:1128.
- Delacre M, Lakens D, Leys C. Why psychologists should by default use Welch's t-test instead of Student's t-test. Int Rev Soc Psychol. 2017;30(1):92-101.