همبستگی و رگرسیون خطی ساده
اندازهگیری قدرت یک همبستگی خطی و سپس مشخص کردن آن. چرا نمودار پراکندگی باید ابتدا ارائه شود، همبستگی و شیب چگونه به هم مرتبط هستند و چرا رگرسیون Y بر X با رگرسیون X بر Y متفاوت است.
پس از این درس شما قادر خواهید بود
- تفاوت بین آنچه معیارهای همبستگی میسنجند و آنچه رگرسیون مشخص میکند را تمایز دهید.
- ضریب همبستگی پیرسون را محاسبه کنید و توضیح دهید که چرا علامت آن چنین است.
- یک همبستگی را آزمون کنید و با استفاده از تبدیل زی فیشر یک فاصله اطمینان بسازید.
- رابطه بین ضریب همبستگی و شیب رگرسیون را بیان کنید.
- توضیح دهید چرا رگرسیون Y بر X با رگرسیون X بر Y متفاوت است.
- اهداف رگرسیون را بیان کنید و هر یک را با یک تصمیم مدلسازی مطابقت دهید.
همبستگی و رگرسیون خطی ساده
این دوره چه میکند
هدف این است که شما اصول اساسی تحلیل رگرسیون را درک کنید، بدانید چه زمانی و چگونه رویکردهای مختلف را به کار ببرید و بتوانید نتایج را تفسیر و ارائه دهید.
چهار خانواده مدل، به ترتیب:
| مدل | نوع نتیجه |
|---|---|
| رگرسیون خطی | پیوسته |
| رگرسیون لجستیک | دوگانه |
| تحلیل بقا | زمان تا رویداد، با سانسور |
| مدلهای چندسطحی | هر یک از موارد فوق، با دادههای خوشهای یا تکراری |
هر چهار مورد یک ساختار مشترک دارند که در پایان دوره زیستآمار معرفی میشود: یک پیشبین خطی، یک تابع پیوند که آن را به میانگین خروجی متصل میکند و یک توزیع برای خروجی. تشخیص این ساختار مشترک باعث میشود دوره بهصورت تجمعی باشد، نه چهار موضوع مجزا.
پیش از آنکه هر تحلیلی را آغاز کنید
ترتیب پیش از اولین خط کد:
مرور ادبیات، که پرسش و اهداف پژوهش را روشن میکند، عوامل دیگر (عوامل خطر، مداخلهگران بالقوه) را شناسایی میکند و به شما امکان میدهد فرضیهها را تدوین کنید.
شناسه PICO خود را مشخص کنید، سپس جزئیات را بررسی کنید:
- نتیجه چگونه اندازهگیری میشود؟
- متغیرهای کلیدی خود را تعریف کنید.
- سایر عوامل چگونه اندازهگیری میشوند؟
- آیا دادههای گمشدهای وجود دارد؟ چگونه کدگذاری خواهند شد و آیا آنها را برآورد میکنید یا حذف؟
یک جدول برنامه تحلیل، که تحلیلهای اولیه را از ثانویه جدا کند.
جدولهای نمونه: یک جدول جمعیتشناختی و یک جدول نتایج، با سطرها و ستونها پر شده و اعداد خالی گذاشته شدهاند.
جدولهای نمونه مفیدترین مورد در آن فهرست و در عین حال اغلب نادیده گرفته میشوند. تهیه آنها شما را مجبور میکند پیش از آنکه دادهها بتوانند بر تصمیم تأثیر بگذارند، مشخص کنید مقاله چه خواهد گفت و معمولاً آشکار میکند که متغیری را که قصد جمعآوری آن را داشتید در هیچ جدولی جای نمیگیرد، یا جدولی که به آن نیاز دارید متغیری را میطلبد که قصد جمعآوری آن را نداشتید.
یک مثال عملی
جرایم گزارششده به ازای هر یک میلیون نفر جمعیت در مقابل میانگین سالهای تحصیل، برای 47 ایالت US در سال 1960. دادهها در R موجود هستند:
library(MASS)
d <- UScrime
d$crime <- d$y / 10 # offenses per million, as in the original tabulation
d$ed <- d$Ed # mean years of schooling x 10, age 25 and over
| متوسط | SD | نه | |
|---|---|---|---|
| نرخ جرایم | 90.5 | 38.7 | 47 |
| آموزش | 105.6 | 11.2 | 47 |
چگونه میتوانید این دادهها را خلاصه کنید؟
- توزیع هر متغیر: هیستوگرام، میانگین، واریانس.
- رابطه بین آنها: نمودار پراکندگی، همواری، همبستگی.
پرسش: آیا شواهدی وجود دارد که نرخ جرم با سالهای تحصیلات مرتبط باشد؟
دو قدم، و آنها متفاوتاند:
- سنجش شدت رابطه، از راه همبستگی.
- تصریح رابطه، از راه رگرسیون.
همبستگی
ضریب همبستگی پیرسون شاخصی از همبستگی خطی بین X و Y است: معیاری برای سنجش میزان نزدیکی نقاط به یک خط مستقیم. مقدار آن بین −1 و +1 قرار دارد.
| ارزش | معنی |
|---|---|
| +1 | رابطهای کاملاً مثبت، همه نقاط روی خطی که به سمت بالا شیب دارد. |
| 0 | رابطه خطی وجود ندارد |
| −1 | رابطه منفی کامل |
مقدار جمعیت است؛ برآورد نمونه است.
مهم نیست کدام متغیر را x و کدام را y بنامید. همبستگی متقارن است. رگرسیون چنین نیست و این تفاوت موضوع نیمه دوم این درس است.
چرا این تابلو این شکلی است
به مخرج نگاه کنید، ، و هر بار یک مشاهده را در نظر بگیرید.
- اگر بالاتر از میانگین باشد و بالاتر از میانگین باشد، حاصلضرب مثبت در مثبت است: مثبت.
- اگر هر دو زیر میانگین باشند، حاصل ضرب منفی در منفی مثبت میشود.
- اگر بالاتر و پایینتر باشد، حاصل ضرب مثبت در منفی میشود: منفی.
- اگر پایینتر و بالاتر باشد: منفی.
نمود پراکندگی را در به چهارخانه تقسیم کنید:
| چهارخانه | محصول | ||
|---|---|---|---|
| من (بالای راست) | + | + | + |
| II (بالای چپ) | − | + | − |
| III (پایین سمت چپ) | − | − | + |
| IV (پایین سمت راست) | + | − | − |
اگر دادهها عمدتاً در ربعهای I و III قرار داشته باشند، مثبت است. اگر عمدتاً در II و IV باشند، منفی است. اگر بهطور یکنواخت پخش شده باشند، محصولات مثبت و منفی یکدیگر را خنثی میکنند و نزدیک به صفر است.
همیشه به نمودار پراکندگی نگاه کنید.
این نکته را نمیتوان بیش از حد تأکید کرد. چهار مجموعه داده کاملاً متفاوت میتوانند ضریب همبستگی یکسانی داشته باشند: یکی که یک رابطه خطی واقعی را نشان میدهد، یکی که یک منحنی را نشان میدهد، یکی که یک رابطه خطی همراه با یک داده پرت نشان میدهد و یکی که جز یک نقطهٔ بسیار دور، هیچ رابطهای ندارد.
همبستگی صفر میتواند به معنای عدم وجود رابطه یا یک منحنی متقارن کامل باشد. همبستگی 0.7 میتواند یک الگوی خطی تنگ یا یک ابر بیشکل با یک نقطه تأثیرگذار را توصیف کند.
plot(d$ed, d$crime, xlab = "Mean years of schooling x 10",
ylab = "Offenses per million")
cor(d$ed, d$crime) # 0.323
برای این دادهها، .
آزمون همبستگی
برای این دادهها:
با 45 درجه آزادی، که را میدهد.
cor.test(d$ed, d$crime)
# t = 2.29, df = 45, p-value = 0.027
فاصله اطمینان، از طریق زی فیشر
توزیع نمونهبرداری کج و محدود است، بنابراین نمیتوان این بازه را بهطور مستقیم ساخت. تبدیل z فیشر، را به مقیاسی تقریباً نرمال نگاشت میکند:
این تقریباً نرمال است با واریانس . بنابراین:
برای و :
سپس با استفاده از ، تبدیل را معکوس کنید تا به مقیاس همبستگی بازگردید:
r <- cor(d$ed, d$crime); n <- nrow(d)
fz <- atanh(r) # 0.335
ci_fz <- fz + c(-1,1) * 1.96 / sqrt(n - 3)
tanh(ci_fz) # 0.039 0.558
نکتهٔ جانبی دربارهٔ تفسیر فاصله
صحیح است که بگوییم: 95% احتمال دارد که فاصله اطمینانی که محاسبه کردهاید، همبستگی واقعی جمعیت را در بر داشته باشد.
دقیقاً درست نیست که بگوییم: احتمال 95% وجود دارد که همبستگی جمعیت در این بازه قرار گیرد.
این تفاوت اهمیت دارد و ارزش دارد که با دقت بیان شود. همبستگی جمعیت یک مقدار دارد. شما آن را نمیدانید، اما این مقدار تغییر نمیکند. اگر مطالعه را تکرار کنید، آن مقدار یکسان خواهد بود. بنابراین پرسیدن احتمال اینکه یک ثابت معین در یک بازه قرار گیرد، چندان معنادار نیست.
در مقابل، بازهای که شما محاسبه میکنید به دادههایی بستگی دارد که تصادفاً جمعآوری کردهاید. اگر مطالعه را تکرار کنید، بازهٔ شما تقریباً بهطور قطع متفاوت خواهد بود. بنابراین پرسیدن دربارهٔ احتمال اینکه این بازه پارامتر را پوشش دهد، موجه است. تصادفی بودن در بازه است، نه در پارامتر.
پسروی
اهداف
رگرسیون برای چندین هدف متمایز به کار میرود و تصمیمات مدلسازی بسته به هدف متفاوت هستند:
- ارتباط بین X و Y را برآورد کنید.
- کمیکردن اینکه اثر X بر Y چقدر بزرگ یا مهم است
- پیشبینی Y از یک یا چند X
- رابطه بین X و Y را با کنترل متغیرهای عامل مخدوشگر برآورد کنید.
- اهمیت نسبی چندین X را در تعیین Y مشخص کنید.
- بهترین مدل برای پیشبینی Y از روی Xها را تعیین کنید.
چهار مورد اول اهداف تبیینی هستند؛ مورد سوم و ششم پیشبینیکننده. این تمایز که در واحد پیشآگهی دوره مبانی مطرح شده است، انتخاب متغیرها، نحوه تفسیر ضرایب و اینکه آیا مدل میتواند از مداخله پشتیبانی کند را تعیین میکند. تصمیمگیری درباره اینکه در حال انجام کدام یک هستید، نخستین تصمیم مدلسازی است و انجام بیصدا آن منبع بسیاری از سردرگمیهاست.
رگرسیون ساده و چندگانه
رگرسیون خطی ساده دارای یک پیشبین است و یک خط مستقیم را از میان ابر دوبعدی نقاط عبور میدهد.
رگرسیون خطی چندگانه دارای دو یا چند پیشبین است و یک سطح رگرسیونی را از میان یک ابر چندبعدی برازش میکند.
خط
- is the y-intercept: the value of y when x is 0.
- شیب است: میزان تغییر در y برای افزایش یکواحدی در x.
دو مثال برای روشنتر کردن معنی:
- : intercept 5، شیب −2. خط در نقطهٔ 5 از محور عمودی عبور میکند و برای هر واحد به سمت راست، 2 واحد پایین میآید.
- : برش −4، شیب 1.
از قطعی به آماری
این روابط خطی قطعی هستند: اگر x را بدانید، y را دقیقاً میدانید.
در دادههای پژوهشی تقریباً همیشه روابط ناقص وجود دارد، بهطوریکه نقاط روی خط قرار نمیگیرند. ما یک خط مستقیم برای توصیف دادهها مدلسازی میکنیم و میپذیریم که نقاط منفرد از آن منحرف میشوند. مدل به صورت زیر درمیآید:
این خط میانگین شرطی y به شرط x را توصیف میکند، نه مقدار y را برای هیچ فرد خاصی.
برای دادههای جرم
fit <- lm(crime ~ ed, data = d)
coef(fit)
# (Intercept) ed
# -27.40 1.12
تفسیر. برای هر واحد اضافی در معیار تحصیلات (که برابر است با میانگین سالهای تحصیل ضربدر 10، بنابراین یک واحد معادل یکدهم سال است)، نرخ جرایم مورد انتظار 1.12 مورد در هر یک میلیون نفر افزایش مییابد.
مقطع −27.4 نرخ مورد انتظار جرم در ایالتی با صفر سال تحصیلات است. این یک برونیابی بیمعنی است: هیچ ایالتی در دادهها به صفر نزدیک نیست و نرخ جرم منفی غیرممکن است. این امر طبیعی است و نقصی در مدل نیست؛ یادآوری است که مخرج (intercept) اغلب قابل تفسیر نیست و مدل تنها در بازهٔ مشاهدهشدهٔ x کاربرد دارد.
نتیجهٔ مضمونی نیز شایستهٔ مکثی است. تحصیلات بیشتر با جرم بیشتر همراه است. پیش از آنکه از آن نتیجهگیری کنیم، رگرسیون چندگانهٔ همان دادهها در درس بیوستاتستیک را به یاد آورید، جایی که با کنترل متغیر ایالتی GDP این ارتباط بهطور کامل از بین رفت، و به یاد داشته باشید که اینها میانگینهای سطح ایالتی هستند، بنابراین خطای بومشناختی اعمال میشود. یک رگرسیون سادهٔ معنادار، آغاز یک تحلیل است، نه پایان آن.
رابطه بین همبستگی و شیب
ضریب همبستگی قدرت یک رابطه خطی را در مقیاسی از −1 تا 1 میسنجد. شیب یک متغیر را از متغیر دیگر پیشبینی میکند: چگونگی تغییر مقدار مورد انتظار Y برای افزایش یکواحدی X.
آنها از طریق ... با هم مرتبط هستند:
برای دادههای جرم: .
چه زمانی رخ میدهد؟ زمانی که باشد، یعنی وقتی که واریانس دو متغیر برابر باشد. به همین دلیل استانداردسازی هر دو متغیر باعث میشود شیب با همبستگی برابر شود.
سه مورد با همبستگی یکسان 0.64:
| وضعیت | شیب | |
|---|---|---|
| واریانس X برابر واریانس Y است. | 0.64 | 0.64 |
| واریانس X بزرگتر از واریانس Y | 0.64 | 0.32 |
| واریانس X کمتر از واریانس Y است. | 0.64 | 1.28 |
همبستگی بدون تغییر مانده؛ شیب تغییر کرده است. شیب واحد دارد و همبستگی ندارد. شیب 1.12 تخلف در هر میلیون نفر در هر ده سال تحصیل، بیانیهای دربارهٔ جهان است؛ همبستگی 0.32 بیانیهای دربارهٔ میزان چگالی نقاط است.
چرا رگرسیون متقارن نیست؟
فرض کنید نقشها را جابهجا کنیم و آموزش را بهعنوان متغیر وابسته و نرخ جرم را بهعنوان متغیر مستقل در نظر بگیریم.
| پسروی | شیب | |
|---|---|---|
| جرم علیه آموزش | 0.323 | 1.12 |
| آموزش دربارهٔ جرم | 0.323 | 0.09 |
coef(lm(crime ~ ed, data = d))["ed"] # 1.12
coef(lm(ed ~ crime, data = d))["crime"] # 0.0935
همبستگی در هر دو جهت یکسان است. شیبها کاملاً متفاوت هستند و معکوس یکدیگر نیستند: ، نه 0.09.
دلیل: روش کمترین مربعات عمودی فاصلهها را از نقاط تا خط به حداقل میرساند و «عمودی» بر اساس متغیری تعریف میشود که روی محور عمودی قرار دارد. جابهجایی محورها آنچه را که به حداقل میرسد تغییر میدهد، بنابراین خط را نیز تغییر میدهد.
دو پیامد:
- انتخاب متغیر وابسته یک تصمیم علمی است، نه آماری. این انتخاب باید از پرسش زیر ناشی شود: چه چیزی را میخواهید پیشبینی یا توضیح دهید؟
- ضریب رگرسیون را نمیتوان معکوس کرد تا اثر در جهت مخالف بهدست آید.
درک خود را بررسی کنید
- با استفاده از
MASS::UScrime، همبستگی، آزمون آن و فاصله اطمینان Fisher z را بازتولید کنید. سپس نمودار پراکندگی را تهیه کرده و در مورد مناسب بودن خلاصه خطی نظر دهید. - دو متغیر دارای هستند. توضیح دهید اگر هر مقدار X در 100 ضرب شود، برای و شیب رگرسیون چه اتفاقی میافتد و چرا آنها رفتار متفاوتی دارند.
- با استفاده از استدلال ربعبندی توضیح دهید چرا یک رابطه کاملاً متقارن Uشکل همبستگیای نزدیک به صفر میدهد.
- یک مطالعه همبستگی 0.7 بین دو معیار بالینی گزارش میکند و نتیجه میگیرد که آنها قابل تعویض هستند. دو دلیل ارائه دهید که این نتیجه را توجیه نمیکند.
- توضیح دهید چرا رگرسیون Y بر X و رگرسیون X بر Y شیبهای متفاوتی دارند و چرا این دو شیب معکوس یکدیگر نیستند.
- به درستی عبارت زیر را بازنویسی کنید: «ما با اطمینان 95% معتقدیم که همبستگی جمعیت احتمال 95% دارد که بین 0.04 و 0.56 باشد.»
- در رگرسیون جرم، ضریب برش برابر با −27.4 است. توضیح دهید چرا این موضوع مشکلی ایجاد نمیکند و این مقدار چه چیزی را دربارهٔ دامنهای که مدل در آن کاربرد دارد به شما میگوید.
مطالعه بیشتر
- Kleinbaum DG, Kupper LL, Nizam A, Rosenberg ES. Applied Regression Analysis and Other Multivariable Methods. 5th ed.
- Anscombe FJ. Graphs in statistical analysis. Am Stat. 1973;27(1):17-21.
- Altman DG, Bland JM. Correlation, regression and repeated data. BMJ. 1994;308:896.
- Vandaele W. Participation in illegitimate activities: Ehrlich revisited. In: Deterrence and Incapacitation. National Academy of Sciences, 1978:270-335.