تحلیل رگرسیون
واحد 1·45 دقیقه

همبستگی و رگرسیون خطی ساده

اندازه‌گیری قدرت یک همبستگی خطی و سپس مشخص کردن آن. چرا نمودار پراکندگی باید ابتدا ارائه شود، همبستگی و شیب چگونه به هم مرتبط هستند و چرا رگرسیون Y بر X با رگرسیون X بر Y متفاوت است.

پس از این درس شما قادر خواهید بود

  • تفاوت بین آنچه معیارهای همبستگی می‌سنجند و آنچه رگرسیون مشخص می‌کند را تمایز دهید.
  • ضریب همبستگی پیرسون را محاسبه کنید و توضیح دهید که چرا علامت آن چنین است.
  • یک همبستگی را آزمون کنید و با استفاده از تبدیل زی فیشر یک فاصله اطمینان بسازید.
  • رابطه بین ضریب همبستگی و شیب رگرسیون را بیان کنید.
  • توضیح دهید چرا رگرسیون Y بر X با رگرسیون X بر Y متفاوت است.
  • اهداف رگرسیون را بیان کنید و هر یک را با یک تصمیم مدل‌سازی مطابقت دهید.

همبستگی و رگرسیون خطی ساده

این دوره چه می‌کند

هدف این است که شما اصول اساسی تحلیل رگرسیون را درک کنید، بدانید چه زمانی و چگونه رویکردهای مختلف را به کار ببرید و بتوانید نتایج را تفسیر و ارائه دهید.

چهار خانواده مدل، به ترتیب:

مدل نوع نتیجه
رگرسیون خطی پیوسته
رگرسیون لجستیک دوگانه
تحلیل بقا زمان تا رویداد، با سانسور
مدل‌های چندسطحی هر یک از موارد فوق، با داده‌های خوشه‌ای یا تکراری

هر چهار مورد یک ساختار مشترک دارند که در پایان دوره زیست‌آمار معرفی می‌شود: یک پیش‌بین خطی، یک تابع پیوند که آن را به میانگین خروجی متصل می‌کند و یک توزیع برای خروجی. تشخیص این ساختار مشترک باعث می‌شود دوره به‌صورت تجمعی باشد، نه چهار موضوع مجزا.

پیش از آنکه هر تحلیلی را آغاز کنید

ترتیب پیش از اولین خط کد:

مرور ادبیات، که پرسش و اهداف پژوهش را روشن می‌کند، عوامل دیگر (عوامل خطر، مداخله‌گران بالقوه) را شناسایی می‌کند و به شما امکان می‌دهد فرضیه‌ها را تدوین کنید.

شناسه PICO خود را مشخص کنید، سپس جزئیات را بررسی کنید:

  • نتیجه چگونه اندازه‌گیری می‌شود؟
  • متغیرهای کلیدی خود را تعریف کنید.
  • سایر عوامل چگونه اندازه‌گیری می‌شوند؟
  • آیا داده‌های گمشده‌ای وجود دارد؟ چگونه کدگذاری خواهند شد و آیا آن‌ها را برآورد می‌کنید یا حذف؟

یک جدول برنامه تحلیل، که تحلیل‌های اولیه را از ثانویه جدا کند.

جدول‌های نمونه: یک جدول جمعیت‌شناختی و یک جدول نتایج، با سطرها و ستون‌ها پر شده و اعداد خالی گذاشته شده‌اند.

جدول‌های نمونه مفیدترین مورد در آن فهرست و در عین حال اغلب نادیده گرفته می‌شوند. تهیه آن‌ها شما را مجبور می‌کند پیش از آنکه داده‌ها بتوانند بر تصمیم تأثیر بگذارند، مشخص کنید مقاله چه خواهد گفت و معمولاً آشکار می‌کند که متغیری را که قصد جمع‌آوری آن را داشتید در هیچ جدولی جای نمی‌گیرد، یا جدولی که به آن نیاز دارید متغیری را می‌طلبد که قصد جمع‌آوری آن را نداشتید.

یک مثال عملی

جرایم گزارش‌شده به ازای هر یک میلیون نفر جمعیت در مقابل میانگین سال‌های تحصیل، برای 47 ایالت US در سال 1960. داده‌ها در R موجود هستند:

library(MASS)
d <- UScrime
d$crime <- d$y / 10        # offenses per million, as in the original tabulation
d$ed <- d$Ed               # mean years of schooling x 10, age 25 and over
متوسط SD نه
نرخ جرایم 90.5 38.7 47
آموزش 105.6 11.2 47

چگونه می‌توانید این داده‌ها را خلاصه کنید؟

  • توزیع هر متغیر: هیستوگرام، میانگین، واریانس.
  • رابطه بین آن‌ها: نمودار پراکندگی، هم‌واری، همبستگی.

پرسش: آیا شواهدی وجود دارد که نرخ جرم با سال‌های تحصیلات مرتبط باشد؟

دو قدم، و آن‌ها متفاوت‌اند:

  1. سنجش شدت رابطه، از راه همبستگی.
  2. تصریح رابطه، از راه رگرسیون.

همبستگی

ضریب همبستگی پیرسون شاخصی از همبستگی خطی بین X و Y است: معیاری برای سنجش میزان نزدیکی نقاط به یک خط مستقیم. مقدار آن بین −1 و +1 قرار دارد.

ارزش معنی
+1 رابطه‌ای کاملاً مثبت، همه نقاط روی خطی که به سمت بالا شیب دارد.
0 رابطه خطی وجود ندارد
−1 رابطه منفی کامل

مقدار جمعیت ρ\rho است؛ برآورد نمونه rr است.

r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum(x_i - \bar{x})^2 \sum(y_i - \bar{y})^2}}

مهم نیست کدام متغیر را x و کدام را y بنامید. همبستگی متقارن است. رگرسیون چنین نیست و این تفاوت موضوع نیمه دوم این درس است.

چرا این تابلو این شکلی است

به مخرج نگاه کنید، (xixˉ)(yiyˉ)\sum(x_i - \bar{x})(y_i - \bar{y})، و هر بار یک مشاهده را در نظر بگیرید.

  • اگر xix_i بالاتر از میانگین باشد و yiy_i بالاتر از میانگین باشد، حاصل‌ضرب مثبت در مثبت است: مثبت.
  • اگر هر دو زیر میانگین باشند، حاصل ضرب منفی در منفی مثبت می‌شود.
  • اگر xix_i بالاتر و yiy_i پایین‌تر باشد، حاصل ضرب مثبت در منفی می‌شود: منفی.
  • اگر xix_i پایین‌تر و yiy_i بالاتر باشد: منفی.

نمود پراکندگی را در (xˉ,yˉ)(\bar{x}, \bar{y}) به چهارخانه تقسیم کنید:

چهارخانه xixˉx_i - \bar{x} yiyˉy_i - \bar{y} محصول
من (بالای راست) + + +
II (بالای چپ) +
III (پایین سمت چپ) +
IV (پایین سمت راست) +

اگر داده‌ها عمدتاً در ربع‌های I و III قرار داشته باشند، rr مثبت است. اگر عمدتاً در II و IV باشند، rr منفی است. اگر به‌طور یکنواخت پخش شده باشند، محصولات مثبت و منفی یکدیگر را خنثی می‌کنند و rr نزدیک به صفر است.

همیشه به نمودار پراکندگی نگاه کنید.

این نکته را نمی‌توان بیش از حد تأکید کرد. چهار مجموعه داده کاملاً متفاوت می‌توانند ضریب همبستگی یکسانی داشته باشند: یکی که یک رابطه خطی واقعی را نشان می‌دهد، یکی که یک منحنی را نشان می‌دهد، یکی که یک رابطه خطی همراه با یک داده پرت نشان می‌دهد و یکی که جز یک نقطهٔ بسیار دور، هیچ رابطه‌ای ندارد.

همبستگی صفر می‌تواند به معنای عدم وجود رابطه یا یک منحنی متقارن کامل باشد. همبستگی 0.7 می‌تواند یک الگوی خطی تنگ یا یک ابر بی‌شکل با یک نقطه تأثیرگذار را توصیف کند.

plot(d$ed, d$crime, xlab = "Mean years of schooling x 10",
     ylab = "Offenses per million")
cor(d$ed, d$crime)          # 0.323

برای این داده‌ها، r(education,crime)=+0.32r(\text{education}, \text{crime}) = +0.32.

آزمون همبستگی

H0:ρ=0H1:ρ0H_0: \rho = 0 \qquad H_1: \rho \neq 0

t=rn21r2,df=n2t = r\sqrt{\frac{n-2}{1-r^2}}, \qquad df = n - 2

برای این داده‌ها:

t=0.3234510.104=0.323×7.09=2.29t = 0.323\sqrt{\frac{45}{1 - 0.104}} = 0.323 \times 7.09 = 2.29

با 45 درجه آزادی، که p=0.027p = 0.027 را می‌دهد.

cor.test(d$ed, d$crime)
# t = 2.29, df = 45, p-value = 0.027

فاصله اطمینان، از طریق زی فیشر

توزیع نمونه‌برداری rr کج و محدود است، بنابراین نمی‌توان این بازه را به‌طور مستقیم ساخت. تبدیل z فیشر، rr را به مقیاسی تقریباً نرمال نگاشت می‌کند:

Fz=12ln(1+r1r)F_z = \frac{1}{2}\ln\left(\frac{1+r}{1-r}\right)

این تقریباً نرمال است با واریانس 1/(n3)1/(n-3). بنابراین:

95% CI on Fz=Fz±1.961n3\text{95\% CI on } F_z = F_z \pm 1.96\sqrt{\frac{1}{n-3}}

برای r=0.323r = 0.323 و n=47n = 47:

Fz=12ln(1.3230.677)=0.335,SE=144=0.151F_z = \frac{1}{2}\ln\left(\frac{1.323}{0.677}\right) = 0.335, \qquad SE = \frac{1}{\sqrt{44}} = 0.151

Fz,upper=0.335+1.96(0.151)=0.630F_{z,\text{upper}} = 0.335 + 1.96(0.151) = 0.630 Fz,lower=0.3351.96(0.151)=0.039F_{z,\text{lower}} = 0.335 - 1.96(0.151) = 0.039

سپس با استفاده از r=tanh(Fz)r = \tanh(F_z)، تبدیل را معکوس کنید تا به مقیاس همبستگی بازگردید:

95% CI for ρ=(0.04,  0.56)\text{95\% CI for } \rho = (0.04,\; 0.56)

r <- cor(d$ed, d$crime); n <- nrow(d)
fz <- atanh(r)                       # 0.335
ci_fz <- fz + c(-1,1) * 1.96 / sqrt(n - 3)
tanh(ci_fz)                          # 0.039  0.558

نکتهٔ جانبی دربارهٔ تفسیر فاصله

صحیح است که بگوییم: 95% احتمال دارد که فاصله اطمینانی که محاسبه کرده‌اید، همبستگی واقعی جمعیت را در بر داشته باشد.

دقیقاً درست نیست که بگوییم: احتمال 95% وجود دارد که همبستگی جمعیت در این بازه قرار گیرد.

این تفاوت اهمیت دارد و ارزش دارد که با دقت بیان شود. همبستگی جمعیت یک مقدار دارد. شما آن را نمی‌دانید، اما این مقدار تغییر نمی‌کند. اگر مطالعه را تکرار کنید، آن مقدار یکسان خواهد بود. بنابراین پرسیدن احتمال اینکه یک ثابت معین در یک بازه قرار گیرد، چندان معنادار نیست.

در مقابل، بازه‌ای که شما محاسبه می‌کنید به داده‌هایی بستگی دارد که تصادفاً جمع‌آوری کرده‌اید. اگر مطالعه را تکرار کنید، بازهٔ شما تقریباً به‌طور قطع متفاوت خواهد بود. بنابراین پرسیدن دربارهٔ احتمال اینکه این بازه پارامتر را پوشش دهد، موجه است. تصادفی بودن در بازه است، نه در پارامتر.

پس‌روی

اهداف

رگرسیون برای چندین هدف متمایز به کار می‌رود و تصمیمات مدل‌سازی بسته به هدف متفاوت هستند:

  • ارتباط بین X و Y را برآورد کنید.
  • کمی‌کردن اینکه اثر X بر Y چقدر بزرگ یا مهم است
  • پیش‌بینی Y از یک یا چند X
  • رابطه بین X و Y را با کنترل متغیرهای عامل مخدوش‌گر برآورد کنید.
  • اهمیت نسبی چندین X را در تعیین Y مشخص کنید.
  • بهترین مدل برای پیش‌بینی Y از روی Xها را تعیین کنید.

چهار مورد اول اهداف تبیینی هستند؛ مورد سوم و ششم پیش‌بینی‌کننده. این تمایز که در واحد پیش‌آگهی دوره مبانی مطرح شده است، انتخاب متغیرها، نحوه تفسیر ضرایب و اینکه آیا مدل می‌تواند از مداخله پشتیبانی کند را تعیین می‌کند. تصمیم‌گیری درباره اینکه در حال انجام کدام یک هستید، نخستین تصمیم مدل‌سازی است و انجام بی‌صدا آن منبع بسیاری از سردرگمی‌هاست.

رگرسیون ساده و چندگانه

رگرسیون خطی ساده دارای یک پیش‌بین است و یک خط مستقیم را از میان ابر دوبعدی نقاط عبور می‌دهد.

رگرسیون خطی چندگانه دارای دو یا چند پیش‌بین است و یک سطح رگرسیونی را از میان یک ابر چندبعدی برازش می‌کند.

خط

y=β0+β1xy = \beta_0 + \beta_1 x

  • β0\beta_0 is the y-intercept: the value of y when x is 0.
  • β1\beta_1 شیب است: میزان تغییر در y برای افزایش یک‌واحدی در x.

دو مثال برای روشن‌تر کردن معنی:

  • y=52xy = 5 - 2x: intercept 5، شیب −2. خط در نقطهٔ 5 از محور عمودی عبور می‌کند و برای هر واحد به سمت راست، 2 واحد پایین می‌آید.
  • y=4+xy = -4 + x: برش −4، شیب 1.

از قطعی به آماری

این روابط خطی قطعی هستند: اگر x را بدانید، y را دقیقاً می‌دانید.

در داده‌های پژوهشی تقریباً همیشه روابط ناقص وجود دارد، به‌طوری‌که نقاط روی خط قرار نمی‌گیرند. ما یک خط مستقیم برای توصیف داده‌ها مدل‌سازی می‌کنیم و می‌پذیریم که نقاط منفرد از آن منحرف می‌شوند. مدل به صورت زیر درمی‌آید:

μyx=β0+β1x\mu_{y|x} = \beta_0 + \beta_1 x

این خط میانگین شرطی y به شرط x را توصیف می‌کند، نه مقدار y را برای هیچ فرد خاصی.

برای داده‌های جرم

Y^=27.4+1.12x\hat{Y} = -27.4 + 1.12x

fit <- lm(crime ~ ed, data = d)
coef(fit)
# (Intercept)          ed
#     -27.40         1.12

تفسیر. برای هر واحد اضافی در معیار تحصیلات (که برابر است با میانگین سال‌های تحصیل ضربدر 10، بنابراین یک واحد معادل یک‌دهم سال است)، نرخ جرایم مورد انتظار 1.12 مورد در هر یک میلیون نفر افزایش می‌یابد.

مقطع −27.4 نرخ مورد انتظار جرم در ایالتی با صفر سال تحصیلات است. این یک برون‌یابی بی‌معنی است: هیچ ایالتی در داده‌ها به صفر نزدیک نیست و نرخ جرم منفی غیرممکن است. این امر طبیعی است و نقصی در مدل نیست؛ یادآوری است که مخرج (intercept) اغلب قابل تفسیر نیست و مدل تنها در بازهٔ مشاهده‌شدهٔ x کاربرد دارد.

نتیجهٔ مضمونی نیز شایستهٔ مکثی است. تحصیلات بیشتر با جرم بیشتر همراه است. پیش از آنکه از آن نتیجه‌گیری کنیم، رگرسیون چندگانهٔ همان داده‌ها در درس بیوستاتستیک را به یاد آورید، جایی که با کنترل متغیر ایالتی GDP این ارتباط به‌طور کامل از بین رفت، و به یاد داشته باشید که این‌ها میانگین‌های سطح ایالتی هستند، بنابراین خطای بوم‌شناختی اعمال می‌شود. یک رگرسیون سادهٔ معنادار، آغاز یک تحلیل است، نه پایان آن.

رابطه بین همبستگی و شیب

ضریب همبستگی قدرت یک رابطه خطی را در مقیاسی از −1 تا 1 می‌سنجد. شیب یک متغیر را از متغیر دیگر پیش‌بینی می‌کند: چگونگی تغییر مقدار مورد انتظار Y برای افزایش یک‌واحدی X.

آنها از طریق ... با هم مرتبط هستند:

β^1=rSYSX\hat{\beta}_1 = r\,\frac{S_Y}{S_X}

برای داده‌های جرم: 0.323×38.711.2=1.120.323 \times \frac{38.7}{11.2} = 1.12.

β^1=r\hat{\beta}_1 = r چه زمانی رخ می‌دهد؟ زمانی که SY=SXS_Y = S_X باشد، یعنی وقتی که واریانس دو متغیر برابر باشد. به همین دلیل استانداردسازی هر دو متغیر باعث می‌شود شیب با همبستگی برابر شود.

سه مورد با همبستگی یکسان 0.64:

وضعیت rr شیب
واریانس X برابر واریانس Y است. 0.64 0.64
واریانس X بزرگ‌تر از واریانس Y 0.64 0.32
واریانس X کمتر از واریانس Y است. 0.64 1.28

همبستگی بدون تغییر مانده؛ شیب تغییر کرده است. شیب واحد دارد و همبستگی ندارد. شیب 1.12 تخلف در هر میلیون نفر در هر ده سال تحصیل، بیانیه‌ای دربارهٔ جهان است؛ همبستگی 0.32 بیانیه‌ای دربارهٔ میزان چگالی نقاط است.

چرا رگرسیون متقارن نیست؟

فرض کنید نقش‌ها را جابه‌جا کنیم و آموزش را به‌عنوان متغیر وابسته و نرخ جرم را به‌عنوان متغیر مستقل در نظر بگیریم.

پس‌روی rr شیب
جرم علیه آموزش 0.323 1.12
آموزش دربارهٔ جرم 0.323 0.09
coef(lm(crime ~ ed, data = d))["ed"]      # 1.12
coef(lm(ed ~ crime, data = d))["crime"]   # 0.0935

همبستگی در هر دو جهت یکسان است. شیب‌ها کاملاً متفاوت هستند و معکوس یکدیگر نیستند: 1/1.12=0.891/1.12 = 0.89، نه 0.09.

دلیل: روش کمترین مربعات عمودی فاصله‌ها را از نقاط تا خط به حداقل می‌رساند و «عمودی» بر اساس متغیری تعریف می‌شود که روی محور عمودی قرار دارد. جابه‌جایی محورها آنچه را که به حداقل می‌رسد تغییر می‌دهد، بنابراین خط را نیز تغییر می‌دهد.

دو پیامد:

  1. انتخاب متغیر وابسته یک تصمیم علمی است، نه آماری. این انتخاب باید از پرسش زیر ناشی شود: چه چیزی را می‌خواهید پیش‌بینی یا توضیح دهید؟
  2. ضریب رگرسیون را نمی‌توان معکوس کرد تا اثر در جهت مخالف به‌دست آید.

درک خود را بررسی کنید

  1. با استفاده از MASS::UScrime، همبستگی، آزمون آن و فاصله اطمینان Fisher z را بازتولید کنید. سپس نمودار پراکندگی را تهیه کرده و در مورد مناسب بودن خلاصه خطی نظر دهید.
  2. دو متغیر دارای r=0.5r = 0.5 هستند. توضیح دهید اگر هر مقدار X در 100 ضرب شود، برای rr و شیب رگرسیون چه اتفاقی می‌افتد و چرا آن‌ها رفتار متفاوتی دارند.
  3. با استفاده از استدلال ربع‌بندی توضیح دهید چرا یک رابطه کاملاً متقارن U‌شکل همبستگی‌ای نزدیک به صفر می‌دهد.
  4. یک مطالعه همبستگی 0.7 بین دو معیار بالینی گزارش می‌کند و نتیجه می‌گیرد که آن‌ها قابل تعویض هستند. دو دلیل ارائه دهید که این نتیجه را توجیه نمی‌کند.
  5. توضیح دهید چرا رگرسیون Y بر X و رگرسیون X بر Y شیب‌های متفاوتی دارند و چرا این دو شیب معکوس یکدیگر نیستند.
  6. به درستی عبارت زیر را بازنویسی کنید: «ما با اطمینان 95% معتقدیم که همبستگی جمعیت احتمال 95% دارد که بین 0.04 و 0.56 باشد.»
  7. در رگرسیون جرم، ضریب برش برابر با −27.4 است. توضیح دهید چرا این موضوع مشکلی ایجاد نمی‌کند و این مقدار چه چیزی را دربارهٔ دامنه‌ای که مدل در آن کاربرد دارد به شما می‌گوید.

مطالعه بیشتر

  • Kleinbaum DG, Kupper LL, Nizam A, Rosenberg ES. Applied Regression Analysis and Other Multivariable Methods. 5th ed.
  • Anscombe FJ. Graphs in statistical analysis. Am Stat. 1973;27(1):17-21.
  • Altman DG, Bland JM. Correlation, regression and repeated data. BMJ. 1994;308:896.
  • Vandaele W. Participation in illegitimate activities: Ehrlich revisited. In: Deterrence and Incapacitation. National Academy of Sciences, 1978:270-335.

اصطلاحات کلیدی

نمودار پراکندگیهمبستگی پیرسونتبدیل فیشر زیمصادرهشیبمتغیر وابسته و مستقلرابطهٔ قطعی و تصادفی