طرح تحلیل، بخش II (روشهای آماری)
انتخاب روشی که با نوع نتیجه مطابقت دارد، ارائه صحیح دادههای پایه، گزارش اثراتی که از تصمیم پشتیبانی میکنند، محاسبه حجم نمونه و دانستن اینکه چه زمانی به طبقهبندی و چه زمانی به تعدیل نیاز است.
پس از این درس شما قادر خواهید بود
- ویژگیهای پایه را بهدرستی ارائه دهید و توضیح دهید چرا آزمونهای معناداری در مرحله پایه اشتباه هستند.
- یک روش تحلیلی متناسب با نوع نتیجه انتخاب کنید: کمی، رویدادی یا زمان تا رویداد.
- اثرات نسبی و مطلق را همراه با فواصل اطمینان گزارش کنید.
- جدولها و نمودارهایی را طراحی کنید که نتایج آزمایش را صادقانه ارائه دهند.
- اندازه نمونه را برای نتایج پیوسته، دودویی و زمان تا رویداد محاسبه کنید.
- توضیح دهید چرا در یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشدهشدهشدهشده، مخدوشسازی دلیل انجام تعدیل نیست.
طرح تحلیل، بخش II (روشهای آماری)
واحد قبلی به تصمیمهای علمی پرداخت. این واحد روشهایی را که آنها را اجرا میکنند، پوشش میدهد. بیشتر سازوکارهای آماری در دوره زیستآمار توسعه یافتهاند؛ این واحد درباره بهکارگیری آنها در چارچوب خاص یک کارآزمایی تصادفیشدهشدهشدهشدهشده است، جایی که برخی از استدلالهای معمول تغییر میکنند.
توضیحات و مقایسههای مبنایی
جدول پایه گروههای تصادفیشده را توصیف میکند و به خوانندگان امکان میدهد قضاوت کنند که آیا جمعیت مورد مطالعه شباهتی به بیمارانشان دارد یا خیر.
چگونه آن را ارائه کنیم:
- هر ویژگی به تفکیک بازو، همراه با تعداد و درصد برای متغیرهای دستهای و میانگین با انحراف معیار یا میانه با دامنه بینکوارتیلی برای متغیرهای پیوسته.
- انحراف معیار را گزارش کنید، نه خطای استاندارد. خطای استاندارد عدم قطعیت در میانگین را توصیف میکند؛ در اینجا شما پراکندگی شرکتکنندگان را توصیف میکنید.
- برای هر متغیر، تعداد دادههای ناقص را گزارش کنید.
- عوامل بهکاررفته در تصادفیسازی طبقهای و عوامل پیشآگهی قوی را درج کنید تا عدمتوازن در آنها قابل مشاهده باشد.
ویژگیهای پایه را از نظر معناداری آماری آزمون نکنید.
دلیل قاطع است و در واحد 4 بیان شده است: در یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشدهشدهشدهشدهٔ مناسب، فرضیهٔ صفر مبنی بر عدم وجود تفاوت در خط پایه بهعنوان درست پذیرفته میشود. هر تفاوتی طبق تعریف بهصورت تصادفی بهوجود آمده است. مقدار p فرضیه را آزمایش میکند که از قبل پاسخ آن را میدانید و مقدار «معنادار» آن بهطور ساختاری یک خطای نوع اول است.
آنچه اهمیت دارد این نیست که آیا یک عدم توازن از نظر آماری معنادار است، بلکه این است که آیا آنقدر بزرگ هست که از نظر بالینی اهمیت داشته باشد، که داوریای است درباره بزرگی و درباره اینکه آن متغیر چقدر قوی پیامد را پیشبینی میکند. تفاوت 3 ساله سن در کارآزماییای که سن پیامد را بهشدت پیشبینی میکند، بیشتر از یک تفاوت بزرگ و معنادار در چیزی نامربوط اهمیت دارد.
پاسخ صحیح به یک عدم تعادل نگرانکننده، یک تحلیل تعدیلشده از پیش تعیینشده شامل آن عامل است، یا در صورت عدم امکان، یک تحلیل حساسیت پسینی با برچسب واضح. این یک مقدار p نیست.
مطابقت روش با نوع نتیجه
سه خانواده نتایج، با روشهای مختلف، معیارهای تأثیر و فرمولهای اندازه نمونه.
نتایج کمی (پیوسته)
اندازه اثر: اختلاف میانگینها، در واحدهای اصلی، با فاصله اطمینان 95%.
روشها:
- آزمون تی دو نمونهای برای سادهترین حالت
- رگرسیون خطی (ANCOVA) با تعدیل بر ارزش پایهٔ نتیجه و عوامل طبقهبندی، که تحلیل اصلی ترجیحی است.
- مدلهای ترکیبی برای اندازهگیریهای مکرر در طول زمان
تحلیل همواریانی شایستهٔ یادداشتی جداگانه است. وقتی نتیجه در خط پایه و پیگیری اندازهگیری میشود، سه تحلیل ممکن است: مقایسه مقادیر پیگیری، مقایسه نمرههای تغییر یا رگرسیون پیگیری بر درمان با تعدیل بر اساس خط پایه. سومین تحلیل قدرتمندترین است و بهصورت پیشفرض صحیح محسوب میشود. مقایسه نمرههای تغییر کارایی کمتری دارد و زمانی که گروهها در خط پایه متفاوت هستند، در معرض بازگشت به میانگین قرار میگیرد.
چه چیزی را باید گزارش کرد: میانگین در هر بازو، تفاوت تعدیلشده، فاصله اطمینان آن و حداقل اختلاف مهم تا خوانندگان بتوانند قضاوت کنند که آیا این اثر اهمیت دارد یا خیر.
نتایج رویداد (دودویی)
معیارهای اثر، و همهٔ آنها باید گزارش شوند:
| اندازهگیری | فرمول | استفاده کنید |
|---|---|---|
| خطر در هر بازو | واقعیت خام | |
| تفاوت خطر | از تصمیم حمایت میکند؛ به NNT تبدیل میشود | |
| نسبت خطر | انتقالها بین جمعیتها | |
| نسبت شانس | خروجی رگرسیون لجستیک | |
| تعداد مورد نیاز برای درمان | ارتباط |
روشها: آزمون کایدو یا رگرسیون لجستیک با تعدیل برای عوامل طبقهبندی و هممقیاسهای از پیش تعیینشده.
دو قاعده گزارشدهی:
هم اثرات مطلق و هم نسبی را گزارش کنید. کاهش نسبی خطر به میزان 30% به معنای افزایش 15 واحد درصدی در حالی که خطر پایه 50% است و افزایش 0.3 واحد درصدی در حالی که خطر پایه 1% است. گزارش صرفاً اثر نسبی باعث میشود یک منفعت ناچیز بزرگ جلوه کند و این روش استاندارد برای بهتر نشان دادن نتایج آزمایشها است.
تعداد مورد نیاز برای درمان را همراه با فاصله اطمینان و افق زمانی گزارش کنید. یک NNT بدون هر دو بیمعنی است. و توجه داشته باشید که وقتی فاصله اطمینان برای اختلاف خطر از صفر عبور میکند، فاصله NNT گسسته است، از تعداد لازم برای درمان تا بینهایت و سپس به تعداد لازم برای آسیب میرسد؛ در این صورت بهجای آن فاصله اختلاف خطر را گزارش کنید.
نتایج زمان تا وقوع رویداد
معیار اثر: نسبت خطر همراه با فاصله اطمینان، تکمیلشده با نرخهای مطلق رویدادها و بقای بیماران در زمانهای دارای اهمیت بالینی.
روشها: منحنیهای کاپلان-مایر برای توصیف، آزمون لوگرت برای مقایسه، رگرسیون مخاطرههای متناسب کاکس برای تعدیل. همهٔ این موارد در دورهٔ زیستآمار پوشش داده شدند.
چه چیزی را گزارش کنیم:
- منحنیهای کاپلان-مایر برای هر دو گروه، با اعداد در معرض خطر که زیر محور چاپ شدهاند. بدون آنها، خواننده نمیتواند تشخیص دهد که دم روی 200 بیمار قرار دارد یا 3 نفر.
- نسبت خطر همراه با فاصله اطمینان آن
- بررسی فرض مخاطرههای متناسب
- بقای مطلق در زمانهای از پیش تعیینشده، زیرا صرفاً نسبت خطر به بیمار نمیگوید که چه مدت دیگر میتواند انتظار زندگی داشته باشد.
آزمون فرضیه، برآورد و فواصل اطمینان
تأکید ویژهی این کارآزمایی بر نکتهای که در سراسر دورهی زیستآمار مطرح شده است:
برآورد و فاصله اطمینان آن را بهعنوان نتیجهٔ اصلی گزارش کنید. مقدار p در درجهٔ دوم اهمیت قرار دارد.
دلیل این است که فاصله اطمینان به پرسشهای پاسخ میدهد که مقدار p قادر به پاسخگویی به آنها نیست:
- تأثیر چقدر بزرگ است؟
- دقیقاً چگونه برآورد میشود؟
- آزمون چه تأثیراتی را کنار گذاشته است؟ یک نتیجه غیرمعنادار با فاصلهٔ −1 تا +1 در مقیاسی که عدد 5 اهمیت دارد، یک اثر مهم را کنار گذاشته است. یک نتیجه غیرمعنادار با فاصلهٔ −20 تا +25 هیچ چیزی را کنار نگذاشته است و توصیف آن بهعنوان «نشاندهندهٔ هیچ تفاوتی» نادرست است.
این درمان عملی برای سوءتعبیر نتایج نامطلوب است که در بخش توان درسی بیوستاتستیک مورد بحث قرار گرفت، و هیچ هزینهای ندارد.
نمایش نتایج
جدولها:
- جدول پایه، همانطور که در بالا آمده است
- نتیجهی اصلی: اعداد و نرخها در هر بازو، برآورد اثر، فاصله اطمینان و مقدار p
- نتایج ثانویه، که بهوضوح بهعنوان چنین برچسبگذاری شدهاند
- اجزای هر مرکب، بهطور جداگانه
- آسیبهای دست، همراه با مخرجها و مدت زمان قرارگیری در معرض
- انحرافات پروتکلی و پایبندی بر حسب بازو
اعداد:
- نمودار جریان CONSORT که الزامی است و خوانندگان از آن برای تشخیص مشکلات فرسایش استفاده میکنند.
- منحنیهای کاپلان-مایر با اعداد در معرض خطر
- یک نمودار جنگلی برای زیرگروههای از پیش تعیینشده، که برآورد هر زیرگروه، برآورد کلی، و مقدار p اثر متقابل را نشان دهد، نه مقدارهای p درونزیرگروهی
- نمودارهای نتایج در طول زمان برای اندازهگیریهای مکرر
اصول:
- محورهای نمودار را از مقادیری شروع کنید که تفاوتها را اغراقآمیز نشان ندهند.
- دادهها را نشان دهید، نه فقط خلاصهها را، هرگاه حجم نمونه اجازه دهد.
- به هر دو بازو یکسان از نظر بصری رسیدگی کنید.
- وقتی جدول دقیقتر است، از نمودار استفاده نکنید.
اندازه نمونه و توان
چارچوب کلی در دوره بیواحصایی توسعه یافت. در اینجا فرمولها برای سه نوع نتیجه و تعدیلات خاص هر کارآزمایی آورده شده است.
نتیجهٔ پیوسته
power.t.test(delta = 5, sd = 12, power = 0.80) # n = 91.4 per group
نتیجهٔ دودویی
power.prop.test(p1 = 0.30, p2 = 0.20, power = 0.80) # n = 294 per group
نتیجه زمان تا وقوع رویداد
در اینجا عامل تعیینکننده تعداد رویدادها است، نه تعداد شرکتکنندگان:
d <- 4 * (qnorm(0.975) + qnorm(0.80))^2 / log(0.75)^2
ceiling(d) # 380 events
تعداد شرکتکنندگان سپس بر اساس نرخ رخداد مورد انتظار و مدت پیگیری تعیین میشود. یک کارآزمایی میتواند با تعداد کمتری شرکتکننده که مدت طولانیتری پیگیری میشوند یا تعداد بیشتری شرکتکننده که مدت کوتاهتری پیگیری میشوند به تعداد لازم رویدادها برسد و انتخاب بر اساس امکانسنجی و هزینه انجام میشود.
به همین دلیل است که آزمایشهای بقا بهعنوان رویدادمحور توصیف میشوند: تحلیل زمانی انجام میشود که تعداد هدف رویدادها محقق شود، نه در تاریخ ثابت.
تنظیمات
فرمول به شرکتکنندگان دادههای قابل تحلیل میدهد. بین آن و تعداد افراد مورد نیاز برای جذب:
سایش:
گروهبندی: با ضریب اثر طراحی ضرب کنید
تخصیص نابرابر: کل را در ضرب کنید تا نسبت به دست آید.
عدمکمتری: در این محاسبه از حاشیه بهجای و از یکطرفه استفاده میشود و معمولاً به نمونهای بزرگتر از یک کارآزمایی برتری در همان زمینه نیاز دارد، زیرا حاشیه کمتر از اثری است که در کارآزمایی برتری جستوجو میشود.
تحلیلهای میانی: طرحهای توالی گروهی برای حفظ توان آماری به افزایش اندکی در حداکثر حجم نمونه نیاز دارند، معمولاً چند درصد برای مرزهای اوبراین تا فلمنگ.
گزارش محاسبه
تمام موارد را بیان کنید تا خواننده بتواند تعداد را بازتولید کند: نتیجهٔ اصلی، اندازهٔ اثر و توجیه آن، برآورد واریانس و منبع آن، آلفا و اینکه تکطرفه یا دوطرفه است، توان آماری، آزمون آماری فرضشده، نرخ ترک نمونهٔ مورد انتظار، هرگونه اثر طراحی و اندازهٔ نمونهٔ بهدستآمده. بیانیهای مانند «200 بیمار قدرت 80% را فراهم میکند» قابل بازتولید نیست و نباید از بررسی عبور کند.
مختلطسازی، لایهبندی و تعدیل
بخش نهایی، و بخشی که در آن استدلال مبتنی بر پژوهشهای مشاهداتی باید کنار گذاشته شود.
در یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشده، هیچ عاملی که نتایج را مخدوش کند وجود ندارد. مخدوشسازی مستلزم آن است که عامل در معرض قرار گرفتن با یک عامل پیشآگهی مرتبط باشد، و تصادفیسازی بهطور طراحی این ارتباط را قطع میکند. این دقیقاً هدف اصلی این روش است.
از این رو، تعدیل در یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشده هدف متفاوتی نسبت به تعدیل در یک مطالعه مشاهدهای دارد.
| مطالعه مشاهدهای | آزمون تصادفی | |
|---|---|---|
| چرا تنظیم کنیم | برای حذف آمیختگی | برای دستیابی به دقت |
| اثر حذف تعدیل | برآورد جانبدارانه | برآوردی بیطرفانه اما با دقت کمتر |
| کدام متغیرهای همبسته | تمام عوامل عامل مخدوشگر، بهخوبی اندازهگیریشده | چند عامل پیشآگهی قوی که از پیش مشخص شدهاند |
| پیامد یک متغیر همبسته اندازهگیریشده ضعیف | آمیختگی باقیمانده | دقت اندکی کمتر بهدست آمد |
| آیا تنظیم میتواند مشکل را حل کند؟ | فقط برای متغیرهای عامل مخدوشگر اندازهگیریشده | هیچ مشکلی برای رفع وجود ندارد. |
سه پیامد عملی:
- تحلیل بدون تعدیل یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشده معتبر است. ممکن است دقت کمتری داشته باشد و مغرضانه نیست.
- تنظیم برای دقت انتخاب میشود، به همین دلیل باید بر پیشبینهای قوی نتیجه تمرکز کند، نه متغیرهایی که نامتعادل به نظر میرسند.
- لایهبندی در زمان تصادفیسازی و تنظیم در تحلیل با هم همراه هستند. لایهبندی و سپس عدم تنظیم، خطاهای استاندارد محافظهکارانه میدهد و لایهبندی را هدر میدهد.
جایی که آمیختگی دوباره وارد یک کارآزمایی میشود، در هر تحلیلی است که گروهها بهصورت تصادفی تقسیم نشدهاند: تحلیلهای مطابق پروتکل، تحلیلهای بر اساس درمان دریافتشده، زیرگروههایی که پس از تصادفیسازی تعریف شدهاند، و مقایسه شرکتکنندگان پایبند با غیرپایبند. در همهٔ این موارد، تصادفیسازی شکسته شده و استدلال مشاهدهای دوباره اعمال میشود، با تمام خطراتش.
درک خود را بررسی کنید
- یک جدول پایه تفاوت معناداری در سن (p = 0.03) بین دو بازو در یک کارآزمایی 900 بیمار نشان میدهد. توضیح دهید چرا این مقدار p بیاطلاعاتی است و شرح دهید بهجای آن چه کاری انجام میدهید.
- یک کارآزمایی کاهش خطر نسبی 25% را گزارش میکند. نرخ رویداد در گروه کنترل 4% در طول دو سال است. کاهش خطر مطلق و NNT را با افق زمانی آن محاسبه کنید و توضیح دهید این دو نحوه بیان چگونه بر خواننده تأثیر متفاوتی میگذارند.
- یک نتیجه در خط پایه و شش ماه بعد اندازهگیری میشود. سه استراتژی تحلیلی را مقایسه کرده و توضیح دهید چرا ANCOVA برای مقدار پیگیری ترجیح داده میشود.
- تعداد رویدادهای لازم برای تشخیص نسبت خطر 0.70 با توان 90% در سطح معناداری دوطرفه 0.05 را محاسبه کنید. سپس دو روش مختلف برای جمعآوری آنها را شرح دهید.
- یک نمودار کاپلان-مایر منحنیهایی را نشان میدهد که پس از 30 ماه از هم جدا میشوند، اما هیچ عددی در معرض خطر چاپ نشده است. بیان کنید چه چیزی را نمیتوانید قضاوت کنید و چرا این موضوع اهمیت دارد.
- توضیح دهید چرا تحلیل بدون تعدیل یک کارآزمایی تصادفیشدهشدهشدهشدهشدهشده بیطرفانه است، در حالی که تحلیل بدون تعدیل یک مطالعه گروهی معمولاً چنین نیست.
- تحلیل بر اساس پروتکل در یک کارآزمایی، منفعت زیادی را نشان میدهد و تحلیل ITT آن هیچ منفعتی را نشان نمیدهد. توضیح دهید احتمالاً چه اتفاقی افتاده و چه چیزی را گزارش خواهید کرد.
مطالعه بیشتر
- Chow SC, Shao J, Wang H. Sample Size Calculations in Clinical Research.
- Lenth RV. Some practical guidelines for effective sample-size determination. Am Stat. 2001;55(3):187-193.
- Schulz KF, Grimes DA. Sample size calculations in randomised trials: mandatory and mystical. Lancet. 2005;365(9467):1348-1353.
- Assmann SF, Pocock SJ, Enos LE, Kasten LE. Subgroup analysis and other (mis)uses of baseline data in clinical trials. Lancet. 2000;355(9209):1064-1069.
- Vickers AJ, Altman DG. Analysing controlled trials with baseline and follow up measurements. BMJ. 2001;323:1123-1124.
- Altman DG, Andersen PK. Calculating the number needed to treat for trials where the outcome is time to an event. BMJ. 1999;319:1492-1495.