کارآزمایی‌های بالینی تصادفی‌شده شاهددار
واحد 5·40 دقیقه

مسائل کلی اندازه‌گیری

چه کسی نتیجه را اندازه‌گیری می‌کند، چه زمانی و چگونه. انتخاب بهترین معیار نتیجه، تبدیل معیارهای کمی به رویدادها، اجتناب از سوگیری در اندازه‌گیری و اینکه کمیته داوری برای چه کاری است.

پس از این درس شما قادر خواهید بود

  • تصمیم بگیرید چه کسی باید هر نتیجه را اندازه‌گیری کند و انتخاب را توجیه کنید.
  • تصمیم بگیرید که نتایج چه زمانی و هر چند وقت یک‌بار باید اندازه‌گیری شوند.
  • بهترین معیار نتیجه را برای یک پرسش آزمایشی با در نظر گرفتن پایایی، اعتبار و حساسیت به تغییر انتخاب کنید.
  • هزینه‌های تبدیل یک معیار کمی به نتیجهٔ رویداد را توضیح دهید.
  • منابع سوگیری اندازه‌گیری و ویژگی‌های طراحی که هر یک از آن‌ها را جلوگیری می‌کنند، شناسایی کنید.
  • ترکیب و وظایف یک کمیتهٔ داوری را شرح دهید.
  • تفاوت بین خطای اندازه‌گیری تصادفی و سوگیری اندازه‌گیری را در اثرات آن‌ها بر یک کارآزمایی مشخص کنید.

مسائل کلی اندازه‌گیری

تصادفی‌سازی دو گروه قابل مقایسه ایجاد می‌کند. همه چیز پس از آن اندازه‌گیری است و اندازه‌گیری جایی است که یک کارآزمایی به‌خوبی تصادفی‌شده می‌تواند همچنان پاسخ نادرستی ارائه دهد.

چه کسی باید نتیجه را اندازه‌گیری کند؟

هر نامزد تعصبات متفاوتی دارد.

شرکت‌کننده. برای هر چیزی که تنها در تجربهٔ او وجود دارد (درد، خستگی، تهوع، عملکرد، کیفیت زندگی)، شرکت‌کننده تنها منبع معتبر است. سنجش درد بیمار توسط پزشک، خودِ پزشک را می‌سنجد.

  • تهدید: انتظار. یک شرکت‌کننده غیرکور که گمان می‌کند درمان فعال دریافت کرده است، نتایج بهتری گزارش می‌کند.
  • حفاظت: کورسازی شرکت‌کنندگان؛ در صورت عدم امکان، یک نتیجهٔ هم‌اصلی عینی.

پزشک معالج. گزینه‌ای راحت و در عین حال بدترین گزینه وقتی که نتیجه نیازمند قضاوت است، زیرا پزشک از تخصیص مطلع است و در نتیجه سرمایه‌گذاری کرده است.

  • تهدید: ارزیابی تفاضلی و کاوش تفاضلی برای رویدادها.
  • حفاظت: تا حد امکان اجتناب کنید.

یک ارزیاب مستقل و آموزش‌دیده. راه‌حل استاندارد زمانی که نتیجه نیازمند قضاوت است. ارزیاب در ارائه مداخله دخالت ندارد و از تخصیص گروهی کور است.

  • تهدید: عدم سازگاری بین ارزیابان.
  • حمایت: آموزش، راهنمای مکتوب و سنجش پایایی بین ارزیابان.

یک آزمایشگاه مرکزی یا مرکز خوانش. برای تصاویر، نمونه‌ها و ضبط‌ها. نمونه‌ها ارسال می‌شوند، هویت آن‌ها حذف می‌شود و توسط افرادی خوانده می‌شوند که از تخصیص یا مرکز مطلع نیستند.

  • تهدید: اندک؛ این قوی‌ترین گزینه است که در دسترس باشد.

داده‌های روتین. سوابق اداری، ثبت‌ها، داده‌های سلامت پیوندی. تحت تأثیر کارآزمایی قرار نگرفته و بنابراین نسبت به آن بی‌طرف هستند.

  • تهدید: تنها آنچه را که سیستم کدگذاری ثبت می‌کند، ثبت می‌کند و این کار را با دقت متغیر انجام می‌دهد.

قاعده کلی: هرچه نتیجه نیازمند قضاوت بیشتری باشد، اهمیت کور و مستقل بودن ارزیاب بیشتر است. مرگ‌ومیر کلی را هر کسی می‌تواند تعیین کند. اما «پنومونی»، «تشدید بالینی» و «شکست درمان» را نمی‌توانند.

توجه داشته باشید که یک نتیجه ظاهراً عینی ممکن است بیش از آنچه به نظر می‌رسد قضاوت در خود داشته باشد. تصمیم به بستری شدن، تشخیص سکته قلبی و تعیین علت مرگ همگی مستلزم تفسیر هستند و همگی می‌توانند با تغییر انتظارات دگرگون شوند.

چه زمانی باید اندازه‌گیری شود؟

زمان‌بندی نسبت به مداخله. به اندازه کافی زود تا اثر را ثبت کند و به اندازه کافی دیر تا رخ داده باشد. این امر نیازمند یک فرضیه درباره روند زمانی است که باید بیان شود.

تعداد ارزیابی‌ها. ارزیابی‌های بیشتر تصویری کامل‌تر از مسیر ارائه می‌دهند و بار، هزینه و داده‌های گمشده را افزایش می‌دهند. هر مراجعه اضافی منجر به از دست دادن شرکت‌کنندگان می‌شود.

مدت کل پیگیری. به اندازه‌ی کافی طولانی تا نتایج مهم را پوشش دهد. یک کارآزمایی درمانی برای یک بیماری مزمن با 12 هفته پیگیری چیزی را اندازه‌گیری می‌کند، اما نه آنچه برای بیماران اهمیت دارد.

در هر دو بازو باید از همان برنامه زمانی استفاده شود. این امر ضروری است و بیشتر از آنچه باید، نقض می‌شود. اگر بازوی مداخله با فواصل زمانی کوتاه‌تری ملاقات شود، رویدادهای بیشتری در آن شناسایی خواهد شد، صرف‌نظر از اینکه آیا واقعاً رویدادهای بیشتری رخ داده باشد یا خیر. هر تماس اضافی که خود مداخله ایجاب می‌کند، باید از بازدیدهای ارزیابی نتایج جدا شود.

چگونه باید اندازه‌گیری شود؟

فراتر از انتخاب ابزار، روش را استاندارد کنید. تجهیزات، برنامه کالیبراسیون، موقعیت و آماده‌سازی شرکت‌کننده، زمان روز، تعداد تکرارها و نحوه ترکیب آن‌ها و نحوه برخورد با مقادیر غیرمحتمل را مشخص کنید. آن را در دفترچه روش‌ها بنویسید، آموزش دهید و بر اساس آن بازرسی کنید.

دلیل این موشکافی: تغییرپذیری ناشی از روش اندازه‌گیری همان تغییرپذیری است که باید با افزایش حجم نمونه بر آن غلبه کنید. کاهش آن معمولاً ارزان‌تر از جذب شرکت‌کنندگان بیشتر است و دوره بیوستاتستیک نشان داد چرا: حجم نمونه با σ2\sigma^2 مقیاس‌پذیر است.

انتخاب بهترین معیار نتیجه

نتیجهٔ اصلی باید هم‌زمان چندین شرط را برآورده کند و این شروط با یکدیگر در تضاد هستند.

مهم برای بیمار. چیزی که بیماران می‌توانند آن را احساس یا تجربه کنند، یا برایشان اهمیت داشته باشد. مرگ‌ومیر، علائم، عملکرد، کیفیت زندگی، بستری شدن.

حساس به مداخله. اگر مداخله به‌طور معقول نتواند بر آن تأثیر بگذارد، هیچ اندازه نمونه‌ای کمکی نخواهد کرد.

قابل اندازه‌گیری به‌طور قابل‌اعتماد. قابلیت اعتماد سقف اعتبار را تعیین می‌کند، همان‌طور که در دوره مبانی مشخص شد.

واکنشی. قادر به تشخیص تغییر زمانی است که تغییر رخ داده باشد. ابزاری که در جمعیت شما دارای اثر سقف باشد، نمی‌تواند پیشرفت را نشان دهد.

قابل تفسیر. تغییر در نمره باید قابل تبدیل به چیزی معنادار باشد، که مستلزم حداقل اختلاف مهم است.

قابل جمع‌آوری از هر شرکت‌کننده در هر نقطه زمانی.

به اندازه کافی رخ دادن تا کارآزمایی توان داشته باشد. همین قید است که پژوهشگران را به سمت پیامدهای ترکیبی و جانشین‌ها می‌راند، و معمولاً همین‌جاست که سازش‌ها رخ می‌دهند.

نتایج ترکیبی و جانشین

هر دو در دوره مبانی مورد بررسی قرار گرفتند و هر دو تصمیم‌گیری‌های مربوط به اندازه‌گیری هستند:

  • یک رویداد مرکب نرخ وقوع رویدادها را افزایش می‌دهد و تنها زمانی قابل تفسیر است که اجزای آن از نظر اهمیت، فراوانی و جهت تأثیر مشابه باشند.
  • یک جانشین یک واسطه اندازه‌پذیر را جایگزین می‌کند و تنها زمانی پذیرفتنی است که مداخلاتی که جانشین را تغییر می‌دهند، به شکل قابل اتکا پیامد مهم برای بیمار را هم تغییر دهند.

تعاریف نقطه پایانی

هر چه انتخاب شود، آن را در پروتکل به صورت عملیاتی تعریف کنید، پیش از آغاز کارآزمایی، با جزئیاتی کافی تا دو نفر که تعریف را روی یک پرونده به کار می‌برند به یک پاسخ برسند.

«انسداد میوکارد» تعریف نیست. یک تعریف مشخص می‌کند که کدام نشانگر زیستی، در چه آستانه‌ای، با چه علائمی یا چه تغییرات الکتروکاردیوگرافی، در چه بازه زمانی و چگونه رویدادهای پیرامون مداخله باید درمان شوند. دلیل اینکه کارآزمایی‌های مختلف یک مداخله واحد نرخ‌های رویداد متفاوتی را گزارش می‌کنند، اغلب این است که رویداد را به‌طور متفاوتی تعریف کرده‌اند.

تبدیل معیارهای کمی به رویدادها

یک نتیجه پیوسته اغلب دودویی می‌شود: فشار خون به «کنترل‌شده یا کنترل‌نشده» تبدیل می‌شود، نمره درد به «واکنش‌دهنده یا غیرواکنش‌دهنده» تبدیل می‌شود و یک مقدار آزمایشگاهی به «غیرطبیعی» تبدیل می‌شود.

چرا انجام می‌شود:

  • نتیجه آسان‌تر برای انتقال است. «40% پاسخ دادند» قابل درک‌تر از «میانگین اختلاف 6.2 امتیاز» است.
  • این از تصمیمی که خود دودویی است، پشتیبانی می‌کند.
  • این به عددی تبدیل می‌شود که برای درمان لازم است.
  • این در برابر توزیع نامتقارن و داده‌های پرت مقاوم است.

هزینه‌اش:

  • قدرت. دوگانه‌سازی یک متغیر پیوسته معمولاً اطلاعاتی را معادل تقریباً یک‌سوم نمونه دور می‌ریزد. این بهای سنگینی است که با مشارکت‌کنندگان پرداخت می‌شود.
  • اطلاعات. یک بیمار درست بالای آستانه و یک بیمار بسیار فراتر از آن مانند یکدیگر در نظر گرفته می‌شوند، در حالی که بیمارانی که در هر دو سوی آستانه قرار دارند، مانند مقابل یکدیگر در نظر گرفته می‌شوند.
  • انتخابی که می‌توان آن را دستکاری کرد. اگر آستانه پس از مشاهده داده‌ها و در نقطه‌ای که بیشترین اختلاف را ایجاد می‌کند انتخاب شود، نتیجه جانبدارانه و مقدار p نامعتبر خواهد بود.

قاعده: اگر دوبخشی می‌کنید، آستانه باید از پیش تعیین‌شده و از نظر بالینی موجه باشد، و تحلیل پیوسته هم باید گزارش شود. تعریف پاسخ‌دهنده که بر کمترین تفاوت مهم اعتبارسنجی‌شده استوار باشد دفاع‌پذیر است؛ تعریفی که چون بزرگ‌ترین اثر را می‌داد انتخاب شده باشد نه.

اجتناب از سوگیری اندازه‌گیری

منابع و درمان‌های آن‌ها:

منبع چه اتفاقی می‌افتد درمان
ارزیابی بدون‌پوشش انتظار ارزیاب، اندازه‌گیری وابسته به قضاوت را تغییر می‌دهد. ارزیابان مستقل کور؛ خوانش مرکزی؛ داوری
تعیین تمایز یک بازو به‌طور دقیق‌تر بررسی می‌شود، بنابراین رویدادهای بیشتری یافت می‌شوند. برنامه ارزیابی و شدت یکسان در هر دو بازو؛ آزمایش‌های الزامی پروتکل
یادآوری تفاضلی شرکت‌کنندگانی که از تخصیص آگاه هستند، به شیوه‌ای متفاوت به یاد می‌آورند و گزارش می‌دهند. کورکننده؛ پرسشنامه‌های ساختاریافتهٔ علائم به جای پرسش‌ها باز
انحراف ابزار تجهیزات در طول آزمون کالیبراسیون خود را از دست می‌دهد. کالیبراسیون برنامه‌ریزی‌شده؛ تجهیزات مرکزی؛ آنالیز دسته‌ای نمونه‌ها
انحراف ارزیاب ارزیابان نحوهٔ اعمال معیارها را در طول زمان تغییر می‌دهند. آموزش مجدد؛ بررسی‌های دوره‌ای قابلیت اطمینان؛ ارزیابی دوبل کور
ترجیح دیجیتال مقادیر گرد روی اعداد گرد متمرکز شده‌اند. ثبت خودکار؛ دستگاه‌های ناشناس‌شناس عددی
داده‌های نتایج مفقود آن‌هایی که اندازه‌گیری نشده‌اند با آن‌هایی که اندازه‌گیری شده‌اند متفاوت‌اند. کاهش حداکثر از دست‌داده‌ها؛ سنجش دلیل عدم مشاهده؛ تحلیل حساسیت

دو مورد از این‌ها شایسته توضیح مفصل هستند.

تعیین تفاوتی ظریف است زیرا می‌تواند بدون آنکه کسی قصد آن را داشته باشد رخ دهد. اگر مداخله باعث عارضه‌ای شود که به انجام بررسی منجر شود، در آن بازو یافته‌های تصادفی بیشتری کشف خواهد شد. اگر بازوی مداخله بیشتر مشاهده شود، رویدادهای بیشتری ثبت خواهد شد. پروتکل باید برنامه ارزیابی را ثابت کند و انجام همان بررسی‌ها را در هر دو بازو الزامی سازد.

ارزیابی نتایج به‌صورت کور تقریباً همیشه ممکن است، حتی زمانی که کورسازی شرکت‌کنندگان امکان‌پذیر نیست. یک کارآزمایی جراحی نمی‌تواند جراح یا بیمار را کور کند، اما می‌تواند تصاویر بدون هویت را برای یک خوانشگر مرکزی ارسال کرده و نتایج عملکردی را توسط ارزیابی که در حین جراحی حضور نداشته است، اندازه‌گیری کند. عدم انجام این کار یک انتخاب طراحی است، نه یک اجبار.

تفاوت و خطای تصادفی

این تمایز بنیادی است و پیامدهای آن‌ها کاملاً متفاوت است.

خطای تصادفی غیرسیستمیک است و احتمال وقوع آن در هر دو جهت به یک اندازه است. آن:

  • فاصله‌های اطمینان را گسترش می‌دهد
  • وقتی بر اندازه‌گیری نتیجه به‌طور غیرمتفاوت تأثیر می‌گذارد، برآورد ارتباط را به سمت مقدار صفر متمایل می‌کند.
  • با اندازه‌گیری بهتر و نمونه‌های بزرگ‌تر کاهش می‌یابد.

تفاوت سیستماتیک در یک جهت است. آن:

  • تخمین را از حقیقت دور می‌کند
  • با افزایش حجم نمونه کاهش نمی‌یابد. یک آزمایش جانبدارانه بزرگ‌تر، پاسخ اشتباه دقیق‌تری می‌دهد.
  • آیا تنها از طریق طراحی به آن پرداخته می‌شود؟

آن نکتهٔ دوم دربارهٔ سوگیری همان نکته‌ای است که باید به خاطر بسپارید. پژوهشگران به‌طور غریزی در مواجهه با یک نتیجهٔ ناامیدکننده با پیشنهاد یک آزمایش بزرگ‌تر واکنش نشان می‌دهند. اگر مشکل سوگیری در اندازه‌گیری باشد، یک آزمایش بزرگ‌تر اوضاع را بدتر می‌کند، زیرا همان برآورد نادرست را با فاصلهٔ اطمینان باریک‌تر و اعتبار ظاهری بیشتر ارائه می‌دهد.

همچنین به پیآمدی برای یک نکته ظریف که پیش‌تر مطرح شده توجه کنید: طبقه‌بندی نادرست غیرمرتبط با تفاوت، نتایج را در یک کارآزمایی برتری که محافظه‌کارانه است به سمت فرضیه صفر و در یک کارآزمایی عدم‌کمتری‌بودن که محافظه‌کارانه نیست به سمت نتیجه‌گیری متمایل می‌کند.

کمیته‌های داوری

برای پیامدهایی که به داوری نیاز دارند، یک کمیته داوری (نقطه پایانی) تعریف‌های پروتکل را به شکل یکسان بر هر رویداد نامزد اعمال می‌کند.

ترکیب: متخصصان بالینی با تخصص مرتبط، مستقل از اجرای کارآزمایی و حامی مالی، کور نسبت به تخصیص.

فرآیند:

  1. سایت‌ها رویدادهای احتمالی را با استفاده از محرک‌های از پیش تعیین‌شده گزارش می‌کنند.
  2. مستندات گردآوری و ویرایش می‌شوند تا هر چیزی که تخصیص را فاش می‌کند، از جمله نام داروها، مقادیر آزمایشگاهی اختصاصی یک بازو و شناسه‌های سایت، حذف شود.
  3. دو داور به‌طور مستقل بر اساس تعاریف مکتوب بازبینی می‌کنند.
  4. اختلافات توسط یک داور سوم یا بحث در کمیته حل می‌شوند.
  5. موافقت اندازه‌گیری و گزارش می‌شود.

آنچه به دست می‌آورد: اعمال یکنواخت تعریف در سایت‌ها و در طول زمان، و طبقه‌بندی نتایج که واقعاً کور است حتی زمانی که کارآزمایی کور نیست.

آنچه این روش به دست نمی‌دهد: نمی‌تواند رویدادهایی را که هرگز گزارش نشده‌اند بازیابی کند. داوری طبقه‌بندی رویدادهایی را که به آن می‌رسند بهبود می‌بخشد و در برابر تعیین تفکیک‌شده در مراحل قبلی بی‌توان است. هر دو تدبیر حفاظتی لازم هستند.

آیا همیشه ارزشش را دارد؟ داوری پرهزینه و کند است و ارزش آن بستگی به میزان قضاوتی دارد که نتیجه می‌طلبد. برای مرگ‌ومیر کلی عملاً هیچ چیز اضافه نمی‌کند، زیرا واقعیت مرگ مورد مناقشه نیست (علت مرگ موضوعی متفاوت است که یکی از دلایل ترجیح مرگ‌ومیر کلی است). برای ترکیبات نرم و وابسته به قضاوت، این امر ضروری است. مرورهایی بر کارآزمایی‌هایی که نتایج پایانی خود را قضاوت کرده‌اند نشان داده است که قضاوت به ندرت اثر کلی درمان را در کارآزمایی‌های بزرگ با نتایج عینی تغییر می‌دهد، که این خود دلیلی است برای اختصاص آن به مواردی که نتیجه نهایی واقعاً به آن نیاز دارد.

اعتبار و روایی

ویژگی‌های اندازه‌گیری مطرح‌شده در دوره مبانی، با تأکید بر یک جنبه خاص مربوط به آزمون، به‌طور مستقیم کاربرد دارند.

اعتمادپذیری بر اعتبار مقدم است. ابزاری که نتواند نتیجهٔ خود را بازتولید کند، نمی‌تواند به‌طور مداوم چیز درست را اندازه‌گیری کند.

در یک کارآزمایی، اندازه‌گیری نامطمئن نتایج، اثر را تضعیف می‌کند. این معمولاً اثری کاذب ایجاد نمی‌کند. پیامد عملی این است که کارآزمایی با اندازه‌گیری ضعیف به نمونه‌ای بزرگ‌تر نیاز دارد و این موضوع باید در محاسبه حجم نمونه لحاظ شود، نه اینکه بعداً کشف شود.

پایایی را پیش از کارآزمایی احراز کنید، در همان جامعه و به دست همان ارزیابانی که کار را انجام خواهند داد. پایایی گزارش‌شده از جامعه‌ای دیگر، یا از سازندگان ابزار، ممکن است منتقل نشود.

درک خود را بررسی کنید

  1. برای یک کارآزمایی برنامه توانبخشی پس از سکته مغزی، یک نتیجهٔ اصلی را نام ببرید و بگویید چه کسی باید آن را اندازه‌گیری کند، چه زمانی و چگونه، و هر انتخاب را توجیه کنید.
  2. آزمون یک دستگاه قابل کاشت نمی‌تواند بیماران یا جراحان را کور کند. با این وجود، سه اقدام جداگانه‌ای را که برای حفاظت از ارزیابی نتایج انجام می‌دهید، شرح دهید.
  3. یک پروتکل نمرهٔ پیوستۀ درد را در «کاهش 50%» دودویی می‌کند. شرایطی را که در آن این اقدام قابل دفاع است بیان کنید و همچنین آنچه را که علاوه بر آن گزارش خواهید کرد.
  4. توضیح دهید چرا افزایش حجم نمونه خطای تصادفی را برطرف می‌کند اما سوگیری را نه، و یک مثال ملموس از پژوهشگری که این اشتباه را مرتکب شده ارائه دهید.
  5. در بازوی مداخله، شرکت‌کنندگان ماهانه برای دریافت تزریق اجباری حضور می‌یابند؛ در بازوی کنترل هر سه ماه یک‌بار حضور می‌یابند. این سوگیری را نام ببرید و اصلاح طراحی را توضیح دهید.
  6. دو کارآزمایی بالینی یک دارو در بازوهای کنترل خود نرخ سکته قلبی را به‌ترتیب 4% و 11% گزارش کرده‌اند. محتمل‌ترین توضیح روش‌شناختی را ارائه دهید و بگویید برای تأیید آن به کجا مراجعه می‌کنید.
  7. توضیح دهید چرا رسیدگی قضایی نمی‌تواند تعیین متفاوت را اصلاح کند و چه ضامن جایگزینی برای آن وجود دارد.

مطالعه بیشتر

  • Tugwell P, Guyatt GH. Generating outcome measurements, especially for quality of life. In: Haynes RB et al, Clinical Epidemiology: How to Do Clinical Practice Research, 3rd ed.
  • Guyatt GH, Furukawa T. An illustration of bias and random error. In: Users' Guides to the Medical Literature.
  • Granger CB, Vogel V, Cummings SR, et al. Do we need to adjudicate major clinical events? Clin Trials. 2008;5(1):56-60.
  • Altman DG, Royston P. The cost of dichotomising continuous variables. BMJ. 2006;332:1080.
  • Hrobjartsson A, Thomsen ASS, Emanuelsson F, et al. Observer bias in randomised clinical trials with binary outcomes. BMJ. 2012;344:e1119.

اصطلاحات کلیدی

ارزیاب نتایجارزیابی کورتفاوت اندازه‌گیریتفاوت‌سنجی جانبدارانهدوگانه‌سازیپاسخگوییحداقل اختلاف مهمکمیته داوریتعریف نقطه پایانیخطای تصادفی