فصل چهارم از اجرای چند آزمون آماری آغاز نمیشود. پیش از هر تحلیل باید مطمئن شوید دادهها با پرسشنامه، سؤالهای پژوهش و برنامه فصل سوم هماهنگ هستند. یک فایل نامرتب میتواند خروجی ظاهراً دقیق اما نتیجه علمی نادرست تولید کند.
نسخه نهایی ابزار را مشخص کنید
پرسشنامه یا فرم جمعآوری داده باید همان نسخهای باشد که واقعاً استفاده شده است. تعداد سؤالها، گزینهها، جهت نمرهگذاری و خردهمقیاسها را ثبت کنید. اگر سؤال معکوس وجود دارد، فهرست آن را جداگانه بنویسید.
هر ردیف و ستون چه معنایی دارد؟
در اغلب فایلها هر ردیف یک پاسخدهنده و هر ستون یک متغیر است. نام متغیرها باید کوتاه اما قابل فهم باشد. فایل راهنمای کدگذاری بسازید و برای هر ستون، عنوان کامل، نوع داده، دامنه مجاز و معنی کدها را بنویسید.
کدگذاری پاسخها را یکدست کنید
برای نمونه، جنسیت نباید در بخشی از فایل با ۱ و ۲ و در بخش دیگر با «زن» و «مرد» ثبت شده باشد. گزینههای طیف لیکرت نیز باید ترتیب مشخص داشته باشند. فاصله اضافی، اعداد فارسی و انگلیسی مخلوط و خانههای دارای علامت نامعلوم را اصلاح کنید.
دادههای گمشده
خانه خالی، صفر، عدد ۹۹ یا عبارت «ندارد» ممکن است همگی برای داده گمشده استفاده شده باشند. ابتدا مشخص کنید هر کد چه معنایی دارد. روش برخورد با داده گمشده به مقدار، الگو و نوع تحلیل بستگی دارد و حذف همه ردیفها همیشه بهترین تصمیم نیست.
پاسخهای نامعتبر یا تکراری
زمان پاسخ بسیار کوتاه، الگوی یکسان در همه سؤالها، تناقض آشکار، شناسه تکراری یا پاسخ خارج از دامنه باید بررسی شود. حذف پاسخ بدون معیار روشن قابل دفاع نیست؛ معیارها را پیش از دیدن نتیجه نهایی تعیین و ثبت کنید.
ساخت نمره خردهمقیاسها
پس از اعمال سؤالهای معکوس، نمره هر سازه بر اساس دستورالعمل ابزار محاسبه میشود. میانگین، جمع یا وزندهی باید با منبع اصلی سازگار باشد. نام متغیر ساختهشده و فرمول آن را در فایل راهنما بنویسید.
هماهنگی با فصل سوم
جامعه، نمونه، متغیرها، فرضیهها و آزمونهای برنامهریزیشده را با داده واقعی تطبیق دهید. اگر حجم نمونه، ابزار یا روش تغییر کرده است، پیش از تحلیل باید اثر آن بر طرح پژوهش بررسی و در متن مستند شود.
نسخه پشتیبان و فایل کاری
فایل خام را هرگز مستقیماً ویرایش نکنید. یک نسخه فقطخواندنی از داده خام نگه دارید و پاکسازی را روی فایل جدا انجام دهید. مراحل تغییر، تاریخ و دلیل هر تصمیم را ثبت کنید تا تحلیل قابل تکرار باشد.
فایلهایی که برای بررسی لازماند
- پروپوزال یا فصل سوم نهایی
- نسخه پرسشنامه و راهنمای نمرهگذاری
- فایل داده خام و فایل پاکشده
- فهرست سؤالها و فرضیهها
- اصلاحات استاد درباره تحلیل
از فایل خام تا داده قابل تحلیل
یک فرهنگ متغیرها بسازید
فرهنگ متغیرها یا Data Dictionary فایل کوچکی است که معنای هر ستون را ثبت میکند. برای هر متغیر نام کوتاه، برچسب کامل، نوع عددی یا متنی، واحد، دامنه مجاز، کد داده گمشده، منبع سؤال و نحوه محاسبه نمره را بنویسید. اگر متغیر ساختهشده است، فرمول و ترتیب اعمال سؤالهای معکوس نیز ثبت شود. این فایل جلوی برداشت متفاوت اعضای تیم را میگیرد و بعداً نوشتن جدولهای فصل چهارم را آسان میکند.
| نام ستون | معنا | دامنه/کد | کنترل لازم |
|---|---|---|---|
| age | سن بر حسب سال | ۱۸ تا ۸۰ | مقادیر خارج از دامنه با فرم اصلی تطبیق داده شوند. |
| q12 | سؤال ۱۲ ابزار | ۱ تا ۵ | اگر سؤال معکوس است، نسخه خام حفظ شود. |
| score_a | نمره خردهمقیاس الف | میانگین سؤالهای تعیینشده | فرمول و حداقل پاسخ معتبر ثبت شود. |
| missing_reason | دلیل نبود پاسخ | ۱، ۲، ۳ یا خالی | معنای هر کد در راهنما نوشته شود. |
پاکسازی را با گزارش تغییرات انجام دهید
هر تغییر باید پاسخ سه سؤال را داشته باشد: چه چیزی تغییر کرد، چرا تغییر کرد و روی چند ردیف اثر گذاشت؟ برای نمونه «هشت مقدار ۹۹ طبق راهنمای ابزار به داده گمشده تبدیل شد» قابل دفاعتر از «دادهها تمیز شدند» است. اگر مقدار مشکوکی را با فایل اصلی کنترل کردید، نتیجه را ثبت کنید. اگر امکان کنترل وجود ندارد، آن مقدار را خودسرانه حدس نزنید.
داده گمشده را یک تصمیم تحلیلی ببینید
ابتدا درصد و الگوی فقدان را برای هر متغیر و هر پاسخدهنده بررسی کنید. تفاوت دارد که یک سؤال تصادفی جا افتاده باشد یا گروه مشخصی به مجموعهای از سؤالها پاسخ نداده باشد. حذف کامل ردیفها، جایگزینی میانگین یا روشهای مدلمحور هرکدام فرض و پیامد دارند. تصمیم باید با طرح مطالعه، مقدار فقدان و روش تحلیل هماهنگ و در گزارش نوشته شود.
پاسخ دورافتاده همیشه خطا نیست
یک مقدار بسیار بزرگ ممکن است خطای تایپ، واحد متفاوت یا مشاهده واقعی باشد. اول منشأ را بررسی کنید؛ سپس اثر آن بر تحلیل را بسنجید. حذف صرفاً به دلیل تغییر نتیجه پژوهش قابل قبول نیست. در صورت نیاز میتوان تحلیل حساسیت انجام داد و نتیجه با و بدون مشاهده مشکوک را مقایسه کرد.
تحلیل قابل تکرار یعنی چه؟
فرد دیگری باید بتواند از داده ناشناس و دستورهای ثبتشده به همان جدولها برسد. در نرمافزارهای منویی، Syntax یا Log را ذخیره کنید؛ در R و Python کد، نسخه بستهها و Seed را ثبت کنید. نام فایلهای خروجی را به سؤال پژوهش وصل کنید و از کپی دستی عدد میان چند فایل پرهیز کنید.
حریم خصوصی قبل از ارسال فایل
ستون نام، تلفن، کد ملی، نشانی دقیق و شناسه سازمانی را حذف یا با کد تصادفی جایگزین کنید، مگر اینکه برای تحلیل ضرورت علمی مستند داشته باشند. کلید اتصال کد به هویت باید جدا و با دسترسی محدود نگهداری شود. ناشناسسازی فقط حذف نام نیست؛ ترکیب سن، شغل و محل کوچک نیز گاهی فرد را قابل شناسایی میکند.
منابع برای مطالعه بیشتر
- مقاله Tidy Data در Journal of Statistical Software — اصول ساختاردهی داده برای تحلیل قابل تکرار.
- راهنمای ناشناسسازی UK Data Service — ملاحظات شناسایی مستقیم و غیرمستقیم.
- مستندات رسمی IBM SPSS Statistics — تعریف متغیر، داده گمشده و ثبت دستورها.
قبل از ارسال داده، نام و اطلاعات هویتی پاسخدهندگان را حذف یا ناشناس کنید. برای بررسی تخصصی، جزئیات را در فرم پروژه ثبت کنید و راهنمای تحلیل آماری و گزارش نتایج را نیز ببینید.
درباره نویسنده و بازبینی این مطلب
نویسنده: تیم پژوهشی آیدین دسک







