وبلاگ / رسانه اجتماعی / اعتبار و سوگیری و اخلاق در پژوهش با داده‌های…

اعتبار و سوگیری و اخلاق در پژوهش با داده‌های رسانه‌ای

L
📅 2026/10/02
👁 1 بازدید

یک میلیون پیام ممکن است حاصل فعالیت گروه کوچکی از حساب‌ها باشد. اگر همان گروه در موضوع مورد مطالعه دیدگاهی خاص داشته باشد، افزودن پیام‌های بیشتر لزوماً تصویر متوازن‌تری ایجاد نمی‌کند. پیش از هر تحلیل، باید پرسید داده چه کسانی را نشان می‌دهد و چه کسانی در آن غایب‌اند. اعتبار پژوهش رسانه‌ای به اندازه مجموعه وابسته نیست. انتخاب منبع، جست‌وجو، کیفیت پردازش و شیوه گزارش، همگی بر نتیجه اثر دارند. در کنار این مسائل، داده‌ها به انسان‌های واقعی مربوط‌اند و تصمیم درباره نگهداری یا انتشار آن‌ها می‌تواند برای صاحبانشان پیامد داشته باشد.

سوگیری پژوهش از کجا وارد می‌شود.
اولتئانو و همکاران (۲۰۱۹) سوگیری‌های داده اجتماعی را در مراحل مختلف پژوهش بررسی کرده‌اند. این نگاه کمک می‌کند مشکل را فقط به «نمونه کوچک» محدود نکنیم؛ کاربران حاضر در پلتفرم، کسانی که محتوا تولید می‌کنند و پیام‌هایی که ابزار گردآوری در دسترس می‌گذارد، لزوماً یک مجموعه واحد نیستند. برای نمونه، جست‌وجوی «مهاجرت نخبگان» ممکن است پیام‌هایی با عبارت «رفتن پزشک‌ها» یا «فرار مغزها» را از دست بدهد. در مقابل، یک واژه عمومی می‌تواند داده نامرتبط زیادی وارد مجموعه کند. راه‌حل عملی، مطالعه نمونه اولیه و اصلاح مرحله‌ای عبارت‌های جست‌وجوست. نسخه هر عبارت و زمان اعمال تغییر را ثبت کنید تا تغییر پوشش جست‌وجو با تغییر واقعی گفت‌وگو اشتباه نشود. تعداد پیام‌ها، حساب‌های یکتا و سهم حساب‌های بسیار فعال را جداگانه بررسی کنید. اگر نتیجه به فعالیت چند حساب وابسته است، تحلیل را یک بار با حضور آن‌ها و یک بار بدون آن‌ها مقایسه کنید. این آزمون حساسیت، جای تصمیم پنهان درباره حذف داده را می‌گیرد.

پاک‌سازی باید قابل بازگشت باشد.
در فارسی، یکدست‌کردن «ی» و «ک»، فاصله‌ها و شکل‌های نوشتاری برای جست‌وجو مفید است. با این حال، حذف همه نشانه‌ها، شکلک‌ها یا هشتگ‌ها ممکن است اطلاعات لازم برای تحلیل لحن را از بین ببرد. حذف بازنشرها نیز برای همه پرسش‌ها مناسب نیست. نسخه خام را با دسترسی محدود نگه دارید و پردازش را روی نسخه جداگانه انجام دهید. برای هر تغییر توضیح دهید چه چیزی عوض شده و چرا. در صورت نیاز به متن اصلی، باید بتوان به آن بازگشت؛ البته فقط تا زمانی که نگهداری آن با برنامه مصوب پژوهش و ملاحظات حریم خصوصی سازگار است.

ابزار خودکار را روی همین داده ارزیابی کنیم.
مدلی که روی نقد کالا خوب عمل می‌کند، ممکن است در گفت‌وگوی سیاسی فارسی ضعیف باشد. پیش از تحلیل نهایی، نمونه‌ای از داده واقعی پژوهش را به‌صورت دستی برچسب‌گذاری کنید و خطاهای مدل را بررسی کنید. نمونه ارزیابی بهتر است فقط شامل پیام‌های کوتاه و واضح نباشد؛ کنایه، متن ترکیبی و موارد مبهم هم باید دیده شوند. برای طبقه‌بندی، درست‌بودن کلی پاسخ‌ها یا Accuracy همه چیز را نشان نمی‌دهد. اگر بیشتر پیام‌ها خنثی باشند، مدلی که همواره «خنثی» پاسخ می‌دهد ممکن است ظاهراً موفق به نظر برسد. Precision نشان می‌دهد چه سهمی از موارد منتسب به یک دسته واقعاً متعلق به آن‌اند؛ Recall نشان می‌دهد چه سهمی از موارد واقعی آن دسته پیدا شده‌اند؛ و F1 میان این دو تعادل برقرار می‌کند. عملکرد هر دسته را جداگانه گزارش کنید. اختلاف میان برچسب‌گذاران انسانی نیز اطلاعات مهمی دارد. اگر تعریف «حمایت» یا «کنایه» برای انسان‌ها روشن نباشد، عدد عملکرد مدل نمی‌تواند این ابهام مفهومی را برطرف کند. ابتدا راهنمای کدگذاری را اصلاح کنید.

حساب خودکار را متناسب با مسئله بررسی کنیم.
اگر پرسش درباره تجربه کاربران انسانی است، فعالیت خودکار ممکن است نتیجه را منحرف کند. اگر هدف بررسی دستکاری جریان اطلاعات باشد، همین فعالیت بخشی از موضوع پژوهش است. فرزام و همکاران (۲۰۲۳) در مطالعه توییتر فارسی، نشانه‌های فعالیت غیرواقعی و تفاوت آن میان بحث‌ها را بررسی کرده‌اند. با این حال، امتیاز یک ابزار تشخیص ربات، اثبات هویت یا نیت حساب نیست. هماهنگی نیز لزوماً به معنی غیرواقعی‌بودن نیست؛ گروهی از افراد واقعی ممکن است برای کارزاری مشخص هماهنگ شوند. معیارها و میزان عدم قطعیت را توضیح دهید و از اتهام‌زنی به حساب‌ها بر پایه یک شاخص خودکار پرهیز کنید.

عمومی‌بودن به معنی بی‌خطر بودن نیست.
زیمر (۲۰۱۰) نشان می‌دهد دسترسی عمومی به داده، مسائل اخلاقی استفاده پژوهشی را از میان نمی‌برد. حتی با حذف نام کاربری، نقل مستقیم یک پیام حساس ممکن است از راه جست‌وجوی متن، نویسنده را قابل شناسایی کند. پیش از گردآوری، اطلاعات ضروری را مشخص کنید. در گزارش، در صورت سازگاری با هدف تحلیل، از آمار تجمیعی یا بازنویسی نمونه‌های حساس استفاده کنید. بازنویسی باید به‌صراحت از نقل مستقیم متمایز باشد و معنای پیام را تغییر ندهد. دسترسی به داده خام، مدت نگهداری و شیوه حذف آن نیز باید روشن باشد. راهنمای فرانتسکه و همکاران (۲۰۲۰) بر ارزیابی اخلاقی متناسب با زمینه پژوهش تأکید دارد. پیوندزدن داده رسانه‌ای به پاسخ‌های پیمایش، خطر شناسایی افراد را بیشتر می‌کند. اسلون و همکاران (۲۰۲۰) مسائل رضایت آگاهانه، افشا، امنیت و بایگانی چنین داده‌هایی را بررسی کرده‌اند. برای این نوع طرح، تصمیم درباره رضایت و مجوز اخلاقی باید پیش از اتصال داده‌ها گرفته شود.

پیش از انتشار چه چیزهایی را روشن کنیم؟
خواننده باید بتواند بفهمد داده از چه منابعی و در چه دوره‌ای آمده، چگونه انتخاب و پردازش شده و ابزار تحلیل چه خطایی دارد. مقایسه با پیمایش، مصاحبه یا آمار رسمی نیز می‌تواند تفسیر را تقویت کند، به شرط آنکه تفاوت جامعه و زمان اندازه‌گیری در نظر گرفته شود. توافق چند منبع، وقتی همگی از یک منبع اولیه کپی کرده‌اند، تأیید مستقل نیست. اختلاف نتایج هم لزوماً شکست پژوهش نیست؛ ممکن است نشان دهد هر روش بخش متفاوتی از پدیده را می‌بیند. گزارش صریح همین تفاوت‌ها، نتیجه را قابل استفاده‌تر می‌کند.

منابع
Farzam, A., Moradi, P., Mohammadi, S., Padar, Z., & Siegel, A. A. (2023). Opinion manipulation on Farsi Twitter. Scientific Reports, 13, 333. https://doi.org/10.1038/s41598-022-26921-5
Franzke, A. S., Bechmann, A., Zimmer, M., Ess, C., & the Association of Internet Researchers. (2020). Internet research: Ethical guidelines 3.0. https://aoir.org/reports/ethics3.pdf
Olteanu, A., Castillo, C., Diaz, F., & Kıcıman, E. (2019). Social Data: Biases, Methodological Pitfalls, and Ethical Boundaries. Frontiers in Big Data, 2, 13. https://doi.org/10.3389/fdata.2019.00013
Sloan, L., Jessop, C., Al Baghal, T., & Williams, M. (2020). Linking Survey and Twitter Data: Informed Consent, Disclosure, Security, and Archiving. Journal of Empirical Research on Human Research Ethics, 15(1–2), 63–76. https://doi.org/10.1177/1556264619853447
Zimmer, M. (2010). But the Data Is Already Public: On the Ethics of Research in Facebook. Ethics and Information Technology, 12(4), 313–325. https://doi.org/10.1007/s10676-010-9227-5