کشف رویدادها با دادههای رسانهای
گاهی نخستین نشانه یک اتفاق در دادهها، جهش تعداد پیامهاست. در مثال فرضی آلودگی هوا، ممکن است تعداد پیامهای مرتبط در چند ساعت افزایش یابد و همزمان عبارتهایی مانند «تعطیلی مدارس» و نام یک شهر بیشتر تکرار شوند. این تغییر، نقطه مناسبی برای بررسی است؛ اما هنوز ثابت نمیکند بحران تازهای رخ داده است. کشف رویداد به شناسایی اتفاقها یا تغییرات معنادار در جریان داده گفته میشود. پژوهشگر میکوشد بفهمد چه اتفاقی توجه را جلب کرده، چه زمانی ظاهر شده و چگونه گسترش یافته است. مرور هو و همکاران (۲۰۲۲) نشان میدهد روشهای این حوزه از نشانههایی مانند جهش واژگان، ویژگیهای متن و روابط اجتماعی استفاده میکنند.
ابتدا الگوی معمول را بشناسیم.
برای تشخیص افزایش غیرعادی، باید بدانیم وضعیت عادی چیست. مقایسه تعداد پیامهای ظهر با نیمهشب میتواند گمراهکننده باشد؛ زیرا فعالیت کاربران در ساعتهای مختلف تغییر میکند. رویدادهای تقویمی و تغییر پوشش گردآوری نیز ممکن است تعداد پیامها را بالا ببرند. در یک طرح ساده، میتوان شمار پیامهای مرتبط را در بازههای یکساعته محاسبه و با ساعتهای مشابه روزهای گذشته مقایسه کرد. آستانه هشدار باید متناسب با داده تنظیم شود، نه اینکه یک مقدار ثابت برای همه موضوعات به کار رود. کلاینبرگ (۲۰۰۳) در پژوهش خود درباره ساختار جهشی جریان داده، روشی برای تشخیص دورههای افزایش شدت فعالیت ارائه کرده است. علاوه بر تعداد کل پیامها، تعداد حسابها یا کانالهای مشارکتکننده را هم ببینید. افزایش پیامهای یک کانال با افزایش همزمان مشارکت دهها منبع متفاوت، معنای یکسانی ندارد.
متن و زمان و رابطه را کنار هم بگذاریم.
متن به شناسایی موضوع کمک میکند؛ زمان، آغاز و ادامه تغییر را نشان میدهد؛ و روابط بازنشر، بخشی از مسیر انتشار را آشکار میکنند. گیل و فاور (۲۰۱۴) در روش «کشف رویداد مبتنی بر ناهنجاری اشارهها»، از تغییر غیرعادی اشاره کاربران به یکدیگر در کنار متن استفاده کردهاند. برای مثال، افزایش واژه «زلزله» ممکن است به حادثهای تازه، سالگرد یک حادثه یا بازنشر ویدئویی قدیمی مربوط باشد. خواندن نمونه پیامها، بررسی تاریخ محتوای بازنشرشده و مقایسه با گزارشهای مستقل برای تفکیک این حالتها ضروری است. چند رسانه که همگی یک خبر را کپی کردهاند، چند تأیید مستقل به شمار نمیآیند. در تلگرام، پیوند بازنشر در صورت موجودبودن میتواند سرنخی از منبع باشد. در ایکس، زنجیره پاسخ یا بازنشر اطلاعات دیگری میدهد. در خبرگزاریها نیز زمان نخستین انتشار باید از زمان بهروزرسانی خبر جدا شود. یکدستکردن منطقه زمانی، پیشنیاز مقایسه این دادههاست.
هر جهش به معنای بحران نیست
تبلیغات، یک کارزار برنامهریزیشده یا انتشار دوباره خبری قدیمی هم میتواند نمودار را ناگهان بالا ببرد. حتی افت تعداد پیامها ممکن است نتیجه اختلال در گردآوری باشد. بنابراین سامانه هشدار بهتر است برای هر مورد، نمونه محتوا و وضعیت کیفیت داده را نیز ارائه کند تا پژوهشگر بتواند هشدار را بررسی کند. در مطالعه بحران، اطلاعات رسانهای میتواند به شناسایی نگرانیها و درخواستهای مطرحشده کمک کند. با این حال، مکان درجشده در پروفایل کاربر یا نام شهری در متن، بهتنهایی محل وقوع حادثه یا حضور نویسنده را ثابت نمیکند. چنین دادههایی باید با توجه به منشأ و میزان اطمینانشان استفاده شوند.
کشف رویداد با پیشبینی آن فرق دارد
تشخیص اینکه «اکنون توجه به قطع برق افزایش یافته است» با پیشبینی اینکه «فردا برق قطع خواهد شد» تفاوت دارد. حتی پیامهایی درباره یک رویداد آینده ممکن است فقط اعلام برنامه، انتظار یا شایعه باشند. پژوهش پیشبینی به آزمون روی دادههای بعدی و مقایسه با روشهای ساده پایه نیاز دارد. برای جلوگیری از ارزیابی خوشبینانه، اطلاعاتی که پس از رویداد منتشر شدهاند نباید وارد ورودی مدل پیشبینی شوند. تشخیص رویداد نیز باید با معیارهایی مانند تعداد هشدارهای درست، رویدادهای ازدسترفته و تأخیر تشخیص ارزیابی شود. سامانهای که دائماً هشدار میدهد، صرفاً به دلیل یافتن چند رویداد مهم مفید نیست.
یک تمرین پژوهشی قابل اجرا
برای یک پروژه دانشجویی، موضوعی محدود و دارای سابقه مستند انتخاب کنید. ابتدا خط زمانی رویدادها را با اتکا به منابع معتبر بسازید. سپس داده رسانهای همان دوره را تحلیل کنید و ببینید جهشها چه زمانی رخ دادهاند، چند هشدار نامرتبط تولید شده و کدام رویدادها دیده نشدهاند. خروجی مناسب فقط یک نمودار قلهدار نیست. شرح هر رویداد، شواهد تأییدکننده و توضیح هشدارهای اشتباه، نشان میدهد روش در چه شرایطی قابل استفاده است. همین بررسی میتواند نقطه اتصال یک مسئله اجتماعی با پروژهای در پردازش زبان طبیعی یا تحلیل داده باشد.
منابع
Guille, A., & Favre, C. (2014). Mention-Anomaly-Based Event Detection and Tracking in Twitter. ASONAM 2014, 375–382. https://doi.org/10.1109/ASONAM.2014.6921613
Hu, X., Ma, W., Chen, C., Wen, S., Zhang, J., Xiang, Y., & Fei, G. (2022). Event Detection in Online Social Network: Methodologies, State-of-Art, and Evolution. Computer Science Review, 46, 100500. https://doi.org/10.1016/j.cosrev.2022.100500
Kleinberg, J. (2003). Bursty and Hierarchical Structure in Streams. Data Mining and Knowledge Discovery, 7(4), 373–397. https://doi.org/10.1023/A:1024940629314