تشخیص ناهنجاری رفتاری در لاگ‌های SOC با مدل‌های Transformer

29 تیر 1405 admin ابزار های SOC 3 بازدید ۰ دیدگاه

در مراکز عملیات امنیت (Security Operations Center – SOC)، حجم عظیمی از لاگ‌ها از منابعی مانند EDR، Firewall، Active Directory، Cloud، Proxy و SIEM جمع‌آوری می‌شود. چالش اصلی این است که بسیاری از تهدیدهای پیشرفته، به‌ویژه Insider Threat، Lateral Movement و Low-and-Slow Attacks، الگوی مشخص و ثابتی ندارند و به همین دلیل با Rule-based Detection به‌سختی شناسایی می‌شوند.

اینجاست که مدل‌های Transformer اهمیت پیدا می‌کنند. این مدل‌ها به‌دلیل توانایی بالا در درک توالی (Sequence)، زمینه (Context) و وابستگی‌های بلندمدت، به گزینه‌ای جدی برای Behavioral Anomaly Detection در لاگ‌های SOC تبدیل شده‌اند.

چرا روش‌های سنتی کافی نیستند؟

روش‌های سنتی تشخیص ناهنجاری معمولاً بر پایه:

  • Thresholdهای ثابت
  • Correlation Ruleهای ایستا
  • آماره‌های ساده
  • Signature Detection

هستند. این رویکردها برای تهدیدهای شناخته‌شده مؤثرند، اما در برابر رفتارهای پیچیده ضعف دارند.

مثال:

  • کاربری که هر شب login می‌کند، عادی است
  • اما اگر همان کاربر ناگهان به ۲۰ سرور جدید SSH بزند، الگو دیگر عادی نیست
  • Ruleهای ساده این تغییر رفتاری را همیشه به‌درستی تشخیص نمی‌دهند

Transformerها می‌توانند الگوی نرمال رفتار را از روی دنباله رویدادها یاد بگیرند و انحراف از آن را شناسایی کنند.

چرا Transformer برای لاگ‌های SOC مناسب است؟

1. درک وابستگی‌های بلندمدت

مدل‌های سنتی مانند RNN/LSTM در توالی‌های طولانی محدودیت دارند. اما Transformer با مکانیزم Self-Attention می‌تواند ارتباط میان رویدادهایی را که با فاصله زمانی زیاد رخ داده‌اند، مدل کند.

2. Context-Aware Detection

در SOC، یک Event به‌تنهایی معنای زیادی ندارد؛ معنا از توالی و context به‌دست می‌آید.

مثلاً:

  • Login موفق
  • دسترسی به فایل حساس
  • PowerShell execution
  • اتصال به یک سرور غیرمعمول

این توالی ممکن است نشانه حمله باشد، نه هر Event به‌صورت مستقل.

3. مقیاس‌پذیری در داده‌های بزرگ

با وجود هزینه محاسباتی بالا، Transformerها برای پردازش حجم زیاد داده و آموزش روی corpusهای بزرگ لاگ مناسب‌اند، به‌ویژه با معماری‌های بهینه‌شده.

معماری کلی مدل

1. جمع‌آوری و نرمال‌سازی لاگ‌ها

ابتدا لاگ‌ها از منابع مختلف جمع‌آوری و به قالبی استاندارد تبدیل می‌شوند.

فیلدهای مهم:

  • timestamp
  • user
  • source IP
  • destination
  • event type
  • process name
  • command line
  • host
  • 2. Tokenization رخدادها

هر رخداد می‌تواند به‌صورت یک توکن یا مجموعه‌ای از توکن‌ها نمایش داده شود.

مثلاً:

USER_LOGIN | user=alice | host=HR-LAPTOP | time=22:14

یا به‌شکل embeddingهای ساختاریافته:

  • embedding کاربر
  • embedding میزبان
  • embedding نوع رویداد
  • embedding زمان
  • 3. Sequence Modeling

مدل Transformer دنباله‌ای از eventها را برای هر:

  • کاربر
  • سیستم
  • Session
  • یا Asset

دریافت می‌کند و الگوی عادی را یاد می‌گیرد.

روش‌های آموزش

1. Unsupervised / Self-Supervised Learning

رایج‌ترین روش در SOC همین است، چون داده‌های برچسب‌خورده کم هستند.

نمونه رویکردها:

  • Next Event Prediction
  • Masked Event Modeling
  • Sequence Reconstruction

اگر مدل نتواند event بعدی را با احتمال مناسب پیش‌بینی کند، ممکن است ناهنجاری وجود داشته باشد.

2. Supervised Detection

اگر dataset دارای برچسب حمله باشد، می‌توان از Transformer برای طبقه‌بندی استفاده کرد.

اما در عمل این داده‌ها محدود و وابسته به سازمان‌اند.

مزایای این رویکرد

ویژگی

Transformer-based Detection

درک توالی رخدادها

بسیار بالا

مدل‌سازی context

قوی

کشف حملات ناشناخته

خوب

کاهش وابستگی به Rule ثابت

بالا

تشخیص low-and-slow attack

مناسب

چالش‌ها

1. کیفیت داده

اگر لاگ‌ها ناقص، نامنظم یا بدون enrichment باشند، مدل عملکرد ضعیفی خواهد داشت.

2. Explainability

یکی از چالش‌های مهم این است که تحلیلگر SOC باید بداند چرا یک رویداد مشکوک تشخیص داده شده است.

3. False Positive

اگر baseline رفتاری خوب ساخته نشود، فعالیت‌های مشروع اما نادر به‌اشتباه مشکوک تلقی می‌شوند.

4. Drift رفتاری

رفتار کاربران و سیستم‌ها در طول زمان تغییر می‌کند. مدل باید به‌صورت دوره‌ای بازآموزی یا تنظیم شود.

بهترین شیوه پیاده‌سازی در SOC

استفاده از feature enrichment با IAM، Asset Context و GeoIP

مدل‌سازی جداگانه برای user، host و service account

ترکیب Transformer با Rule-based Detection

ارسال خروجی مدل به SIEM/SOAR برای triage

استفاده از Risk Scoring به‌جای alert binary

جمع‌بندی

مدل‌های Transformer به دلیل توانایی درک توالی، context و وابستگی‌های بلندمدت، ابزار بسیار قدرتمندی برای تشخیص ناهنجاری رفتاری در لاگ‌های SOC هستند. این رویکرد به‌ویژه برای شناسایی حملات پیچیده و کم‌سر‌وصدا مانند Insider Threat، Lateral Movement و Living-off-the-Land ارزش بالایی دارد.

با این حال، موفقیت این مدل‌ها به کیفیت داده، enrichment مناسب، کنترل false positive و قابلیت توضیح‌پذیری وابسته است. در عمل، بهترین نتیجه زمانی حاصل می‌شود که Transformerها به‌عنوان مکمل detection engineering سنتی و نه جایگزین کامل آن استفاده شوند.

نویسنده

admin

ثبت دیدگاه