در مراکز عملیات امنیت (Security Operations Center – SOC)، حجم عظیمی از لاگها از منابعی مانند EDR، Firewall، Active Directory، Cloud، Proxy و SIEM جمعآوری میشود. چالش اصلی این است که بسیاری از تهدیدهای پیشرفته، بهویژه Insider Threat، Lateral Movement و Low-and-Slow Attacks، الگوی مشخص و ثابتی ندارند و به همین دلیل با Rule-based Detection بهسختی شناسایی میشوند.
اینجاست که مدلهای Transformer اهمیت پیدا میکنند. این مدلها بهدلیل توانایی بالا در درک توالی (Sequence)، زمینه (Context) و وابستگیهای بلندمدت، به گزینهای جدی برای Behavioral Anomaly Detection در لاگهای SOC تبدیل شدهاند.
چرا روشهای سنتی کافی نیستند؟
روشهای سنتی تشخیص ناهنجاری معمولاً بر پایه:
- Thresholdهای ثابت
- Correlation Ruleهای ایستا
- آمارههای ساده
- Signature Detection
هستند. این رویکردها برای تهدیدهای شناختهشده مؤثرند، اما در برابر رفتارهای پیچیده ضعف دارند.
مثال:
- کاربری که هر شب login میکند، عادی است
- اما اگر همان کاربر ناگهان به ۲۰ سرور جدید SSH بزند، الگو دیگر عادی نیست
- Ruleهای ساده این تغییر رفتاری را همیشه بهدرستی تشخیص نمیدهند
Transformerها میتوانند الگوی نرمال رفتار را از روی دنباله رویدادها یاد بگیرند و انحراف از آن را شناسایی کنند.
چرا Transformer برای لاگهای SOC مناسب است؟
1. درک وابستگیهای بلندمدت
مدلهای سنتی مانند RNN/LSTM در توالیهای طولانی محدودیت دارند. اما Transformer با مکانیزم Self-Attention میتواند ارتباط میان رویدادهایی را که با فاصله زمانی زیاد رخ دادهاند، مدل کند.
2. Context-Aware Detection
در SOC، یک Event بهتنهایی معنای زیادی ندارد؛ معنا از توالی و context بهدست میآید.
مثلاً:
- Login موفق
- دسترسی به فایل حساس
- PowerShell execution
- اتصال به یک سرور غیرمعمول
این توالی ممکن است نشانه حمله باشد، نه هر Event بهصورت مستقل.
3. مقیاسپذیری در دادههای بزرگ
با وجود هزینه محاسباتی بالا، Transformerها برای پردازش حجم زیاد داده و آموزش روی corpusهای بزرگ لاگ مناسباند، بهویژه با معماریهای بهینهشده.
معماری کلی مدل
1. جمعآوری و نرمالسازی لاگها
ابتدا لاگها از منابع مختلف جمعآوری و به قالبی استاندارد تبدیل میشوند.
فیلدهای مهم:
- timestamp
- user
- source IP
- destination
- event type
- process name
- command line
- host
- 2. Tokenization رخدادها
هر رخداد میتواند بهصورت یک توکن یا مجموعهای از توکنها نمایش داده شود.
مثلاً:
USER_LOGIN | user=alice | host=HR-LAPTOP | time=22:14
یا بهشکل embeddingهای ساختاریافته:
- embedding کاربر
- embedding میزبان
- embedding نوع رویداد
- embedding زمان
- 3. Sequence Modeling
مدل Transformer دنبالهای از eventها را برای هر:
- کاربر
- سیستم
- Session
- یا Asset
دریافت میکند و الگوی عادی را یاد میگیرد.
روشهای آموزش
1. Unsupervised / Self-Supervised Learning
رایجترین روش در SOC همین است، چون دادههای برچسبخورده کم هستند.
نمونه رویکردها:
- Next Event Prediction
- Masked Event Modeling
- Sequence Reconstruction
اگر مدل نتواند event بعدی را با احتمال مناسب پیشبینی کند، ممکن است ناهنجاری وجود داشته باشد.
2. Supervised Detection
اگر dataset دارای برچسب حمله باشد، میتوان از Transformer برای طبقهبندی استفاده کرد.
اما در عمل این دادهها محدود و وابسته به سازماناند.
مزایای این رویکرد
ویژگی
Transformer-based Detection
درک توالی رخدادها
بسیار بالا
مدلسازی context
قوی
کشف حملات ناشناخته
خوب
کاهش وابستگی به Rule ثابت
بالا
تشخیص low-and-slow attack
مناسب
چالشها
1. کیفیت داده
اگر لاگها ناقص، نامنظم یا بدون enrichment باشند، مدل عملکرد ضعیفی خواهد داشت.
2. Explainability
یکی از چالشهای مهم این است که تحلیلگر SOC باید بداند چرا یک رویداد مشکوک تشخیص داده شده است.
3. False Positive
اگر baseline رفتاری خوب ساخته نشود، فعالیتهای مشروع اما نادر بهاشتباه مشکوک تلقی میشوند.
4. Drift رفتاری
رفتار کاربران و سیستمها در طول زمان تغییر میکند. مدل باید بهصورت دورهای بازآموزی یا تنظیم شود.
بهترین شیوه پیادهسازی در SOC
استفاده از feature enrichment با IAM، Asset Context و GeoIP
مدلسازی جداگانه برای user، host و service account
ترکیب Transformer با Rule-based Detection
ارسال خروجی مدل به SIEM/SOAR برای triage
استفاده از Risk Scoring بهجای alert binary
جمعبندی
مدلهای Transformer به دلیل توانایی درک توالی، context و وابستگیهای بلندمدت، ابزار بسیار قدرتمندی برای تشخیص ناهنجاری رفتاری در لاگهای SOC هستند. این رویکرد بهویژه برای شناسایی حملات پیچیده و کمسروصدا مانند Insider Threat، Lateral Movement و Living-off-the-Land ارزش بالایی دارد.
با این حال، موفقیت این مدلها به کیفیت داده، enrichment مناسب، کنترل false positive و قابلیت توضیحپذیری وابسته است. در عمل، بهترین نتیجه زمانی حاصل میشود که Transformerها بهعنوان مکمل detection engineering سنتی و نه جایگزین کامل آن استفاده شوند.