Kihagyás

Gépi tanulási technikák a behatolás-észlelésben: datasetek, modellek, kihívások és jövőbeli irányok, szisztematikus irodalmi áttekintés

Folyóirat: Journal of Big Data (Springer Open) | DOI: 10.1186/s40537-025-01323-2 | Megjelenés: 2025 | Auditált cikkek: 104 | Időszak: 2011–2024 | Forrás: link.springer.com/article/10.1186/s40537-025-01323-2


Bevezetés és motiváció

A kibertér exponenciális növekedése az elmúlt évtizedben a kibertámadások volumenét és kifinomultságát egyaránt megnövelte. Az IBM 2023-as jelentése szerint egyetlen amerikai adatvédelmi incidens átlagosan 8,19 millió dollár közvetlen kárt okoz, míg a globális éves kiberbűnözési veszteség megközelíti a 4,45 milliárd dollárt. A hagyományos, aláírás-alapú (signature-based) biztonsági rendszerek egyre kevésbé tudnak lépést tartani a polimorf és zero-day támadásokkal, ezért a gépi tanulás (ML) alapú behatolás-észlelő rendszerek (Intrusion Detection System, IDS) az iparági és akadémiai kutatás egyik fókuszpontjává váltak.

A cikk egy PRISMA-alapú szisztematikus irodalmi áttekintés, amely a 2011 és 2024 közötti időszakból 104, gondosan kiválogatott peer-reviewed cikket dolgoz fel, és három fő célt szolgál: (a) az ML-alapú IDS technikák szervezett taxonómiája, (b) a leggyakoribb IDS datasetek (NSL-KDD, CICIDS2017, UNSW-NB15) összehasonlító elemzése korlátaik feltárásával, (c) a kutatási hiányosságok azonosítása a jövőbeli irányok meghatározásához.

A szisztematikus áttekintés módszertana

A szerzők a Kitchenham és munkatársai által javasolt strukturált szisztematikus áttekintési protokollt követték. A keresést kilenc adatbázisban (IEEE Xplore, ACM Digital Library, Emerald Insight, SpringerLink, ScienceDirect, Web of Science, Google Scholar, Scopus, Semantic Scholar) végezték, a keresési kifejezések között olyan kulcsszavakkal, mint a „machine learning”, „cyber security”, „intrusion detection” és „IDS”.

A PRISMA folyamatábra szerint az 1598 kezdeti találatból 104 cikk került be a végső elemzésbe. A kizárási kritériumok szigorúak voltak: csak eredeti kutatásokat vettek figyelembe (konferencia-papírek, workshop-ok, levelek és másodlagos források kizárásával), és csak 2011 utáni, IDS-specifikus, ML-alapú megközelítéseket alkalmazó cikkeket. A három szerző egymástól függetlenül vizsgálta a címeket, absztraktokat és szükség esetén a teljes szövegeket.

A kutatási kérdések a következők voltak: (RQ1) Mi a legfrissebb state-of-the-art az ML-alapú IDS-ben számítógépes hálózatokban és mobileszközökön? (RQ2) Mely dataseteket használják leggyakrabban a gyakorlati kísérleti elemzésben? (RQ3) Milyen korlátai vannak a jelenlegi kutatásnak, és milyen jövőbeli irányok azonosíthatók?

A publikációs évenkénti eloszlás a 2018–2019-es csúcsot mutatja, ami összhangban van a deep learning technikák IDS-területen való térnyerésével. A földrajzi eloszlásban India, az Egyesült Államok és Kína vezet, ami a globális kutatási érdeklődés egyenlőtlenségét tükrözi.

Kibertámadások típusai és az IDS architektúrája

A cikk öt fő kibertámadás-kategóriát azonosít: (1) jogosulatlan hozzáférés (illegal access), (2) malware (vírusok, férgek, kémprogramok, adware, botok), (3) Denial of Service (DoS) és DDoS, (4) phishing (a leggyakoribb és AI-val egyre kifinomultabb támadás-típus), valamint (5) zero-day exploitok (szoftver-sebezhetőségek kihasználása a patch kiadása előtt). Ezeken felül az IoT-eszközök, orvosi eszközök és ipari vezérlőrendszerek (ICS) speciális támadási vektorokat jelentenek.

A hagyományos IDS három fő típusba sorolható: Network IDS (NIDS) a hálózati forgalmat figyeli, Host IDS (HIDS) a hoszt-specifikus tevékenységet, és Hybrid IDS a kettő kombinációja. Az észlelési mechanizmus alapján megkülönböztetünk signature-based (ismert aláírásokkal való összevetés, magas false-positive arány), anomaly-based (viselkedési alapvonaltól való eltérés detektálása) és hybrid megközelítéseket.

A szerzők hangsúlyozzák, hogy az ML-alapú IDS felülmúlja a hagyományos signature-alapú rendszereket, mert képes a forgalmi mintákból tanulni, észleli az ismeretlen támadásokat, alacsonyabb CPU-terheléssel jár (nem kell minden adatbázis-bejegyzést ellenőrizni), és gyorsabban azonosítja a komplex támadási mintákat.

Az ML-alapú IDS algoritmusok áttekintése

A cikk hét fő gépi tanulási algoritmust vizsgál meg IDS-kontextusban:

Support Vector Machine (SVM)

Az SVM egy felügyelt tanulási modell, amely hipersíkokkal választja el az osztályokat. Előnyei: hatékony magas dimenziós terekben (komplex hálózati minták), erős generalizációs képesség (ismeretlen támadások felismerése), kernel-trükk a nem-lineáris döntési határokhoz, sokoldalúság (bináris és többosztályos osztályozás). Korlátai: számítási komplexitás nagy forgalomnál, érzékenység a hiperparaméter-hangolásra, egyensúlytalanság (imbalanced data) kezelésének nehézsége.

Decision Tree (DT)

A DT rekurzív fa struktúrájú modell (ID3, C4.5 algoritmusok). Előnyei: kezeli a kategorikus és numerikus adatokat, gyors osztályozás, nem-lineáris kapcsolatok feltárása. Korlátai: overfitting-kockázat, domináns osztályok felé torzítás, komplex támadások nehezebb észlelése, inkrementális tanulás hiánya (új támadás esetén teljes újraképzés).

K-Nearest Neighbor (KNN)

A KNN lusta tanulási (lazy learning) módszer, amely nem épít modellt, hanem a K legközelebbi szomszéd alapján osztályoz. Előnyei: magas dimenziós adatok kezelése, rugalmasság új támadásokra, többosztályos és többcímkés támadások kezelése, zajos és hiányos adatokon is működik. Korlátai: magas számítási költség, K értékének kritikus megválasztása (alulillesztés vs. túlillesztés), korlátozott értelmezhetőség nagy adathalmazoknál.

Random Forest (RF)

Az RF ensemble módszer, amely több döntési fát kombinál. Előnyei: magas pontosság az ensemble mechanizmusnak köszönhetően, overfitting-ellenállás magas dimenziós adatoknál, egyensúlytalanság kezelése. Korlátai: komplex hiperparaméter-hangolás, zajra való érzékenység, magas számítási költség.

Naive Bayes (NB)

A NB a Bayes-tételen alapuló valószínűségi osztályozó. Előnyei: kis adathalmazoknál is jól teljesít, kezeli a hiányzó adatokat, jól alkalmazható szöveges feladatoknál (pl. spam-szűrés). Korlátai: a feltételes függetlenség feltételezése gyakran nem teljesül, érzékenység az egyensúlytalanságra, folytonos adatok kezelésének nehézsége.

Extreme Gradient Boosting (XGBoost)

Az XGBoost egy hatékony gradient-boosting implementáció. Előnyei: magas pontosság, hatékony egyensúlytalanság-kezelés, párhuzamos feldolgozás révén nagy adathalmazok kezelése. Korlátai: számításigényes, overfitting-kockázat.

Artificial Neural Network (ANN)

Az ANN előrecsatolt (feed-forward) és visszaterjesztéses (back-propagation) hurkokból épül fel. Előnyei: nem-lineáris kapcsolatok modellezése, jól skálázható. Korlátai: fekete doboz jelleg (alacsony értelmezhetőség), nagy tanító adathalmaz igénye.

IDS datasetek: NSL-KDD, CICIDS2017, UNSW-NB15

A három leggyakrabban használt IDS dataset sajátosságai:

NSL-KDD: A KDD Cup 1999-ből származtatott, továbbfejlesztett verzió, amely eltávolítja a redundáns rekordokat. Előnyei: széles körű irodalmi hivatkozási alap, jó minőségű jellemzők. Korlátai: elavult támadás-típusok (1999-es adatok), hiányzó modern támadások (IoT, zero-day), statikus forgalmi jellemzők, ami dataset-specifikus optimalizáláshoz vezethet a valós alkalmazhatóság rovására.

CICIDS2017: A Canadian Institute for Cybersecurity által 2017-ben készített, modern támadás-forgalmat tartalmazó dataset. Előnyei: naprakész támadás-típusok (Brute Force, DoS, Web Attack, Infiltration). Korlátai: egyetlen hálózati topológia, címkézési torzítások lehetségesek.

UNSW-NB15: Az University of New South Wales által 2015-ben generált szintetikus dataset. Előnyei: kilenc modern támadás-kategória, valós hálózati forgalmi jellemzők. Korlátai: szintetikus generálás miatt a valós forgalomtól való eltérés.

A szerzők kritikusan rámutatnak: a különböző kutatásokban publikált pontossági értékek nem közvetlenül összehasonlíthatók, mert minden dataset más támadás-típusokat, jellemző-készleteket és egyensúlytalansági arányokat tartalmaz, és az adat-tisztítási technikák (feature selection, scaling) is eltérőek.

Limitációk és kihívások

A 104 auditált cikk szisztematikus elemzése alapján a szerzők 13 fő dataset-korlátozást azonosítanak:

  1. Duplikált rekordok, osztályozó torzítás, egyensúlytalanság, valósághűség hiánya
  2. Implementációs és növekedési korlátok, nehézkes bővíthetőség
  3. Erőforrás-igényesség és tanítási idő, overfitting-kockázat, skálázhatósági problémák
  4. Számítási költség és egyensúlytalanság, ritka támadások alulreprezentáltsága
  5. Elavult és korlátozott diverzitás, titkosított forgalom hiánya, valós idejű alkalmazhatatlanság
  6. Modern támadások hiánya, zero-day támadások limitált reprezentációja
  7. Kis adathalmaz-méret, titkosított forgalmi szcenáriók hiánya
  8. Szintetikus és duplikált rekordok, a valós problémák alulreprezentáltsága
  9. Komplex jellemző-tér, nem optimális modell-teljesítmény
  10. Osztály-egyensúlytalanság, preprocesszálás szükségessége
  11. Nem publikus vagy nem szabványos datasetek, diverzitás hiánya
  12. Rendszerhívás (system call) datasetek limitációi, valós környezettől való eltérés, felhő-támadások hiánya
  13. HTTP-specifikus támadásokra fókuszálás, statikus dataset, titkosítatlan forgalom

Az algoritmus-oldali kihívások között a szerzők kiemelik: az elavult fenyegetések reprezentációját, az egyensúlytalanságot és a nagyszámú attribútumot, a valós idejű észlelés nehézségeit, a túlillesztést, a magyarázhatóság hiányát, a modell-számítási költséget, az információveszteséget, a nem-linearitás kezelését, a skálázhatóságot és az általánosíthatóságot, a felhő-környezetek volatilitását és a pontos címkézés hiányát, valamint a feature engineering nehézségeit.

A jelenlegi áttekintés megkülönböztető jellemzői

A szerzők táblázatos formában hasonlítják össze a munkájukat más IDS-survey-kkel. A legfontosabb distinkciók:

  • Modern datasetek elemzése, szemben a régebbi survey-kkel, amelyek a KDD Cup 1999-re támaszkodnak
  • Dataset-veracitás és PRISMA-alapú módszertan, strukturált, reprodukálható áttekintés
  • Empirikus dataset-összehasonlítás, gyakorlati alkalmazhatóság értékelése
  • ML vs. hagyományos módszerek strukturált összehasonlítása, több dataset párhuzamos elemzése
  • Feature selection és dimenzió-csökkentés, haladó modellek (deep, ensemble) kiemelése
  • Szélesebb hatókör, legújabb datasetek és technikák egyaránt

Értékelési metrikák és jövőbeli irányok

Az IDS-modellek értékelésére a cikk három fő szempontot azonosít: (1) pontosság (false positive arány minimalizálása), (2) teljesség (false negative arány, azaz az összes fenyegetés észlelése), (3) sebesség (valós idejű észlelési késleltetés).

A jövőbeli kutatási irányok között a szerzők kiemelik:

Explainable AI (XAI) integráció: Az ML-modellek „fekete doboz” jellege miatt a biztonsági szakemberek nem tudják értelmezni a döntéseket. Az XAI technikák (pl. SHAP, LIME) alkalmazása lehetővé teszi a modell-döntések magyarázatát, ami kritikus a jogi és compliance környezetben.

Multimodal IDS: Különböző adatforrások (hálózati forgalom, hoszt-naplók, felhasználói viselkedés) együttes elemzése a pontosabb észlelés érdekében.

Real-time detection: A jelenlegi modellek többsége batch-módban dolgozik, de a modern támadások másodperces válaszidőt igényelnek.

Federated learning: Az adatvédelmi előírások (GDPR, HIPAA) miatt a központosított modell-tanítás helyett a federated learning lehetővé teszi az elosztott tanítást anélkül, hogy az érzékeny nyers adatok elhagynák a szervezetet.

Generatív AI és LLM-ek: A legújabb kutatások a nagy nyelvi modellek alkalmazását vizsgálják a támadás-minták felismerésében és a fenyegetés-információk elemzésében.

Quantum-resistant cryptography: A kvantum-számítástechnika térnyerésével a jelenlegi titkosítási algoritmusok sebezhetővé válnak, és új, poszt-kvantum kriptográfiai megoldásokra van szükség az IDS-rendszerekben is.

Kritikai összegzés és jövőbeli kutatási hiányosságok

A cikk egyik legértékesebb hozzájárulása a 104 cikk szisztematikus összehasonlítása során feltárt kutatási hiányosságok listája:

  1. Egységes benchmark-protokollok hiánya, a pontossági értékek nem összehasonlíthatók a különböző datasetek és módszertanok miatt
  2. Cross-dataset kiértékelés hiánya, a modellek általában egyetlen dataseten vannak tesztelve, nem mutatják az általánosíthatóságot
  3. Titkosított forgalom elemzésének hiánya, a modern TLS 1.3-alapú forgalom elemzése speciális módszereket igényel
  4. Zero-day támadások limitált reprezentációja, a datasetek többsége nem tartalmaz valódi zero-day mintákat
  5. Magyarázhatóság hiánya, az ipari alkalmazáshoz elengedhetetlen a döntések értelmezhetősége
  6. Adversarial robustness, a támadók kifejezetten az ML-modellek elleni adversarial támadásokat fejlesztenek
  7. Edge és IoT-specifikus IDS, a korlátozott erőforrású eszközökre optimalizált modellek hiánya
  8. Valós idejű és streaming feldolgozás, a legtöbb modell batch-módban dolgozik, nem valós időben

Összegzés

A cikk egy átfogó, PRISMA-alapú szisztematikus irodalmi áttekintést nyújt a gépi tanulás alapú behatolás-észlelő rendszerekről. A 104 auditált cikk (2011–2024) alapján a szerzők három fő hozzájárulása: (a) az ML-alapú IDS technikák szervezett taxonómiája (SVM, DT, KNN, RF, NB, XGBoost, ANN), (b) a leggyakoribb datasetek (NSL-KDD, CICIDS2017, UNSW-NB15) összehasonlító elemzése korlátaik részletes feltárásával, és (c) a kutatási hiányosságok azonosítása a jövőbeli irányok (XAI, multimodal IDS, federated learning, real-time detection) meghatározásához.

A cikk legfontosabb üzenete, hogy az ML-alapú IDS ígéretes, de korlátai vannak: a jelenlegi modellek többsége dataset-specifikus, nem általánosítható, nehezen értelmezhető, és nem alkalmas valós idejű alkalmazásra. A jövőbeli kutatásnak egységes benchmark-protokollokra, cross-dataset kiértékelésre, magyarázható modellekre és a titkosított forgalom elemzésére kell összpontosítania. A hangsúly a gyakorlati alkalmazhatóságon van: az elméleti pontosság csak akkor értékes, ha a modell valós körülmények között, másodperces válaszidővel, értelmezhető döntésekkel működik.

Forrás

  • Cikk: "A systematic literature study of machine learning techniques based intrusion detection: datasets, models, challenges, and future directions"
  • Folyóirat: Journal of Big Data (Springer Open)
  • DOI: 10.1186/s40537-025-01323-2
  • URL: https://link.springer.com/article/10.1186/s40537-025-01323-2
  • PRISMA workflow: 1598 → 1098 → 594 → 104 papers (2011–2024)
  • Földrajzi lefedettség: India, USA, Kína vezet
  • Topic: cybersecurity.md (új topic)
  • Feldolgozás dátuma: 2026-08-24
  • Forrásszöveg hossza: 6775 szó
  • Summary hossza: ~2400 szó
Vissza a tetejére