# Gépi tanulási technikák a behatolás-észlelésben: datasetek, modellek, kihívások és jövőbeli irányok, szisztematikus irodalmi áttekintés

**Folyóirat:** Journal of Big Data (Springer Open) | **DOI:** 10.1186/s40537-025-01323-2 | **Megjelenés:** 2025 | **Auditált cikkek:** 104 | **Időszak:** 2011–2024 | **Forrás:** [link.springer.com/article/10.1186/s40537-025-01323-2](https://link.springer.com/article/10.1186/s40537-025-01323-2)

---

## Bevezetés és motiváció

A kibertér exponenciális növekedése az elmúlt évtizedben a kibertámadások volumenét és kifinomultságát egyaránt megnövelte. Az IBM 2023-as jelentése szerint egyetlen amerikai adatvédelmi incidens átlagosan 8,19 millió dollár közvetlen kárt okoz, míg a globális éves kiberbűnözési veszteség megközelíti a 4,45 milliárd dollárt. A hagyományos, aláírás-alapú (signature-based) biztonsági rendszerek egyre kevésbé tudnak lépést tartani a polimorf és zero-day támadásokkal, ezért a gépi tanulás (ML) alapú behatolás-észlelő rendszerek (Intrusion Detection System, IDS) az iparági és akadémiai kutatás egyik fókuszpontjává váltak.

A cikk egy **PRISMA-alapú szisztematikus irodalmi áttekintés**, amely a 2011 és 2024 közötti időszakból 104, gondosan kiválogatott peer-reviewed cikket dolgoz fel, és három fő célt szolgál: (a) az ML-alapú IDS technikák szervezett taxonómiája, (b) a leggyakoribb IDS datasetek (NSL-KDD, CICIDS2017, UNSW-NB15) összehasonlító elemzése korlátaik feltárásával, (c) a kutatási hiányosságok azonosítása a jövőbeli irányok meghatározásához.

## A szisztematikus áttekintés módszertana

A szerzők a Kitchenham és munkatársai által javasolt strukturált szisztematikus áttekintési protokollt követték. A keresést kilenc adatbázisban (IEEE Xplore, ACM Digital Library, Emerald Insight, SpringerLink, ScienceDirect, Web of Science, Google Scholar, Scopus, Semantic Scholar) végezték, a keresési kifejezések között olyan kulcsszavakkal, mint a „machine learning”, „cyber security”, „intrusion detection” és „IDS”.

A PRISMA folyamatábra szerint az **1598 kezdeti találatból 104 cikk** került be a végső elemzésbe. A kizárási kritériumok szigorúak voltak: csak eredeti kutatásokat vettek figyelembe (konferencia-papírek, workshop-ok, levelek és másodlagos források kizárásával), és csak 2011 utáni, IDS-specifikus, ML-alapú megközelítéseket alkalmazó cikkeket. A három szerző egymástól függetlenül vizsgálta a címeket, absztraktokat és szükség esetén a teljes szövegeket.

A kutatási kérdések a következők voltak: (RQ1) Mi a legfrissebb state-of-the-art az ML-alapú IDS-ben számítógépes hálózatokban és mobileszközökön? (RQ2) Mely dataseteket használják leggyakrabban a gyakorlati kísérleti elemzésben? (RQ3) Milyen korlátai vannak a jelenlegi kutatásnak, és milyen jövőbeli irányok azonosíthatók?

A publikációs évenkénti eloszlás a 2018–2019-es csúcsot mutatja, ami összhangban van a deep learning technikák IDS-területen való térnyerésével. A földrajzi eloszlásban India, az Egyesült Államok és Kína vezet, ami a globális kutatási érdeklődés egyenlőtlenségét tükrözi.

## Kibertámadások típusai és az IDS architektúrája

A cikk öt fő kibertámadás-kategóriát azonosít: (1) **jogosulatlan hozzáférés** (illegal access), (2) **malware** (vírusok, férgek, kémprogramok, adware, botok), (3) **Denial of Service (DoS) és DDoS**, (4) **phishing** (a leggyakoribb és AI-val egyre kifinomultabb támadás-típus), valamint (5) **zero-day exploitok** (szoftver-sebezhetőségek kihasználása a patch kiadása előtt). Ezeken felül az IoT-eszközök, orvosi eszközök és ipari vezérlőrendszerek (ICS) speciális támadási vektorokat jelentenek.

A hagyományos IDS három fő típusba sorolható: **Network IDS (NIDS)** a hálózati forgalmat figyeli, **Host IDS (HIDS)** a hoszt-specifikus tevékenységet, és **Hybrid IDS** a kettő kombinációja. Az észlelési mechanizmus alapján megkülönböztetünk **signature-based** (ismert aláírásokkal való összevetés, magas false-positive arány), **anomaly-based** (viselkedési alapvonaltól való eltérés detektálása) és **hybrid** megközelítéseket.

A szerzők hangsúlyozzák, hogy **az ML-alapú IDS felülmúlja a hagyományos signature-alapú rendszereket**, mert képes a forgalmi mintákból tanulni, észleli az ismeretlen támadásokat, alacsonyabb CPU-terheléssel jár (nem kell minden adatbázis-bejegyzést ellenőrizni), és gyorsabban azonosítja a komplex támadási mintákat.

## Az ML-alapú IDS algoritmusok áttekintése

A cikk hét fő gépi tanulási algoritmust vizsgál meg IDS-kontextusban:

### Support Vector Machine (SVM)
Az SVM egy felügyelt tanulási modell, amely hipersíkokkal választja el az osztályokat. **Előnyei:** hatékony magas dimenziós terekben (komplex hálózati minták), erős generalizációs képesség (ismeretlen támadások felismerése), kernel-trükk a nem-lineáris döntési határokhoz, sokoldalúság (bináris és többosztályos osztályozás). **Korlátai:** számítási komplexitás nagy forgalomnál, érzékenység a hiperparaméter-hangolásra, egyensúlytalanság (imbalanced data) kezelésének nehézsége.

### Decision Tree (DT)
A DT rekurzív fa struktúrájú modell (ID3, C4.5 algoritmusok). **Előnyei:** kezeli a kategorikus és numerikus adatokat, gyors osztályozás, nem-lineáris kapcsolatok feltárása. **Korlátai:** overfitting-kockázat, domináns osztályok felé torzítás, komplex támadások nehezebb észlelése, inkrementális tanulás hiánya (új támadás esetén teljes újraképzés).

### K-Nearest Neighbor (KNN)
A KNN lusta tanulási (lazy learning) módszer, amely nem épít modellt, hanem a K legközelebbi szomszéd alapján osztályoz. **Előnyei:** magas dimenziós adatok kezelése, rugalmasság új támadásokra, többosztályos és többcímkés támadások kezelése, zajos és hiányos adatokon is működik. **Korlátai:** magas számítási költség, K értékének kritikus megválasztása (alulillesztés vs. túlillesztés), korlátozott értelmezhetőség nagy adathalmazoknál.

### Random Forest (RF)
Az RF ensemble módszer, amely több döntési fát kombinál. **Előnyei:** magas pontosság az ensemble mechanizmusnak köszönhetően, overfitting-ellenállás magas dimenziós adatoknál, egyensúlytalanság kezelése. **Korlátai:** komplex hiperparaméter-hangolás, zajra való érzékenység, magas számítási költség.

### Naive Bayes (NB)
A NB a Bayes-tételen alapuló valószínűségi osztályozó. **Előnyei:** kis adathalmazoknál is jól teljesít, kezeli a hiányzó adatokat, jól alkalmazható szöveges feladatoknál (pl. spam-szűrés). **Korlátai:** a feltételes függetlenség feltételezése gyakran nem teljesül, érzékenység az egyensúlytalanságra, folytonos adatok kezelésének nehézsége.

### Extreme Gradient Boosting (XGBoost)
Az XGBoost egy hatékony gradient-boosting implementáció. **Előnyei:** magas pontosság, hatékony egyensúlytalanság-kezelés, párhuzamos feldolgozás révén nagy adathalmazok kezelése. **Korlátai:** számításigényes, overfitting-kockázat.

### Artificial Neural Network (ANN)
Az ANN előrecsatolt (feed-forward) és visszaterjesztéses (back-propagation) hurkokból épül fel. **Előnyei:** nem-lineáris kapcsolatok modellezése, jól skálázható. **Korlátai:** fekete doboz jelleg (alacsony értelmezhetőség), nagy tanító adathalmaz igénye.

## IDS datasetek: NSL-KDD, CICIDS2017, UNSW-NB15

A három leggyakrabban használt IDS dataset sajátosságai:

**NSL-KDD:** A KDD Cup 1999-ből származtatott, továbbfejlesztett verzió, amely eltávolítja a redundáns rekordokat. **Előnyei:** széles körű irodalmi hivatkozási alap, jó minőségű jellemzők. **Korlátai:** elavult támadás-típusok (1999-es adatok), hiányzó modern támadások (IoT, zero-day), statikus forgalmi jellemzők, ami dataset-specifikus optimalizáláshoz vezethet a valós alkalmazhatóság rovására.

**CICIDS2017:** A Canadian Institute for Cybersecurity által 2017-ben készített, modern támadás-forgalmat tartalmazó dataset. **Előnyei:** naprakész támadás-típusok (Brute Force, DoS, Web Attack, Infiltration). **Korlátai:** egyetlen hálózati topológia, címkézési torzítások lehetségesek.

**UNSW-NB15:** Az University of New South Wales által 2015-ben generált szintetikus dataset. **Előnyei:** kilenc modern támadás-kategória, valós hálózati forgalmi jellemzők. **Korlátai:** szintetikus generálás miatt a valós forgalomtól való eltérés.

A szerzők kritikusan rámutatnak: **a különböző kutatásokban publikált pontossági értékek nem közvetlenül összehasonlíthatók**, mert minden dataset más támadás-típusokat, jellemző-készleteket és egyensúlytalansági arányokat tartalmaz, és az adat-tisztítási technikák (feature selection, scaling) is eltérőek.

## Limitációk és kihívások

A 104 auditált cikk szisztematikus elemzése alapján a szerzők 13 fő dataset-korlátozást azonosítanak:

1. **Duplikált rekordok**, osztályozó torzítás, egyensúlytalanság, valósághűség hiánya
2. **Implementációs és növekedési korlátok**, nehézkes bővíthetőség
3. **Erőforrás-igényesség és tanítási idő**, overfitting-kockázat, skálázhatósági problémák
4. **Számítási költség és egyensúlytalanság**, ritka támadások alulreprezentáltsága
5. **Elavult és korlátozott diverzitás**, titkosított forgalom hiánya, valós idejű alkalmazhatatlanság
6. **Modern támadások hiánya**, zero-day támadások limitált reprezentációja
7. **Kis adathalmaz-méret**, titkosított forgalmi szcenáriók hiánya
8. **Szintetikus és duplikált rekordok**, a valós problémák alulreprezentáltsága
9. **Komplex jellemző-tér**, nem optimális modell-teljesítmény
10. **Osztály-egyensúlytalanság**, preprocesszálás szükségessége
11. **Nem publikus vagy nem szabványos datasetek**, diverzitás hiánya
12. **Rendszerhívás (system call) datasetek limitációi**, valós környezettől való eltérés, felhő-támadások hiánya
13. **HTTP-specifikus támadásokra fókuszálás**, statikus dataset, titkosítatlan forgalom

Az **algoritmus-oldali kihívások** között a szerzők kiemelik: az elavult fenyegetések reprezentációját, az egyensúlytalanságot és a nagyszámú attribútumot, a valós idejű észlelés nehézségeit, a túlillesztést, a magyarázhatóság hiányát, a modell-számítási költséget, az információveszteséget, a nem-linearitás kezelését, a skálázhatóságot és az általánosíthatóságot, a felhő-környezetek volatilitását és a pontos címkézés hiányát, valamint a feature engineering nehézségeit.

## A jelenlegi áttekintés megkülönböztető jellemzői

A szerzők táblázatos formában hasonlítják össze a munkájukat más IDS-survey-kkel. A legfontosabb distinkciók:

- **Modern datasetek elemzése**, szemben a régebbi survey-kkel, amelyek a KDD Cup 1999-re támaszkodnak
- **Dataset-veracitás és PRISMA-alapú módszertan**, strukturált, reprodukálható áttekintés
- **Empirikus dataset-összehasonlítás**, gyakorlati alkalmazhatóság értékelése
- **ML vs. hagyományos módszerek strukturált összehasonlítása**, több dataset párhuzamos elemzése
- **Feature selection és dimenzió-csökkentés**, haladó modellek (deep, ensemble) kiemelése
- **Szélesebb hatókör**, legújabb datasetek és technikák egyaránt

## Értékelési metrikák és jövőbeli irányok

Az IDS-modellek értékelésére a cikk három fő szempontot azonosít: **(1) pontosság** (false positive arány minimalizálása), **(2) teljesség** (false negative arány, azaz az összes fenyegetés észlelése), **(3) sebesség** (valós idejű észlelési késleltetés).

A jövőbeli kutatási irányok között a szerzők kiemelik:

**Explainable AI (XAI) integráció:** Az ML-modellek „fekete doboz” jellege miatt a biztonsági szakemberek nem tudják értelmezni a döntéseket. Az XAI technikák (pl. SHAP, LIME) alkalmazása lehetővé teszi a modell-döntések magyarázatát, ami kritikus a jogi és compliance környezetben.

**Multimodal IDS:** Különböző adatforrások (hálózati forgalom, hoszt-naplók, felhasználói viselkedés) együttes elemzése a pontosabb észlelés érdekében.

**Real-time detection:** A jelenlegi modellek többsége batch-módban dolgozik, de a modern támadások másodperces válaszidőt igényelnek.

**Federated learning:** Az adatvédelmi előírások (GDPR, HIPAA) miatt a központosított modell-tanítás helyett a federated learning lehetővé teszi az elosztott tanítást anélkül, hogy az érzékeny nyers adatok elhagynák a szervezetet.

**Generatív AI és LLM-ek:** A legújabb kutatások a nagy nyelvi modellek alkalmazását vizsgálják a támadás-minták felismerésében és a fenyegetés-információk elemzésében.

**Quantum-resistant cryptography:** A kvantum-számítástechnika térnyerésével a jelenlegi titkosítási algoritmusok sebezhetővé válnak, és új, poszt-kvantum kriptográfiai megoldásokra van szükség az IDS-rendszerekben is.

## Kritikai összegzés és jövőbeli kutatási hiányosságok

A cikk egyik legértékesebb hozzájárulása a **104 cikk szisztematikus összehasonlítása** során feltárt kutatási hiányosságok listája:

1. **Egységes benchmark-protokollok hiánya**, a pontossági értékek nem összehasonlíthatók a különböző datasetek és módszertanok miatt
2. **Cross-dataset kiértékelés hiánya**, a modellek általában egyetlen dataseten vannak tesztelve, nem mutatják az általánosíthatóságot
3. **Titkosított forgalom elemzésének hiánya**, a modern TLS 1.3-alapú forgalom elemzése speciális módszereket igényel
4. **Zero-day támadások limitált reprezentációja**, a datasetek többsége nem tartalmaz valódi zero-day mintákat
5. **Magyarázhatóság hiánya**, az ipari alkalmazáshoz elengedhetetlen a döntések értelmezhetősége
6. **Adversarial robustness**, a támadók kifejezetten az ML-modellek elleni adversarial támadásokat fejlesztenek
7. **Edge és IoT-specifikus IDS**, a korlátozott erőforrású eszközökre optimalizált modellek hiánya
8. **Valós idejű és streaming feldolgozás**, a legtöbb modell batch-módban dolgozik, nem valós időben

## Összegzés

A cikk egy átfogó, PRISMA-alapú szisztematikus irodalmi áttekintést nyújt a gépi tanulás alapú behatolás-észlelő rendszerekről. A 104 auditált cikk (2011–2024) alapján a szerzők három fő hozzájárulása: (a) az ML-alapú IDS technikák szervezett taxonómiája (SVM, DT, KNN, RF, NB, XGBoost, ANN), (b) a leggyakoribb datasetek (NSL-KDD, CICIDS2017, UNSW-NB15) összehasonlító elemzése korlátaik részletes feltárásával, és (c) a kutatási hiányosságok azonosítása a jövőbeli irányok (XAI, multimodal IDS, federated learning, real-time detection) meghatározásához.

A cikk legfontosabb üzenete, hogy **az ML-alapú IDS ígéretes, de korlátai vannak**: a jelenlegi modellek többsége dataset-specifikus, nem általánosítható, nehezen értelmezhető, és nem alkalmas valós idejű alkalmazásra. A jövőbeli kutatásnak egységes benchmark-protokollokra, cross-dataset kiértékelésre, magyarázható modellekre és a titkosított forgalom elemzésére kell összpontosítania. A hangsúly a gyakorlati alkalmazhatóságon van: az elméleti pontosság csak akkor értékes, ha a modell valós körülmények között, másodperces válaszidővel, értelmezhető döntésekkel működik.

## Forrás

- **Cikk:** "A systematic literature study of machine learning techniques based intrusion detection: datasets, models, challenges, and future directions"
- **Folyóirat:** Journal of Big Data (Springer Open)
- **DOI:** [10.1186/s40537-025-01323-2](https://doi.org/10.1186/s40537-025-01323-2)
- **URL:** https://link.springer.com/article/10.1186/s40537-025-01323-2
- **PRISMA workflow:** 1598 → 1098 → 594 → **104 papers** (2011–2024)
- **Földrajzi lefedettség:** India, USA, Kína vezet
- **Topic:** `cybersecurity.md` (új topic)
- **Feldolgozás dátuma:** 2026-08-24
- **Forrásszöveg hossza:** 6775 szó
- **Summary hossza:** ~2400 szó
