# Are We Ready For An Agent-Native Memory System?

**Cím:** Are We Ready For An Agent-Native Memory System?
**arXiv ID:** 2606.24775v1
**Szerzők:** Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu
**Intézmény:** Shanghai Jiao Tong University
**Dátum:** 2026-06-23
**Kategóriák:** cs.CL, cs.DB, cs.IR
**Típus:** Rendszeres kísérleti tanulmány — agent memória adatkezelési perspektívából
**Kód:** https://github.com/OpenDataBox/MemoryData

---

## Magyar Összefoglaló: *Are We Ready For An Agent-Native Memory System?*
**Szerzők:** Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu
**Intézmények:** Shanghai Jiao Tong University, Tsinghua University, MemTensor (Shanghai) Technology Co., Ltd.
**arXiv:** 2606.24775v1 (2026-06-23, cs.CL, cs.DB, cs.IR)

---

## Áttekintés

A tanulmány az LLM-ágensek memóriarendszereit adatkezelési (*data management*) szemszögből vizsgálja. A memória a korábbi egyszerű retrieval-augmented mechanizmusokból egy olyan adatkezelési rendszerré fejlődött, amely tartós információtárolást, visszakeresést, frissítést, konszolidációt és dinamikus életciklus-kezelést támogat az ágens futása során. A szerzők rámutatnak, hogy a meglévő értékelések főként végponttól-végpontig (*end-to-end*) metrikákat használnak (pl. F1, BLEU), és a rendszert monolitikus „fekete dobozként” kezelik, így a rendszer-szintű kérdések — működési költségek, architekturális kompromisszumok, robusztusság dinamikus tudásfrissítések esetén — feltáratlanok maradnak.

> *"In this paper, we present a systematic experimental study of agent memory from a data management perspective."*

A tanulmány fő hozzájárolásai:

- **(1) Technológiai dekompozíció és taxonómia** — az ágensmemóriát négy alapmodulra bontja.
- **(2) Végponttól-végpontig teljesítményértékelés** — 12 reprezentatív memóriarendszer és 2 referencia baseline összehasonlítása 5 benchmark workload és 11 adathalmaz alapján.
- **(3) Finom szemcsés komponens-értékelés** — kontrollált ablatációs kísérletek modulonként.
- **(4) Megállapítások** — költség-teljesítmény kompromisszumok elemzése.

---

## Az Ágensmemória Négy Alapmodulja

A szerzők a memóriarendszert formálisan egy négyes tuple-ként definiálják:

> *ℳ_sys = ⟨ℛ, 𝒮, 𝒬, 𝒰⟩*

ahol minden modul a memória életciklus egy különálló fázisát kormányozza.

### 1. Memória reprezentáció és tárolás (ℛ)

A logikai és fizikai memóriaformátumot határozza meg két aspektusban:

- **Logikai reprezentáció:** egyszerű primitívektől (diszkrét tokenek, folytonos vektorok) komplex topológiákig (tudásgráfok, fák, kompozit struktúrák).
- **Fizikai tárolás:** tranziens regiszterek, specializált egymotoros adatbázisok, vagy többmotoros háttérrendszerek perzisztenciához és indexeléshez.

### 2. Memória extrakció (𝒮)

A heterogén bemeneti adatfolyamok (többkörös párbeszédek, eszköznaplók) logikai memóriaprimitívekké történő átalakítását kormányozza. Stratégiák: nyers szekvencia-konkatenáció, séma-mentes szemantikus extrakció, vagy séma-korlátozott strukturált extrakció.

### 3. Memória visszakeresés és útválasztás (𝒬)

A lekérdezési kontextus alapján dinamikusan azonosítja a releváns memórianylezeteket. Mechanizmusok: natív figyelem-alapú visszakeresés, szemantikus K-legközelebbi-szomszéd keresés, topológiai algráf-bejárás, autonóm ágens-útválasztás LLM-tervezéssel, többfázisú hibrid végrehajtás.

### 4. Memória karbantartás (𝒰)

A memóriabejegyzések dinamikus életciklusát kormányozza három alopációval:

- **(a) Konfliktuskezelés és verziózás:** többverziózás, invalidálás, precedenciaszabályok.
- **(b) Kapacitásmenedzsment:** korlátalapú kemény kivétel (FIFO, token-limit) vagy pontszám-alapú prioritásos kivétel (temporális csökkenés).
- **(c) Szemantikus konszolidáció:** LLM-vezérelt összevonás, sűrű összefoglalók vagy CRUD műveletek.

---

## Architekturális Paradigmák

A tanulmány négy jellegzetes architekturális kategóriát különböztet meg:

- **Stream-and-Reflection Memory System** (pl. MemoryBank): időbélyegzett memóriafolyam + periodikus reflexiók, amelyek visszakerülnek a folyamba.
- **Hierarchical Tiered Memory System** (pl. MemGPT/Letta): többszintű memória eltérő kapacitással és hozzáférési tulajdonságokkal; core memória és archív tároló szétválasztása explicit mozgatással (kivétel, előléptetés).
- **Knowledge Graph Memory System** (pl. Mem0^g, Zep): entitások, relációk és temporális evolúció strukturált formában (temporális tudásgráfok), entitás-diszambiguációval és konfliktusfeloldással.
- **Composite Hybrid Memory System** (pl. A-MEM): sématudatos memóriaobjektumok több tárolószubsztrátum közötti útválasztása; futásidejű állapot (KV-cache) és hosszú távú tároló (vektor, gráf, kulcsszó-index) szétválasztása.

---

## Megkülönböztetés RAG-től és Tradicionális Adatbázisoktól

- **RAG:** állapotnélküli, csak olvasható visszakeresési primitív statikus korpuszból. Az ágensmemória ezzel szemben *perzisztens és frissíthető* infrastruktúra, amely a teljes hosszú távú memória-életciklust kormányozza.
- **Tradicionális adatbázisok (OLTP/OLAP):** az ágensmemória workload-jai lényegesen különböznek:
  - A hozzáférés gyakran *szemantikus* és nem predikátum-alapú — természetes nyelvű lekérdezések, approximatív matching, LLM-vezérelt visszakeresés.
  - A memóriatartalom *folyamatosan és potenciálisan konfliktusos* megfigyelések alatt fejlődik — bizonytalan, részleges, ellentmondásos információk kezelése szükséges.
  - A workload-ok *magas heterogenitásúak* — hosszú kontextus-szintézis, epizodikus felidézés, strukturált ténykeresés, temporális érvelés és streaming frissítések együtt.

> *"These properties distinguish agent memory from traditional databases, motivating dedicated abstractions and evaluation methodologies."*

---

## Értékelt Memóriarendszerek (12 rendszer + 2 baseline)

A tanulmány a következő rendszereket vizsgálja (részletes taxonómia a Table 1 alapján):

- **Token-szekvencia alapúak:** MemoChat, Mem0, MEM1, Sequential Context MemAgent
- **Gráf/fa topológia alapúak:** MemTree, Zep, Mem0^g, Cognee
- **Heterogén kompozit:** LightMem, SimpleMem, MemOS, MemoryOS, A-MEM, Letta

A teljesítményt öt szempont szerint értékelik: feladat-hatékonyság (RQ1), visszakeresési hűség (RQ2), dinamikus frissítési robusztusság (RQ3), hosszú horizónú stabilitás (RQ4), működési költség (RQ5).

---

## Memória Reprezentációs és Tárolási Módszerek (részletesebben)

### Logikai reprezentáció kategóriák

**❶ Token-szintű szekvencia reprezentáció:**
- *Explicit diszkrét szöveges token:* ember által olvasható karakterláncok vagy független tényállítások (pl. Mem0 diszkrét tények, MemoChat JSON blokkok, MemAgent 1024 token limit, MEM1 `<IS>` címkék).
- *Implicit folytonos vektor token:* sűrű szemantikus beágyazások vagy modell-oldali latens állapotok (pl. MemoRAG KV-cache tenzorok). Előny: alacsony tokenizációs teher; hátrány: strukturális értelmezhetőség hiánya, nehéz finom szemcsés műveletek végrehajtása.

**❷ Gráf és fa-alapú topológiai reprezentáció:**
- *Temporális tudásgráfok:* entitások és kapcsolatok gráfja, natív temporális érvelés és konfliktusdetektálás (pl. Zep epizód/entitás/közösség algráfok, Mem0^g címkézett irányított gráf).
- *Hierarchikus fa struktúrák:* rekurzív hierarchia — leveleken granuláris megfigyelések, ős-csomópontokon szemantikus absztrakciók (pl. MemTree dinamikus irányított fa).

**❸ Heterogén kompozit reprezentáció:**
- Komplex többrészes adatkonténerek, strukturálatlan szöveg + strukturált metaadatok kombinációja (pl. MemOS MemCube: plain-text + activation + parametric memory + strukturált részletek).

### Fizikai tárolás és indexelés kategóriák

**❶ Tranziens in-kontextus regiszter:** memória kizárólag aktív hardverállapotban (kontextusablak, KV-cache), lemezes I/O nélkül (pl. MemoChat JSON memók kontextusban, MemAgent KV-cache tenzorok).

**❷ Specializált egymotoros tároló:**
- *Sűrű vektor adatbázisok:* (pl. Mem0, MemTree, Letta pgvector)
- *Gráf adatbázisok:* (pl. Zep, Mem0^g Neo4j, Cypher lekérdezések)
- *Relációs SQL motorok:* strukturális és temporális sémák szerializálása

**❸ Heterogén többmotoros tároló** — a rész végén előzetesen jelezve, részletezés a következő részben.

---

## Kulcsfontosságú Megállapítások (előzetes)

1. **Nincs univerzálisan domináns architektúra** — a hatékonyság attól függ, mennyire illeszkedik a memóriastruktúra a workload szűk keresztmetszetéhez.
2. **Gráf-alapú módszerek** megbízhatóan kezelik a tudásfrissítéseket, míg a népszerű tény-extrakciós pluginok és append-only tárolók küzdenek a célzott felülírásokkal.
3. **Hosszú horizónon** sok append-only memóriatároló katastrofális degradációt szenved — a nyers hosszú-kontextus visszkeresés sok esetben felülmúlja a memória-alapú megközelítéseket.
4. **Költség:** a magas strukturáltságú rendszerek nagyságrendekkel magasabb index-építési időt és lekérdezési latenciát produkálnak, de nem biztos, hogy arányos pontossági nyereséget hoznak.
5. **Konszolidáció:** a konzervatív memóriakonszolidáció a legjobb alapértelmezett karbantartási stratégia; a késleltetett kiírás felszíni lefedettség és tényleges válaszolhatóság között megtévesztő kompromisszumot teremt.

> *"Each layer of abstraction (e.g., compression, summarization, and fact extraction) progressively discards information."*

---

*A kód publikusan elérhető: https://github.com/OpenDataBox/MemoryData*
*Taxonómia: https://github.com/OpenDataBox/awesome-agent-memory*

---

## Hungarian Summary — Are We Ready For An Agent-Native Memory System?
**arXiv:** 2606.24775v1 | **Szerzők:** Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu | **Publikálva:** 2026-06-23

Ez a rész a memóriamodulok taxonómiájának folytatását (extrakció, visszakeresés és routing, karbantartás) valamint a 4. szakasz végponttól-végpontig tartó értékelését (RQ1–RQ4) fedi le.

---

## 3.2. Memória Extrakció (Memory Extraction)

A memória-extrakció azt írja le, hogyan dolgozzák fel a nyers interakciós nyomvonalakat — azaz hogyan alakítja a rendszer a heterogén bemeneti adatfolyamokat (többkörös párbeszédek, eszközvégrehajtási naplók) logikai memória-primitívekké fizikai tárolás előtt. Három kategória azonosítható:

- **Nyers szekvencia-konkatenáció (Raw Sequence Concatenation):** Minimális számítási többletköltség — nincs explicit extrakciós prompt; a memória közvetlenül nyers token-konkatenációként vagy tranziens állapot-összefoglalóként jön létre. A *MEM1* és *MemAgent* kizárólag az aktív számítási állapotban tartják az új struktúrákat, másodlagos feldolgozás nélkül.
- **Séma-mentes szemantikus extrakció (Schema-Free Semantic Extraction):** A nyers, strukturálatlan bemeneteket független, magas értékű információs egységekké desztillálja — szabad szöveges tényekként vagy kompresszált latens vektorokként. Például a *Mem0* különálló tényállításokat extrahál (pl. *"User is vegetarian and dairy-free"*).
- **Séma-korlátozott strukturált extrakció (Schema-Constrained Structured Extraction):** Az LLM-et előre definiált szerkezeti sémával tölti fel, szigorúan típusos adatot eredményezve — topologikus entitás-reláció hármasokként (gráfhoz) vagy multimodális relációs payload-ként (hibrid tárolóhoz). A *Zep* és *Mem0^g* típusos irányított relációs éleket extrahálnak (pl. `LIVES_IN`, `WORKS_AT`); a *Zep* emellett reflexió-inspirált ellenőrzési lépést alkalmaz a hallucinált hármasok szűrésére. A *MemoChat* előre definiált JSON-sémába segmentálja a beszélgetéseket.

## 3.3. Memória Visszakeresés és Lekérdezés-Routing (Memory Retrieval and Query Routing)

Ez a modul határozza meg, hogyan azonosítja és nyeri ki a rendszer dinamikusan a releváns történeti kontextust az ágens aktuális érvelési állapotához. Öt kategória:

- **Natív attention-alapú visszakeresés:** A transformer saját self-attention mechanizmusát használja egyedüli visszakeresési motorként, külső adatbázis-I/O nélkül (pl. KV-cache-ben való token-szkennelés). *MEM1* két-dimenziós attention mask-kal; *MemAgent* blokkok prompt-sablonba konkatenálásával.
- **Szemantikus sűrű visszakeresés:** Folytonos latens terekben KNN-keresést hajt végre. *Mem0* vektor-embedding-alapú sűrű hasonlósági keresés; *LightMem* koszinusz-hasonlóság; *MemTree* összenyomott-fa architektúrával globális koszinusz-disztribúciót számol.
- **Topologikus algráf-bejárás:** Explicit relációs éleket jár be tudásgráfokon. *Mem0^g* entitás-centrikus heurisztikával rekurzívan bejárja lokális algráfokat; *A-MEM* sűrű KNN-kereséssel azonosít horgonyokat, majd lokális gráf-bejárást végez.
- **Autonóm ágens-routing:** Az LLM maga functioning as aktív lekérdezés-tervező:
  - *Függvényhívás-invokáció (Function Call Invocation):* Explicit függvényhívás-parancsok generálása (pl. *Letta* `archival_storage.search()` parancsot generál).
  - *Generatív lekérdezés-bővítés (Generative Query Expansion):* Természetes nyelvű generációval intermediate clue-kat szintetizál (pl. *SimpleMem* Intent-Aware Retrieval Planning modulja).
- **Többfázisú hibrid végrehajtás (Multi-Stage Hybrid Execution):**
  - *Szekvenciális hibrid routing:* Meghatározott sorrendben láncolja a visszakeresési paradigmákat — pl. *MemoryOS* durva predikátum-értékelés után finom szemantikus rangsorolást végre.
  - *Párhuzamos ensemble visszakeresés:* Több indexelési algoritmusnak küld párhuzamosan lekérdezéseket, majd fusion + reranking — pl. *Zep* egyidejű koszinusz-szemantikus, Okapi BM25 és topologikus BFS, majd RRF/MMR/cross-encoder optimalizáció.

## 3.4. Memória Karbantartás (Memory Maintenance)

A memória frissítését, karbantartását, kompresszióját, felejtését és eltávolítását szabályozza a idő múlásával. Négy kategória:

- **Időbélyeg-alapú több-verziózás (Timestamp-Based Multi-Versioning):** Fizikai törlés helyett időbélyeg-metaadattal és append-only naplókkal logikailag érvényteleníti az elavult tényeket. *Zep* és *Mem0^g* validity flag-eket használ; *LightMem* időbélyegelt tényfolyamokat illeszt be; *SimpleMem* ISO-8601 időbélyegekkel old fel ellentmondásokat; *MemOS* strukturált Update API-val differenciális írásokat végez.
- **Kapacitás-vezérelt fizikai kizárás (Capacity-Driven Physical Eviction):** A korlátlan memória-növekedést fizikai adateldobással vagy felülírással kezeli:
  - *Korlát-alapú hard eviction:* Determinisztikus szabályok — FIFO sorok, fix szekvencia-határok, hard token-limit. *MemAgent* programozott ütemezéssel; *MEM1* automatikus FIFO pruning; *Letta* OS-inspirált queue managerrel threshold-flush-t végez.
  - *Pontszám-alapú prioritás-eviction:* Dinamikusan számolt időbeli lebomlás vagy hozzáférési-gyakoriság pontszámok. *MemoryOS* skalár *Heat score*-ot használ, amely a visszakeresési gyakoriságot exponenciális időbeli lebomlással egyensúlyozza.
- **LLM-vezérelt szemantikus konszolidáció (LLM-Driven Semantic Consolidation):** Az LLM mint kognitív kormányzó oldja fel a logikai konfliktusokat és sűrít össze redundáns megfigyeléseket:
  - *Inline szemantikus kompakció:* Írás közben mergeli a redundáns állításokat — *SimpleMem* online szemantikus szintézis; *MemTree* rekurzív szemantikus összefoglaló prompt szülő-csomópontokon.
  - *Eszköz-vezérelt CRUD végrehajtás:* Explicit LLM-eszközhívásokkal CRUD-parancsok — *Mem0* strukturált LLM tool-calling interfészen keresztül UPDATE/DELETE műveletekkel.
- **Folytonos paraméteres optimalizáció (Continuous Parametric Optimization):** Az állapotfrissítést az online interferencia-latenciától függetlenítve aszinkron háttérfolyamatként végzi — magát a modellparamétert módosítja. *MemoRAG* offline tréning fázisban *Reinforcement Learning with Generation Feedback (RLGF)* keretrendszerrel optimalizál.

---

## 4. Végponttól-Végpontig Értékelés (End-to-End Assessment)

A szerzők 12 reprezentatív memóriarendszert és két referenciabázist (*Long Context*, *Embedding RAG*) értékelnek öt benchmark workload és 11 adathalmaz alapján, öt kutatási kérdés (RQ) mentén.

### 4.1. Általános Hatékonyság (RQ1)

**Kutatási kérdés:** *"Do different agent memory systems successfully improve end-to-end task performance across workloads?"*

**Benchmarks:**
- **LoCoMo** — hosszú beszélgetés QA benchmark (epizodikus, temporális, nyílt-tartományú memória); EM és Answer F1.
- **LongMemEval** — több-munkamenetes hosszú-memória benchmark; Substring EM, ROUGE-L F1/Recall, GPT-5.4-alapú LLM Judge Accuracy.
- **DB-Bench** — procedurális végrehajtás adatbázis-műveleteken; EM és Task Success Rate.

**Megfigyelés O1 (Cross-Workload Effectiveness):** Egyetlen memóriarendszer sem dominál minden workloadon, de a *structure-guided filtering*-el feladat-kritikus evidenciát megőrző módszerek a legversenyképesebbek:
- Struktúra-tudatos rendszerek vezetnek a *LongMemEval*-en (Zep: 48.0 LLM Judge Accuracy; Cognee: 35.3 ROUGE-L F1).
- Hibrid szűrés legerősebb a *LoCoMo* pontosságon (MemOS: 11.5 EM).
- Nyomvonal-megőrző memóriák legerősebbek a *DB-Bench*-en (Long Context: 48.20 EM; MemoChat: 55.40 Task Success Rate).
- Teljes lefedettségű módszerek közül *MemoryOS* és *MemOS* a legközelebb a fronthoz.

**Megfigyelés O2 (Beyond Exact Match):** Az EM informatív marad kanonikus, közvetlenül alapozott kimeneteknél, de elégtelenné válik, ha a helyesség parafrasztikus szintézistől vagy végrehajthatóságtól függ. A *DB-Bench*-en a Long Context éri el a legjobb EM-et, de a MemoChat lényegesen magasabb Task Success Rate-et — *"exact output matching does not fully capture whether memory supports successful execution."*

> **Finding 1 (Workload-Aligned Memory):** *"Strong agent memory is not defined by a single universal representation, but by how well it supports the dominant workload bottleneck."* (1) Diszperz cross-session érveléshez reláció- és idő-tudatos visszakeresés; (2) hosszú, koherens párbeszédhez coarse-to-fine szűrés; (3) állapottartó végrehajtáshoz interakciós nyomvonal megőrzése.

### 4.2. Memória Visszakeresési Hűség (RQ2)

**Kutatási kérdés:** *"How accurately can a memory system surface the stored evidence required by a query?"*

**Módszer:** 8 reprezentatív rendszer a *LoCoMo*-n — *Recall@K* (a top-k visszakeresett source-id csoport tartalmazza-e az annotált gold evidenciát) és *Recall@10* hat evidencia-távolsági binen (1–5-től 26–31-ig).

**Megfigyelés O1 (Structured Evidence Expansion):** A visszakeresési hűség kevésbé attól függ, hogy egy releváns memória korán előbukkanjon, inkább attól, hogy explicit módon szervezett memória-struktúra álljon rendelkezésre, amely teljes és időben távoli evidenciát össze tud gyűjteni:
- *SimpleMem* éri el a legmagasabb Recall@1-et (39.0), de *A-MEM* (69.5/85.9) és *MemTree* (59.7/80.5) jóval erősebbek nagyobb visszakeresési keretnél, és stabilabbak a növekvő evidencia-távolsággal.
- Az *Embedding RAG* alapvonal élesen esik a legrövidebb távolsági bin után.

> **Finding 2 (Evidence-Centric Memory Organization):** *"Retrieval quality depends more on how a system organizes evidence for later reconstruction than on how well it ranks one relevant memory first."* (1) Korai lokalizáció és evidencia-összeszerelés különálló tervezési célok; (2) explicit struktúra (linkek, hierarchia) értékes, ha a támogató evidencia szórt vagy távoli; (3) flat similarity search főleg rövid-távú hozzáférésnél hatékony.

### 4.3. Memória Evolúció Robusztussága (RQ3)

**Kutatási kérdés:** *"Can agent memory systems reliably incorporate revised facts, preserve the correct temporal state after updates, and remain robust across answer backbones?"*

**Két kísérlet:**
1. **Update Robustness Comparison:** 11 rendszer a *LongMemEval* Knowledge Update és Temporal Reasoning szeletein, valamint a *LoCoMo* Temporal szeletén.
2. **Backbone Robustness Ablation:** 6 rendszer 4 LLM backbone alatt a *LoCoMo*-n.

**Megfigyelés O4 (Temporal State Externalization):** Egyetlen rendszer sem dominál minden update-orientált szeletet, de a strukturált szervezéssel temporálisan érvényes evidenciát megőrző módszerek a legversenyképesebbek:
- Gráf/reláció-szervezett memória legerősebb közvetlen tény-reviziónál (*Zep*: 44.4 Substring EM, 36.8 ROUGE-L F1 a Knowledge Update-en).
- Reláció-szervezett visszakeresés legerősebb temporálisan diszperz evidenciánál (*Cognee*: 18.7/35.8 a Temporal Reasoning-on).
- Hibrid szűrt memória legerősebb pontos aktuális-állapot alapozásnál (*MemOS*: 8.9 EM; *Cognee*: 28.1 Answer F1 a LoCoMo Temporal-on).

**Megfigyelés O5 (Backbone Robustness):** A backbone-változás inkább az abszolút válaszminőséget változtatja, mint azt, hogy melyik memória-pipeline marad hatékony — *"stable update behavior is determined primarily before final generation."* A *MemOS* minden négy backbone alatt legerősebb marad (32.2, 41.2, 38.6, 41.2).

> **Finding 3 (Temporal Update Fidelity):** *"Reliable post-update behavior is a pipeline-level design problem rather than a pure model-capacity problem."* (1) A revizibilitás beépítendő a memória-reprezentációba; (2) query-time szelektivitás illeszkedjen a workload szűk keresztmetszetéhez; (3) LLM scaling csak a grounding sikere után értékes.

### 4.4. Hosszú Horizontú Memória Stabilitás (RQ4)

**Kutatási kérdés:** *"How stable are agent memory systems as the effective memory horizon increases, either through longer contexts or more distant supporting evidence?"*

**Benchmarks:** *LongBench* (Short/Medium/Long kontextus-hossz bucket), *LongMemEval* (történeti munkamenet-szám bin), *LoCoMo* (evidencia-távolsági bin).

**Megfigyelés O6 (Long-Horizon Evidence Preservation):** A memória stabilabb marad hosszabb horizonton, ha az evidenciát explicit relációs linkekkel vagy hierarchikus konszolidációval szervezik, nem pedig flat szövegként hagyják közvetlen matching-re:
- *LongBench*: *SimpleMem* alig változik Short→Medium (35.2→34.9), míg *Long Context* 42.6→19.0-re esik — *"larger prompts alone do not sustain answer quality once long inputs accumulate distractors."*
- *LoCoMo*: *Embedding RAG* 37.1→7.4 Answer F1-re esik a távolság növekedésével, míg gráf/konszolidált memóriák (Cognee, MemOS, MemoryOS) lényegesen magasabban maradnak.

---

## Kulcsfontosságú Rendszerek (a rész alapján)

| Rendszer | Kiemelt jellemzők |
|---|---|
| **MemOS** | Hibrid szűrés, strukturált Update API, multi-version chains; legközelebb a fronthoz overall |
| **MemoryOS** | Hibrid index, Heat score eviction, federated routing; robust cross-workload |
| **Zep** | Gráf-szervezett, timestamp multi-versioning, párhuzamos ensemble (BM25 + koszinusz + BFS + RRF/MMR) |
| **Cognee** | Reláció-szervezett; legerősebb Temporal Reasoning; stabil hosszú horizonton |
| **Mem0 / Mem0^g** | Séma-mentes + gráf extrakció; CRUD tool-calling maintenance |
| **A-MEM** | KNN + gráf-bejárás; erős nagy Recall@K-nál és távoli evidenciánál |
| **SimpleMem** | LanceDB IVF-PQ; legjobb Recall@1; inline szemantikus kompakció |
| **MemoChat** | JSON-séma extrakció; magas Task Success Rate DB-Bench-en |

## Főbb Tanulságok

1. **Nincs univerzális memória-reprezentáció** — a hatékonyság a workload domináns szűk keresztmetszetéhez való illeszkedésen múlik.
2. **A visszakeresés evidencia-komplettségi probléma**, nem top-1 rangsorolási — a strukturált szervezés kritikus a szórt/távoli evidenciánál.
3. **A temporális update-hűség pipeline-szintű tervezési probléma**, nem modell-kapacitás probléma — az LLM scaling csak a grounding után segít.
4. **A hosszú horizontú stabilitágot explicit relációs/hierarchikus szervezés biztosítja**, nem a flat kontextus-növelés.

---

## Összefoglaló — 3. rész

## *Are We Ready For An Agent-Native Memory System?*
**arXiv:** 2606.24775v1 · **Szerzők:** Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu · **Publikálás:** 2026-06-23

---

## 4.4. RQ4 — Horizont-strukturált memória (folytatás)

A hosszabb memóriahorizontoknál a fő nehézség nem a memória mennyisége, hanem az, hogy a reprezentáció összeköti-e a távoli tényeket a válaszadáshoz szükséges absztrakciókkal:

- **Gráf- vagy temporálisan szervezett memória** megőrzi az entitás–esemény–idő relációkat távoli tényeknél (pl. egy több munkamenettel korábbi személyes esemény előhívása).
- **Hierarchikus vagy összegzés-vezérelt szervezés** megőrzi a munkamenet-szintű struktúrát (először a releváns munkamenet lokalizálása, majd a helyi részlet feloldása), így az LLM leszűkítheti a figyelmét a végső generálás előtt.
- A tiszta hosszú kontextusú prompting és a lapos sűrű memória egyik támogatást sem nyújtja, ezért élezve romlanak, ahogy a hatékony horizont nő.

**Finding 4 (Horizon-Structured Memory):** Ahogy a memóriahorizont nő, a kihívás a *több történet tárolásáról* a *megfelelő absztrakció kiválasztására* tolódik át:
1. A többnézetes szűrés (multi-view filtering) segíthet, ha hosszú bemenet sok zavaró elemet tartalmaz — *SimpleMem*.
2. A reláció-tudatos indexelés segíthet, ha a támogató tények több körrel vagy munkamenettel távol vannak — *Cognee* és *Zep*.
3. A durvától-finomig összegzés (coarse-to-fine) segíthet, ha először a releváns munkamenetet kell azonosítani — *MemOS* és *MemoryOS*.

---

## 4.5. Memóriaművelet-költség (RQ5)

**Kísérleti beállítás:** 8 reprezentatív memóriarendszer értékelése egységes idő-túllépési nyomok alapján. Két szempontot mérnek:
- **(1) Utility–latency trade-off:** *Avg. Operation Latency/Query* és *Normalized Utility* (hat min–max normalizált válaszminőség-metrika átlaga LoCoMo és LongMemEval benchmarkokon).
- **(2) Cross-workload latency footprint:** *Outlier-Filtered Avg. Total Latency/Query* három benchmarkon.

### O7 — Localized Maintenance
A legköltséghatékonyabb memóriamechanizmusok azok, amelyek a karbantartást egy korlátozott memóriahalmazra lokalizálják, míg a nagy globális állapotot ismételten átszervező mechanizmusok a legkevésbé hatékonyak.

- LightMem (48.3 Normalized Utility, 3.67 s) és MemTree (63.5, 15.9 s) a leghatékonyabb frontier.
- MemoChat (28.0, 15.4 s), Mem0 (21.4, 35.9 s) és A-MEM (57.7, 17.9 s) kevésbé hatékonyak.
- MemoryOS (82.0, 28.6 s), Cognee (>84, 116.5 s) és Zep (>84, 155.1 s) — magasabb utility, de nagyon magas késleltetés.
- LongBench-specifikus késleltetések: Mem0 (374.2 s), MemoChat (460.2 s), MemoryOS (490.0 s), A-MEM (552.1 s).

**Finding 5 (Operational Scaling Rule):** A hatékonyságot a karbantartás hatóköre (scope) határozza meg, nem pusztán a struktúra:
1. A lokalizált frissítés és keresés nyújtja a legjobb költség–utility egyensúlyt — *LightMem* és *MemTree*.
2. A gazdagabb szervezés csak akkor segít, ha a karbantartás elkerüli a széles körű újraszámítást — különben az overhead ellensúlyozza a nyereséget (*Cognee*, *MemoryOS*).
3. Hosszú kontextusú terhelés alatt a teljes memóriára kiterjedő koordináció válik a domináns költség-hajtóerővé.

---

## 5. Finom szemcsés komponens-összehasonlítás

Az end-to-end teljesítménykülönbségek kiváltó okainak megértéséhez a rendszereket négy alapmodulra bontják, és kontrollált variánsokkal egyenként módosítják őket.

### 5.1. Memóriareprezentáció és tárolás (M1)

- **LightMem:** *User-Only Raw* (verbatim felhasználói megnyilvánulások) vs. *User-Only Summary* (LLM absztraktív összegzés) vs. *User-Only Compressed* (töltelék és redundancia eltávolítása, jelentés megőrzése).
- **MemTree:** *Flat-biased* (lapos) vs. *Deeper Tree* (mélyebb hierarchia).

**O8 — Content Fidelity:** Az eredeti beszélgetési tartalom megőrzése fontosabb, mint az absztrakció vagy hierarchia növelése a tényhűség és érvelésminőség fenntartásához.

| Metrika | Raw | Summary | Compressed |
|---------|-----|---------|------------|
| LoCoMo EM | 24.2 | 8.5 | 23.6 |
| LoCoMo Ans. F1 | 38.9 | 15.6 | 38.6 |
| LongMemEval Substr. EM | 26.0 | 11.7 | 10.7 |

**Finding 6 (Representation Granularity):** A használható bizonyíték megőrzése fontosabb, mint a memória kompaktabbá vagy strukturáltabbá tétele:
1. A magas visszatartású formák legjobban támogatják a pontos részletvisszaállítást — *User-Only Raw*.
2. A könnyű kompresszió megőrizheti az érvelést, de gyengíti a pontos egyeztetést — *User-Only Compressed*.
3. A hierarchia főleg a hozzáférést javítja, de nem tudja visszaállítani az eltávolított tartalmat — *MemTree (Deeper Tree)*.

### 5.2. Memóriaextrakció (M2)

- **MemoChat:** *Heuristic Topic* vs. *LLM Topic* szegmentálás.
- **MemOS:** *Fast Memorize* vs. *Fine Memorize* ugyanazon a `tree_text` backenden.
- **LightMem:** *User-Only Raw* vs. *Hybrid Raw* (csak felhasználói vs. felhasználó + asszisztens körök).

**O9 — Coverage-Preserving Extraction:** A lefedetést megőrző írásidejű extrakció nyújtja a legstabilabb egyensúlyt a ténybeli visszakeresés és az alsóbb rétegbeli érvelés között. A szélesebb, kevésbé szelektív extrakció jobban megőrzi a kontextust, amelyet a downstream válaszadóképesség igényel.

**Finding 7 (Late Filtering Principle):** A memóriaextrakciónak íráskor meg kell őriznie a kontextust, nem pedig agresszíven szűrnie a részleteket:
1. A durvább szegmentálás segít a szálon átívelő kérdéseknél — a kapcsolódó nyomokat egyben tartja.
2. A korlátozott újraírás támogatja a kompozicionális érvelést — olyan részleteket őriz meg, amelyek csak kombinálva számítanak.
3. A felhasználó- és asszisztens-körök együttes tárolása segít a tisztázás-gazdag párbeszédeknél — finomított megfogalmazásokat őriz meg.

### 5.3. Visszakeresés és útválasztás (M3)

- **A-MEM:** *Hybrid-Balanced* (mérlegelt dense–sparse fúzió) vs. *Hybrid Sparse-Leaning* (növelt sparse járulék).
- **SimpleMem:** *No Planning* (közvetlen visszakeresés) vs. *Planning Only* (explicit tervezési lépés) vs. *Planning + Reflect* (reflexió hozzáadása).

**O10 — Planning and Fusion:** Az explicit tervezés és a mérlegelt visszakeresési fúzió nyújtja a legerősebb javulást a visszakeresési hatékonyságban.
- A-MEM: *Hybrid-Balanced* (24.6 Ans. F1, 27.5 Substr. EM) > *Sparse-Leaning* (23.0, 24.3).
- SimpleMem: *Planning Only* (20.7 Ans. F1, 90.6 Strict Rec., 27.9 ROUGE-L F1) a legjobb — a reflexió hozzáadása nem hoz további nyereséget.

**Finding 8 (Retrieval Strategy Guidance):** A visszakeresési minőség a célzott struktúrából javul leginkább, nem az összetettség hozzáadásából:
1. A mérsékelt hibrid fúzió előnyösebb, ha a bizonyíték szemantikailag rokon, de lexikailag változatos.
2. A könnyű súlyozású tervezés hatékony a korlátozott memória-lekerdezésnél.
3. Ha az útvonal már specifikált, az extra reflexió korlátozott hasznot hoz és főleg overhead-et ad.

### 5.4. Memóriakarbantartás (M4)

- **MemoChat:** alapértelmezett több-témás konszolidáció vs. *Topic1* (kényszerített egy-témás összegzés).
- **MemoryOS:** alapértelmezett azonnali konszolidáció vs. *Delayed-Flush* (rövid távú puffer növelése) vs. *Conservative-Merge* (szigorúbb témahasonlósági küszöb).

**O11 — Conservative Consolidation:** A konzervatív konszolidáció hatékonyabb, mint a késleltetett kiürítés vagy a túlzottan durva összegzés. *Conservative-Merge* javít (23.2→23.5 Ans. F1; 22.4→22.8 Substr. EM), míg *Delayed-Flush* ront (20.6/19.5), és a *Topic1* kényszerítés is alulteljesít az alapértelmezetthez képest.

**Finding 9 (Maintenance Design Principle):** A memóriakarbantartás kiegyensúlyozott frissítési rendszerrel működik a legjobban:
1. A konzervatív integráció megőrzi a körök közötti kapcsolatokat a hosszú-horizontú érveléshez.
2. A késleltetett kiürítés lekérdezéskor friss bizonyítékot hagy fragmentálva.
3. A túlzottan durva összegzés elfedi a ritka, de hasznos nyomokat.

---

## 6. Konklúzió

A tanulmány átfogó adatkezelési szemszögű áttekintést nyújt a meglévő ügynökmemória-rendszerekről. Fő hozzájárulások:

- **End-to-end teljesítményértékelés** 12 reprezentatív memóriarendszer és 2 referencia baseline között, 5 benchmark terhelésen 11 adathalmazon.
- **Modulszintű elemzés** — a reprezentáció, extrakció, útválasztás és karbantartás modulok egyenkénti hatásának vizsgálata kontrollált variánsokkal.
- **Költség- és hosszú-horizontú stabilitási tényezők** azonosítása.
- **Gyakorlati útmutató** a felhasználóknak megfelelő memóriaarchitektúrák kiválasztásához, valamint ígéretes kutatási irányok felvázolása.
- A tesztbed és értékelési keretrendszer nyilvánossá tétele.

---

## Kulcsfontosságú megfigyelések (Observations) összefoglalója

| # | Megfigyelés | Fő üzenet |
|---|------------|-----------|
| O7 | Localized Maintenance | A lokalizált karbantartás a leghatékonyabb; a globális átszervezés a legdrágább |
| O8 | Content Fidelity | Az eredeti tartalom megőrzése fontosabb az absztrakciónál vagy hierarchiánál |
| O9 | Coverage-Preserving Extraction | A szélesebb, kevésbé szelektív extrakció stabilabb |
| O10 | Planning and Fusion | Explicit tervezés + mérlegelt fúzió a legjobb visszakeresési javulás |
| O11 | Conservative Consolidation | A konzervatív konszolidáció felülmúlja a késleltetett kiürítést és durva összegzést |

## Megállapítások (Findings) összefoglalója

| # | Finding | Modul/RQ |
|---|---------|----------|
| 4 | Horizon-Structured Memory | RQ4 |
| 5 | Operational Scaling Rule | RQ5 |
| 6 | Representation Granularity | M1 |
| 7 | Late Filtering Principle | M2 |
| 8 | Retrieval Strategy Guidance | M3 |
| 9 | Maintenance Design Principle | M4 |
