Are We Ready For An Agent-Native Memory System?¶
Cím: Are We Ready For An Agent-Native Memory System? arXiv ID: 2606.24775v1 Szerzők: Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu Intézmény: Shanghai Jiao Tong University Dátum: 2026-06-23 Kategóriák: cs.CL, cs.DB, cs.IR Típus: Rendszeres kísérleti tanulmány — agent memória adatkezelési perspektívából Kód: https://github.com/OpenDataBox/MemoryData
Magyar Összefoglaló: Are We Ready For An Agent-Native Memory System?¶
Szerzők: Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu Intézmények: Shanghai Jiao Tong University, Tsinghua University, MemTensor (Shanghai) Technology Co., Ltd. arXiv: 2606.24775v1 (2026-06-23, cs.CL, cs.DB, cs.IR)
Áttekintés¶
A tanulmány az LLM-ágensek memóriarendszereit adatkezelési (data management) szemszögből vizsgálja. A memória a korábbi egyszerű retrieval-augmented mechanizmusokból egy olyan adatkezelési rendszerré fejlődött, amely tartós információtárolást, visszakeresést, frissítést, konszolidációt és dinamikus életciklus-kezelést támogat az ágens futása során. A szerzők rámutatnak, hogy a meglévő értékelések főként végponttól-végpontig (end-to-end) metrikákat használnak (pl. F1, BLEU), és a rendszert monolitikus „fekete dobozként” kezelik, így a rendszer-szintű kérdések — működési költségek, architekturális kompromisszumok, robusztusság dinamikus tudásfrissítések esetén — feltáratlanok maradnak.
"In this paper, we present a systematic experimental study of agent memory from a data management perspective."
A tanulmány fő hozzájárolásai:
- (1) Technológiai dekompozíció és taxonómia — az ágensmemóriát négy alapmodulra bontja.
- (2) Végponttól-végpontig teljesítményértékelés — 12 reprezentatív memóriarendszer és 2 referencia baseline összehasonlítása 5 benchmark workload és 11 adathalmaz alapján.
- (3) Finom szemcsés komponens-értékelés — kontrollált ablatációs kísérletek modulonként.
- (4) Megállapítások — költség-teljesítmény kompromisszumok elemzése.
Az Ágensmemória Négy Alapmodulja¶
A szerzők a memóriarendszert formálisan egy négyes tuple-ként definiálják:
ℳ_sys = ⟨ℛ, 𝒮, 𝒬, 𝒰⟩
ahol minden modul a memória életciklus egy különálló fázisát kormányozza.
1. Memória reprezentáció és tárolás (ℛ)¶
A logikai és fizikai memóriaformátumot határozza meg két aspektusban:
- Logikai reprezentáció: egyszerű primitívektől (diszkrét tokenek, folytonos vektorok) komplex topológiákig (tudásgráfok, fák, kompozit struktúrák).
- Fizikai tárolás: tranziens regiszterek, specializált egymotoros adatbázisok, vagy többmotoros háttérrendszerek perzisztenciához és indexeléshez.
2. Memória extrakció (𝒮)¶
A heterogén bemeneti adatfolyamok (többkörös párbeszédek, eszköznaplók) logikai memóriaprimitívekké történő átalakítását kormányozza. Stratégiák: nyers szekvencia-konkatenáció, séma-mentes szemantikus extrakció, vagy séma-korlátozott strukturált extrakció.
3. Memória visszakeresés és útválasztás (𝒬)¶
A lekérdezési kontextus alapján dinamikusan azonosítja a releváns memórianylezeteket. Mechanizmusok: natív figyelem-alapú visszakeresés, szemantikus K-legközelebbi-szomszéd keresés, topológiai algráf-bejárás, autonóm ágens-útválasztás LLM-tervezéssel, többfázisú hibrid végrehajtás.
4. Memória karbantartás (𝒰)¶
A memóriabejegyzések dinamikus életciklusát kormányozza három alopációval:
- (a) Konfliktuskezelés és verziózás: többverziózás, invalidálás, precedenciaszabályok.
- (b) Kapacitásmenedzsment: korlátalapú kemény kivétel (FIFO, token-limit) vagy pontszám-alapú prioritásos kivétel (temporális csökkenés).
- (c) Szemantikus konszolidáció: LLM-vezérelt összevonás, sűrű összefoglalók vagy CRUD műveletek.
Architekturális Paradigmák¶
A tanulmány négy jellegzetes architekturális kategóriát különböztet meg:
- Stream-and-Reflection Memory System (pl. MemoryBank): időbélyegzett memóriafolyam + periodikus reflexiók, amelyek visszakerülnek a folyamba.
- Hierarchical Tiered Memory System (pl. MemGPT/Letta): többszintű memória eltérő kapacitással és hozzáférési tulajdonságokkal; core memória és archív tároló szétválasztása explicit mozgatással (kivétel, előléptetés).
- Knowledge Graph Memory System (pl. Mem0^g, Zep): entitások, relációk és temporális evolúció strukturált formában (temporális tudásgráfok), entitás-diszambiguációval és konfliktusfeloldással.
- Composite Hybrid Memory System (pl. A-MEM): sématudatos memóriaobjektumok több tárolószubsztrátum közötti útválasztása; futásidejű állapot (KV-cache) és hosszú távú tároló (vektor, gráf, kulcsszó-index) szétválasztása.
Megkülönböztetés RAG-től és Tradicionális Adatbázisoktól¶
- RAG: állapotnélküli, csak olvasható visszakeresési primitív statikus korpuszból. Az ágensmemória ezzel szemben perzisztens és frissíthető infrastruktúra, amely a teljes hosszú távú memória-életciklust kormányozza.
- Tradicionális adatbázisok (OLTP/OLAP): az ágensmemória workload-jai lényegesen különböznek:
- A hozzáférés gyakran szemantikus és nem predikátum-alapú — természetes nyelvű lekérdezések, approximatív matching, LLM-vezérelt visszakeresés.
- A memóriatartalom folyamatosan és potenciálisan konfliktusos megfigyelések alatt fejlődik — bizonytalan, részleges, ellentmondásos információk kezelése szükséges.
- A workload-ok magas heterogenitásúak — hosszú kontextus-szintézis, epizodikus felidézés, strukturált ténykeresés, temporális érvelés és streaming frissítések együtt.
"These properties distinguish agent memory from traditional databases, motivating dedicated abstractions and evaluation methodologies."
Értékelt Memóriarendszerek (12 rendszer + 2 baseline)¶
A tanulmány a következő rendszereket vizsgálja (részletes taxonómia a Table 1 alapján):
- Token-szekvencia alapúak: MemoChat, Mem0, MEM1, Sequential Context MemAgent
- Gráf/fa topológia alapúak: MemTree, Zep, Mem0^g, Cognee
- Heterogén kompozit: LightMem, SimpleMem, MemOS, MemoryOS, A-MEM, Letta
A teljesítményt öt szempont szerint értékelik: feladat-hatékonyság (RQ1), visszakeresési hűség (RQ2), dinamikus frissítési robusztusság (RQ3), hosszú horizónú stabilitás (RQ4), működési költség (RQ5).
Memória Reprezentációs és Tárolási Módszerek (részletesebben)¶
Logikai reprezentáció kategóriák¶
❶ Token-szintű szekvencia reprezentáció:
- Explicit diszkrét szöveges token: ember által olvasható karakterláncok vagy független tényállítások (pl. Mem0 diszkrét tények, MemoChat JSON blokkok, MemAgent 1024 token limit, MEM1 <IS> címkék).
- Implicit folytonos vektor token: sűrű szemantikus beágyazások vagy modell-oldali latens állapotok (pl. MemoRAG KV-cache tenzorok). Előny: alacsony tokenizációs teher; hátrány: strukturális értelmezhetőség hiánya, nehéz finom szemcsés műveletek végrehajtása.
❷ Gráf és fa-alapú topológiai reprezentáció: - Temporális tudásgráfok: entitások és kapcsolatok gráfja, natív temporális érvelés és konfliktusdetektálás (pl. Zep epizód/entitás/közösség algráfok, Mem0^g címkézett irányított gráf). - Hierarchikus fa struktúrák: rekurzív hierarchia — leveleken granuláris megfigyelések, ős-csomópontokon szemantikus absztrakciók (pl. MemTree dinamikus irányított fa).
❸ Heterogén kompozit reprezentáció: - Komplex többrészes adatkonténerek, strukturálatlan szöveg + strukturált metaadatok kombinációja (pl. MemOS MemCube: plain-text + activation + parametric memory + strukturált részletek).
Fizikai tárolás és indexelés kategóriák¶
❶ Tranziens in-kontextus regiszter: memória kizárólag aktív hardverállapotban (kontextusablak, KV-cache), lemezes I/O nélkül (pl. MemoChat JSON memók kontextusban, MemAgent KV-cache tenzorok).
❷ Specializált egymotoros tároló: - Sűrű vektor adatbázisok: (pl. Mem0, MemTree, Letta pgvector) - Gráf adatbázisok: (pl. Zep, Mem0^g Neo4j, Cypher lekérdezések) - Relációs SQL motorok: strukturális és temporális sémák szerializálása
❸ Heterogén többmotoros tároló — a rész végén előzetesen jelezve, részletezés a következő részben.
Kulcsfontosságú Megállapítások (előzetes)¶
- Nincs univerzálisan domináns architektúra — a hatékonyság attól függ, mennyire illeszkedik a memóriastruktúra a workload szűk keresztmetszetéhez.
- Gráf-alapú módszerek megbízhatóan kezelik a tudásfrissítéseket, míg a népszerű tény-extrakciós pluginok és append-only tárolók küzdenek a célzott felülírásokkal.
- Hosszú horizónon sok append-only memóriatároló katastrofális degradációt szenved — a nyers hosszú-kontextus visszkeresés sok esetben felülmúlja a memória-alapú megközelítéseket.
- Költség: a magas strukturáltságú rendszerek nagyságrendekkel magasabb index-építési időt és lekérdezési latenciát produkálnak, de nem biztos, hogy arányos pontossági nyereséget hoznak.
- Konszolidáció: a konzervatív memóriakonszolidáció a legjobb alapértelmezett karbantartási stratégia; a késleltetett kiírás felszíni lefedettség és tényleges válaszolhatóság között megtévesztő kompromisszumot teremt.
"Each layer of abstraction (e.g., compression, summarization, and fact extraction) progressively discards information."
A kód publikusan elérhető: https://github.com/OpenDataBox/MemoryData Taxonómia: https://github.com/OpenDataBox/awesome-agent-memory
Hungarian Summary — Are We Ready For An Agent-Native Memory System?¶
arXiv: 2606.24775v1 | Szerzők: Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu | Publikálva: 2026-06-23
Ez a rész a memóriamodulok taxonómiájának folytatását (extrakció, visszakeresés és routing, karbantartás) valamint a 4. szakasz végponttól-végpontig tartó értékelését (RQ1–RQ4) fedi le.
3.2. Memória Extrakció (Memory Extraction)¶
A memória-extrakció azt írja le, hogyan dolgozzák fel a nyers interakciós nyomvonalakat — azaz hogyan alakítja a rendszer a heterogén bemeneti adatfolyamokat (többkörös párbeszédek, eszközvégrehajtási naplók) logikai memória-primitívekké fizikai tárolás előtt. Három kategória azonosítható:
- Nyers szekvencia-konkatenáció (Raw Sequence Concatenation): Minimális számítási többletköltség — nincs explicit extrakciós prompt; a memória közvetlenül nyers token-konkatenációként vagy tranziens állapot-összefoglalóként jön létre. A MEM1 és MemAgent kizárólag az aktív számítási állapotban tartják az új struktúrákat, másodlagos feldolgozás nélkül.
- Séma-mentes szemantikus extrakció (Schema-Free Semantic Extraction): A nyers, strukturálatlan bemeneteket független, magas értékű információs egységekké desztillálja — szabad szöveges tényekként vagy kompresszált latens vektorokként. Például a Mem0 különálló tényállításokat extrahál (pl. "User is vegetarian and dairy-free").
- Séma-korlátozott strukturált extrakció (Schema-Constrained Structured Extraction): Az LLM-et előre definiált szerkezeti sémával tölti fel, szigorúan típusos adatot eredményezve — topologikus entitás-reláció hármasokként (gráfhoz) vagy multimodális relációs payload-ként (hibrid tárolóhoz). A Zep és Mem0^g típusos irányított relációs éleket extrahálnak (pl.
LIVES_IN,WORKS_AT); a Zep emellett reflexió-inspirált ellenőrzési lépést alkalmaz a hallucinált hármasok szűrésére. A MemoChat előre definiált JSON-sémába segmentálja a beszélgetéseket.
3.3. Memória Visszakeresés és Lekérdezés-Routing (Memory Retrieval and Query Routing)¶
Ez a modul határozza meg, hogyan azonosítja és nyeri ki a rendszer dinamikusan a releváns történeti kontextust az ágens aktuális érvelési állapotához. Öt kategória:
- Natív attention-alapú visszakeresés: A transformer saját self-attention mechanizmusát használja egyedüli visszakeresési motorként, külső adatbázis-I/O nélkül (pl. KV-cache-ben való token-szkennelés). MEM1 két-dimenziós attention mask-kal; MemAgent blokkok prompt-sablonba konkatenálásával.
- Szemantikus sűrű visszakeresés: Folytonos latens terekben KNN-keresést hajt végre. Mem0 vektor-embedding-alapú sűrű hasonlósági keresés; LightMem koszinusz-hasonlóság; MemTree összenyomott-fa architektúrával globális koszinusz-disztribúciót számol.
- Topologikus algráf-bejárás: Explicit relációs éleket jár be tudásgráfokon. Mem0^g entitás-centrikus heurisztikával rekurzívan bejárja lokális algráfokat; A-MEM sűrű KNN-kereséssel azonosít horgonyokat, majd lokális gráf-bejárást végez.
- Autonóm ágens-routing: Az LLM maga functioning as aktív lekérdezés-tervező:
- Függvényhívás-invokáció (Function Call Invocation): Explicit függvényhívás-parancsok generálása (pl. Letta
archival_storage.search()parancsot generál). - Generatív lekérdezés-bővítés (Generative Query Expansion): Természetes nyelvű generációval intermediate clue-kat szintetizál (pl. SimpleMem Intent-Aware Retrieval Planning modulja).
- Többfázisú hibrid végrehajtás (Multi-Stage Hybrid Execution):
- Szekvenciális hibrid routing: Meghatározott sorrendben láncolja a visszakeresési paradigmákat — pl. MemoryOS durva predikátum-értékelés után finom szemantikus rangsorolást végre.
- Párhuzamos ensemble visszakeresés: Több indexelési algoritmusnak küld párhuzamosan lekérdezéseket, majd fusion + reranking — pl. Zep egyidejű koszinusz-szemantikus, Okapi BM25 és topologikus BFS, majd RRF/MMR/cross-encoder optimalizáció.
3.4. Memória Karbantartás (Memory Maintenance)¶
A memória frissítését, karbantartását, kompresszióját, felejtését és eltávolítását szabályozza a idő múlásával. Négy kategória:
- Időbélyeg-alapú több-verziózás (Timestamp-Based Multi-Versioning): Fizikai törlés helyett időbélyeg-metaadattal és append-only naplókkal logikailag érvényteleníti az elavult tényeket. Zep és Mem0^g validity flag-eket használ; LightMem időbélyegelt tényfolyamokat illeszt be; SimpleMem ISO-8601 időbélyegekkel old fel ellentmondásokat; MemOS strukturált Update API-val differenciális írásokat végez.
- Kapacitás-vezérelt fizikai kizárás (Capacity-Driven Physical Eviction): A korlátlan memória-növekedést fizikai adateldobással vagy felülírással kezeli:
- Korlát-alapú hard eviction: Determinisztikus szabályok — FIFO sorok, fix szekvencia-határok, hard token-limit. MemAgent programozott ütemezéssel; MEM1 automatikus FIFO pruning; Letta OS-inspirált queue managerrel threshold-flush-t végez.
- Pontszám-alapú prioritás-eviction: Dinamikusan számolt időbeli lebomlás vagy hozzáférési-gyakoriság pontszámok. MemoryOS skalár Heat score-ot használ, amely a visszakeresési gyakoriságot exponenciális időbeli lebomlással egyensúlyozza.
- LLM-vezérelt szemantikus konszolidáció (LLM-Driven Semantic Consolidation): Az LLM mint kognitív kormányzó oldja fel a logikai konfliktusokat és sűrít össze redundáns megfigyeléseket:
- Inline szemantikus kompakció: Írás közben mergeli a redundáns állításokat — SimpleMem online szemantikus szintézis; MemTree rekurzív szemantikus összefoglaló prompt szülő-csomópontokon.
- Eszköz-vezérelt CRUD végrehajtás: Explicit LLM-eszközhívásokkal CRUD-parancsok — Mem0 strukturált LLM tool-calling interfészen keresztül UPDATE/DELETE műveletekkel.
- Folytonos paraméteres optimalizáció (Continuous Parametric Optimization): Az állapotfrissítést az online interferencia-latenciától függetlenítve aszinkron háttérfolyamatként végzi — magát a modellparamétert módosítja. MemoRAG offline tréning fázisban Reinforcement Learning with Generation Feedback (RLGF) keretrendszerrel optimalizál.
4. Végponttól-Végpontig Értékelés (End-to-End Assessment)¶
A szerzők 12 reprezentatív memóriarendszert és két referenciabázist (Long Context, Embedding RAG) értékelnek öt benchmark workload és 11 adathalmaz alapján, öt kutatási kérdés (RQ) mentén.
4.1. Általános Hatékonyság (RQ1)¶
Kutatási kérdés: "Do different agent memory systems successfully improve end-to-end task performance across workloads?"
Benchmarks: - LoCoMo — hosszú beszélgetés QA benchmark (epizodikus, temporális, nyílt-tartományú memória); EM és Answer F1. - LongMemEval — több-munkamenetes hosszú-memória benchmark; Substring EM, ROUGE-L F1/Recall, GPT-5.4-alapú LLM Judge Accuracy. - DB-Bench — procedurális végrehajtás adatbázis-műveleteken; EM és Task Success Rate.
Megfigyelés O1 (Cross-Workload Effectiveness): Egyetlen memóriarendszer sem dominál minden workloadon, de a structure-guided filtering-el feladat-kritikus evidenciát megőrző módszerek a legversenyképesebbek: - Struktúra-tudatos rendszerek vezetnek a LongMemEval-en (Zep: 48.0 LLM Judge Accuracy; Cognee: 35.3 ROUGE-L F1). - Hibrid szűrés legerősebb a LoCoMo pontosságon (MemOS: 11.5 EM). - Nyomvonal-megőrző memóriák legerősebbek a DB-Bench-en (Long Context: 48.20 EM; MemoChat: 55.40 Task Success Rate). - Teljes lefedettségű módszerek közül MemoryOS és MemOS a legközelebb a fronthoz.
Megfigyelés O2 (Beyond Exact Match): Az EM informatív marad kanonikus, közvetlenül alapozott kimeneteknél, de elégtelenné válik, ha a helyesség parafrasztikus szintézistől vagy végrehajthatóságtól függ. A DB-Bench-en a Long Context éri el a legjobb EM-et, de a MemoChat lényegesen magasabb Task Success Rate-et — "exact output matching does not fully capture whether memory supports successful execution."
Finding 1 (Workload-Aligned Memory): "Strong agent memory is not defined by a single universal representation, but by how well it supports the dominant workload bottleneck." (1) Diszperz cross-session érveléshez reláció- és idő-tudatos visszakeresés; (2) hosszú, koherens párbeszédhez coarse-to-fine szűrés; (3) állapottartó végrehajtáshoz interakciós nyomvonal megőrzése.
4.2. Memória Visszakeresési Hűség (RQ2)¶
Kutatási kérdés: "How accurately can a memory system surface the stored evidence required by a query?"
Módszer: 8 reprezentatív rendszer a LoCoMo-n — Recall@K (a top-k visszakeresett source-id csoport tartalmazza-e az annotált gold evidenciát) és Recall@10 hat evidencia-távolsági binen (1–5-től 26–31-ig).
Megfigyelés O1 (Structured Evidence Expansion): A visszakeresési hűség kevésbé attól függ, hogy egy releváns memória korán előbukkanjon, inkább attól, hogy explicit módon szervezett memória-struktúra álljon rendelkezésre, amely teljes és időben távoli evidenciát össze tud gyűjteni: - SimpleMem éri el a legmagasabb Recall@1-et (39.0), de A-MEM (69.5/85.9) és MemTree (59.7/80.5) jóval erősebbek nagyobb visszakeresési keretnél, és stabilabbak a növekvő evidencia-távolsággal. - Az Embedding RAG alapvonal élesen esik a legrövidebb távolsági bin után.
Finding 2 (Evidence-Centric Memory Organization): "Retrieval quality depends more on how a system organizes evidence for later reconstruction than on how well it ranks one relevant memory first." (1) Korai lokalizáció és evidencia-összeszerelés különálló tervezési célok; (2) explicit struktúra (linkek, hierarchia) értékes, ha a támogató evidencia szórt vagy távoli; (3) flat similarity search főleg rövid-távú hozzáférésnél hatékony.
4.3. Memória Evolúció Robusztussága (RQ3)¶
Kutatási kérdés: "Can agent memory systems reliably incorporate revised facts, preserve the correct temporal state after updates, and remain robust across answer backbones?"
Két kísérlet: 1. Update Robustness Comparison: 11 rendszer a LongMemEval Knowledge Update és Temporal Reasoning szeletein, valamint a LoCoMo Temporal szeletén. 2. Backbone Robustness Ablation: 6 rendszer 4 LLM backbone alatt a LoCoMo-n.
Megfigyelés O4 (Temporal State Externalization): Egyetlen rendszer sem dominál minden update-orientált szeletet, de a strukturált szervezéssel temporálisan érvényes evidenciát megőrző módszerek a legversenyképesebbek: - Gráf/reláció-szervezett memória legerősebb közvetlen tény-reviziónál (Zep: 44.4 Substring EM, 36.8 ROUGE-L F1 a Knowledge Update-en). - Reláció-szervezett visszakeresés legerősebb temporálisan diszperz evidenciánál (Cognee: 18.7/35.8 a Temporal Reasoning-on). - Hibrid szűrt memória legerősebb pontos aktuális-állapot alapozásnál (MemOS: 8.9 EM; Cognee: 28.1 Answer F1 a LoCoMo Temporal-on).
Megfigyelés O5 (Backbone Robustness): A backbone-változás inkább az abszolút válaszminőséget változtatja, mint azt, hogy melyik memória-pipeline marad hatékony — "stable update behavior is determined primarily before final generation." A MemOS minden négy backbone alatt legerősebb marad (32.2, 41.2, 38.6, 41.2).
Finding 3 (Temporal Update Fidelity): "Reliable post-update behavior is a pipeline-level design problem rather than a pure model-capacity problem." (1) A revizibilitás beépítendő a memória-reprezentációba; (2) query-time szelektivitás illeszkedjen a workload szűk keresztmetszetéhez; (3) LLM scaling csak a grounding sikere után értékes.
4.4. Hosszú Horizontú Memória Stabilitás (RQ4)¶
Kutatási kérdés: "How stable are agent memory systems as the effective memory horizon increases, either through longer contexts or more distant supporting evidence?"
Benchmarks: LongBench (Short/Medium/Long kontextus-hossz bucket), LongMemEval (történeti munkamenet-szám bin), LoCoMo (evidencia-távolsági bin).
Megfigyelés O6 (Long-Horizon Evidence Preservation): A memória stabilabb marad hosszabb horizonton, ha az evidenciát explicit relációs linkekkel vagy hierarchikus konszolidációval szervezik, nem pedig flat szövegként hagyják közvetlen matching-re: - LongBench: SimpleMem alig változik Short→Medium (35.2→34.9), míg Long Context 42.6→19.0-re esik — "larger prompts alone do not sustain answer quality once long inputs accumulate distractors." - LoCoMo: Embedding RAG 37.1→7.4 Answer F1-re esik a távolság növekedésével, míg gráf/konszolidált memóriák (Cognee, MemOS, MemoryOS) lényegesen magasabban maradnak.
Kulcsfontosságú Rendszerek (a rész alapján)¶
| Rendszer | Kiemelt jellemzők |
|---|---|
| MemOS | Hibrid szűrés, strukturált Update API, multi-version chains; legközelebb a fronthoz overall |
| MemoryOS | Hibrid index, Heat score eviction, federated routing; robust cross-workload |
| Zep | Gráf-szervezett, timestamp multi-versioning, párhuzamos ensemble (BM25 + koszinusz + BFS + RRF/MMR) |
| Cognee | Reláció-szervezett; legerősebb Temporal Reasoning; stabil hosszú horizonton |
| Mem0 / Mem0^g | Séma-mentes + gráf extrakció; CRUD tool-calling maintenance |
| A-MEM | KNN + gráf-bejárás; erős nagy Recall@K-nál és távoli evidenciánál |
| SimpleMem | LanceDB IVF-PQ; legjobb Recall@1; inline szemantikus kompakció |
| MemoChat | JSON-séma extrakció; magas Task Success Rate DB-Bench-en |
Főbb Tanulságok¶
- Nincs univerzális memória-reprezentáció — a hatékonyság a workload domináns szűk keresztmetszetéhez való illeszkedésen múlik.
- A visszakeresés evidencia-komplettségi probléma, nem top-1 rangsorolási — a strukturált szervezés kritikus a szórt/távoli evidenciánál.
- A temporális update-hűség pipeline-szintű tervezési probléma, nem modell-kapacitás probléma — az LLM scaling csak a grounding után segít.
- A hosszú horizontú stabilitágot explicit relációs/hierarchikus szervezés biztosítja, nem a flat kontextus-növelés.
Összefoglaló — 3. rész¶
Are We Ready For An Agent-Native Memory System?¶
arXiv: 2606.24775v1 · Szerzők: Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu · Publikálás: 2026-06-23
4.4. RQ4 — Horizont-strukturált memória (folytatás)¶
A hosszabb memóriahorizontoknál a fő nehézség nem a memória mennyisége, hanem az, hogy a reprezentáció összeköti-e a távoli tényeket a válaszadáshoz szükséges absztrakciókkal:
- Gráf- vagy temporálisan szervezett memória megőrzi az entitás–esemény–idő relációkat távoli tényeknél (pl. egy több munkamenettel korábbi személyes esemény előhívása).
- Hierarchikus vagy összegzés-vezérelt szervezés megőrzi a munkamenet-szintű struktúrát (először a releváns munkamenet lokalizálása, majd a helyi részlet feloldása), így az LLM leszűkítheti a figyelmét a végső generálás előtt.
- A tiszta hosszú kontextusú prompting és a lapos sűrű memória egyik támogatást sem nyújtja, ezért élezve romlanak, ahogy a hatékony horizont nő.
Finding 4 (Horizon-Structured Memory): Ahogy a memóriahorizont nő, a kihívás a több történet tárolásáról a megfelelő absztrakció kiválasztására tolódik át: 1. A többnézetes szűrés (multi-view filtering) segíthet, ha hosszú bemenet sok zavaró elemet tartalmaz — SimpleMem. 2. A reláció-tudatos indexelés segíthet, ha a támogató tények több körrel vagy munkamenettel távol vannak — Cognee és Zep. 3. A durvától-finomig összegzés (coarse-to-fine) segíthet, ha először a releváns munkamenetet kell azonosítani — MemOS és MemoryOS.
4.5. Memóriaművelet-költség (RQ5)¶
Kísérleti beállítás: 8 reprezentatív memóriarendszer értékelése egységes idő-túllépési nyomok alapján. Két szempontot mérnek: - (1) Utility–latency trade-off: Avg. Operation Latency/Query és Normalized Utility (hat min–max normalizált válaszminőség-metrika átlaga LoCoMo és LongMemEval benchmarkokon). - (2) Cross-workload latency footprint: Outlier-Filtered Avg. Total Latency/Query három benchmarkon.
O7 — Localized Maintenance¶
A legköltséghatékonyabb memóriamechanizmusok azok, amelyek a karbantartást egy korlátozott memóriahalmazra lokalizálják, míg a nagy globális állapotot ismételten átszervező mechanizmusok a legkevésbé hatékonyak.
- LightMem (48.3 Normalized Utility, 3.67 s) és MemTree (63.5, 15.9 s) a leghatékonyabb frontier.
- MemoChat (28.0, 15.4 s), Mem0 (21.4, 35.9 s) és A-MEM (57.7, 17.9 s) kevésbé hatékonyak.
- MemoryOS (82.0, 28.6 s), Cognee (>84, 116.5 s) és Zep (>84, 155.1 s) — magasabb utility, de nagyon magas késleltetés.
- LongBench-specifikus késleltetések: Mem0 (374.2 s), MemoChat (460.2 s), MemoryOS (490.0 s), A-MEM (552.1 s).
Finding 5 (Operational Scaling Rule): A hatékonyságot a karbantartás hatóköre (scope) határozza meg, nem pusztán a struktúra: 1. A lokalizált frissítés és keresés nyújtja a legjobb költség–utility egyensúlyt — LightMem és MemTree. 2. A gazdagabb szervezés csak akkor segít, ha a karbantartás elkerüli a széles körű újraszámítást — különben az overhead ellensúlyozza a nyereséget (Cognee, MemoryOS). 3. Hosszú kontextusú terhelés alatt a teljes memóriára kiterjedő koordináció válik a domináns költség-hajtóerővé.
5. Finom szemcsés komponens-összehasonlítás¶
Az end-to-end teljesítménykülönbségek kiváltó okainak megértéséhez a rendszereket négy alapmodulra bontják, és kontrollált variánsokkal egyenként módosítják őket.
5.1. Memóriareprezentáció és tárolás (M1)¶
- LightMem: User-Only Raw (verbatim felhasználói megnyilvánulások) vs. User-Only Summary (LLM absztraktív összegzés) vs. User-Only Compressed (töltelék és redundancia eltávolítása, jelentés megőrzése).
- MemTree: Flat-biased (lapos) vs. Deeper Tree (mélyebb hierarchia).
O8 — Content Fidelity: Az eredeti beszélgetési tartalom megőrzése fontosabb, mint az absztrakció vagy hierarchia növelése a tényhűség és érvelésminőség fenntartásához.
| Metrika | Raw | Summary | Compressed |
|---|---|---|---|
| LoCoMo EM | 24.2 | 8.5 | 23.6 |
| LoCoMo Ans. F1 | 38.9 | 15.6 | 38.6 |
| LongMemEval Substr. EM | 26.0 | 11.7 | 10.7 |
Finding 6 (Representation Granularity): A használható bizonyíték megőrzése fontosabb, mint a memória kompaktabbá vagy strukturáltabbá tétele: 1. A magas visszatartású formák legjobban támogatják a pontos részletvisszaállítást — User-Only Raw. 2. A könnyű kompresszió megőrizheti az érvelést, de gyengíti a pontos egyeztetést — User-Only Compressed. 3. A hierarchia főleg a hozzáférést javítja, de nem tudja visszaállítani az eltávolított tartalmat — MemTree (Deeper Tree).
5.2. Memóriaextrakció (M2)¶
- MemoChat: Heuristic Topic vs. LLM Topic szegmentálás.
- MemOS: Fast Memorize vs. Fine Memorize ugyanazon a
tree_textbackenden. - LightMem: User-Only Raw vs. Hybrid Raw (csak felhasználói vs. felhasználó + asszisztens körök).
O9 — Coverage-Preserving Extraction: A lefedetést megőrző írásidejű extrakció nyújtja a legstabilabb egyensúlyt a ténybeli visszakeresés és az alsóbb rétegbeli érvelés között. A szélesebb, kevésbé szelektív extrakció jobban megőrzi a kontextust, amelyet a downstream válaszadóképesség igényel.
Finding 7 (Late Filtering Principle): A memóriaextrakciónak íráskor meg kell őriznie a kontextust, nem pedig agresszíven szűrnie a részleteket: 1. A durvább szegmentálás segít a szálon átívelő kérdéseknél — a kapcsolódó nyomokat egyben tartja. 2. A korlátozott újraírás támogatja a kompozicionális érvelést — olyan részleteket őriz meg, amelyek csak kombinálva számítanak. 3. A felhasználó- és asszisztens-körök együttes tárolása segít a tisztázás-gazdag párbeszédeknél — finomított megfogalmazásokat őriz meg.
5.3. Visszakeresés és útválasztás (M3)¶
- A-MEM: Hybrid-Balanced (mérlegelt dense–sparse fúzió) vs. Hybrid Sparse-Leaning (növelt sparse járulék).
- SimpleMem: No Planning (közvetlen visszakeresés) vs. Planning Only (explicit tervezési lépés) vs. Planning + Reflect (reflexió hozzáadása).
O10 — Planning and Fusion: Az explicit tervezés és a mérlegelt visszakeresési fúzió nyújtja a legerősebb javulást a visszakeresési hatékonyságban. - A-MEM: Hybrid-Balanced (24.6 Ans. F1, 27.5 Substr. EM) > Sparse-Leaning (23.0, 24.3). - SimpleMem: Planning Only (20.7 Ans. F1, 90.6 Strict Rec., 27.9 ROUGE-L F1) a legjobb — a reflexió hozzáadása nem hoz további nyereséget.
Finding 8 (Retrieval Strategy Guidance): A visszakeresési minőség a célzott struktúrából javul leginkább, nem az összetettség hozzáadásából: 1. A mérsékelt hibrid fúzió előnyösebb, ha a bizonyíték szemantikailag rokon, de lexikailag változatos. 2. A könnyű súlyozású tervezés hatékony a korlátozott memória-lekerdezésnél. 3. Ha az útvonal már specifikált, az extra reflexió korlátozott hasznot hoz és főleg overhead-et ad.
5.4. Memóriakarbantartás (M4)¶
- MemoChat: alapértelmezett több-témás konszolidáció vs. Topic1 (kényszerített egy-témás összegzés).
- MemoryOS: alapértelmezett azonnali konszolidáció vs. Delayed-Flush (rövid távú puffer növelése) vs. Conservative-Merge (szigorúbb témahasonlósági küszöb).
O11 — Conservative Consolidation: A konzervatív konszolidáció hatékonyabb, mint a késleltetett kiürítés vagy a túlzottan durva összegzés. Conservative-Merge javít (23.2→23.5 Ans. F1; 22.4→22.8 Substr. EM), míg Delayed-Flush ront (20.6/19.5), és a Topic1 kényszerítés is alulteljesít az alapértelmezetthez képest.
Finding 9 (Maintenance Design Principle): A memóriakarbantartás kiegyensúlyozott frissítési rendszerrel működik a legjobban: 1. A konzervatív integráció megőrzi a körök közötti kapcsolatokat a hosszú-horizontú érveléshez. 2. A késleltetett kiürítés lekérdezéskor friss bizonyítékot hagy fragmentálva. 3. A túlzottan durva összegzés elfedi a ritka, de hasznos nyomokat.
6. Konklúzió¶
A tanulmány átfogó adatkezelési szemszögű áttekintést nyújt a meglévő ügynökmemória-rendszerekről. Fő hozzájárulások:
- End-to-end teljesítményértékelés 12 reprezentatív memóriarendszer és 2 referencia baseline között, 5 benchmark terhelésen 11 adathalmazon.
- Modulszintű elemzés — a reprezentáció, extrakció, útválasztás és karbantartás modulok egyenkénti hatásának vizsgálata kontrollált variánsokkal.
- Költség- és hosszú-horizontú stabilitási tényezők azonosítása.
- Gyakorlati útmutató a felhasználóknak megfelelő memóriaarchitektúrák kiválasztásához, valamint ígéretes kutatási irányok felvázolása.
- A tesztbed és értékelési keretrendszer nyilvánossá tétele.
Kulcsfontosságú megfigyelések (Observations) összefoglalója¶
| # | Megfigyelés | Fő üzenet |
|---|---|---|
| O7 | Localized Maintenance | A lokalizált karbantartás a leghatékonyabb; a globális átszervezés a legdrágább |
| O8 | Content Fidelity | Az eredeti tartalom megőrzése fontosabb az absztrakciónál vagy hierarchiánál |
| O9 | Coverage-Preserving Extraction | A szélesebb, kevésbé szelektív extrakció stabilabb |
| O10 | Planning and Fusion | Explicit tervezés + mérlegelt fúzió a legjobb visszakeresési javulás |
| O11 | Conservative Consolidation | A konzervatív konszolidáció felülmúlja a késleltetett kiürítést és durva összegzést |
Megállapítások (Findings) összefoglalója¶
| # | Finding | Modul/RQ |
|---|---|---|
| 4 | Horizon-Structured Memory | RQ4 |
| 5 | Operational Scaling Rule | RQ5 |
| 6 | Representation Granularity | M1 |
| 7 | Late Filtering Principle | M2 |
| 8 | Retrieval Strategy Guidance | M3 |
| 9 | Maintenance Design Principle | M4 |