MeMo: Memory as a Model — A Modular Framework for Knowledge Integration in Frozen LLMs¶
Szerzők: Arun Verma et al. Dátum: 2026-05-14 (v1), 2026-05-20 (v2) Forrás: https://arxiv.org/abs/2605.15156
Összegzés¶
A MeMo egy moduláris keretrendszer, ami új tudást kódol egy kis, dedikált Memory modellbe, miközben a fő LLM (Executive) paramétereit változatlanul hagyja. Három létező paradigma korlátait kerüli meg:
- Nem-parametrikus (RAG, ICL): cross-document reasoning gyenge, retrieval noise-ra érzékeny
- Parametrikus (fine-tuning): catastrophic forgetting, closed-source modelleknél kivitelezhetetlen
- Latent memory (soft tokenek): specifikus architektúrához kötött
MeMo előnyei: (a) komplex cross-document kapcsolatokat rögzít, (b) robusztus retrieval noise-ra, (c) nincs catastrophic forgetting, (d) black-box LLM-ekkel is működik (plug-and-play), (e) konstans idejű inferencia korpusz mérettől függetlenül.
Architektúra¶
Training — 5 lépéses Reflection QA Pipeline¶
Egy Generator modell hajtja: 1. Fact extraction — direkt és indirekt tények kinyerése 2. Consolidation — kapcsolódó QA párok kompozicionális reprezentációkba 3. Verification & rewriting — önálló (self-contained) QA formátum 4. Entity surfacing — "reversal curse" ellensúlyozása 5. Cross-document synthesis — konvergáló nyomok, párhuzamos tulajdonságok azonosítása ⚠️ Legkritikusabb lépés — kihagyása 6.37%-ra zuhanás (NarrativeQA)
A Memory modell (sokkal kisebb, pl. 1.5B vs. Executive 32B) SFT-vel tanul a generált reflection QA dataset-en. Inferencia során nincs hozzáférése a forrás dokumentumokhoz.
Inferencia — 3 Stage Structured Protocol¶
- Stage 1 (Grounding): Kérdés felbontása atomi sub-kérdésekre
- Stage 2 (Entity Identification): Iteratív entitás szűkítés célzott follow-up kérdésekkel
- Stage 3 (Answer Seeking): Támogató tények gyűjtése és végső válasz szintézise
A Memory modell válaszai kompakt természetes nyelvű snippet-ek, hosszuk független a korpusz méretétől → konstans idejű inferencia.
Eredmények¶
| Benchmark | MeMo | RAG Baseline | Különbség |
|---|---|---|---|
| NarrativeQA | 53.58% (Gemini-3-Flash) | alacsonyabb | +jelentős |
| MuSiQue | 60.20% | alacsonyabb | +jelentős |
| BrowseComp-Plus | 66.67% | versenyképes | ≈ |
- Retrieval noise robusztusság: RAG baseline-ok 6.22%-ot zuhannak, MeMo 1 SD-n belül marad
- Plug-and-play: Ugyanaz a Memory modell Qwen2.5-32B → Gemini-3-Flash: +12-27% újratanítás nélkül
Continual Knowledge Integration¶
Model merging (TIES, rho=0.3): - 2 korpusz: 33% compute megtakarítás - 10 korpusz: 5.5x megtakarítás - Pontosság: 11-19%-kal a teljes újratanítás alatt, de még mindig minden retrieval baseline felett
Relevancia a Rendszerünkre¶
A jelenlegi wiki tudásbázis (267 raw, 53 topic, 26 concept) lényegében egy RAG rendszer — memory_search + memory_get. A MeMo architektúra potenciális upgrade útvonal lehet:
- A Memory modell betanítása a teljes wiki korpuszra
- Konstans idejű lekérdezés a jelenlegi lineáris search helyett
- Cross-document reasoning képesség (jelenleg nincs)
- Plug-and-play: deepseek-v4-pro cserélhető anélkül hogy a Memory modellt újra kéne tanítani
Feldolgozás¶
- Módszer: arxiv HTML → summarize CLI
- Típus: arXiv preprint (v2)