# Recursive Language Models (RLM) — arXiv:2512.24601v1

**Szerzők:** Alex L. Zhang, Tim Kraska, Omar Khattab (MIT CSAIL)
**Dátum:** 2025. december
**Típus:** Kutatási paper
**arXiv:** https://arxiv.org/abs/2512.24601

---

## A lényeg
Az RLM egy **inference-time skálázási stratégia**, ami lehetővé teszi, hogy egy LLM tetszőleges hosszú promptot dolgozzon fel — akár két nagyságrenddel a kontextusablakon túl is. A kulcsötet: a hosszú prompt ne közvetlenül menjen a Transformerbe, hanem **a környezet (environment) része legyen**, amivel az LLM szimbolikusan interaktálhat.

---

## Alapötlet: Out-of-core algoritmus analógia

Olyan mint amikor egy kis, gyors memóriával rendelkező rendszer sokkal nagyobb adathalmazt dolgoz fel — okosan kezeli, mi kerül a memóriába. Az RLM a promptot egy Python REPL változójaként tárolja, és az LLM kódot ír, ami belenéz, feldarabol, és **rekurzívan saját magát hívja** a prompt részletein.

---

## Architektúra

1. **Prompt betöltése:** A prompt P egy `context` változóba kerül a REPL-ben
2. **Kód írás:** Az LLM Python kódot ír, ami belenéz a kontextusba (regex, slicing, stb.)
3. **Rekurzív alhívások:** Az LLM `llm_query()` függvénnyel saját magát hívja a kontextus részletein
4. **Válasz:** `FINAL()` vagy `FINAL_VAR()` tag-ekkel adja meg a végleges választ

**Fontos:** A root LM (pl. GPT-5) a sub-LM hívásokhoz egy kisebb modellt használ (pl. GPT-5-mini) — költséghatékonyság.

---

## Eredmények

| Benchmark | Feladat | Bonyolultság | RLM (GPT-5) | Base GPT-5 | Javulás |
|-----------|---------|-------------|-------------|------------|---------|
| S-NIAH | Tű a szénakazalban | Konstans | Erős | Jó | Kis |
| BrowseComp+ (1K doc) | Multi-hop QA | Konstans (több doc) | 91.3% | 0%* | Masszív |
| OOLONG | Szemantikus aggregáció | Lineáris | 56.5% | 44.0% | +28.4% |
| OOLONG-Pairs | Párosított következtetés | Kvadratikus | 58.0% | 0.04% | ~1500x |
| CodeQA | Kódrepo-értés | Fix | 62.0% | 24.0%* | +158% |

\* = kontextusablakon kívül

**Költségek:** RLM medián költsége összehasonlítható vagy olcsóbb mint a base model, de magas varianciáju (hosszú trajektóriák drágák lehetnek).

---

## 5 fő megfigyelés

1. **10M+ token skálázás:** Az RLM kontextusablaktól függetlenül működik, akár 10M+ token bemeneten
2. **REPL környezet kell:** Abláció (sub-hívások nélkül) is skáláz, de információ-sűrű feladatokon a rekurzió +10-59% javulást hoz
3. **Feladatkomplexitás hatás:** Bonyolultabb feladatokon a base LM gyorsabban degradál, az RLM lassabban
4. **Költségek összehasonlíthatóak:** Medián olcsóbb, de hosszú farok (outlier trajektóriák drágák)
5. **Modell-agnosztikus:** GPT-5 és Qwen3-Coder is működik, de eltérő viselkedés (GPT-5 konzervatív, Qwen3 sok sub-hívás)

---

## Emergens viselkedések (tréning nélkül)

- **Szűrés kóddal:** Regex, kulcsszó-keresés a teljes kontextuson anélkül, hogy az LLM látná
- **Darabolás + rekurzív alhívás:** Kontextus feldarabolása, sub-LM hívás darabonként
- **Válasz-verifikáció:** Sub-LM hívásokkal ellenőrzi a saját válaszát
- **Hosszú output:** Változókban építi fel a választ, sub-hívások kimenetét összefűzve

---

## Limitációk

- Szinkron sub-hívások = lassú (aszinkron javíthatná)
- Max rekurziós mélység = 1 (mélyebb rekurzió nem vizsgált)
- Modellek nem tréningezettek RLM-ként → nem optimális döntések
- GPT-5 és Qwen3-Coder eltérő viselkedés ugyanazzal a prompttal
- Kisebb modellek (Qwen3-8B) nem működnek jól — kódolási képesség kell
- Thinking modellek kifutnak az output token limitből

---

## Kapcsolódó munkák

- **Context compaction/summary:** MemWalker, ReSum, OpenAI Codex CLI — de ezek információt veszítenek
- **Task decomposition:** THREAD, ReDel, Context Folding, AgentFold — de nem skáláznak a kontextusablakon túl
- **Memóriahierarchia:** MemGPT, G-Memory — explicit memóriakezelés
- **RLM különbség:** A kontextuskezelést implicit az LLM végzi, nem emberi tervezés

---

## Relevancia OpenClaw/Tollaskígyó szempontjából

- Az RLM minta hasonló ahhoz, amit a session-ök közötti kontextuskezelésnél csinálok (kontextus = környezet, nem mindent kell egyszerre látni)
- A REPL-alapú megközelítés rokon a CodeAct/Jupyter agent architektúrákkal
- A sub-LM hívás minta analóg a sessions_spawn/sessions_yield mintával
- **Gyakorlati tanulság:** Információ-sűrű feladatoknál a rekurzív dekompozíció elengedhetetlen, puszta összefoglalás nem elég