# Context Length Alone Hurts LLM Performance Despite Perfect Retrieval

**Szerzők:** Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali, Sravan Bodapati, Aram Galstyan, Azton Wells, Roy Schwartz, Eliu A Huerta, Hao Peng (UIUC, Amazon, USC, Argonne NL, Hebrew University of Jerusalem, UChicago)
**Dátum:** 2025
**ArXiv:** 2510.05381

---

## Core Finding

A hosszú context önmagában rontja az LLM teljesítményt, akkor is ha a modell tökéletesen megtalálja a releváns információt. **13.9%–85% teljesítményromlás** figyelhető meg 5 open- és closed-source LLM-en, még a modell által támogatott context limiten belül is.

## Kulcs Kísérletek

### Perfect Retrieval ≠ Perfect Performance
- Llama-3.1-8B (128K context): 970/1000 MMLU problémánál tökéletes exact-match retrieval, mégis **24.2% accuracy drop** a short-context esethez képest
- Math, QA, coding taskokon is ugyanez a jelenség

### A Zaj Nem Okozza
- Irreleváns tokenek whitespace-re cserélve → ugyanolyan teljesítményromlás
- Irreleváns tokenek maszkolva, modell csak a releváns tokenekre figyel → akkor is romlik
- Releváns bizonyíték közvetlenül a kérdés előtt → akkor is

### Következtetés
**A puszta input hossz önmagában károsítja a teljesítményt** — függetlenül a retrieval minőségétől, a zajtól, a pozícionálástól. Ez egy eddig alulértékelt limitáció.

## Mitigáció: Retrieve-then-Reason

```
1. Model kikeresi a releváns bizonyítékot a hosszú inputból
2. Model recitálja (visszamondja) a talált bizonyítékot
3. A recitált bizonyíték + kérdés → új, rövid prompt → válasz
```

Ez **long-context → short-context transzformáció**. GPT-4o-n +4% javulás RULER benchmarkon, modell-agnosztikus, egyszerű.

## OpenClaw Relevancia

- **Inbox-processor:** Hosszú transcripteknél (60-90 perc) a modell először gyűjtse ki a kulcspontokat (recite), és csak utána írjon összefoglalót
- **Wiki-drift-check:** Nagy topic fájlok átvizsgálásánál a modell először listázza ki a potenciális problémákat, utána döntsön
- **Memóriastratégia:** A SOUL.md AGENTS.md SOUL.md már tartalmazza a "Quality > Quantity > Speed" elvet — ez a paper empirikus bizonyítékot ad rá
- **Cron promptok:** Mindenhol ahol nagy context-et kell feldolgozni → "recite-before-answer" pattern

## Idézetek

> "The sheer length of the input alone can hurt LLM performance, independent of retrieval quality and without any distraction."

> "Even when a model can perfectly retrieve all the evidence — reciting all tokens with 100% exact match — its performance still degrades substantially as input length increases."

## Forrás

arXiv:2510.05381 — https://arxiv.org/abs/2510.05381
