Context Length Alone Hurts LLM Performance Despite Perfect Retrieval¶
Szerzők: Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali, Sravan Bodapati, Aram Galstyan, Azton Wells, Roy Schwartz, Eliu A Huerta, Hao Peng (UIUC, Amazon, USC, Argonne NL, Hebrew University of Jerusalem, UChicago) Dátum: 2025 ArXiv: 2510.05381
Core Finding¶
A hosszú context önmagában rontja az LLM teljesítményt, akkor is ha a modell tökéletesen megtalálja a releváns információt. 13.9%–85% teljesítményromlás figyelhető meg 5 open- és closed-source LLM-en, még a modell által támogatott context limiten belül is.
Kulcs Kísérletek¶
Perfect Retrieval ≠ Perfect Performance¶
- Llama-3.1-8B (128K context): 970/1000 MMLU problémánál tökéletes exact-match retrieval, mégis 24.2% accuracy drop a short-context esethez képest
- Math, QA, coding taskokon is ugyanez a jelenség
A Zaj Nem Okozza¶
- Irreleváns tokenek whitespace-re cserélve → ugyanolyan teljesítményromlás
- Irreleváns tokenek maszkolva, modell csak a releváns tokenekre figyel → akkor is romlik
- Releváns bizonyíték közvetlenül a kérdés előtt → akkor is
Következtetés¶
A puszta input hossz önmagában károsítja a teljesítményt — függetlenül a retrieval minőségétől, a zajtól, a pozícionálástól. Ez egy eddig alulértékelt limitáció.
Mitigáció: Retrieve-then-Reason¶
1. Model kikeresi a releváns bizonyítékot a hosszú inputból
2. Model recitálja (visszamondja) a talált bizonyítékot
3. A recitált bizonyíték + kérdés → új, rövid prompt → válasz
Ez long-context → short-context transzformáció. GPT-4o-n +4% javulás RULER benchmarkon, modell-agnosztikus, egyszerű.
OpenClaw Relevancia¶
- Inbox-processor: Hosszú transcripteknél (60-90 perc) a modell először gyűjtse ki a kulcspontokat (recite), és csak utána írjon összefoglalót
- Wiki-drift-check: Nagy topic fájlok átvizsgálásánál a modell először listázza ki a potenciális problémákat, utána döntsön
- Memóriastratégia: A SOUL.md AGENTS.md SOUL.md már tartalmazza a "Quality > Quantity > Speed" elvet — ez a paper empirikus bizonyítékot ad rá
- Cron promptok: Mindenhol ahol nagy context-et kell feldolgozni → "recite-before-answer" pattern
Idézetek¶
"The sheer length of the input alone can hurt LLM performance, independent of retrieval quality and without any distraction."
"Even when a model can perfectly retrieve all the evidence — reciting all tokens with 100% exact match — its performance still degrades substantially as input length increases."
Forrás¶
arXiv:2510.05381 — https://arxiv.org/abs/2510.05381