Kihagyás

Context Length Alone Hurts LLM Performance Despite Perfect Retrieval

Szerzők: Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali, Sravan Bodapati, Aram Galstyan, Azton Wells, Roy Schwartz, Eliu A Huerta, Hao Peng (UIUC, Amazon, USC, Argonne NL, Hebrew University of Jerusalem, UChicago) Dátum: 2025 ArXiv: 2510.05381


Core Finding

A hosszú context önmagában rontja az LLM teljesítményt, akkor is ha a modell tökéletesen megtalálja a releváns információt. 13.9%–85% teljesítményromlás figyelhető meg 5 open- és closed-source LLM-en, még a modell által támogatott context limiten belül is.

Kulcs Kísérletek

Perfect Retrieval ≠ Perfect Performance

  • Llama-3.1-8B (128K context): 970/1000 MMLU problémánál tökéletes exact-match retrieval, mégis 24.2% accuracy drop a short-context esethez képest
  • Math, QA, coding taskokon is ugyanez a jelenség

A Zaj Nem Okozza

  • Irreleváns tokenek whitespace-re cserélve → ugyanolyan teljesítményromlás
  • Irreleváns tokenek maszkolva, modell csak a releváns tokenekre figyel → akkor is romlik
  • Releváns bizonyíték közvetlenül a kérdés előtt → akkor is

Következtetés

A puszta input hossz önmagában károsítja a teljesítményt — függetlenül a retrieval minőségétől, a zajtól, a pozícionálástól. Ez egy eddig alulértékelt limitáció.

Mitigáció: Retrieve-then-Reason

1. Model kikeresi a releváns bizonyítékot a hosszú inputból
2. Model recitálja (visszamondja) a talált bizonyítékot
3. A recitált bizonyíték + kérdés → új, rövid prompt → válasz

Ez long-context → short-context transzformáció. GPT-4o-n +4% javulás RULER benchmarkon, modell-agnosztikus, egyszerű.

OpenClaw Relevancia

  • Inbox-processor: Hosszú transcripteknél (60-90 perc) a modell először gyűjtse ki a kulcspontokat (recite), és csak utána írjon összefoglalót
  • Wiki-drift-check: Nagy topic fájlok átvizsgálásánál a modell először listázza ki a potenciális problémákat, utána döntsön
  • Memóriastratégia: A SOUL.md AGENTS.md SOUL.md már tartalmazza a "Quality > Quantity > Speed" elvet — ez a paper empirikus bizonyítékot ad rá
  • Cron promptok: Mindenhol ahol nagy context-et kell feldolgozni → "recite-before-answer" pattern

Idézetek

"The sheer length of the input alone can hurt LLM performance, independent of retrieval quality and without any distraction."

"Even when a model can perfectly retrieve all the evidence — reciting all tokens with 100% exact match — its performance still degrades substantially as input length increases."

Forrás

arXiv:2510.05381 — https://arxiv.org/abs/2510.05381

Vissza a tetejére