Why Language Models Hallucinate¶
Szerzők: Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang Dátum: 2025-09-04 arXiv: 2509.04664v1
Absztrakt¶
A tanulmány megmagyarázza, miért hallucinálnak az LLM-ek még a legmodernebb rendszerekben is. A válasz nem misztikus — a hallucináció egyszerűen bináris osztályozási hiba, ami a pretraining és post-training statisztikai nyomásaiból ered.
Pretraining: A Hallucináció Eredete¶
Is-It-Valid (IIV) Redukció¶
A kulcsfelismerés: valid kimenet generálása nehezebb, mint valid/nem-valid osztályozás.
Minden LM használható IIV osztályozóként: thresholdáljuk a valószínűséget, és ha p(x) > 1/|E|, akkor validnek jelöljük.
Következmény:
Ez azt jelenti, hogy minden osztályozási hiba átragad a generálásra.
Singleton Rate Alsó Korlát¶
Ha egy tény egyszer szerepel a tréningben (singleton), az LM hallucinálni fog rá.
Definíció: sr = singleton rate = egyszer szereplő tények aránya
Tétel:
Példa: Ha 20% singleton rate, akkor legalább 20% hallucination rate.
Miért Kalibrált LM-ek Hallucinálnak?¶
A cross-entropy loss miatt:
A kalibráció (δ kicsi) a pretraining természetes következménye. De a kalibrált LM kötelezően hallucinál — ha nem hallucinálna, nem lenne kalibrált.
Ellenpélda: A mindig "IDK" választó modul sosem hallucinál, de rossz sűrűségbecslő.
Post-training: Miért Marad a Hallucináció?¶
Bináris Értékelések Bűne¶
A mainstream benchmarkok mind bináris pontozást használnak: - Accuracy (helyes = 1, helytelen = 0) - Pass rate - Exact match
Ez optimalizálja a találgatást: - Helytelen válasz: 0 pont - IDK (bizonytalan): 0 pont - Helyes válasz: 1 pont
Ha 25% esélyed van találgatni helyeset, a találgatás jobb, mint IDK!
Teszt-Vevő Mód¶
Az LLM-ek "mindig tesztelés alatt vannak" — nincs "school of hard knocks" ahol megtanulnák a bizonytalanság értékét.
Példa: Diákok multiple choice teszten — találgatnak, ha bizonytalanok.
Mainstream Benchmarkok¶
| Benchmark | Pontozás | IDK büntetés? |
|---|---|---|
| GPQA | Accuracy | Igen (0 pont) |
| MMLU-Pro | Accuracy | Igen |
| BigBench Hard | Exact match | Igen |
| SWE-bench | Accuracy | Igen |
| Humanity's Last Exam | Accuracy | Igen |
| MATH Level-5 | Accuracy | Igen |
Mindegyik bináris. Egyetlen mainstream sem ad kreditet a bizonytalanság kifejezéséért.
Megoldás¶
Amit Nem Működik¶
- Több hallucináció benchmark — ezek nem jutnak el a leaderboardokra
- Calibration error metrika — nem mér közvetlenül hallucinációt (kalibrált LM is hallucinálhat)
Ami Működik¶
Existáló értékelések módosítása:
Ezzel a bizonytalan válasz (IDK) jobb, mint a rossz találgatás.
Viselkedési kalibráció: Minden confidence threshold-re optimális viselkedés — nem csak a maximum likelihood.
Gyakorlati Tanulságok¶
Mikor Hallucinál Egy LM?¶
- Epistemikus bizonytalanság — nincs minta az adatban (születésnapok)
- Rossz modell — a modellcsalád nem tudja reprezentálni a konceptust (betűszámolás)
- GIGO — tréning adat hibás (összeesküvés elméletek)
Mire Figyelni?¶
- Singleton rate — gyakori tények OK, ritkák hallucináció-veszélyes
- Kalibráció — a jól kalibrált LM-ek többet hallucinálnak
- Post-training — RLHF/DPO nem oldja meg, sőt ronthat
Kapcsolódó témák¶
- ai-automation — AI megbízhatóság
- privacy-tech — AI profilozás, bizalom
- llm-supply-chain — API router támadások, megbízhatóság
Hivatkozások¶
- Kalai & Vempala (2024): Good-Turing és hallucináció
- Good (1953): Turing missing mass estimator
- NIST IR 8547: Post-quantum migration (nem direkt, de calibration párhuzam)