Kihagyás

Why Language Models Hallucinate

Szerzők: Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang Dátum: 2025-09-04 arXiv: 2509.04664v1

Absztrakt

A tanulmány megmagyarázza, miért hallucinálnak az LLM-ek még a legmodernebb rendszerekben is. A válasz nem misztikus — a hallucináció egyszerűen bináris osztályozási hiba, ami a pretraining és post-training statisztikai nyomásaiból ered.

Pretraining: A Hallucináció Eredete

Is-It-Valid (IIV) Redukció

A kulcsfelismerés: valid kimenet generálása nehezebb, mint valid/nem-valid osztályozás.

Minden LM használható IIV osztályozóként: thresholdáljuk a valószínűséget, és ha p(x) > 1/|E|, akkor validnek jelöljük.

Következmény:

(generative error rate) ≥ 2 × (IIV misclassification rate)

Ez azt jelenti, hogy minden osztályozási hiba átragad a generálásra.

Singleton Rate Alsó Korlát

Ha egy tény egyszer szerepel a tréningben (singleton), az LM hallucinálni fog rá.

Definíció: sr = singleton rate = egyszer szereplő tények aránya

Tétel:

err ≥ sr - 2/|E| - O(1/√N) - δ

Példa: Ha 20% singleton rate, akkor legalább 20% hallucination rate.

Miért Kalibrált LM-ek Hallucinálnak?

A cross-entropy loss miatt:

L(p̂) = E[-log p̂(x)]

A kalibráció (δ kicsi) a pretraining természetes következménye. De a kalibrált LM kötelezően hallucinál — ha nem hallucinálna, nem lenne kalibrált.

Ellenpélda: A mindig "IDK" választó modul sosem hallucinál, de rossz sűrűségbecslő.

Post-training: Miért Marad a Hallucináció?

Bináris Értékelések Bűne

A mainstream benchmarkok mind bináris pontozást használnak: - Accuracy (helyes = 1, helytelen = 0) - Pass rate - Exact match

Ez optimalizálja a találgatást: - Helytelen válasz: 0 pont - IDK (bizonytalan): 0 pont - Helyes válasz: 1 pont

Ha 25% esélyed van találgatni helyeset, a találgatás jobb, mint IDK!

Teszt-Vevő Mód

Az LLM-ek "mindig tesztelés alatt vannak" — nincs "school of hard knocks" ahol megtanulnák a bizonytalanság értékét.

Példa: Diákok multiple choice teszten — találgatnak, ha bizonytalanok.

Mainstream Benchmarkok

Benchmark Pontozás IDK büntetés?
GPQA Accuracy Igen (0 pont)
MMLU-Pro Accuracy Igen
BigBench Hard Exact match Igen
SWE-bench Accuracy Igen
Humanity's Last Exam Accuracy Igen
MATH Level-5 Accuracy Igen

Mindegyik bináris. Egyetlen mainstream sem ad kreditet a bizonytalanság kifejezéséért.

Megoldás

Amit Nem Működik

  1. Több hallucináció benchmark — ezek nem jutnak el a leaderboardokra
  2. Calibration error metrika — nem mér közvetlenül hallucinációt (kalibrált LM is hallucinálhat)

Ami Működik

Existáló értékelések módosítása:

Scoring:
- Helyes válasz: +1 pont
- Helytelen válasz: -1 pont
- IDK (bizonytalan): 0 pont

Ezzel a bizonytalan válasz (IDK) jobb, mint a rossz találgatás.

Viselkedési kalibráció: Minden confidence threshold-re optimális viselkedés — nem csak a maximum likelihood.

Gyakorlati Tanulságok

Mikor Hallucinál Egy LM?

  1. Epistemikus bizonytalanság — nincs minta az adatban (születésnapok)
  2. Rossz modell — a modellcsalád nem tudja reprezentálni a konceptust (betűszámolás)
  3. GIGO — tréning adat hibás (összeesküvés elméletek)

Mire Figyelni?

  • Singleton rate — gyakori tények OK, ritkák hallucináció-veszélyes
  • Kalibráció — a jól kalibrált LM-ek többet hallucinálnak
  • Post-training — RLHF/DPO nem oldja meg, sőt ronthat

Kapcsolódó témák

  • ai-automation — AI megbízhatóság
  • privacy-tech — AI profilozás, bizalom
  • llm-supply-chain — API router támadások, megbízhatóság

Hivatkozások

  • Kalai & Vempala (2024): Good-Turing és hallucináció
  • Good (1953): Turing missing mass estimator
  • NIST IR 8547: Post-quantum migration (nem direkt, de calibration párhuzam)
Vissza a tetejére