---
title: "Why Language Models Hallucinate"
source: "https://arxiv.org/abs/2509.04664v1"
type: papers
ingested: 2026-04-11
tags: [paper, hallucination, llm, calibration, binary-classification, evaluation, pretraining]
summary: "Formális analízis: az LLM hallucinációk oka nem misztikus, hanem a pretraining statisztikai nyomása és a post-training bináris értékelések kombinációja. A hallucináció = osztályozási hiba, és a singleton rate alsó korlátot ad."
---

# Why Language Models Hallucinate

**Szerzők:** Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang
**Dátum:** 2025-09-04
**arXiv:** 2509.04664v1

## Absztrakt

A tanulmány megmagyarázza, miért hallucinálnak az LLM-ek még a legmodernebb rendszerekben is. A válasz nem misztikus — a hallucináció egyszerűen bináris osztályozási hiba, ami a pretraining és post-training statisztikai nyomásaiból ered.

## Pretraining: A Hallucináció Eredete

### Is-It-Valid (IIV) Redukció

A kulcsfelismerés: **valid kimenet generálása nehezebb, mint valid/nem-valid osztályozás.**

Minden LM használható IIV osztályozóként: thresholdáljuk a valószínűséget, és ha `p(x) > 1/|E|`, akkor validnek jelöljük.

**Következmény:**
```
(generative error rate) ≥ 2 × (IIV misclassification rate)
```

Ez azt jelenti, hogy minden osztályozási hiba átragad a generálásra.

### Singleton Rate Alsó Korlát

Ha egy tény egyszer szerepel a tréningben (singleton), az LM hallucinálni fog rá.

**Definíció:** `sr = singleton rate = egyszer szereplő tények aránya`

**Tétel:**
```
err ≥ sr - 2/|E| - O(1/√N) - δ
```

Példa: Ha 20% singleton rate, akkor legalább 20% hallucination rate.

### Miért Kalibrált LM-ek Hallucinálnak?

A cross-entropy loss miatt:
```
L(p̂) = E[-log p̂(x)]
```

A kalibráció (`δ` kicsi) a pretraining természetes következménye. De a kalibrált LM kötelezően hallucinál — ha nem hallucinálna, nem lenne kalibrált.

**Ellenpélda:** A mindig "IDK" választó modul sosem hallucinál, de rossz sűrűségbecslő.

## Post-training: Miért Marad a Hallucináció?

### Bináris Értékelések Bűne

A mainstream benchmarkok mind bináris pontozást használnak:
- Accuracy (helyes = 1, helytelen = 0)
- Pass rate
- Exact match

**Ez optimalizálja a találgatást:**
- Helytelen válasz: 0 pont
- IDK (bizonytalan): 0 pont
- Helyes válasz: 1 pont

Ha 25% esélyed van találgatni helyeset, a találgatás jobb, mint IDK!

### Teszt-Vevő Mód

Az LLM-ek "mindig tesztelés alatt vannak" — nincs "school of hard knocks" ahol megtanulnák a bizonytalanság értékét.

**Példa:** Diákok multiple choice teszten — találgatnak, ha bizonytalanok.

### Mainstream Benchmarkok

| Benchmark | Pontozás | IDK büntetés? |
|-----------|----------|---------------|
| GPQA | Accuracy | Igen (0 pont) |
| MMLU-Pro | Accuracy | Igen |
| BigBench Hard | Exact match | Igen |
| SWE-bench | Accuracy | Igen |
| Humanity's Last Exam | Accuracy | Igen |
| MATH Level-5 | Accuracy | Igen |

**Mindegyik bináris.** Egyetlen mainstream sem ad kreditet a bizonytalanság kifejezéséért.

## Megoldás

### Amit Nem Működik

1. **Több hallucináció benchmark** — ezek nem jutnak el a leaderboardokra
2. **Calibration error metrika** — nem mér közvetlenül hallucinációt (kalibrált LM is hallucinálhat)

### Ami Működik

**Existáló értékelések módosítása:**

```
Scoring:
- Helyes válasz: +1 pont
- Helytelen válasz: -1 pont
- IDK (bizonytalan): 0 pont
```

Ezzel a bizonytalan válasz (IDK) jobb, mint a rossz találgatás.

**Viselkedési kalibráció:** Minden confidence threshold-re optimális viselkedés — nem csak a maximum likelihood.

## Gyakorlati Tanulságok

### Mikor Hallucinál Egy LM?

1. **Epistemikus bizonytalanság** — nincs minta az adatban (születésnapok)
2. **Rossz modell** — a modellcsalád nem tudja reprezentálni a konceptust (betűszámolás)
3. **GIGO** — tréning adat hibás (összeesküvés elméletek)

### Mire Figyelni?

- **Singleton rate** — gyakori tények OK, ritkák hallucináció-veszélyes
- **Kalibráció** — a jól kalibrált LM-ek többet hallucinálnak
- **Post-training** — RLHF/DPO nem oldja meg, sőt ronthat

## Kapcsolódó témák

- ai-automation — AI megbízhatóság
- privacy-tech — AI profilozás, bizalom
- llm-supply-chain — API router támadások, megbízhatóság

## Hivatkozások

- Kalai & Vempala (2024): Good-Turing és hallucináció
- Good (1953): Turing missing mass estimator
- NIST IR 8547: Post-quantum migration (nem direkt, de calibration párhuzam)