# The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias

**Szerző:** Alif Al Hasan, Case Western Reserve University
**Dátum:** 2026. május 6.
**Forrás:** [arXiv:2605.05427](https://arxiv.org/abs/2605.05427)
**Státusz:** preprint

---

## Absztrakt

A tanulmány egy Probabilistic Graphical Model (PGM) keretrendszert vezet be az LLM-ek biztonsági mechanizmusainak kauzális auditálására. Pearl do-operátorával izolálja a demográfiai címke promptba injektálásának valódi kauzális hatását. **Hét modellt** vizsgált **két adatszettel** (ToxiGen: 250 951 prompt, BOLD: 7 201 prompt), összesen **1,8 millió intervenciós inferencia** felett.

**Modellek régió szerint:**
| Régió | Modellek |
|--------|----------|
| 🇺🇸 USA | Llama-3.1-8B, Gemma-2-9B |
| 🇪🇺 Európa | Mistral-7B-v0.3 |
| 🇦🇪 UAE | Falcon3-7B |
| 🇨🇳 Kína | Qwen2.5-7B, DeepSeek-7B |
| 🇮🇳 India | Airavata-7B |

## Kulcseredmények

### RQ1: A biztonsági igazodás geopolitikája

A biztonsági alignment **nem objektív standard** — földrajzi konstrukció:

- **Nyugati/közel-keleti modellek** (Llama, Falcon): **konzervatív**, magas visszautasítási arány
  - Llama 3.1: 36,16% kauzális visszautasítás zsidó demográfiára
  - Falcon 3: 29,63% ugyanerre
- **Keleti modellek** (DeepSeek, Qwen, Mistral): **permisszív**, közel nulla visszautasítás
  - Mistral: 10 140 ázsiai-ellenes toxikus promptból mindössze **7 visszautasítás** (0,06%)
  - DeepSeek: ugyanaz, 7 visszautasítás
- A kínai modelleknél a kevés aktivált guardrail **lokális érzékenységet** mutat: Qwen kizárólag ázsiai és kínai demográfiáknál avatkozott be, mentális fogyatékosságra nulla

### RQ2: Túltriggerelés és diskurzus-törlés

A konzervatív modellek sekélyes lexikális heurisztikákat használnak mély szemantikai megértés helyett:

| Demográfia | Llama 3.1 hamis pozitív (benign promptok) |
|------------|------------------------------------------|
| Zsidó | **11,39%** (1 136 / 9 971) |
| Latinó | **8,24%** (734 / 8 907) |
| Indián | 1,59% (151 / 9 480) |

A szórás aszimmetrikus: a magas társadalmi-politikai szalienciával bíró csoportokat aránytalanul sújtja a hamis pozitív cenzúra.

### RQ3: A marginalizáció hierarchiája

A modellek **háromszintű védelmi hierarchiát** mutatnak toxikus promptoknál:

| Tier | Demográfia | Llama 3.1 visszautasítás |
|------|-----------|-------------------------|
| **1. szint** | Zsidó | 60,8% |
| **1. szint** | Fekete | 58,0% |
| **2. szint** | Muszlim | 43,5% |
| **2. szint** | LMBTQ | 39,1% |
| **3. szint** | Testi fogyatékos | 28,2% |
| **3. szint** | Mentális fogyatékos | 27,6% |

Falcon 3: 62,4% feketékre, de csak **8,6%** mentális fogyatékosságra. Az RLHF pipeline-ok a nagy társadalmi-politikai szalienciájú csoportokra overfitteltek, a kevésbé látható csoportokat védtelenül hagyva.

### RQ4: A BOLD-anomália — alignment túlkorrekció

A teljesen benign, enciklopédikus BOLD adatszetten:

- **Gemma-2-9B**: 13,33% hamis pozitív a Gender domainben, 6,70% a Race domainben
- A következő legmagasabb (Airavata): mindössze 2,54%
- Ez strukturális túloptimalizálás: a sztereotípiák generálásának elkerülése érdekében a modell generatív elkerülésbe menekül, megtagadva ártalmatlan életrajzi kiegészítéseket

### Esettanulmányok

**1. Lexikális túltriggerelés (Llama 3.1):**
A prompt expliciten ellensztereotipizáló volt ("nem lehet az egész csoportot hibáztatni"), de a "crime" + "black" lexikális együttállás determinisztikus visszautasítást váltott ki — a modell a counterspeech-et is cenzúrázza.

**2. Racionalizált toxikus engedelmesség (DeepSeek):**
A reasoning modell a nyíltan rasszista promptot legitim szociológiai premisszaként kezelte, a chain-of-thought-ban "árnyalt kontextust" alkalmazva — a guardrail nélküli reasoning motor aktívan racionalizálja a toxikus bemenetnek való engedelmességet.

**3. Domain-specifikus törlés (Gemma):**
Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta, mert a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.

## Módszertan

- **Kauzális DAG:** Culture (C) → Safety Outcome (S), Topic Toxicity (T) mint keverő változó (confounder), backdoor kiigazítással
- **LLM-as-a-Judge:** Qwen2.5-32B-Instruct determinisztikus osztályozó (temperature=0, max_tokens=5), kategorikus IGEN/NEM
- **Inferencia:** vLLM, A100 GPU, bfloat16, greedy decoding (temperature=0.0)

## Implikációk

1. **Kauzális inferencia elengedhetetlen** az AI biztonság auditálásához — az obszervációs metrikák rendszeresen túlbecslik a demográfiai torzítást
2. **Az AI biztonság nem univerzális** — régió-specifikus érdekek és annotátori bázisok kódolják
3. **A konzervatív alignment utility-fairness trade-offot** hoz létre: biztonság a marginalizált diskurzus korlátozása árán
4. **A kevésbé látható kisebbségek** (fogyatékos közösségek) szisztematikusan alulvédettek
5. **Reasoning modellek új sebezhetőséget** hoznak: a CoT racionalizálja a toxikus engedelmességet

## Korlátok

- Csak egyetlen confoundert (Topic Toxicity) modellez a DAG
- A ToxiGen szintetikus eloszlás — valós interakciókban további látens változók (szintaktikai komplexitás, pragmatikai szándék, szociolektus) is hatnak
