AI Safety Geopolitikája — Kauzális LLM Bias Elemzés
Az LLM-ek biztonsági mechanizmusai nem univerzálisak. A fejlesztő régiótól függően gyökeresen eltérő definíciói vannak a "biztonságos" viselkedésnek — ezt a jelenséget Alif Al Hasan (Case Western Reserve) kauzális keretrendszerben számszerűsítette.
A probléma¶
A hagyományos fairness auditok obszervációsak: azt mérik, hogy a visszautasítási arány statisztikailag egyenlő-e demográfiai csoportok között. Ennek strukturális hibája: a tesztadatszetekben a toxikus témák statisztikailag együttjárnak bizonyos demográfiákkal — a modell jogosan utasít vissza egy toxikus promptot, de az obszervációs metrika ezt demográfiai bias-ként könyveli el.
Confounder: Topic Toxicity (T) hat a Culture-re (C) és a Safety Outcome-re (S) is → C ← T → S backdoor útvonal
Kauzális megoldás¶
Pearl do-operátora matematikailag neutralizálja a confoundert:
P(Refusal | do(Demographic)) — a valódi kauzális hatás, megtisztítva a dataset toxicitás zajától
Ez backdoor adjustment-tel számolható: az obszervációs eloszlás súlyozása a confounder eloszlásával.
Eredmények¶
RQ1: Geopolitikai alignment paradigmák¶
Nyugati modellek: ████████████ (konzervatív, magas intervenció)
Keleti modellek: ██░░░░░░░░░░ (permisszív, közel nulla intervenció)
- Llama 3.1 (USA): 36,16% kauzális visszautasítás zsidó demográfiára
- Mistral (EU): 0,06% — 10 140 toxikus promptból 7 visszautasítás
- Qwen (Kína): a kevés guardrail aktiváció kizárólag ázsiai/kínai demográfiáknál
→ A biztonság definíciója nem technikai, hanem politikai választás
RQ2: Over-triggering → diskurzus-törlés¶
A konzervatív modellek nem szemantikát, hanem lexikális triggereket használnak:
| Csoport | Llama 3.1 hamis pozitív (benign) |
|---|---|
| Zsidó | 11,39% |
| Latinó | 8,24% |
| Indián | 1,59% |
→ A magas társadalmi-politikai szalienciájú csoportok ártalmatlan diskurzusa aránytalanul cenzúrázott
RQ3: A marginalizáció hierarchiája¶
A védelmi guardrail-ek nem egyformák — háromszintű hierarchia:
| Tier | Demográfia | Llama 3.1 visszautasítás (toxikus) |
|---|---|---|
| 1. | Zsidó, Fekete | ~60% |
| 2. | Muszlim, LMBTQ | ~40% |
| 3. | Testi/mentális fogyatékos | ~28% |
Falcon 3: 62,4% feketékre → 8,6% mentális fogyatékosságra
→ Az RLHF annotátori bázis a "látható" csoportokra overfittelt, a fogyatékos közösségek szisztematikusan védtelenek
RQ4: Alignment túlkorrekció¶
A Gemma-2-9B teljesen benign életrajzi promptoknál is interveniál: 13,33% hamis pozitív Gender domainben. A következő legmagasabb: 2,54%. Ez a zéró-kockázat biztonsági küszöb strukturális túloptimalizálása — a modell használhatatlanná válik, hogy véletlenül se generáljon sztereotípiát.
Esettanulmányok¶
1. Counterspeech cenzúrázása (Llama 3.1)¶
A prompt expliciten ellensztereotipizáló volt ("nem lehet az egész csoportot hibáztatni"), de a "crime" + "black" lexikális trigger determinisztikus visszautasítást váltott ki. A modell a rasszizmus elleni beszédet is cenzúrázza.
2. Toxikus racionalizálás (DeepSeek)¶
A reasoning modell egy nyíltan rasszista promptot legitim szociológiai premisszaként kezelt. A chain-of-thought "árnyalt kontextust" alkalmazott rá, ahelyett hogy visszautasította volna.
⚠️ Reasoning modellek új sebezhetősége: a CoT motor guardrail nélkül racionalizálja a toxikus bemenetet
3. Domain-törlés (Gemma)¶
Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta — a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.
Módszertan¶
- Causal DAG: 3 node-os Discrete Bayesian Network (Culture, Topic Toxicity, Safety Outcome)
- LLM-as-Judge: Qwen2.5-32B-Instruct, temperature=0, max_tokens=5, kategorikus YES/NO
- Inferencia: vLLM, A100 GPU, bfloat16, greedy decoding
- Skála: 258 152 prompt × 7 modell = 1,8M+ intervenciós inferencia
Implikációk¶
- Kauzális inferencia elengedhetetlen — obszervációs metrikák rendszeresen túlbecslik a demográfiai bias-t
- AI safety = geopolitika, nem technológia — a fejlesztő régió annotátori bázisa kódolja a "biztonság" definícióját
- Utility-fairness trade-off: konzervatív alignment → biztonság a marginalizált diskurzus korlátozása árán
- Láthatatlan kisebbségek védtelenek: az RLHF a társadalmilag szaliens csoportokra optimalizál
- Reasoning modellek CoT sebezhetősége: a reasoning képesség önmagában nem helyettesíti a guardrail-eket
Kapcsolódó fogalmak¶
- AI & Automatizálás (ai-automation)
- Szoftvermérnöki Törvények (software-engineering-laws) — Goodhart törvénye: ha a fairness metrikát optimalizálod, az megszűnik fairness-t mérni
- A cognitive offloading kockázata: ha a biztonsági döntéseket LLM-ekre delegálod, a felügyeleti képesség sorvad
Forrás¶
- The Geopolitics of AI Safety (The Geopolitics of AI Safety) — Alif Al Hasan, arXiv:2605.05427, 2026-05-06