The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias¶
Szerző: Alif Al Hasan, Case Western Reserve University Dátum: 2026. május 6. Forrás: arXiv:2605.05427 Státusz: preprint
Absztrakt¶
A tanulmány egy Probabilistic Graphical Model (PGM) keretrendszert vezet be az LLM-ek biztonsági mechanizmusainak kauzális auditálására. Pearl do-operátorával izolálja a demográfiai címke promptba injektálásának valódi kauzális hatását. Hét modellt vizsgált két adatszettel (ToxiGen: 250 951 prompt, BOLD: 7 201 prompt), összesen 1,8 millió intervenciós inferencia felett.
Modellek régió szerint: | Régió | Modellek | |--------|----------| | 🇺🇸 USA | Llama-3.1-8B, Gemma-2-9B | | 🇪🇺 Európa | Mistral-7B-v0.3 | | 🇦🇪 UAE | Falcon3-7B | | 🇨🇳 Kína | Qwen2.5-7B, DeepSeek-7B | | 🇮🇳 India | Airavata-7B |
Kulcseredmények¶
RQ1: A biztonsági igazodás geopolitikája¶
A biztonsági alignment nem objektív standard — földrajzi konstrukció:
- Nyugati/közel-keleti modellek (Llama, Falcon): konzervatív, magas visszautasítási arány
- Llama 3.1: 36,16% kauzális visszautasítás zsidó demográfiára
- Falcon 3: 29,63% ugyanerre
- Keleti modellek (DeepSeek, Qwen, Mistral): permisszív, közel nulla visszautasítás
- Mistral: 10 140 ázsiai-ellenes toxikus promptból mindössze 7 visszautasítás (0,06%)
- DeepSeek: ugyanaz, 7 visszautasítás
- A kínai modelleknél a kevés aktivált guardrail lokális érzékenységet mutat: Qwen kizárólag ázsiai és kínai demográfiáknál avatkozott be, mentális fogyatékosságra nulla
RQ2: Túltriggerelés és diskurzus-törlés¶
A konzervatív modellek sekélyes lexikális heurisztikákat használnak mély szemantikai megértés helyett:
| Demográfia | Llama 3.1 hamis pozitív (benign promptok) |
|---|---|
| Zsidó | 11,39% (1 136 / 9 971) |
| Latinó | 8,24% (734 / 8 907) |
| Indián | 1,59% (151 / 9 480) |
A szórás aszimmetrikus: a magas társadalmi-politikai szalienciával bíró csoportokat aránytalanul sújtja a hamis pozitív cenzúra.
RQ3: A marginalizáció hierarchiája¶
A modellek háromszintű védelmi hierarchiát mutatnak toxikus promptoknál:
| Tier | Demográfia | Llama 3.1 visszautasítás |
|---|---|---|
| 1. szint | Zsidó | 60,8% |
| 1. szint | Fekete | 58,0% |
| 2. szint | Muszlim | 43,5% |
| 2. szint | LMBTQ | 39,1% |
| 3. szint | Testi fogyatékos | 28,2% |
| 3. szint | Mentális fogyatékos | 27,6% |
Falcon 3: 62,4% feketékre, de csak 8,6% mentális fogyatékosságra. Az RLHF pipeline-ok a nagy társadalmi-politikai szalienciájú csoportokra overfitteltek, a kevésbé látható csoportokat védtelenül hagyva.
RQ4: A BOLD-anomália — alignment túlkorrekció¶
A teljesen benign, enciklopédikus BOLD adatszetten:
- Gemma-2-9B: 13,33% hamis pozitív a Gender domainben, 6,70% a Race domainben
- A következő legmagasabb (Airavata): mindössze 2,54%
- Ez strukturális túloptimalizálás: a sztereotípiák generálásának elkerülése érdekében a modell generatív elkerülésbe menekül, megtagadva ártalmatlan életrajzi kiegészítéseket
Esettanulmányok¶
1. Lexikális túltriggerelés (Llama 3.1): A prompt expliciten ellensztereotipizáló volt ("nem lehet az egész csoportot hibáztatni"), de a "crime" + "black" lexikális együttállás determinisztikus visszautasítást váltott ki — a modell a counterspeech-et is cenzúrázza.
2. Racionalizált toxikus engedelmesség (DeepSeek): A reasoning modell a nyíltan rasszista promptot legitim szociológiai premisszaként kezelte, a chain-of-thought-ban "árnyalt kontextust" alkalmazva — a guardrail nélküli reasoning motor aktívan racionalizálja a toxikus bemenetnek való engedelmességet.
3. Domain-specifikus törlés (Gemma): Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta, mert a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.
Módszertan¶
- Kauzális DAG: Culture (C) → Safety Outcome (S), Topic Toxicity (T) mint keverő változó (confounder), backdoor kiigazítással
- LLM-as-a-Judge: Qwen2.5-32B-Instruct determinisztikus osztályozó (temperature=0, max_tokens=5), kategorikus IGEN/NEM
- Inferencia: vLLM, A100 GPU, bfloat16, greedy decoding (temperature=0.0)
Implikációk¶
- Kauzális inferencia elengedhetetlen az AI biztonság auditálásához — az obszervációs metrikák rendszeresen túlbecslik a demográfiai torzítást
- Az AI biztonság nem univerzális — régió-specifikus érdekek és annotátori bázisok kódolják
- A konzervatív alignment utility-fairness trade-offot hoz létre: biztonság a marginalizált diskurzus korlátozása árán
- A kevésbé látható kisebbségek (fogyatékos közösségek) szisztematikusan alulvédettek
- Reasoning modellek új sebezhetőséget hoznak: a CoT racionalizálja a toxikus engedelmességet
Korlátok¶
- Csak egyetlen confoundert (Topic Toxicity) modellez a DAG
- A ToxiGen szintetikus eloszlás — valós interakciókban további látens változók (szintaktikai komplexitás, pragmatikai szándék, szociolektus) is hatnak