The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias¶
Szerző: Alif Al Hasan, Case Western Reserve University Dátum: 2026-05-06 Forrás: arXiv:2605.05427 Típus: research paper Téma: AI safety, causal inference, LLM alignment, geopolitical bias
Absztrakt¶
A tanulmány Probabilistic Graphical Model (PGM) keretrendszert vezet be LLM-ek biztonsági mechanizmusainak kauzális auditálására. Pearl do-operátorával izolálja a demográfiai címke promptba injektálásának valódi kauzális hatását. 7 modell, 2 adatszett (ToxiGen: 250 951 prompt, BOLD: 7 201 prompt), 1,8M+ intervenciós inferencia.
Modellek: Llama-3.1-8B (USA), Gemma-2-9B (USA), Mistral-7B-v0.3 (EU), Falcon3-7B (UAE), Qwen2.5-7B (Kína), DeepSeek-7B (Kína), Airavata-7B (India).
RQ1: A biztonsági alignment geopolitikája¶
Az AI biztonság nem objektív standard — földrajzi konstrukció: - Nyugati modellek (Llama 3.1: 36,16% visszautasítás zsidó demográfiára; Falcon 3: 29,63%) — konzervatív, magas intervenció - Keleti modellek (Mistral: 0,06% — 10 140 toxikus promptból 7 visszautasítás; DeepSeek: ugyanaz) — permisszív, közel nulla - Kínai modelleknél a kevés guardrail lokális érzékenységet mutat: Qwen csak ázsiai/kínai demográfiáknál avatkozott be
RQ2: Túltriggerelés (over-triggering)¶
Konzervatív modellek sekélyes lexikális heurisztikákat használnak: - Llama 3.1 hamis pozitív arány benign promptoknál: zsidó 11,39%, latinó 8,24%, indián 1,59% - Aszimmetrikus: magas társadalmi-politikai szalienciájú csoportok aránytalanul sújtottak
RQ3: A marginalizáció hierarchiája¶
Háromszintű védelmi hierarchia toxikus promptoknál (Llama 3.1): - Tier 1: Zsidó 60,8%, Fekete 58,0% - Tier 2: Muszlim 43,5%, LMBTQ 39,1% - Tier 3: Testi fogyatékos 28,2%, Mentális fogyatékos 27,6%
Falcon 3: 62,4% feketékre, 8,6% mentális fogyatékosságra. Az RLHF pipeline-ok a látható csoportokra overfitteltek.
RQ4: Alignment túlkorrekció (BOLD-anomália)¶
Teljesen benign adatszetten Gemma-2-9B: 13,33% hamis pozitív Gender domainben (következő: 2,54%). Strukturális túloptimalizálás: a sztereotípia-generálás elkerülésére a modell megtagadja az ártalmatlan kiegészítéseket.
Esettanulmányok¶
- Llama 3.1: ellensztereotipizáló promptot is visszautasított ("crime" + "black" lexikális trigger)
- DeepSeek: reasoning motor racionalizálta a toxikus promptba való engedelmességet (CoT sebezhetőség)
- Gemma: színész életrajzi promptját tagadta meg gender-domain érzékenység miatt
Módszertan¶
- Kauzális DAG: Culture (C) → Safety Outcome (S), Topic Toxicity (T) mint confounder, backdoor adjustment
- LLM-as-Judge: Qwen2.5-32B-Instruct determinisztikus (temperature=0), kategorikus YES/NO
- Inferencia: vLLM, A100, bfloat16, greedy decoding
Fő következtetések¶
- Kauzális inferencia elengedhetetlen AI safety audithoz — obszervációs metrikák túlbecslik a bias-t
- AI biztonság nem univerzális: régió-specifikus annotátori bázisok kódolják
- Konzervatív alignment utility-fairness trade-off: biztonság marginalizált diskurzus árán
- Kevésbé látható kisebbségek (fogyatékos közösségek) szisztematikusan alulvédettek
- Reasoning modellek új sebezhetőség: CoT racionalizálja a toxikus engedelmességet