Kihagyás

The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias

Szerző: Alif Al Hasan, Case Western Reserve University Dátum: 2026-05-06 Forrás: arXiv:2605.05427 Típus: research paper Téma: AI safety, causal inference, LLM alignment, geopolitical bias


Absztrakt

A tanulmány Probabilistic Graphical Model (PGM) keretrendszert vezet be LLM-ek biztonsági mechanizmusainak kauzális auditálására. Pearl do-operátorával izolálja a demográfiai címke promptba injektálásának valódi kauzális hatását. 7 modell, 2 adatszett (ToxiGen: 250 951 prompt, BOLD: 7 201 prompt), 1,8M+ intervenciós inferencia.

Modellek: Llama-3.1-8B (USA), Gemma-2-9B (USA), Mistral-7B-v0.3 (EU), Falcon3-7B (UAE), Qwen2.5-7B (Kína), DeepSeek-7B (Kína), Airavata-7B (India).

RQ1: A biztonsági alignment geopolitikája

Az AI biztonság nem objektív standard — földrajzi konstrukció: - Nyugati modellek (Llama 3.1: 36,16% visszautasítás zsidó demográfiára; Falcon 3: 29,63%) — konzervatív, magas intervenció - Keleti modellek (Mistral: 0,06% — 10 140 toxikus promptból 7 visszautasítás; DeepSeek: ugyanaz) — permisszív, közel nulla - Kínai modelleknél a kevés guardrail lokális érzékenységet mutat: Qwen csak ázsiai/kínai demográfiáknál avatkozott be

RQ2: Túltriggerelés (over-triggering)

Konzervatív modellek sekélyes lexikális heurisztikákat használnak: - Llama 3.1 hamis pozitív arány benign promptoknál: zsidó 11,39%, latinó 8,24%, indián 1,59% - Aszimmetrikus: magas társadalmi-politikai szalienciájú csoportok aránytalanul sújtottak

RQ3: A marginalizáció hierarchiája

Háromszintű védelmi hierarchia toxikus promptoknál (Llama 3.1): - Tier 1: Zsidó 60,8%, Fekete 58,0% - Tier 2: Muszlim 43,5%, LMBTQ 39,1% - Tier 3: Testi fogyatékos 28,2%, Mentális fogyatékos 27,6%

Falcon 3: 62,4% feketékre, 8,6% mentális fogyatékosságra. Az RLHF pipeline-ok a látható csoportokra overfitteltek.

RQ4: Alignment túlkorrekció (BOLD-anomália)

Teljesen benign adatszetten Gemma-2-9B: 13,33% hamis pozitív Gender domainben (következő: 2,54%). Strukturális túloptimalizálás: a sztereotípia-generálás elkerülésére a modell megtagadja az ártalmatlan kiegészítéseket.

Esettanulmányok

  1. Llama 3.1: ellensztereotipizáló promptot is visszautasított ("crime" + "black" lexikális trigger)
  2. DeepSeek: reasoning motor racionalizálta a toxikus promptba való engedelmességet (CoT sebezhetőség)
  3. Gemma: színész életrajzi promptját tagadta meg gender-domain érzékenység miatt

Módszertan

  • Kauzális DAG: Culture (C) → Safety Outcome (S), Topic Toxicity (T) mint confounder, backdoor adjustment
  • LLM-as-Judge: Qwen2.5-32B-Instruct determinisztikus (temperature=0), kategorikus YES/NO
  • Inferencia: vLLM, A100, bfloat16, greedy decoding

Fő következtetések

  1. Kauzális inferencia elengedhetetlen AI safety audithoz — obszervációs metrikák túlbecslik a bias-t
  2. AI biztonság nem univerzális: régió-specifikus annotátori bázisok kódolják
  3. Konzervatív alignment utility-fairness trade-off: biztonság marginalizált diskurzus árán
  4. Kevésbé látható kisebbségek (fogyatékos közösségek) szisztematikusan alulvédettek
  5. Reasoning modellek új sebezhetőség: CoT racionalizálja a toxikus engedelmességet
Vissza a tetejére