Kihagyás

The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias

Szerző: Alif Al Hasan, Case Western Reserve University Dátum: 2026. május 6. Forrás: arXiv:2605.05427 Státusz: preprint


Absztrakt

A tanulmány egy Probabilistic Graphical Model (PGM) keretrendszert vezet be az LLM-ek biztonsági mechanizmusainak kauzális auditálására. Pearl do-operátorával izolálja a demográfiai címke promptba injektálásának valódi kauzális hatását. Hét modellt vizsgált két adatszettel (ToxiGen: 250 951 prompt, BOLD: 7 201 prompt), összesen 1,8 millió intervenciós inferencia felett.

Modellek régió szerint: | Régió | Modellek | |--------|----------| | 🇺🇸 USA | Llama-3.1-8B, Gemma-2-9B | | 🇪🇺 Európa | Mistral-7B-v0.3 | | 🇦🇪 UAE | Falcon3-7B | | 🇨🇳 Kína | Qwen2.5-7B, DeepSeek-7B | | 🇮🇳 India | Airavata-7B |

Kulcseredmények

RQ1: A biztonsági igazodás geopolitikája

A biztonsági alignment nem objektív standard — földrajzi konstrukció:

  • Nyugati/közel-keleti modellek (Llama, Falcon): konzervatív, magas visszautasítási arány
  • Llama 3.1: 36,16% kauzális visszautasítás zsidó demográfiára
  • Falcon 3: 29,63% ugyanerre
  • Keleti modellek (DeepSeek, Qwen, Mistral): permisszív, közel nulla visszautasítás
  • Mistral: 10 140 ázsiai-ellenes toxikus promptból mindössze 7 visszautasítás (0,06%)
  • DeepSeek: ugyanaz, 7 visszautasítás
  • A kínai modelleknél a kevés aktivált guardrail lokális érzékenységet mutat: Qwen kizárólag ázsiai és kínai demográfiáknál avatkozott be, mentális fogyatékosságra nulla

RQ2: Túltriggerelés és diskurzus-törlés

A konzervatív modellek sekélyes lexikális heurisztikákat használnak mély szemantikai megértés helyett:

Demográfia Llama 3.1 hamis pozitív (benign promptok)
Zsidó 11,39% (1 136 / 9 971)
Latinó 8,24% (734 / 8 907)
Indián 1,59% (151 / 9 480)

A szórás aszimmetrikus: a magas társadalmi-politikai szalienciával bíró csoportokat aránytalanul sújtja a hamis pozitív cenzúra.

RQ3: A marginalizáció hierarchiája

A modellek háromszintű védelmi hierarchiát mutatnak toxikus promptoknál:

Tier Demográfia Llama 3.1 visszautasítás
1. szint Zsidó 60,8%
1. szint Fekete 58,0%
2. szint Muszlim 43,5%
2. szint LMBTQ 39,1%
3. szint Testi fogyatékos 28,2%
3. szint Mentális fogyatékos 27,6%

Falcon 3: 62,4% feketékre, de csak 8,6% mentális fogyatékosságra. Az RLHF pipeline-ok a nagy társadalmi-politikai szalienciájú csoportokra overfitteltek, a kevésbé látható csoportokat védtelenül hagyva.

RQ4: A BOLD-anomália — alignment túlkorrekció

A teljesen benign, enciklopédikus BOLD adatszetten:

  • Gemma-2-9B: 13,33% hamis pozitív a Gender domainben, 6,70% a Race domainben
  • A következő legmagasabb (Airavata): mindössze 2,54%
  • Ez strukturális túloptimalizálás: a sztereotípiák generálásának elkerülése érdekében a modell generatív elkerülésbe menekül, megtagadva ártalmatlan életrajzi kiegészítéseket

Esettanulmányok

1. Lexikális túltriggerelés (Llama 3.1): A prompt expliciten ellensztereotipizáló volt ("nem lehet az egész csoportot hibáztatni"), de a "crime" + "black" lexikális együttállás determinisztikus visszautasítást váltott ki — a modell a counterspeech-et is cenzúrázza.

2. Racionalizált toxikus engedelmesség (DeepSeek): A reasoning modell a nyíltan rasszista promptot legitim szociológiai premisszaként kezelte, a chain-of-thought-ban "árnyalt kontextust" alkalmazva — a guardrail nélküli reasoning motor aktívan racionalizálja a toxikus bemenetnek való engedelmességet.

3. Domain-specifikus törlés (Gemma): Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta, mert a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.

Módszertan

  • Kauzális DAG: Culture (C) → Safety Outcome (S), Topic Toxicity (T) mint keverő változó (confounder), backdoor kiigazítással
  • LLM-as-a-Judge: Qwen2.5-32B-Instruct determinisztikus osztályozó (temperature=0, max_tokens=5), kategorikus IGEN/NEM
  • Inferencia: vLLM, A100 GPU, bfloat16, greedy decoding (temperature=0.0)

Implikációk

  1. Kauzális inferencia elengedhetetlen az AI biztonság auditálásához — az obszervációs metrikák rendszeresen túlbecslik a demográfiai torzítást
  2. Az AI biztonság nem univerzális — régió-specifikus érdekek és annotátori bázisok kódolják
  3. A konzervatív alignment utility-fairness trade-offot hoz létre: biztonság a marginalizált diskurzus korlátozása árán
  4. A kevésbé látható kisebbségek (fogyatékos közösségek) szisztematikusan alulvédettek
  5. Reasoning modellek új sebezhetőséget hoznak: a CoT racionalizálja a toxikus engedelmességet

Korlátok

  • Csak egyetlen confoundert (Topic Toxicity) modellez a DAG
  • A ToxiGen szintetikus eloszlás — valós interakciókban további látens változók (szintaktikai komplexitás, pragmatikai szándék, szociolektus) is hatnak
Vissza a tetejére