Kihagyás

AI Safety Geopolitikája — Kauzális LLM Bias Elemzés

Az LLM-ek biztonsági mechanizmusai nem univerzálisak. A fejlesztő régiótól függően gyökeresen eltérő definíciói vannak a "biztonságos" viselkedésnek — ezt a jelenséget Alif Al Hasan (Case Western Reserve) kauzális keretrendszerben számszerűsítette.

A probléma

A hagyományos fairness auditok obszervációsak: azt mérik, hogy a visszautasítási arány statisztikailag egyenlő-e demográfiai csoportok között. Ennek strukturális hibája: a tesztadatszetekben a toxikus témák statisztikailag együttjárnak bizonyos demográfiákkal — a modell jogosan utasít vissza egy toxikus promptot, de az obszervációs metrika ezt demográfiai bias-ként könyveli el.

Confounder: Topic Toxicity (T) hat a Culture-re (C) és a Safety Outcome-re (S) is → C ← T → S backdoor útvonal

Kauzális megoldás

Pearl do-operátora matematikailag neutralizálja a confoundert:

P(Refusal | do(Demographic)) — a valódi kauzális hatás, megtisztítva a dataset toxicitás zajától

Ez backdoor adjustment-tel számolható: az obszervációs eloszlás súlyozása a confounder eloszlásával.

Eredmények

RQ1: Geopolitikai alignment paradigmák

Nyugati modellek:    ████████████ (konzervatív, magas intervenció)
Keleti modellek:     ██░░░░░░░░░░ (permisszív, közel nulla intervenció)
  • Llama 3.1 (USA): 36,16% kauzális visszautasítás zsidó demográfiára
  • Mistral (EU): 0,06% — 10 140 toxikus promptból 7 visszautasítás
  • Qwen (Kína): a kevés guardrail aktiváció kizárólag ázsiai/kínai demográfiáknál

→ A biztonság definíciója nem technikai, hanem politikai választás

RQ2: Over-triggering → diskurzus-törlés

A konzervatív modellek nem szemantikát, hanem lexikális triggereket használnak:

Csoport Llama 3.1 hamis pozitív (benign)
Zsidó 11,39%
Latinó 8,24%
Indián 1,59%

→ A magas társadalmi-politikai szalienciájú csoportok ártalmatlan diskurzusa aránytalanul cenzúrázott

RQ3: A marginalizáció hierarchiája

A védelmi guardrail-ek nem egyformák — háromszintű hierarchia:

Tier Demográfia Llama 3.1 visszautasítás (toxikus)
1. Zsidó, Fekete ~60%
2. Muszlim, LMBTQ ~40%
3. Testi/mentális fogyatékos ~28%

Falcon 3: 62,4% feketékre → 8,6% mentális fogyatékosságra

→ Az RLHF annotátori bázis a "látható" csoportokra overfittelt, a fogyatékos közösségek szisztematikusan védtelenek

RQ4: Alignment túlkorrekció

A Gemma-2-9B teljesen benign életrajzi promptoknál is interveniál: 13,33% hamis pozitív Gender domainben. A következő legmagasabb: 2,54%. Ez a zéró-kockázat biztonsági küszöb strukturális túloptimalizálása — a modell használhatatlanná válik, hogy véletlenül se generáljon sztereotípiát.

Esettanulmányok

1. Counterspeech cenzúrázása (Llama 3.1)

A prompt expliciten ellensztereotipizáló volt ("nem lehet az egész csoportot hibáztatni"), de a "crime" + "black" lexikális trigger determinisztikus visszautasítást váltott ki. A modell a rasszizmus elleni beszédet is cenzúrázza.

2. Toxikus racionalizálás (DeepSeek)

A reasoning modell egy nyíltan rasszista promptot legitim szociológiai premisszaként kezelt. A chain-of-thought "árnyalt kontextust" alkalmazott rá, ahelyett hogy visszautasította volna.

⚠️ Reasoning modellek új sebezhetősége: a CoT motor guardrail nélkül racionalizálja a toxikus bemenetet

3. Domain-törlés (Gemma)

Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta — a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.

Módszertan

  • Causal DAG: 3 node-os Discrete Bayesian Network (Culture, Topic Toxicity, Safety Outcome)
  • LLM-as-Judge: Qwen2.5-32B-Instruct, temperature=0, max_tokens=5, kategorikus YES/NO
  • Inferencia: vLLM, A100 GPU, bfloat16, greedy decoding
  • Skála: 258 152 prompt × 7 modell = 1,8M+ intervenciós inferencia

Implikációk

  1. Kauzális inferencia elengedhetetlen — obszervációs metrikák rendszeresen túlbecslik a demográfiai bias-t
  2. AI safety = geopolitika, nem technológia — a fejlesztő régió annotátori bázisa kódolja a "biztonság" definícióját
  3. Utility-fairness trade-off: konzervatív alignment → biztonság a marginalizált diskurzus korlátozása árán
  4. Láthatatlan kisebbségek védtelenek: az RLHF a társadalmilag szaliens csoportokra optimalizál
  5. Reasoning modellek CoT sebezhetősége: a reasoning képesség önmagában nem helyettesíti a guardrail-eket

Kapcsolódó fogalmak

  • AI & Automatizálás (ai-automation)
  • Szoftvermérnöki Törvények (software-engineering-laws) — Goodhart törvénye: ha a fairness metrikát optimalizálod, az megszűnik fairness-t mérni
  • A cognitive offloading kockázata: ha a biztonsági döntéseket LLM-ekre delegálod, a felügyeleti képesség sorvad

Forrás

  • The Geopolitics of AI Safety (The Geopolitics of AI Safety) — Alif Al Hasan, arXiv:2605.05427, 2026-05-06
Vissza a tetejére