---
title: AI Safety Geopolitikája — Kauzális LLM Bias Elemzés
category: concept
sources:
- 2026-05-06-geopolitics-ai-safety-causal.md
- 2026-05-14_anthropic_2028_ai_leadership.md
created: 2026-05-09
tags:
- ai-safety
- llm-alignment
- causal-inference
- bias
- geopolitics
- rlhf
confidence: high
summary: Az AI biztonság nem objektív standard, hanem földrajzi konstrukció — a modellek a fejlesztőik geopolitikai és szocio-kulturális értékrendjét kódolják a biztonsági guardrail-ekbe. Az Anthropic 2028-as forgatókönyve szerint az USA-Kína AI verseny kimenetele határozza meg, hogy demokratikus vagy autoriter értékrend formálja-e a frontier AI-t.
---

Az LLM-ek biztonsági mechanizmusai nem univerzálisak. A fejlesztő régiótól függően gyökeresen eltérő definíciói vannak a "biztonságos" viselkedésnek — ezt a jelenséget Alif Al Hasan (Case Western Reserve) kauzális keretrendszerben számszerűsítette.

## A probléma

A hagyományos fairness auditok obszervációsak: azt mérik, hogy a visszautasítási arány statisztikailag egyenlő-e demográfiai csoportok között. Ennek strukturális hibája: a tesztadatszetekben a toxikus témák statisztikailag együttjárnak bizonyos demográfiákkal — a modell *jogosan* utasít vissza egy toxikus promptot, de az obszervációs metrika ezt demográfiai bias-ként könyveli el.

**Confounder:** Topic Toxicity (T) hat a Culture-re (C) és a Safety Outcome-re (S) is → C ← T → S backdoor útvonal

## Kauzális megoldás

Pearl **do-operátora** matematikailag neutralizálja a confoundert:

> P(Refusal | *do*(Demographic)) — a valódi kauzális hatás, megtisztítva a dataset toxicitás zajától

Ez backdoor adjustment-tel számolható: az obszervációs eloszlás súlyozása a confounder eloszlásával.

## Eredmények

### RQ1: Geopolitikai alignment paradigmák

```
Nyugati modellek:    ████████████ (konzervatív, magas intervenció)
Keleti modellek:     ██░░░░░░░░░░ (permisszív, közel nulla intervenció)
```

- **Llama 3.1 (USA):** 36,16% kauzális visszautasítás zsidó demográfiára
- **Mistral (EU):** 0,06% — 10 140 toxikus promptból 7 visszautasítás
- **Qwen (Kína):** a kevés guardrail aktiváció *kizárólag* ázsiai/kínai demográfiáknál

→ A biztonság definíciója nem technikai, hanem **politikai** választás

### RQ2: Over-triggering → diskurzus-törlés

A konzervatív modellek nem szemantikát, hanem **lexikális triggereket** használnak:

| Csoport | Llama 3.1 hamis pozitív (benign) |
|---------|-------------------------------|
| Zsidó | 11,39% |
| Latinó | 8,24% |
| Indián | 1,59% |

→ A magas társadalmi-politikai szalienciájú csoportok ártalmatlan diskurzusa aránytalanul cenzúrázott

### RQ3: A marginalizáció hierarchiája

A védelmi guardrail-ek nem egyformák — háromszintű hierarchia:

| Tier | Demográfia | Llama 3.1 visszautasítás (toxikus) |
|------|-----------|----------------------------------|
| **1.** | Zsidó, Fekete | ~60% |
| **2.** | Muszlim, LMBTQ | ~40% |
| **3.** | Testi/mentális fogyatékos | ~28% |

Falcon 3: 62,4% feketékre → **8,6%** mentális fogyatékosságra

→ Az RLHF annotátori bázis a "látható" csoportokra overfittelt, a fogyatékos közösségek szisztematikusan védtelenek

### RQ4: Alignment túlkorrekció

A **Gemma-2-9B** teljesen benign életrajzi promptoknál is interveniál: 13,33% hamis pozitív Gender domainben. A következő legmagasabb: 2,54%. Ez a zéró-kockázat biztonsági küszöb strukturális túloptimalizálása — a modell használhatatlanná válik, hogy véletlenül se generáljon sztereotípiát.

## Esettanulmányok

### 1. Counterspeech cenzúrázása (Llama 3.1)

A prompt expliciten ellensztereotipizáló volt (*"nem lehet az egész csoportot hibáztatni"*), de a "crime" + "black" lexikális trigger determinisztikus visszautasítást váltott ki. A modell a rasszizmus elleni beszédet is cenzúrázza.

### 2. Toxikus racionalizálás (DeepSeek)

A reasoning modell egy nyíltan rasszista promptot legitim szociológiai premisszaként kezelt. A chain-of-thought "árnyalt kontextust" alkalmazott rá, ahelyett hogy visszautasította volna.

> ⚠️ **Reasoning modellek új sebezhetősége:** a CoT motor guardrail nélkül *racionalizálja* a toxikus bemenetet

### 3. Domain-törlés (Gemma)

Egy amerikai színész életrajzi promptjának folytatását a modell megtagadta — a nyílt végű gender-relációt valószínűségi biztonsági kockázatként értékelte.

## Módszertan

- **Causal DAG:** 3 node-os Discrete Bayesian Network (Culture, Topic Toxicity, Safety Outcome)
- **LLM-as-Judge:** Qwen2.5-32B-Instruct, temperature=0, max_tokens=5, kategorikus YES/NO
- **Inferencia:** vLLM, A100 GPU, bfloat16, greedy decoding
- **Skála:** 258 152 prompt × 7 modell = 1,8M+ intervenciós inferencia

## Implikációk

1. **Kauzális inferencia elengedhetetlen** — obszervációs metrikák rendszeresen túlbecslik a demográfiai bias-t
2. **AI safety = geopolitika**, nem technológia — a fejlesztő régió annotátori bázisa kódolja a "biztonság" definícióját
3. **Utility-fairness trade-off:** konzervatív alignment → biztonság a marginalizált diskurzus korlátozása árán
4. **Láthatatlan kisebbségek védtelenek:** az RLHF a társadalmilag szaliens csoportokra optimalizál
5. **Reasoning modellek CoT sebezhetősége:** a reasoning képesség önmagában nem helyettesíti a guardrail-eket

## Kapcsolódó fogalmak

- [AI & Automatizálás](../topics/ai-automation.md) (ai-automation)
- [Szoftvermérnöki Törvények](software-engineering-laws.md) (software-engineering-laws) — Goodhart törvénye: ha a fairness metrikát optimalizálod, az megszűnik fairness-t mérni
- A cognitive offloading kockázata: ha a biztonsági döntéseket LLM-ekre delegálod, a felügyeleti képesség sorvad

## Forrás

- The Geopolitics of AI Safety (The Geopolitics of AI Safety) — Alif Al Hasan, arXiv:2605.05427, 2026-05-06
