On Building Agents From First Principles¶
Szerző: Anshuman Mishra & GPT 5.5 Dátum: 2026-05-20 Forrás: https://x.com/athleticKoder/status/2057091692235481560
A cikk egy text-to-diagram agent példáján keresztül mutatja be az agent training teljes pipeline-ját, az alapoktól. Főbb pontok:
- Core loop: prompt → model action → environment → reward → gradient update
- Minden agent ugyanez — a framework-ek (TRL, Unsloth, verl) csak skálázzák
- SFT = szintaxis (action language tanulása tanár trajectory-kból)
- RL = optimalizálás (environment reward alapján finomhangolás)
- Teacher trajectories oldják meg a cold start problémát
- Environment design fontosabb, mint az RL algoritmus választása
- GRPO: group-relative advantage — ugyanarra a promptra több completion, a jobbak felé mozdulás
- Jó environment: partial credit, szintaxis/szemantika szétválasztás, nehezen kijátszható, log-olható
- Pipeline: env definiálás → prompt-ok → teacher trace-ek → SFT → RL → eval → iteráció
Teljes szöveg a hivatkozott linken elérhető.