Kihagyás

On Building Agents From First Principles

Szerző: Anshuman Mishra & GPT 5.5 Dátum: 2026-05-20 Forrás: https://x.com/athleticKoder/status/2057091692235481560

A cikk egy text-to-diagram agent példáján keresztül mutatja be az agent training teljes pipeline-ját, az alapoktól. Főbb pontok:

  • Core loop: prompt → model action → environment → reward → gradient update
  • Minden agent ugyanez — a framework-ek (TRL, Unsloth, verl) csak skálázzák
  • SFT = szintaxis (action language tanulása tanár trajectory-kból)
  • RL = optimalizálás (environment reward alapján finomhangolás)
  • Teacher trajectories oldják meg a cold start problémát
  • Environment design fontosabb, mint az RL algoritmus választása
  • GRPO: group-relative advantage — ugyanarra a promptra több completion, a jobbak felé mozdulás
  • Jó environment: partial credit, szintaxis/szemantika szétválasztás, nehezen kijátszható, log-olható
  • Pipeline: env definiálás → prompt-ok → teacher trace-ek → SFT → RL → eval → iteráció

Teljes szöveg a hivatkozott linken elérhető.

Vissza a tetejére