A Gauntlet Loop. Adjon az AI-nak valódi mércét
Három bekezdés 55 000 sornyi játékkódot és 5,05 pontos értékelést hozott a tízből. A mögötte álló módszer üzleti anyagokra is működik, és éppen az őszinte számok a hasznosak.
Egy MI-kódoló ügynök felgyorsíthatja a mechanikus munkát. Emberi ellenőrzés nélkül azonban nem bizonyítja, hogy éles használatra alkalmas.
Kevesebb gépelést és több delegálást vártam. A gyakorlatban a munka áthelyeződött. Kevesebb idő megy el a mechanikára, több a változások olvasására, a hiányzó kontextus keresésére és annak eldöntésére, hogy a javaslat illik-e a termékhez.
A Cursor kisebb szerkesztőbeli módosításokhoz illik. A Claude Code-ot nagyobb terminálos feladatokhoz használom, amikor több fájl és hosszabb kontextus fontos. A Copilotot főként autocomplete-ra használom.
A Codexet korábban félretettem, mert nem illett hozzám az interakció módja. Frissítés, 2026. július. A Codex visszakerült a rotációnkba, és a Claude Code mellett ügynökfeladatokat futtat.
Ezek munkapreferenciák, nem ajánlások. Minden csapatnak a saját valós feladatain kell összehasonlítania.
Válasszon elkülönített változtatást egyértelmű eredménnyel és visszafordíthatatlan hatás nélkül. Kezdés előtt írja le, minek kell elkészülnie, mely teszteknek kell átmenniük és ki hagyja jóvá a változást. Hasonlítsa össze a jóváhagyásig tartó időt, a review megállapításait és a releváns határesetek lefedését a kézi eljárással.
Az ügynök javasolhat meggyőzőnek tűnő kódot, amely átmegy néhány teszten. Nem ismeri azonban azt a szabályt, amely nincs a feladatban, a kódban vagy a dokumentációban. Ezért kell neki jó kontextus és a domént értő ember.
Minden ügynökfeladatnál határozza meg, mi futhat automatikusan, és mit kell embernek jóváhagynia küldés, merge vagy telepítés előtt. Őrizze meg a feladatot, a módosított fájlokat, az ellenőrzések eredményét és a jóváhagyás indokát.
Adatokra, pénzre vagy hozzáférési jogokra ható változtatásoknál vonja be a folyamat tulajdonosát a review-ba. A tesztek szükségesek, de nem fognak meg olyan szabályt, amelyet senki nem írt le.
Frissítés, 2026. július 24. Manuálisan indított Shadow folyamatot használunk WorkOrderrel, tervjóváhagyással, pontos ellenőrzésekkel és független review-val. Az ügynök nem végez merge-et vagy telepítést. A folyamatot a review-gated agentic workflow írja le.
Ne a generált sorokat mérje. Mérje a jóváhagyásig tartó időt, a review-beavatkozásokat, a hibás javaslatokat, az eszkalációkat és az élesítés utáni hibákat. Ha ezek a mutatók nem mutatnak előnyt, szűkítse a feladatot vagy ne adja át ügynöknek.
Nem tudom, hogyan fejlődnek ezek az eszközök. Nyitva marad a kérdés, mit tanulnak a junior fejlesztők, ha kezdettől csak mások kódját olvassák és hagyják jóvá. Kódot olvasni más készség, mint azt a nulláról megtervezni.
Ha szeretné meghatározni, hol segíthet az MI a fejlesztési folyamatában, beszéljünk.
Három bekezdés 55 000 sornyi játékkódot és 5,05 pontos értékelést hozott a tízből. A mögötte álló módszer üzleti anyagokra is működik, és éppen az őszinte számok a hasznosak.
2026 júliusa hozta a valaha volt legnagyobb AI-árcsökkenést, és a cégek 73 százaléka mégis túllépte az AI-költségkeretét. A számlát nem a token ára dönti el, hanem az, hány tokent éget el egy befejezett feladat.

Az első automatizálást a munka, az adatok, a kockázat, a felelős és a visszaállíthatóság alapján válassza ki. Bővítés előtt egy pilotot mérjen meg.