
Mit automatizáljon először egy kisvállalatban
Az első automatizálást a munka, az adatok, a kockázat, a felelős és a visszaállíthatóság alapján válassza ki. Bővítés előtt egy pilotot mérjen meg.
2026 júliusának végén Matt Shumer beillesztett három bekezdést a Claude Code-ba, és hagyta futni. Egy böngészőben futó belső nézetes lövöldözős játék jött vissza. Nagyjából 55 000 sor JavaScript tizenegy alrendszerben, és egyetlen grafikai fájl sem. Minden textúra, minden modell, animáció és hang kódból jön létre az oldal betöltésekor. A tároló nyilvános, MIT licenc alatt, a YouTube-on van játékmenet-felvétel, ha mozgásban is látni szeretné, és ugyanezzel a módszerrel azóta több tucat böngészős játék készült.
Ez a teljes prompt.
I want you to build a first-person shooter at the level of the most recent Call of Duty games. It should be utterly perfect, visually beautiful, with every single thing done at AAA quality—from textures to physics to anything you could think of.
Fan out sub-agents and have sub-agents tackle each one individually so that the game is utterly perfect. You should /loop on each item and have a separate sub-agent check it visually to ensure it looks triple A. That separate sub-agent should be a really harsh critic, and if it doesn't look triple A, it should keep going.
Don't stop until each sub-agent is utterly wowed with the quality when compared with the actual Call of Duty game. It should literally compare them side by side blind and say which one looks better. Do this in ThreeJS. /loop until it's utterly perfect. Fan out sub-agents and ultracode.
Shumer később Gauntlet Loopnak nevezte el a mintát. Úgy olvasható, mint egy veszekedés a számítógéppel, és a munkát végző szavak nem az „utterly” és nem a „perfect”.

Ez egyetlen promptból született. A képen látható minden textúra, modell és hang az oldal betöltésekor, kódból áll elő. A tárolóban egyetlen grafikai fájl sincs.
Saját felvétel a Claude of Duty forráskódjából, MIT licencA README fájlban van egy Honest assessment című szakasz. Ez az egész kísérlet leghasznosabb része.
Tizenegy független kritikus értékelte a kész képkockákat valódi Call of Duty-felvételekhez mérve. Az eredmény 3,59 volt, majd 4,14, majd 4,05, végül 5,05 a tízből. Két felvétel érte el a „close” fokozatot, a többi „amateur” maradt. Minden vak összehasonlításban, minden körben a kritikus a valódi játékot választotta.
A hiányosságok pontosan meg vannak nevezve. A kezek szögletes tömbökként hatnak, amelyek nem fogják meg a fegyvert. A felületek procedurális zajnak látszanak, nem fényképezett anyagnak. Az ellenfél távolról próbababára emlékeztet. A közvetett fény csak közelítés. A kész változat Apple Silicon lapkás laptopon másodpercenként 28 és 30 képkocka között fut.

A kezek kapták a kritikusoktól a leggyengébb pontszámot. A szerző maga írja le őket szögletes tömbökként, amelyek nem fogják meg meggyőzően a fegyvert. Így néz ki közelről az 5,05 a tízből.
Saját felvétel a Claude of Duty forráskódjából, MIT licencA hurok tehát veszített. Ugyanakkor minden kör után tudott számot mondani, és tudta, miért veszített. Ez az a különbség, amit érdemes lemásolni. A legtöbb AI-munka akkor áll meg, amikor az eredmény már nem kínos, ez viszont érzés, nem mérés.
Ha kivesszük a promptból a kiabálást, négy utasítás marad.
Az első egy mérce a modellen kívül. Nem „AAA minőség”, amit a modell addig húzhat lefelé, amíg meg nem felel neki. Egy valódi Call of Duty-képkocka, amit nem tud átdefiniálni.
Aztán ott az engedély a munka felosztására. A prompt sehol nem nevezi meg az alrendszereket. Az ügynök maga dönti el, mik a darabok, és éppen ezt a döntést veszik ki a kezéből leggyakrabban az emberek, majd rosszabbul hozzák meg.
A kritikus nem az építő. Megkapja a célt, a mércét és a kész eredményt. Nem kapja meg az építő gondolatmenetét, sem az összefoglalóját. Az Anthropic ezt a mintát evaluator-optimizer néven említi, és ott ajánlja, ahol világos értékelési szempontok vannak, és a második menet mérhetően segít.
Végül az engedély a folytatásra. Enélkül az ügynök egy kör után visszatér, mert a visszatérésre van betanítva.
Az eredeti prompt a /loop szót hétköznapi angolként írja, folytasd értelemben. A mai Claude Code-ban ezeknek a szavaknak pontos jelentésük van, és az összekeverésük pénzbe kerül.
A /goal befejezési feltételt állít be. Minden kör után egy kicsi, gyors modell elolvassa a beszélgetést, és megválaszolja, teljesül-e a feltétel. Ha nem, a Claude újabb kört kezd ahelyett, hogy visszaadná az irányítást. Ez a célhurok.
A /loop időköz letelte után indítja a következő kört. Ismétlődő munkára és megfigyelésre való, nem arra, hogy egy mércéhez csiszoljunk.
Az ultracode megint más. A promptba beírva a Claude arra az egy feladatra dinamikus munkafolyamatot ír és futtat, vagyis egy szkriptet, amely a háttérben alügynököket vezényel. Az /effort ultracode beállítással a legmagasabb gondolkodási szintet kapcsolja össze automatikus munkafolyamat-vezényléssel az egész munkamenetre. A futtatókörnyezet egyszerre tizenhat ügynököt enged, kevés magos gépen ennél kevesebbet, futásonként pedig ezret. Az a futás, amely huszonötnél több ügynököt tervez, vagy átlépi az 1,5 millió tokenes becslést, figyelmeztetést ír ki. Bekapcsolt ultracode mellett viszont nem jelenik meg, mert azzal a beállítással a nagy futásokat már engedélyezte.
Egy Gauntlet Loophoz tehát a /goal kell a leállási feltételhez és az ultracode az elágazáshoz.
Töltsön ki négy helyet. A referencia legyen olyasmi, amit az ügynök valóban meg tud nyitni, el tud indítani, le tud fényképezni vagy el tud olvasni.
Építs egy <DOLOG>-ot, ami <MIT KELL TENNIE>, <MEGNEVEZETT REFERENCIA> minőségi
szintjén. A megközelítést magad válaszd meg.
Oszd fel a munkát a legkisebb darabokra, amelyek külön megítélhetők.
Minden darabra indíts egy építő alügynököt és egy külön kritikus alügynököt.
A kritikus megkapja a célt, a mércét és a kész eredményt. Nem kapja meg az építő
gondolatmenetét, sem az összefoglalóját. Megnézi a valódi kimenetet, vakon
összehasonlítja a <MEGNEVEZETT REFERENCIA> anyaggal, megmondja, melyik jobb, és
megnevezi az egyetlen legnagyobb megmaradt hiányt, bizonyítékkal.
Ha a miénk veszít, add vissza ezt a hiányt az építőnek, és indulj újra.
Állj le, ha a kritikus a miénket választja, vagy <N> kör után, vagy ha egy kör
kevesebb mint <X> értékkel javít. Minden kör után írd ki a pontszámot és a legnagyobb
hiányt.
A kritikus promptja az a rész, amit az emberek átugranak. Rosszul megírva egy második véleményt adó építőt hoz létre. Rendesen megírva így néz ki.
Olyan eredményt értékelsz, amit nem te építettél. Nem kapsz előzményt és nem kapsz
magyarázatot, és ne is kérj ilyet.
A mi eredményünk: <ÚTVONAL VAGY KÉPERNYŐKÉP>
A referencia: <ÚTVONAL VAGY KÉPERNYŐKÉP>
Pontozd a miénket 1-től 10-ig a referenciához mérve. Utána válaszolj egy kérdésre.
Ha egy vásárló mindkettőt felirat nélkül látná, melyiket választaná, és milyen
látható részlet alapján dönt?
Nevezd meg az egyetlen legnagyobb hiányt. Mutass rá a bizonyítékra. Ne sorolj fel tíz
apróságot, és ne enyhíts a pontszámon azért, mert a munka nehéznek látszik.
Az eredeti prompt ma is működik, és érdemes pontosan úgy elolvasni, ahogy megírták. Egy feszesebb változat, amely ritkábban bukik el, így néz ki.
ultracode Építs böngészőben futó gokartversenyt Three.js alatt, a Mario Kart 8
Deluxe vizuális szintjén. Az architektúrát magad válaszd meg.
Oszd fel pályára, járműkezelésre, anyagokra, effektekre, hangra és HUD-ra. Mindegyikhez
adj egy építő alügynököt. Minden kör után indíts külön kritikus alügynököt, amely
képernyőképet készít a játékunkról, vakon összeveti referenciafelvételekkel, 1-től
10-ig pontozza, és megnevezi az egyetlen legnagyobb vizuális hiányt.
Mindig egy összefüggő rendszeren dolgozz, ne mind a haton egyszerre. A világítás,
a tonemapping és az anyagok egy rendszer, nem három.
/goal minden kritikus 7-est vagy többet ad, vagy eltelik négy kör 0,3-nál kisebb
javulással
Az egy összefüggő rendszerről szóló sor nem díszítés. Az oka két fejezettel lejjebb áll.
Ebben a módszerben semmi sem kötődik a grafikához. Olyan eredmény kell hozzá, amit meg lehet vizsgálni, és olyan referencia, amit meg tud nevezni. Egy ároldal megfelel. Egy negyedéves jelentés nem, amíg előbb el nem dönti, hogyan néz ki egy jó.
Két prompt, ami működik.
ultracode Írd újra az ároldalunkat a src/app/arak alatt úgy, hogy egy első
látogató harminc másodperc alatt tudjon csomagot választani. A mérce a Stripe ároldala
és a Linear ároldala. Mindkettő nyilvános, tehát töltsd le és olvasd el őket.
Oszd fel a munkát szerkezetre, csomag-összehasonlításra, szövegre, ellenvetések
kezelésére és mobilnézetre.
Minden kör után egy külön kritikus alügynök betölti böngészőben a mi oldalunkat és
mindkét referenciaoldalt 390 px és 1440 px szélességen, képernyőképekkel. A szövegünket
korábban nem látta. Három kérdésre válaszol. Melyik oldal magyarázza el leggyorsabban
a választást. Hol torpan meg az olvasó a mi oldalunkon. Melyik egyetlen
változtatás zárja be a hiány legnagyobb részét.
Az árakat ne változtasd meg, és ne találj ki olyan funkciót, amit nem árulunk.
/goal a kritikus a mi oldalunkat választja mindkét referencia előtt a harminc
másodperces teszten, vagy eltelik hat kör
És egy olyan, amelyben egyetlen sor kód sincs.
Írd meg az ajánlati dokumentumot a dokumentumautomatizálási szolgáltatásunkhoz, egy
húsz fős cégnek, amely kézzel dolgozza fel a számlákat.
A mérce a Basecamp ároldala és a Stripe Atlas útmutató, mindkettő nyilvános.
Ugyanaz a teszt. Egy elfoglalt tulajdonos egyszer elolvassa, és tudja, mit kap,
mennyibe kerül és mi következik.
Oszd fel a probléma megfogalmazására, a szállítandóra, az árra, az ütemtervre és az
ellenvetésekre.
Egy külön kritikus alügynök csak a kész dokumentumot olvassa el. A jegyzeteimet nem
látja. Megválaszolja, mit nem tudna az olvasó továbbra sem, mit nem hinne el, és melyik
bekezdésnél hagyná abba az olvasást. A referenciadokumentumokhoz méri.
Írd újra a leggyengébb részt. Ismételd, amíg a kritikus nem talál több olyan bekezdést,
ahol az olvasó abbahagyná, vagy amíg el nem telik öt kör.
Ugyanaz a tároló rögzített egy megállapítást, amely ellentmond az őt létrehozó promptnak. Ez a megállapítás a legértékesebb az egész kísérletben.
A párhuzamos elágazás veszített. Három kör hat-hat ügynökkel, mindegyik egy könyvtárat birtokolva, 0,46 ponttal mozdította az eredményt, és a képet tönkretevő hibák számát magasabban hagyta, mint ahol kezdte, vagyis 60, majd 47, majd 66. A tonemapping, az égbolt és a közvetett fény egyetlen összefüggő rendszer, és a különálló ügynökök folyamatosan lerombolták egymás feltevéseit. Egyetlen soros menet, összefüggő területenként egyetlen felelőssel, egy egész ponttal mozdította az eredményt, és 66-ról 26-ra csökkentette a hibákat.
Ágazzon szét olyan dolgok mentén, amelyek nem érintkeznek. Az érintkező dolgokon haladjon egymás után.

Ugyanaz az utca sötétedés után. A közvetett fény itt közelítés, nem valódi globális megvilágítás, és éppen ez tartozik a kitűzött mércéhez képest megnevezett hiányok közé.
Saját felvétel a Claude of Duty forráskódjából, MIT licencMég három hibamód érdemel nevet. Az a mérce, amit az ügynök maga definiálhat, nem mérce, ezért a „professzionális minőség” megbukik, a „jobb, mint ez a megnevezett oldal” pedig áll. Az a kritikus, aki az építő összefoglalóját kapja meg, az összefoglalót értékeli, nem az eredményt. A plafon nélküli hurok pedig addig fut, amíg a költségvetés észre nem veszi. James Altucher nagyjából tíz órán és 1,3 millió tokenen át futtatta az eredeti promptot. Az Anthropic a saját többügynökös kutatórendszerén nagyjából tizenötszörös tokenfogyasztást mért egy szokásos beszélgetéshez képest, és csak ott ajánlja a mintát, ahol a feladat értéke ezt elbírja.
A hurok magától nem áll meg. A leállási feltétel Ön.
A Rise.sk-nál egy review-kapuval ellátott változat fut. Egy ügynök épít, egy friss, építési előzmény nélküli ügynök ellenőriz, és ember mergel. Ezt a folyamatot külön leírtuk, ahogy a kapcsolódó kérdést is, hogy hol a helye az embernek egy AI-fejlesztésben.
A Gauntlet Loop ugyanaz a minta, csak minőségre irányítva a helyesség helyett. Akkor éri meg a tokenköltséget, ha a kimenet megvizsgálható, ha van megnevezett referencia, és ha az „elég jó” csendben kerül valamibe. Semmit nem ér, ha senki nem döntötte el, mit jelent a jó.
Ha azt mérlegeli, melyik folyamata bírna el egy ilyen hurkot, mi AI-automatizálást és munkafolyamatokat építünk, és technológiai auditokat végzünk, amelyek pontosan ezzel a kérdéssel kezdődnek.

Az első automatizálást a munka, az adatok, a kockázat, a felelős és a visszaállíthatóság alapján válassza ki. Bővítés előtt egy pilotot mérjen meg.
Az MCP eszközökhöz és adatokhoz kapcsolja az ügynököt. Az A2A önálló ügynököket köt össze. Itt megtudhatja, melyik protokoll hova illik, és mely biztonsági kontrollok maradnak az Ön felelőssége.
Mindenki AI-ügynökökről beszél. A legtöbb cégnek azonban nincs rá szüksége. Egy jól beállított automatizálás elég, és így derítheti ki, melyik kell Önnek.