
Qué automatizar primero en una pequeña empresa
Elija la primera automatización según el trabajo, los datos, el riesgo, la responsabilidad y la reversibilidad. Valide un piloto antes de ampliarlo.
A finales de julio de 2026 Matt Shumer pegó tres párrafos en Claude Code y lo dejó correr. Lo que volvió fue un juego de disparos en primera persona que funciona en el navegador. Unas 55.000 líneas de JavaScript repartidas en once subsistemas, y ni un solo archivo gráfico. Cada textura, cada modelo, cada animación y cada sonido nacen del código al cargar la página. El repositorio es público con licencia MIT, hay grabación de juego si quiere verlo en movimiento, y el mismo método ha producido desde entonces decenas de juegos de navegador que puede jugar ya.
Este es el prompt completo.
I want you to build a first-person shooter at the level of the most recent Call of Duty games. It should be utterly perfect, visually beautiful, with every single thing done at AAA quality—from textures to physics to anything you could think of.
Fan out sub-agents and have sub-agents tackle each one individually so that the game is utterly perfect. You should /loop on each item and have a separate sub-agent check it visually to ensure it looks triple A. That separate sub-agent should be a really harsh critic, and if it doesn't look triple A, it should keep going.
Don't stop until each sub-agent is utterly wowed with the quality when compared with the actual Call of Duty game. It should literally compare them side by side blind and say which one looks better. Do this in ThreeJS. /loop until it's utterly perfect. Fan out sub-agents and ultracode.
Shumer bautizó después el patrón como Gauntlet Loop. Se lee como una discusión con un ordenador, y las palabras que hacen el trabajo no son «utterly» ni «perfect».

Esto salió de un solo prompt. Cada textura, cada malla y cada sonido del fotograma se calcula desde el código al cargar la página. El repositorio no contiene ningún archivo gráfico.
Captura propia del código fuente de Claude of Duty, licencia MITEn el archivo README hay una sección titulada Honest assessment. Es la parte más útil de todo el experimento.
Once críticos independientes puntuaron los fotogramas terminados frente a material real de Call of Duty. Las notas fueron 3,59, luego 4,14, luego 4,05 y por último 5,05 sobre diez. Dos tomas alcanzaron el grado «close», el resto se quedó en «amateur». En cada comparación a ciegas, en cada ronda, el crítico eligió el juego real.
Las carencias están nombradas con precisión. Las manos parecen bloques angulosos que no agarran el arma. Las superficies parecen ruido procedural y no material fotografiado. El enemigo a distancia recuerda a un maniquí. La luz indirecta es una aproximación. La versión terminada corre entre 28 y 30 fotogramas por segundo en un portátil con chip de Apple.

Las manos fueron lo peor puntuado por los críticos. El propio autor las describe como bloques angulosos que no agarran el arma de forma convincente. Así se ve un 5,05 sobre 10 de cerca.
Captura propia del código fuente de Claude of Duty, licencia MITO sea que el bucle perdió. También daba una cifra en cada ronda y sabía por qué perdía. Esa es la diferencia que vale la pena copiar. La mayoría del trabajo con IA se detiene cuando el resultado deja de dar vergüenza, y eso es una sensación, no una medición.
Si le quitamos los gritos al prompt, quedan cuatro instrucciones.
La primera es un listón que vive fuera del modelo. No «calidad AAA», que un modelo puede redefinir a la baja hasta cumplirla. Un fotograma real de Call of Duty, que no puede redefinir.
Después viene el permiso para repartir el trabajo. El prompt no nombra los subsistemas en ningún momento. El agente decide cuáles son las piezas, y justo esa decisión es la que las personas le quitan más a menudo, para luego tomarla peor.
El crítico no es el constructor. Recibe el objetivo, el listón y el resultado terminado. No recibe el razonamiento del constructor ni su resumen de lo que hizo. Anthropic llama a este patrón evaluator-optimizer y lo recomienda donde existen criterios de evaluación claros y una segunda pasada ayuda de forma medible.
Por último, el permiso para seguir. Sin él, un agente vuelve después de una ronda, porque volver es exactamente para lo que fue entrenado.
El prompt original escribe /loop como inglés corriente, en el sentido de sigue. En el Claude Code de hoy esas palabras tienen un significado preciso, y confundirlas cuesta dinero.
El comando /goal fija una condición de finalización. Después de cada turno, un modelo pequeño y rápido lee la conversación y responde si la condición se cumple. Si no se cumple, Claude empieza otro turno en lugar de devolver el control. Ese es el bucle de objetivo.
El comando /loop arranca el siguiente turno cuando transcurre un intervalo de tiempo. Sirve para trabajo recurrente y vigilancia, no para pulir hacia un listón.
La palabra ultracode es otra cosa distinta. Escrita dentro del prompt hace que Claude redacte y ejecute esa única tarea como un flujo de trabajo dinámico, es decir, un script que dirige subagentes en segundo plano. Configurada con /effort ultracode combina el nivel de razonamiento más alto con orquestación automática de flujos durante toda la sesión. El entorno de ejecución permite dieciséis agentes a la vez, menos en máquinas con pocos núcleos, y mil por ejecución. Una ejecución que planifique más de veinticinco agentes o supere la estimación de 1,5 millones de tokens lanza un aviso, aunque no en una sesión con ultracode activado, porque esa opción ya da vía libre a las ejecuciones grandes.
Para un Gauntlet Loop conviene entonces /goal para la condición de parada y ultracode para la ramificación.
Rellene cuatro huecos. La referencia tiene que ser algo que el agente pueda abrir, ejecutar, fotografiar o leer de verdad.
Construye <COSA> que <QUÉ DEBE HACER>, al nivel de calidad de <REFERENCIA CONCRETA>.
Elige tú el enfoque.
Divide el trabajo en las piezas más pequeñas que se puedan juzgar por separado.
Para cada pieza lanza un subagente constructor y un subagente crítico aparte.
El crítico recibe el objetivo, el listón y el resultado terminado. No recibe el
razonamiento del constructor ni su resumen. Inspecciona la salida real, la compara
a ciegas con <REFERENCIA CONCRETA>, dice cuál es mejor y nombra la mayor brecha
que queda, con pruebas.
Si la nuestra pierde, devuelve esa brecha al constructor y vuelve a empezar.
Detente cuando el crítico elija la nuestra, o tras <N> rondas, o cuando una ronda mejore
la nota menos de <X>. Imprime la nota y la mayor brecha en cada ronda.
El prompt del crítico es la parte que la gente se salta. Mal escrito produce un constructor con una segunda opinión. Bien escrito tiene este aspecto.
Estás evaluando un resultado que no construiste. No recibes historial ni explicación,
y tampoco debes pedirlos.
Nuestro resultado: <RUTA O CAPTURA>
La referencia: <RUTA O CAPTURA>
Puntúa el nuestro de 1 a 10 frente a la referencia. Después responde a una pregunta.
Si un comprador viera los dos sin etiquetas, ¿cuál elegiría y por qué detalle visible
se decidiría?
Nombra la mayor brecha. Señala la prueba. No enumeres diez detalles pequeños,
y no suavices la nota porque el trabajo parezca difícil.
El prompt original sigue funcionando y vale la pena leerlo tal y como fue escrito. Una versión más apretada, que falla con menos frecuencia, tiene este aspecto.
ultracode Construye un juego de karts para navegador en Three.js al nivel visual de
Mario Kart 8 Deluxe. Elige tú la arquitectura.
Divídelo en circuito, conducción, materiales, efectos, audio y HUD. Dale a cada uno un
subagente constructor. Después de cada ronda lanza un subagente crítico aparte que
haga capturas de nuestro juego, lo compare a ciegas con material de referencia, lo
puntúe de 1 a 10 y nombre la mayor brecha visual.
Trabaja sobre un sistema acoplado cada vez, no sobre los seis a la vez. La
iluminación, el tonemapping y los materiales son un sistema, no tres.
/goal todos los críticos puntúan 7 o más, o pasan cuatro rondas con una mejora menor
de 0,3
Esa línea sobre un solo sistema acoplado no es adorno. El motivo está dos secciones más abajo.
En este método no hay nada específico de los gráficos. Necesita un resultado que se pueda inspeccionar y una referencia que usted pueda nombrar. Una página de precios cumple. Un informe trimestral no, mientras no decida antes cómo es uno bueno.
Dos que funcionan.
ultracode Reescribe nuestra página de precios en src/app/precios para que un
visitante nuevo pueda elegir un plan en menos de treinta segundos. El listón son la
página de precios de Stripe y la de Linear. Ambas son públicas, así que descárgalas
y léelas.
Divide el trabajo en estructura, comparación de planes, textos, tratamiento de
objeciones y diseño móvil.
Después de cada ronda, un subagente crítico aparte carga en el navegador nuestra página
y las dos de referencia, a 390 px y 1440 px, con capturas. No ha visto antes nuestros
textos. Responde a tres preguntas. ¿Qué página explica la elección más rápido? ¿Dónde
hace nuestra página que el lector se detenga a pensar? ¿Qué único cambio cierra la
mayor parte de la brecha?
No cambies nuestros precios y no inventes funciones que no vendemos.
/goal el crítico elige nuestra página por delante de las dos referencias en la prueba
de treinta segundos, o pasan seis rondas
Y otro sin una sola línea de código.
Escribe el documento de oferta de nuestro servicio de automatización documental,
dirigido a una empresa de veinte personas que procesa facturas a mano.
El listón son la página de precios de Basecamp y la guía de Stripe Atlas, ambas
públicas. La misma prueba. Un dueño ocupado lo lee una vez y sabe qué recibe, cuánto
cuesta y qué pasa después.
Divídelo en planteamiento del problema, qué entregamos, precio, calendario y objeciones.
Un subagente crítico aparte lee solo el documento terminado. No ve mis notas. Responde
qué seguiría sin saber el lector, qué no se creería y en qué párrafo dejaría de leer.
Lo puntúa frente a los documentos de referencia.
Reescribe la sección más débil. Repite hasta que el crítico deje de encontrar un párrafo
donde el lector abandonaría, o hasta que pasen cinco rondas.
Ese mismo repositorio registró un hallazgo que contradice al prompt que lo produjo. Ese hallazgo es lo más valioso de todo el experimento.
La ramificación en paralelo perdió. Tres rondas de seis agentes, cada uno dueño de un directorio, movieron la nota 0,46 y dejaron el número de defectos que arruinan la imagen más alto que al empezar, es decir 60, luego 47, luego 66. El tonemapping, el cielo y la luz indirecta son un único sistema acoplado, y los agentes separados se rompían continuamente las suposiciones unos a otros. Una sola pasada secuencial, con un único responsable por cada área acoplada, movió la nota un punto entero y bajó los defectos de 66 a 26.
Ramifique a través de cosas que no se tocan. A través de las que sí se tocan, avance en orden.

La misma calle de noche. La luz indirecta es aquí una aproximación y no iluminación global real, y eso figura entre las carencias señaladas frente al listón que se fijó.
Captura propia del código fuente de Claude of Duty, licencia MITMerece la pena nombrar tres modos de fallo más. Un listón que el agente puede definir no es un listón, por eso «calidad profesional» no sirve y «mejor que esta página concreta» sí. Un crítico al que se le entrega el resumen del constructor evalúa el resumen y no el resultado. Y un bucle sin techo se ejecuta hasta que el presupuesto se da cuenta. James Altucher dejó correr el prompt original unas diez horas y 1,3 millones de tokens. Anthropic midió en su propio sistema de investigación con varios agentes alrededor de quince veces los tokens de una conversación normal, y recomienda el patrón solo donde el valor de la tarea lo sostiene.
El bucle no se detiene solo. La condición de parada es usted.
En Rise.sk funciona una versión con revisión previa obligatoria. Un agente construye, un agente nuevo sin historial de construcción revisa, y una persona hace el merge. Ese proceso lo describimos aparte, igual que la pregunta relacionada de dónde encaja la persona en un desarrollo con IA.
El Gauntlet Loop es el mismo patrón apuntado a la calidad en lugar de a la corrección. Merece sus tokens cuando la salida se puede inspeccionar, cuando existe una referencia concreta y cuando el «ya está bien» le está costando algo en silencio. No merece nada cuando nadie ha decidido qué significa bien.
Si está valorando cuál de sus procesos aguantaría un bucle así, nosotros construimos automatización de IA y flujos de trabajo y hacemos auditorías tecnológicas que empiezan exactamente por esa pregunta.

Elija la primera automatización según el trabajo, los datos, el riesgo, la responsabilidad y la reversibilidad. Valide un piloto antes de ampliarlo.
MCP conecta un agente con herramientas y datos. A2A conecta agentes independientes. Aquí verá dónde encaja cada protocolo y qué controles de seguridad siguen siendo su responsabilidad.
Todo el mundo habla de agentes de IA. La mayoría de las empresas no lo necesita. Con una buena automatización basta, y así puede decidir cuál es su caso.