El sitio que estás leyendo fue diseñado, construido, revisado y desplegado en un solo día. Un plan de doce tareas, dieciséis commits, una identidad visual completa, y tráfico en producción antes de la cena. La mayor parte del trabajo la hicieron agentes de IA.
Esa frase es barata en 2026. Todos tienen una demo. Lo que no es barato es esto: pondría mi nombre debajo de cada línea que salió a producción, y no leí casi ninguna.
Lo interesante no es la velocidad. Es lo que hizo falta para confiar en el resultado.
01 / La regla
Un modelo se gana la confianza por su harness, no por sus pesos.
La calidad no se compra cambiando a un modelo más grande o escribiendo un mejor prompt. Se compra con la forma del loop alrededor del modelo. El loop tiene tres partes, y las tres son estructurales:
- Un espacio de acción chico y tipado. El modelo recibe decisiones de un conjunto cerrado, no juicio libre. Una tarea, un brief, valores exactos para usar.
- Un verificador que el modelo no controla. Su salida no vale nada hasta que algo con lo que no puede discutir dice lo contrario: un test, un build, un revisor que nunca vio sus excusas.
- Ante una falla, reintentar con el error del verificador en mano. No desde cero, ni con una arenga. Con el error exacto, pegado en el contexto.
Descomponer una pregunta difícil en tres chequeables vence a hacerla una vez, bien, cada vez.
02 / La forma del loop
Al construir este sitio, el loop se veía así. Un plan dividió el trabajo en doce tareas, cada una lo bastante chica como para que un modelo barato la ejecutara por transcripción. Cada tarea recibió un implementador nuevo, sin memoria de las demás: solo su brief, las interfaces que toca, y las reglas globales.
Después viene la parte que la mayoría se salta. Cada tarea también recibió un revisor. Las instrucciones del revisor incluyen una línea que hace casi todo el trabajo:
Tratá el reporte del implementador como afirmaciones no verificadas sobre el código.
El reporte dice que los tests pasan. Bien. Mostrame el diff. El reporte dice que el archivo coincide con el spec byte por byte. El revisor lo vuelve a diffear, él mismo. Los hallazgos vuelven al implementador con la evidencia adjunta, las rondas de arreglo tienen un tope, y un controlador falla en cada conflicto entre lo que dice el plan y lo que necesita el código, dejando escrito el fallo. Nada se resuelve en silencio.
Suena burocrático. Corre en minutos, en paralelo, y es la razón entera por la que el resultado es confiable.
03 / Lo que atrapó el harness
La teoría está bien. Esto es lo que el loop atrapó de verdad en un día, nada de lo cual yo habría atrapado leyendo el código a mano.
Un diseño que le fallaba a gente que nunca voy a conocer. El rojo de acento de este sitio, sobre su fondo papel, mide un contraste de 3,85:1. Se ve genial. No cumple los estándares de accesibilidad para texto chico. Un revisor calculó la razón, lo marcó, y el arreglo introdujo un rojo más oscuro que se usa solo donde el texto es chico. Lo estás mirando en las etiquetas del catálogo.
Un instrumento mentiroso. El paso de verificación tomó capturas de móvil con Chrome headless y reportó el layout roto en 375px. No lo estaba. Por debajo de unos 500px, ese build de Chrome arma el layout de la página en 500 en silencio y recorta la imagen al ancho pedido. Las capturas eran ficción. El agente que lo detectó no discutió al respecto: construyó un test de calibración, una fila de bloques de ancho fijo que hacen wrap en un punto conocido, y fijó el viewport real en 500px. Después manejó el navegador a través del protocolo DevTools en su lugar, encontró un overflow real en 320px, y lo arregló. Verificá el instrumento antes de confiar en su veredicto.
Su propio jefe, equivocado. En un momento dado, dictaminé, con confianza, que había que bajar la versión de una dependencia para que coincidiera con lo instalado. El implementador, en vez de obedecer, chequeó: lockfile, instalación en seco, build, tests. Todo verde en la versión más nueva. Mi premisa venía de datos viejos. El dictamen se revocó y el código salió con la versión que yo había prohibido. Un harness donde el worker no puede tener razón contra el jefe es solo burocracia con pasos extra.
04 / Lo que no funciona
Los modos de falla son todos versiones del mismo error: dejar que la plausibilidad haga las veces de verificación.
Saltearse la revisión porque el resultado parece correcto. Dejar que el modelo se corrija a sí mismo, que es lo mismo disfrazado. Hacerle una pregunta grande a un modelo grande y esperar, en vez de descomponerla en respuestas chicas que se puedan chequear. Confiar en el reporte en vez del diff. Confiar en la captura en vez del instrumento que la tomó.
Ninguna de estas falla haciendo ruido. Eso es lo que las hace caras. Una falla ruidosa te cuesta minutos. Una respuesta plausible y equivocada te cuesta cada decisión construida encima.
05 / El punto
La flota no construyó este sitio porque los modelos se volvieron lo bastante inteligentes. Los modelos vienen siendo lo bastante inteligentes hace rato. Construyó el sitio porque cada unidad de trabajo pasó por un portón que no pudo convencer con palabras.
El harness es el producto. El modelo es solo la parte que se alquila.