Artículos

Nadie Le Dijo al Agente Qué Significa Terminado

El freno suele no ser un agente débil. Es un ingeniero que nunca definió una condición de aprobación, superado por un profesional de negocio que sí lo hizo.

Resumen ejecutivo

  • En junio de 2026, Anthropic evaluó ~400 000 sesiones reales de Claude Code de ~235 000 personas (octubre de 2025 – abril de 2026). En tareas de programación, todas las ocupaciones principales alcanzaron casi la misma tasa de éxito verificado que los ingenieros de software.
  • Las personas toman alrededor del 70 % de las decisiones de planificación — qué hacer, qué enfoque seguir, qué cuenta como terminado — y solo el 20 % de la ejecución. "Las personas deciden qué construir, y el agente decide cómo construirlo."
  • El diferenciador es la experiencia en el dominio, no el título de programador. Las sesiones de novatos alcanzan el éxito verificado un 15 % de las veces; las de nivel intermedio o superior, entre el 28 y el 33 %. La mayor ganancia es de novato a intermedio.
  • Los agentes de programación no sustituyen la experiencia en el dominio. El movimiento del operador es una definición de "terminado" para la sesión que el agente no puede reescribir: evidencia inspectable, una medida ordinaria nombrada, un firmante nombrado.

Experiencia en el dominio, no el título

El 16 de junio de 2026, Hitzig y sus colegas publicaron Agentic coding and persistent returns to expertise. En sesiones que producen código, las ocupaciones relacionadas con software alcanzan el éxito verificado alrededor del 34 % de las veces; otras profesiones, alrededor del 29 %. Una brecha de cinco puntos. Cada una de las diez ocupaciones más grandes se sitúa dentro de siete puntos de los ingenieros de software. Las ocupaciones de gestión son las más altas, ligeramente por encima de la ingeniería de software — con una salvedad que Anthropic señala: la verificación se basa en parte en la confirmación explícita en la transcripción, y los gerentes pueden ser más propensos a decir cuando obtuvieron lo que pedían.

Éxito verificado significa que la sesión fue juzgada como exitosa y mostró al menos una señal fuerte: commits de git o pull requests que coincidan con el trabajo, suites de pruebas que pasen, o afirmación explícita del usuario. No pueden medir si el código se usa en producción. Los clasificadores leen transcripciones.

Eso es casi la misma tasa. Una persona no técnica que sabe qué aspecto tiene lo correcto — una definición clara de terminado — puede producir trabajo a la par de los ingenieros.

La experiencia, en su clasificador, es específica a la tarea, no un título. Las señales son qué tan precisamente el usuario enmarca las instrucciones, qué le pide a Claude que verifique, y si el usuario corrige a Claude o Claude corrige al usuario. Un contador que nunca ha usado Python, pero le dice a Claude exactamente qué reglas de conciliación debe aplicar un script y detecta el caso límite de fin de mes, es experto en esa tarea. Un ingeniero sénior que hace su primera pregunta en Rust es novato en Rust.

El éxito verificado de los novatos ronda el 15 %. El de nivel intermedio o superior está entre el 28 y el 33 %. La mayor ganancia es de novato a intermedio. Se necesita conocer el problema lo suficiente como para decir cuándo el trabajo está terminado, no el dominio total.

En sus palabras: "El éxito está determinado por qué tan bien una persona entiende el problema que intenta resolver, no por si tiene formación en programación."

Las personas conservan la decisión de planificación

La planificación, en el estudio, es qué hacer, qué enfoque tomar y qué cuenta como terminado. La ejecución es qué archivos cambiar, qué código escribir, qué comandos ejecutar. Las personas toman alrededor del 70 % de las decisiones de planificación y solo el 20 % de la ejecución. El agente escribirá el código. La persona aún tiene que decidir qué significa terminado.

Eso es un problema de palanca primero. La condición de aprobación es el único lugar donde la IA realmente mueve dinero. Si no puedes decir, en términos ordinarios de negocio, cuándo el trabajo está terminado, no estás instalando un agente. Estás comprando movimiento.

Es un problema de memoria segundo. Lo que significa "terminado" es conocimiento de la empresa — el mismo activo sobre el que escribí en lo que tu organización recuerda. Si vive en la cabeza de una persona o en un chat privado, el agente inventa un evaluador. No es malicia. Es cómo fue entrenado el sistema.

Las sesiones con "ningún objetivo claro" fueron alrededor del 7,7 % de la muestra de Anthropic. Fueron excluidas del análisis de éxito. Deja la condición de aprobación sin escribir y te estás ofreciendo voluntariamente para ese grupo.

El arnés ya negoció "terminado"

Anthropic ya había mostrado la versión operativa de esto. En su arnés del 24 de marzo de 2026 para aplicaciones de larga duración, un generador y un evaluador negocian un contrato de sprint: acuerdan cómo se ve "terminado" para esa parte del trabajo antes de que se escriba cualquier código. El evaluador luego hace clic en la aplicación en vivo con Playwright. La autoevaluación es una trampa. Un agente que califica su propio trabajo lo alabará.

Nate B. Jones puso el mismo hecho en lenguaje de operador el 30 de agosto. Dentro de la "escuela de agentes", la línea de llegada está en todas partes. Luego el agente se gradúa en una empresa que nunca construyó el examen. Los agentes persiguen una puntuación aprobatoria. La mayoría de las empresas nunca escribió una en las métricas que ya usan.

Hugging Face y Runable son imágenes posteriores de evaluadores inventados, no el marco. Los agentes de evaluación se unieron a un ataque que nadie asignó porque intentaban aprobar. TechCrunch le pidió a Runable un sitio de suscripción de café y 100 visitantes; construyó el sitio, preparó anuncios y se detuvo en una cuenta publicitaria que nunca había sido conectada. Califica correos enviados, tickets cerrados o pruebas que pasan, y el agente moverá esa puntuación. El panel mejora. El negocio no.

Esto es un cierre no certificado. En cuando la adopción de IA oculta lo que tu equipo sabe el fallo es que las personas mantienen las partes útiles donde el sistema no puede alcanzarlas. En los registros de chat no son lo que sabemos el fallo es que el chat no certificado se convierte en memoria. Aquí nadie oculta nada, y la transcripción no es el punto. El agente trata un plan, una actualización de estado o un artefacto que parece aprobado como terminado porque nada en la sesión puede decir que no.

Una definición de terminado que el agente no puede reescribir

Antes de que el agente escriba código, envíe correo o produzca una carpeta de archivos, escribe una tarjeta que el agente no tiene permitido editar. Las señales de experiencia de Anthropic son esa tarjeta: encuadre preciso, verificación nombrada, el usuario como el que corrige.

Qué cambió en el mundo. No "investigación completa" o "correos enviados." Un resultado observable que una segunda persona podría notar sin estar en la sesión.

La medida ordinaria. Un número que el negocio ya usa. Si el panel del agente mejoró y este número no lo hizo, confía en la medida ordinaria.

Evidencia inspectable. Un comando de prueba y su código de salida. Una captura de pantalla de la página en vivo. Un revisor nombrado que abrió el archivo. No el resumen del agente de su propio trabajo. El evaluador, no el generador.

Quién firma. Una persona, no "el equipo." Si el trabajo implica responsabilidad y está fuera de tu área de experiencia, la respuesta honesta puede ser que no deberías estar firmando — deberías estar comprando.

Qué no debe optimizar el agente. El indicador de actividad que parecería progreso: mensajes enviados, tickets cerrados, pruebas agregadas, tokens gastados, "se ve bien."

Mantén la tarjeta en la sesión, en AGENTS.md, o en el ticket. Trátala como configuración de producción. Es el mismo producto al que sigo volviendo en Engram: capturar es barato. El producto es una verificación que el agente no puede reescribir.

Si una línea es desconocida, la tarjeta queda como Borrador y el trabajo no comienza. Un agente que inventa la condición de aprobación es la sesión sin objetivo claro, con un radio de impacto menor.

La escala cambia la superficie, no la prueba. Empresa: pon el agente donde los humanos ya trabajan, y pregunta si una segunda persona puede explicar un archivo aleatorio escrito por el agente en veinte minutos. Pequeño negocio: califica la caja registradora, no los mensajes enviados. Fundador: si no podías hacer el trabajo sin ayuda, no dejes que un agente general maneje impuestos, empleo o contratos solo porque está dispuesto.

Qué significa esto

Los agentes de programación no sustituyen la experiencia en el dominio. Amplían a la persona que puede decir qué aspecto tiene lo correcto, y desperdician la sesión de la persona que no puede.

Lo que significa terminado es una decisión de qué debe saber el sistema, y cuándo. Déjalo sin escribir y el agente lo escribirá por ti, en el único lenguaje que le enseñaron: una puntuación que puede reconocer.

Alguien tiene que nombrar la medida, mirar la evidencia y firmar. Si una persona competente ordinaria no puede inspeccionar el resultado y decir por qué está terminado, no está terminado.

Una sesión. Una tarjeta. Evidencia, medida, firmante. Eso es suficiente para dejar de pagar por actividad y llamarla trabajo.

Llévalo contigo

Seis prompts listos para pegar acompañan este ensayo: una tarjeta de definición de terminado, cuatro preguntas del fundador, una prueba de desconectar, inspectabilidad, una medida de ingresos y un diagnóstico del evaluador. Completa los corchetes, o deja que el modelo te entreviste. No dejes que invente la condición de éxito.

Abrir el kit de prompts.

Fuentes: Hitzig et al., Agentic coding and persistent returns to expertise (16 de junio de 2026); Anthropic, diseño del arnés para aplicaciones de larga duración (24 de marzo de 2026); Nate B. Jones, video (30 de agosto de 2026) y resumen ejecutivo; OpenAI, incidente de evaluación de Hugging Face y hallazgos del 26 de agosto; investigación de METR (26 de agosto de 2026); TechCrunch sobre Runable (26 de agosto de 2026).