¿Agentes? De qué va Copilot, en serio
A principios de este año todo el mundo empezó a decirle “agente” a Copilot. Vale la pena ordenar el vocabulario antes de que termine en una licitación pública.
Lo que Copilot era, sin marketing
Autocompletado con contexto. Muy bueno, hay que decirlo: lee el archivo abierto, algo de los archivos vecinos, y predice la continuación más probable. Para boilerplate, tests repetitivos y ese switch de veinte casos, es una máquina de ahorrar tendinitis.
Pero predecir la siguiente línea no es lo mismo que resolver un problema. Copilot en modo sugerencia no tiene objetivo, no verifica nada, no sabe si su propuesta compila y se olvida de todo apenas cierras el archivo. Es un pasante entusiasta con amnesia anterógrada: escribe rapidísimo y no recuerda la reunión de ayer.
Qué convierte a un modelo en agente
Cuatro cosas, y las cuatro son de ingeniería, no de modelo:
- Objetivo: un estado final verificable, no un prompt suelto. “Que
pnpm testpase” es un objetivo. “Mejora esto” es un deseo. - Herramientas: leer archivos, editar, ejecutar comandos, consultar la base. Sin herramientas el modelo solo puede opinar.
- Bucle con verificación: actuar, observar el resultado real, corregir. Un modelo que no ve la salida de su propia acción está adivinando con más pasos.
- Límites: qué puede tocar, cuánto puede gastar, cuándo se detiene. Un agente sin límites no es autónomo, es un incidente pendiente.
Quítale el bucle y tienes un autocompletado caro. Quítale las herramientas y tienes un chat. Quítale los límites y tienes una historia entretenida para el postmortem.
Por qué la demo siempre funciona
Porque la demo es un repositorio nuevo, con una tarea autocontenida, sin permisos, sin datos reales y sin tres años de decisiones raras acumuladas. Ahí cualquier modelo brilla.
Tu repo tiene un módulo que solo compila con una variable de entorno que no está documentada, un test que falla los martes y una convención que solo vive en la cabeza de alguien que ya renunció. El agente no falla por falta de inteligencia; falla por falta de contexto, y el contexto es responsabilidad tuya, no del modelo.
Lo que sí cambió, y no es poco
Un modelo que puede correr el test suite y leer el error cambia la economía de tareas específicas: migraciones mecánicas, renombres masivos, cobertura de tests aburrida, traducción entre APIs. Trabajo real, medible en horas.
Donde sigue siendo malo: decidir qué construir, negociar un requisito ambiguo, saber que la solución elegante rompe un contrato con otro equipo. O sea, exactamente lo que hace que un senior sea senior.
El consejo aburrido
Antes de comprar la palabra “agente”, pregunta tres cosas: qué herramientas tiene, cómo verifica que terminó, y qué pasa cuando se equivoca. Si la respuesta a la tercera es “el usuario revisa”, no compraste un agente. Compraste un generador de trabajo de revisión.
Lo cual puede estar bien, siempre que sepas que ese es el trato.