Definición (septiembre 2026). Un harness de IA es el sistema que rodea a un modelo para que un trabajo repetitivo salga bien todas las veces: las entradas (datos, contexto, herramientas), las reglas (qué puede hacer y qué no), las compuertas de calidad, los puntos de aprobación humana, el registro de lo que pasó y la medición del resultado. El modelo es una pieza; el harness es el sistema.

El término viene de la ingeniería de software: un test harness es el andamiaje que ejecuta pruebas, les da datos, controla el entorno y reporta resultados. En la ingeniería de agentes se usa igual: el código y el proceso que sujetan al modelo. La definición más citada de la industria es la de Birgitta Böckeler: «Harness» es todo lo que hay en un agente de IA excepto el modelo: se compone de guías (controles que actúan antes) y sensores (controles que actúan después), ejecutados por código determinista o por inferencia (Birgitta Böckeler, martinfowler.com, «Harness engineering», 2026-04-02). En español podría decirse «arnés» o «andamiaje», pero usamos la palabra de la industria para que puedas buscarla y compararla. Si preferís una imagen: es la línea de producción alrededor de una máquina muy capaz y muy distraída.

Cuánto pesa el sistema frente al modelo tiene medición: cambiar solo el harness, con el mismo modelo, subió el resultado en Terminal-Bench 2.0 de 52,8% a 66,5% (LangChain, «Improving Deep Agents with harness engineering», 2026-02-17). Y por qué hace falta la compuerta de verificación también: al resumir documentos, los mejores modelos alucinan entre 1,8% y 3,3% de las veces y varios modelos frontera entre 8% y 12%: sin una compuerta de verificación, alrededor de 1 de cada 10 resúmenes lleva un error factual (Vectara, Hallucination Leaderboard (HHEM), 2026-05-11).

Las siete piezas

  1. Entradas y contexto. Las fuentes de verdad del flujo: la API de la plataforma (nunca una captura de pantalla), la guía de tono del cliente, el brief aprobado, el histórico. Un harness define de dónde sale cada dato y prohíbe al modelo inventar lo que no recibió.
  2. Herramientas. Lo que el modelo puede usar: consultar Search Console, leer una hoja, buscar en la web, ejecutar un cálculo. Hoy se conectan con estándares como MCP, que evita escribir un conector distinto para cada modelo.
  3. Agentes especializados, no uno que hace todo. Un investigador, un redactor, un verificador, un revisor de tono. Cada uno con instrucciones cortas y una salida definida. Los flujos largos con un solo agente «inteligente» son los que se van de tema.
  4. Compuertas de calidad. Verificaciones automáticas entre pasos: ¿cada cifra del texto existe en la tabla de datos? ¿cada afirmación tiene una fuente que responde? ¿el texto respeta la guía de marca? Lo que no pasa se regenera con el error señalado o se escala.
  5. Aprobación humana donde importa. No en todos lados (eso mata el ahorro) ni en ninguno (eso mata al cliente). El harness marca qué piezas necesitan ojos humanos: todo lo que sale hacia un cliente o se publica, y todo lo que la compuerta no pudo verificar.
  6. Registro. Qué agente hizo qué, con qué entradas, qué rechazó la compuerta, qué cambió la persona. Sirve para auditar un error, para mejorar el flujo y para demostrarle al cliente cómo se hizo su trabajo.
  7. Medición. Horas humanas por pieza antes y después, tasa de rechazo en las compuertas, porcentaje editado por la persona, incidentes. Sin esto no hay forma de saber si funciona: solo hay sensación.

Harness, automatización, prompts y agente autónomo

Lista de promptsAutomatizaciónAgente autónomoHarness
Conecta herramientasNo
Verifica lo que produce el modeloNoNoA veces, a sí mismoSí, con reglas y datos
Decide cuándo interviene una personaLa persona hace todoNuncaNuncaDonde importa, por diseño
Registra decisionesNoLogs técnicosA vecesSí, legibles
Mide horas y calidadNoNoNo
Riesgo frente al clienteBajo, pero no ahorraMedioAltoBajo

Lo que dice la fuente primaria sobre cómo construirlos

Anthropic distingue «workflows» (LLMs orquestados por código con caminos predefinidos) de «agentes» (el modelo dirige su propio proceso) y recomienda empezar por la solución más simple, sumar complejidad solo cuando mejora resultados medibles, y mantener guardrails y puntos de control humanos (Anthropic, «Building effective agents», 2024-12-19). Los patrones que describe son exactamente los bloques de un harness de agencia:

  • Encadenamiento (prompt chaining): brief → outline → borrador → verificación, con una compuerta entre cada paso.
  • Enrutamiento: clasificar un comentario de redes en «responder con plantilla», «responder con borrador» o «escalar a persona».
  • Paralelización: doce reportes de clientes generados a la vez, cada uno con su configuración.
  • Orquestador y trabajadores: un coordinador reparte la investigación de un tema entre agentes y consolida.
  • Evaluador y optimizador: un agente redacta, otro evalúa contra criterios explícitos y devuelve el texto hasta que pasa.

La recomendación central del documento —empezar simple, sumar complejidad solo cuando mejora un resultado medible— es la razón por la que un harness de agencia arranca por reportes y no por «un agente que maneje la cuenta».

Ejemplos por área de una agencia

Contenido SEO y GEO

Intención → brief con fuentes primarias obligatorias → borrador con citas → verificación de que cada URL citada existe y dice lo que se afirma → QA editorial → schema → aprobación → publicación a ritmo controlado. Guía completa.

Reportes de clientes

APIs → cálculo en código → anomalías → narrativa sobre la tabla → compuerta que verifica cada cifra → aprobación del account manager. Guía completa.

Community management

Escucha → clasificación → borradores de respuesta y de posts → cola de aprobación → publicación solo con una persona; comentarios sensibles escalados siempre.

Pauta

Variantes de copy a partir del brief y de lo que funcionó → verificación de políticas de la plataforma → resumen semanal por cliente con anomalías → decisiones de presupuesto humanas.

Por qué la mayoría fracasa

Gartner prevé que más del 40% de los proyectos de agentes de IA se cancelen antes de 2027; el MIT estima que el 95% de los pilotos de IA generativa no llegan a producción (Gartner y MIT, vía Forbes Centroamérica, 2026-05-25). Las causas que vemos en agencias, en orden de frecuencia:

  • Empezar por la herramienta («compremos X») en vez de por el flujo y su medición.
  • Sin compuertas: el borrador del modelo va directo a la persona, que termina revisando tanto como antes escribía.
  • Autonomía sin aprobación: algo llegó a un cliente sin que nadie lo viera, y el proyecto se cerró por miedo.
  • Sin dueño interno: el flujo funciona mientras el proveedor está y se rompe con el primer cambio de API.
  • Sin medición: nadie puede demostrar el ahorro, así que el presupuesto se corta.

¿Tenés un harness o una lista de prompts? Diez preguntas

  1. ¿El modelo recibe los datos por API o alguien los copia y pega?
  2. ¿Hay un paso automático que verifique las cifras o las fuentes antes de que una persona lo lea?
  3. ¿Está escrito qué piezas requieren aprobación humana y cuáles no?
  4. ¿Podés ver, para una pieza publicada hace un mes, qué agente la hizo y quién la aprobó?
  5. ¿Sabés cuántas horas humanas lleva cada pieza hoy y cuántas llevaba antes?
  6. ¿Cada cliente tiene su configuración (tono, métricas, restricciones) o todos comparten un prompt?
  7. ¿Qué pasa cuando la compuerta rechaza algo dos veces seguidas? ¿Hay un camino de escalamiento?
  8. ¿Hay una persona de tu equipo que sea dueña del flujo y pueda cambiarlo?
  9. ¿Las credenciales de las plataformas están en cuentas de la agencia?
  10. ¿Podés apagarlo en un minuto y seguir operando a mano?

Menos de siete «sí»: tenés prompts, no un harness. Y no está mal: es el punto de partida de casi todas las agencias. El diagnóstico te dice por dónde empezar.