Cuánto cuesta hoy el reporte
- Un account manager de agencia dedica entre 6 y 12 horas por semana a reportes de clientes (consultance.ai, guía de operaciones de agencia con IA, 2026-06).
- Caso documentado: el reporte mensual pasó de 11 horas a 90 minutos con IA en el flujo; las propuestas, de 6 horas a 90 minutos (Lilach Bullock, consultora de agencias (Reino Unido), 2026).
- Un estudio de automatización con el SDK de agentes de Anthropic reporta una reducción del 80% en el tiempo de reporting en agencias (StudioMeyer, 26-02-2026; caso del propio proveedor, sin metodología publicada).
Para tu agencia el número correcto es el tuyo: cuántas horas por cliente por mes, medidas una semana antes de automatizar nada. El diagnóstico te da una estimación; el cronómetro te da el dato.
La arquitectura, paso por paso
- Extracción por API, con código. GA4 expone la Data API; Google Ads, la Google Ads API; Meta, la Marketing API. Cada cliente es una configuración (IDs de propiedad y cuenta, métricas que le importan, periodo). Sin scraping de paneles: rompe, viola términos y no deja rastro.
- Consolidación y cálculo, con código. Variaciones contra el mes anterior y contra el mismo mes del año pasado, costo por resultado, participación por canal. Todo cálculo vive en código probado, con tests, no en un prompt. La salida es una tabla con las cifras finales y sus definiciones.
- Detección de anomalías, con reglas y con histórico. Umbrales por métrica (un CPA que sube más de 30% en un mes, un canal que cae a cero) más comparación contra la serie del cliente. Las anomalías se marcan como hechos para que la narrativa las explique, no para que las descubra.
- Narrativa, con el modelo, sobre la tabla. El prompt recibe la tabla, las anomalías marcadas, la guía de tono del cliente y los objetivos del trimestre. Instrucción central: redactar la lectura y las recomendaciones citando solo cifras de la tabla, en español, en el formato del reporte (resumen ejecutivo, por canal, próximos pasos). Un borrador por cliente.
- Compuerta de cifras. Un paso automático extrae cada número del texto generado y lo busca en la tabla (con tolerancia de redondeo). Si aparece una cifra que no está, el borrador se rechaza y se regenera con el error señalado; a la segunda falla, se escala a una persona. Este paso es la razón por la que el harness no inventa datos.
- Compuerta de tono y de alcance. El texto no puede prometer resultados, no puede recomendar aumentar presupuesto sin que el account manager lo haya marcado como opción, y tiene que respetar la guía de tono. Se verifica con reglas y con una segunda pasada del modelo en rol de revisor con criterios explícitos.
- Aprobación humana. El account manager recibe el borrador con las anomalías resaltadas y los datos fuente a un clic. Edita, aprueba, envía. El harness registra qué se cambió: esas ediciones son la señal para mejorar el prompt el mes siguiente.
- Registro y medición. Por corrida: tiempo de máquina, tiempo humano de revisión, rechazos en la compuerta de cifras, cambios manuales. Esas cuatro series son la evidencia de que el harness funciona, o de que no.
Qué se automatiza y qué no
| Tarea | Quién la hace | Por qué |
|---|---|---|
| Bajar datos de GA4, Google Ads, Meta | Código (API) | Determinista, repetible, auditable |
| Calcular variaciones, costos por resultado, participaciones | Código con tests | Un modelo de lenguaje no debe hacer aritmética de cliente |
| Detectar anomalías | Reglas + histórico | Los umbrales son decisiones de la agencia, no del modelo |
| Redactar la lectura y las recomendaciones | Modelo, sobre la tabla | Es lenguaje, y ahí el modelo ahorra horas |
| Verificar que cada cifra del texto exista en la tabla | Compuerta automática | Cero tolerancia a cifras inventadas |
| Interpretar el «por qué» y decidir la recomendación | Account manager | Es la relación con el cliente; es lo que la agencia vende |
| Aprobar y enviar | Persona | Nada llega al cliente sin firma humana |
Qué herramienta usar
Las tres familias sirven para extraer y consolidar; se diferencian en las compuertas y en escalar a muchos clientes:
- Orquestadores visuales (n8n, Make): rápidos para conectar APIs y disparar el modelo; la compuerta de cifras se hace con un nodo de código. Convienen si en tu equipo hay alguien cómodo con ellos y los clientes son pocos. n8n tiene miles de plantillas de marketing en su biblioteca pública, útiles como punto de partida y peligrosas como producto final: ninguna trae la compuerta de cifras.
- Agentes con código (SDKs de Anthropic u OpenAI, con MCP para conectar las plataformas): más trabajo inicial, más fácil de probar, versionar y auditar cuando hay doce clientes con configuraciones distintas. Es lo que usamos cuando el reporte va directo al cliente.
- SaaS de reportes con IA (Reportei, Porter Metrics, Master Metrics, Looker Studio): resuelven el tablero y a veces la narrativa; no controlás la compuerta de calidad ni el tono, y el costo crece por cliente. Buena opción para agencias chicas que no van a mantener nada propio.
Errores que vimos (y cómo se evitan)
- Pedirle al modelo que «analice el CSV». Calcula mal, redondea distinto cada vez y no se puede auditar. El cálculo es código; el modelo redacta.
- Un solo prompt para todos los clientes. Cada cliente tiene métricas que le importan y palabras que no quiere leer. La configuración por cliente es parte del harness.
- Sin registro de ediciones. Si no sabés qué corrigió el account manager, no podés mejorar el flujo ni demostrar el ahorro.
- Automatizar el envío. El reporte lo manda una persona con su nombre. Siempre.
Cómo medir si funcionó
Cuatro números por mes: horas humanas por reporte (antes y después), tasa de rechazo en la compuerta de cifras (debe tender a cero), porcentaje del texto editado por el account manager (debe bajar mes a mes) y quejas del cliente por errores (debe ser cero). Si los cuatro no mejoran en dos meses, el problema es de diseño, no de adopción.