Caso de estudio · Sistemas de IA: agentes, equipos y resultados
Caso: un estudio de mercado con seis agentes de IA en paralelo, un día de captura y una auditoría dato a dato
Sebastián Ocampo · 2026-07-25
Queríamos saber qué pide de verdad el mercado europeo cuando contrata dirección de IA, y no había estudio que citara ofertas literales. Así que lo hicimos nosotros: este es el sistema con el que un equipo de una persona produce investigación de mercado auditable en días, no en meses. Todo lo que afirma este caso se puede reconstruir desde el dataset.
- 6 Agentes de investigación en paralelo, uno por segmento de mercado
- 83 → 79 Ofertas capturadas en un día → filas en alcance tras limpieza y deduplicación
- 2 Errores que bloqueaban la publicación, encontrados por la auditoría independiente antes de publicar
El problema: un mercado que no se deja leer
La pregunta era concreta: ¿qué piden por escrito las empresas suizas y europeas cuando contratan dirección de IA? No opiniones de consultora ni encuestas de percepción: las responsabilidades literales, los KPIs, las líneas de reporte y los salarios de ofertas reales. Esa evidencia no existía publicada, y producirla a mano es un trabajo de semanas: encontrar decenas de ofertas vivas en cuatro idiomas, extraer de cada una más de veinte campos, mantener la procedencia de cada dato y no contaminar nada con memoria o suposición.
Y había un obstáculo peor que el volumen: las fuentes se defienden. Los buscadores de los portales de empleo suizos y LinkedIn bloquean el acceso automatizado, así que la ruta obvia (un scraper clásico sobre los listados) estaba cerrada, y la ruta perezosa (pedirle a un modelo "qué pide el mercado") habría producido exactamente el tipo de informe sin fuentes que queríamos evitar. Hacía falta un sistema que navegara como investigador, extrajera como base de datos y rindiera cuentas como un científico de datos.
El sistema: seis agentes, un contrato de datos
El diseño divide el mercado en seis segmentos (liderazgo en Suiza, liderazgo DACH, transformación, finanzas y operaciones, marketing y crecimiento, Benelux con nórdicos y Francia) y lanza un agente de investigación por segmento, en paralelo. Cada agente navega páginas de empleo de empresas, sistemas ATS públicos y portales accesibles, y entrega sus hallazgos en un archivo JSON por segmento con el mismo esquema. La captura completa se hizo en un solo día.
La fiabilidad no vive en los agentes sino en el contrato que firman. Tres reglas de extracción: los campos de texto se copian literalmente de la oferta (responsabilidades, KPIs, salario tal cual aparece), lo que no está visible se deja vacío en lugar de estimarse, y cada fila lleva la URL donde la oferta fue vista, con las réplicas de portales espejo etiquetadas como tales. Después de la fusión y la deduplicación, cada estadística del estudio se calcula con una definición escrita y congelada en un archivo de resultados, de modo que cualquier cifra se puede recontar desde el dataset sin preguntarle a nadie. El flujo completo, del brief a la publicación:
- Brief y definiciones
- Seis agentes en paralelo
- Extracción a 22 campos
- Fusión y deduplicación
- Estadísticas congeladas
- Auditoría independiente
- Correcciones documentadas
- Publicación con fuentes
Las decisiones: por qué esto y no aquello
Cada pieza del sistema desplazó a una alternativa concreta. Esta tabla es la parte del caso que más vale robar: no las herramientas, sino los porqués.
| Decisión | Alternativa descartada | Por qué |
|---|---|---|
| Seis agentes en paralelo, uno por segmento | Un solo agente secuencial | El paralelismo convierte semanas en un día, y el corte por segmento da a cada agente un contexto pequeño y coherente: menos confusión, mejores extracciones. |
| Extracción literal a campos estructurados | Resúmenes redactados por el agente | Un resumen mezcla lo que la oferta dice con lo que el modelo espera que diga. El texto literal se puede verificar contra la fuente; el resumen no. |
| Celda vacía cuando el dato no es visible | Dejar que el modelo estime o complete | Es la regla anti-alucinación más barata que existe: un hueco honesto se puede rellenar después; un dato inventado envenena todas las estadísticas que lo tocan. |
| Definiciones de cada estadística congeladas en un archivo | Contar a demanda cada vez que se cita | Sin definición congelada, la misma pregunta da números distintos según quién cuente y cuándo. Nos pasó de verdad: ver la sección de fallos. |
| Auditoría por un sistema independiente antes de publicar | Confiar en el pipeline que produjo los datos | Quien produce un dato no debe ser quien lo aprueba. El recuento independiente reprodujo cada cifra y encontró dos errores que habrían salido publicados. |
| URL de origen en cada fila del dataset | Dataset sin procedencia por fila | La procedencia por fila es lo que separa un estudio citable de una opinión con tabla: cualquier lector puede ir a la oferta y comprobar. |
La cuenta honesta: lo que costó y lo que no medimos
Lo verificable: la captura completa (83 ofertas, seis segmentos, cuatro idiomas de origen) se hizo en un día de trabajo con los seis agentes en paralelo, dentro de suscripciones de IA ya contratadas, sin coste incremental de plataforma. La auditoría independiente añadió una segunda pasada sobre el dataset. El equivalente manual de la sola captura y extracción (decenas de ofertas leídas campo a campo en alemán, francés, inglés y español) es trabajo de semanas para una persona; no publicamos una cifra de "horas ahorradas" porque no operamos ese proceso manual como línea base, y estimarla de memoria es exactamente lo que este sistema prohíbe.
Lo que no medimos, y es el fallo más útil de contar: no registramos el consumo de tokens de esta ejecución, así que no podemos publicar el coste por oferta extraída, y no lo vamos a inventar. La lección ya está aplicada: la ampliación del corpus a 150-300 ofertas correrá con medición de tokens y de horas de agente desde el primer minuto, y ese número saldrá publicado aquí. El método para convertir tokens, suscripciones y supervisión en coste por unidad está en la calculadora del blueprint de operación de contenido; le faltaba su dato de entrada, y esa es la moraleja: instrumenta antes de ejecutar, no después.
El resultado, y cómo se midió
El resultado es un dataset de 79 ofertas en alcance (de 83 capturadas), con 22 campos por fila, 74 filas con extracción del texto completo y las 5 restantes marcadas como nivel resumen, procedencia por fila y un archivo de estadísticas con definiciones congeladas. El criterio de medición fue externo por diseño: cada cifra de cabecera fue recontada de forma independiente contra el dataset crudo, y la publicación quedaba bloqueada hasta reproducirlas todas. Todas se reprodujeron tras dos correcciones (contadas abajo), y las reglas de redacción quedaron escritas para que las cifras no se deformen al citarse: por ejemplo, 38 de 79 ofertas "exigen KPIs medibles", que no es lo mismo que "exigen ROI", y la diferencia importa.
El dataset ya está produciendo piezas: el blueprint para contratar un Chief AI Officer sale entero de él, igual que el átomo qué hace un Chief AI Officer. El estudio completo se publicará cuando el corpus crezca a 150-300 ofertas con las mismas definiciones. Esa es la otra mitad del resultado: una infraestructura de investigación reutilizable, no un informe de usar y tirar.
Lo que falló
Cuatro fallos reales, con su corrección, porque un registro de fallos vacío solo significa que nadie apunta. Uno: un falso positivo de cumplimiento. La búsqueda del texto "AI Act" marcó una oferta suiza que en realidad decía "AI activities"; el recuento automático daba dos ofertas nombrando la ley europea cuando la cifra real es una. Lo cazó la auditoría leyendo el contexto de cada coincidencia, y la regla quedó escrita: toda coincidencia de cadena se verifica en contexto antes de contarse.
Dos: el campo de país mezclaba formatos ("CH" y "Switzerland" en filas distintas), así que los recuentos por país no cuadraban con las estadísticas publicadas hasta que se añadió una columna normalizada con código de país. Tres: una cifra de cabecera (24 títulos Head of AI) no era reproducible porque su definición vivía en la cabeza de quien la contó; hubo que congelarla por escrito (títulos que empiezan por Head of AI, Head of Artificial Intelligence o Head of Data & AI: 22 más 0 más 2) para que cualquier recuento futuro dé lo mismo. Y cuatro: los buscadores de portales bloqueados sesgan la muestra hacia empleadores con ATS público, y 5 filas solo alcanzaron nivel resumen. Ese sesgo no se pudo eliminar; se pudo declarar, y está declarado en la metodología y en cada pieza que usa el dataset.
La gobernanza del dato: las reglas que hicieron el resto
Todo el sistema cuelga de reglas de integridad escritas antes de lanzar el primer agente: ninguna oferta se inventa ni se embellece; cada fila conserva su URL; los espejos y las estimaciones se etiquetan en la propia fila; las filas fuera de ventana o de región se conservan en el dataset marcadas como fuera de alcance, en lugar de borrarse, para que la limpieza sea inspeccionable; y las definiciones y reglas de redacción viajan con los datos para que las cifras no muten al citarse. Es la misma gobernanza que aplicamos a todo lo que publica esta casa, aplicada a investigación: los agentes hacen el trabajo, las reglas deciden qué cuenta como verdad, y una persona firma.
La consecuencia práctica para cualquier empresa: este nivel de rigor no encarece el proyecto, lo abarata. Las dos correcciones de la auditoría costaron horas; el mismo error descubierto por un lector después de publicar habría costado la credibilidad del estudio entero. En investigación con agentes, la gobernanza no es el freno: es lo que convierte velocidad en algo publicable.
Cómo replicar este sprint de investigación en tu empresa
El mismo patrón sirve para cualquier pregunta de mercado que viva en fuentes públicas dispersas: qué piden las licitaciones de tu sector, qué prometen los competidores en sus fichas, qué exigen los reguladores en cada país donde vendes. Seis pasos:
- Escribe la pregunta y el esquema antes que ningún prompt Una pregunta concreta y una tabla vacía: qué campos tendrá cada fila, cuáles son literales y cuáles calculados. Si no puedes dibujar la tabla vacía, aún no sabes qué estás investigando.
- Escribe el contrato de integridad Tres reglas mínimas: literal o vacío (nunca estimado), URL de origen en cada fila, y toda anomalía etiquetada en la propia fila. Este documento es más importante que la elección de modelo.
- Divide el terreno en segmentos y lanza un agente por segmento Por geografía, idioma o categoría: lo que produzca lotes pequeños y coherentes. Cada agente entrega en el mismo esquema. El paralelismo es lo que comprime semanas en un día.
- Instrumenta la ejecución desde el primer minuto Registra tokens, tiempo de agente y horas humanas de revisión mientras ocurre. Es el paso que nosotros nos saltamos y por eso este caso no puede publicar su coste por oferta: aprende de nuestro hueco.
- Congela las definiciones y calcula las estadísticas una sola vez Cada cifra que vayas a citar se define por escrito y se calcula contra el dataset, y el resultado se guarda en un archivo. A partir de ahí, todo el mundo cita el archivo, nadie recuenta de memoria.
- Haz auditar por alguien que no construyó el pipeline Otra persona u otro sistema recuenta cada cifra de cabecera desde el dataset crudo, con la publicación bloqueada hasta que todas reproduzcan. Presupuesta medio día: es el seguro más barato del proyecto.
Hacia dónde evoluciona (leído en julio de 2026)
Lo inmediato ya está decidido: la ampliación del corpus a 150-300 ofertas con las mismas definiciones congeladas, medición de tokens y horas desde el primer minuto, y la publicación del estudio completo con el dataset abierto. Lo estructural es más interesante: los agentes de investigación mejoran cada trimestre en navegación y en idiomas, así que el coste de repetir este sprint cae mientras su valor sube, y eso convierte la investigación de mercado en algo que se reejecuta cada trimestre en lugar de encargarse una vez al año. La ventaja competitiva se desplaza del acceso a los datos (que se abarata) a lo que casi nadie está montando: el contrato de integridad, las definiciones congeladas y la auditoría independiente que hacen que un dataset producido por agentes sea citable. Quien tenga esa infraestructura publicará evidencia mientras sus competidores publican opiniones.
Este caso es el segundo sistema en producción documentado en este lab, tras la operación editorial con agentes. El marco general, en Sistemas de IA.
Preguntas frecuentes
- ¿Cómo evitáis que los agentes se inventen ofertas o datos?
- Con el contrato, no con la confianza: los campos de texto se copian literalmente de la oferta, lo que no es visible se deja vacío en lugar de estimarse, y cada fila lleva la URL donde la oferta fue vista, de modo que cualquier fila se puede verificar contra su fuente. Encima de eso, una auditoría independiente recontó cada estadística de cabecera contra el dataset crudo antes de usarla. No encontró filas inventadas; encontró dos errores de conteo, que es exactamente el tipo de fallo que ese diseño existe para cazar.
- ¿Cuánto costó producir el dataset?
- Un día de captura con seis agentes en paralelo más una pasada de auditoría, dentro de suscripciones ya contratadas y sin coste de plataforma adicional. El coste exacto en tokens no lo sabemos porque no lo medimos en esta ejecución, y preferimos decírtelo a inventar una cifra: la ampliación a 150-300 ofertas correrá instrumentada desde el primer minuto y su coste por oferta se publicará. Si quieres estimar un proyecto así para tu empresa, la estructura de coste (tokens, suscripciones, supervisión humana) está desglosada con calculadora en el blueprint de operación de contenido.
- ¿Por qué agentes y no un scraper clásico?
- Porque el trabajo no era descargar páginas sino leerlas. Las fuentes eran heterogéneas (ATS de empresa, portales, páginas de carrera en cuatro idiomas), muchas bloquean el acceso automatizado masivo, y el valor estaba en extraer campos semánticos (responsabilidades literales, línea de reporte, matices de salario como "sobrepaga según experiencia") que un scraper de selectores no entiende. Un agente navega fuentes irregulares y extrae significado; el contrato de integridad y la auditoría le quitan el riesgo que trae a cambio. Para páginas uniformes y estables, un scraper clásico sigue siendo más barato: esta no era esa tarea.
- ¿Puede mi equipo replicar esto sin programadores?
- El patrón sí; la ambición inicial debe ser menor. Con una herramienta de agentes generalista y sin escribir código se puede ejecutar la versión pequeña: una pregunta, un esquema de tabla, el contrato de integridad (literal o vacío, URL por fila), dos o tres agentes por segmento y una persona que reconte las cifras antes de usarlas. Lo que sí exige algo de oficio es la fase de estadísticas congeladas y auditoría scriptada. Empieza por la versión pequeña sobre una pregunta que te importe; si el resultado te cambia una decisión, ya sabes que vale la pena montar la versión instrumentada.
- ¿Cuándo se publica el estudio completo?
- Cuando el corpus crezca de 79 a entre 150 y 300 ofertas con las mismas definiciones congeladas, la misma auditoría y la ejecución instrumentada. Publicar el piloto como si fuera el estudio habría sido más rápido y peor: la muestra piloto ya alimenta piezas que citan su tamaño y sus sesgos honestamente, y el estudio saldrá con el dataset abierto para que cualquiera lo recuente.
Fuentes
- How we built our multi-agent research system · Anthropic · 2025-06
- Building effective agents · Anthropic · 2024-12
- AI Risk Management Framework · NIST · 2023
- El blueprint construido con este dataset · y8y.ai · 2026-07
Más casos y método, en Sistemas de IA: agentes, equipos y resultados.