Cas d’étude · Systèmes d'IA : agents, équipes et résultats

Cas : une étude de marché avec six agents d'IA en parallèle, un jour de capture et un audit donnée par donnée

Sebastián Ocampo · 2026-07-25

Nous voulions savoir ce que demande vraiment le marché européen quand il recrute une direction de l'IA, et aucune étude ne citait des offres littérales. Alors nous l'avons fait : voici le système avec lequel une équipe d'une personne produit une étude de marché auditable en jours, pas en mois. Tout ce qu'affirme ce cas peut être reconstruit depuis le dataset.

Le problème : un marché qui ne se laisse pas lire

La question était concrète : que demandent par écrit les entreprises suisses et européennes quand elles recrutent une direction de l'IA ? Pas des opinions de cabinet ni des enquêtes de perception : les responsabilités littérales, les KPI, les lignes de reporting et les salaires d'offres réelles. Cette évidence n'existait pas publiée, et la produire à la main est un travail de semaines : trouver des dizaines d'offres vivantes en quatre langues, extraire de chacune plus de vingt champs, maintenir la provenance de chaque donnée et ne rien contaminer par mémoire ou supposition.

Et il y avait un obstacle pire que le volume : les sources se défendent. Les moteurs des portails d'emploi suisses et LinkedIn bloquent l'accès automatisé, donc la route évidente (un scraper classique sur les listes) était fermée, et la route paresseuse (demander à un modèle "ce que demande le marché") aurait produit exactement le type de rapport sans sources que nous voulions éviter. Il fallait un système qui navigue comme un chercheur, extraie comme une base de données et rende des comptes comme un data scientist.

Le système : six agents, un contrat de données

Le design divise le marché en six segments (leadership en Suisse, leadership DACH, transformation, finance et opérations, marketing et croissance, Benelux avec les pays nordiques et la France) et lance un agent de recherche par segment, en parallèle. Chaque agent navigue sur les pages carrières d'entreprises, les ATS publics et les portails accessibles, et livre ses trouvailles dans un fichier JSON par segment au même schéma. La capture complète s'est faite en un seul jour.

La fiabilité ne vit pas dans les agents mais dans le contrat qu'ils signent. Trois règles d'extraction : les champs de texte se copient littéralement de l'offre (responsabilités, KPI, salaire tel qu'affiché), ce qui n'est pas visible reste vide au lieu d'être estimé, et chaque ligne porte l'URL où l'offre a été vue, les répliques de portails miroirs étiquetées comme telles. Après la fusion et la déduplication, chaque statistique de l'étude se calcule avec une définition écrite et gelée dans un fichier de résultats, si bien que tout chiffre peut être recompté depuis le dataset sans demander à personne. Le flux complet, du brief à la publication :

  1. Brief et définitions
  2. Six agents en parallèle
  3. Extraction en 22 champs
  4. Fusion et déduplication
  5. Statistiques gelées
  6. Audit indépendant
  7. Corrections documentées
  8. Publication avec sources

Les décisions : pourquoi ceci et pas cela

Chaque pièce du système a écarté une alternative concrète. Ce tableau est la partie du cas qui vaut le plus la peine d'être volée : pas les outils, les pourquoi.

DécisionAlternative écartéePourquoi
Six agents en parallèle, un par segmentUn seul agent séquentielLe parallélisme convertit des semaines en un jour, et la coupe par segment donne à chaque agent un contexte petit et cohérent : moins de confusion, meilleures extractions.
Extraction littérale en champs structurésRésumés rédigés par l'agentUn résumé mélange ce que dit l'offre avec ce que le modèle s'attend à ce qu'elle dise. Le texte littéral se vérifie contre la source ; le résumé non.
Cellule vide quand la donnée n'est pas visibleLaisser le modèle estimer ou compléterC'est la règle anti-hallucination la moins chère qui existe : un trou honnête peut se remplir après ; une donnée inventée empoisonne toutes les statistiques qui la touchent.
Définitions de chaque statistique gelées dans un fichierCompter à la demande à chaque citationSans définition gelée, la même question donne des nombres différents selon qui compte et quand. Cela nous est vraiment arrivé : voir la section des défaillances.
Audit par un système indépendant avant publicationFaire confiance au pipeline qui a produit les donnéesQui produit une donnée ne doit pas être qui l'approuve. Le recomptage indépendant a reproduit chaque chiffre et trouvé deux erreurs qui seraient parties publiées.
URL d'origine sur chaque ligne du datasetDataset sans provenance par ligneLa provenance par ligne est ce qui sépare une étude citable d'une opinion avec tableau : tout lecteur peut aller à l'offre et vérifier.

Le compte honnête : ce que cela a coûté et ce que nous n'avons pas mesuré

Le vérifiable : la capture complète (83 offres, six segments, quatre langues d'origine) s'est faite en un jour de travail avec les six agents en parallèle, dans des abonnements d'IA déjà souscrits, sans coût incrémental de plateforme. L'audit indépendant a ajouté une seconde passe sur le dataset. L'équivalent manuel de la seule capture-extraction (des dizaines d'offres lues champ par champ en allemand, français, anglais et espagnol) est un travail de semaines pour une personne ; nous ne publions pas un chiffre d'"heures économisées" parce que nous n'avons pas opéré ce processus manuel comme ligne de base, et l'estimer de mémoire est exactement ce que ce système interdit.

Ce que nous n'avons pas mesuré, et c'est la défaillance la plus utile à raconter : nous n'avons pas enregistré la consommation de tokens de cette exécution, donc nous ne pouvons pas publier le coût par offre extraite, et nous n'allons pas l'inventer. La leçon est déjà appliquée : l'extension du corpus à 150-300 offres tournera avec mesure des tokens et des heures d'agent dès la première minute, et ce nombre sera publié ici. La méthode pour convertir tokens, abonnements et supervision en coût par unité est dans le calculateur du blueprint d'opération de contenu ; il lui manquait sa donnée d'entrée, et c'est la morale : instrumentez avant d'exécuter, pas après.

Le résultat, et comment il a été mesuré

Le résultat est un dataset de 79 offres dans le périmètre (sur 83 capturées), avec 22 champs par ligne, 74 lignes en extraction de texte complet et les 5 restantes marquées niveau résumé, provenance par ligne et un fichier de statistiques aux définitions gelées. Le critère de mesure était externe par design : chaque chiffre de tête a été recompté indépendamment contre le dataset brut, et la publication restait bloquée jusqu'à toutes les reproduire. Toutes se sont reproduites après deux corrections (racontées plus bas), et les règles de rédaction sont écrites pour que les chiffres ne se déforment pas en se citant : par exemple, 38 offres sur 79 "exigent des KPI mesurables", ce qui n'est pas pareil qu'"exigent du ROI", et la différence compte.

Le dataset produit déjà des pièces : le blueprint pour recruter un Chief AI Officer en sort entièrement, comme l'atome que fait un Chief AI Officer. L'étude complète sera publiée quand le corpus atteindra 150-300 offres avec les mêmes définitions. C'est l'autre moitié du résultat : une infrastructure de recherche réutilisable, pas un rapport jetable.

Ce qui a échoué

Quatre défaillances réelles, avec leur correction, parce qu'un registre de défaillances vide signifie seulement que personne ne note. Un : un faux positif de conformité. La recherche du texte "AI Act" a marqué une offre suisse qui disait en réalité "AI activities" ; le comptage automatique donnait deux offres nommant la loi européenne quand le chiffre réel est un. L'audit l'a attrapé en lisant le contexte de chaque correspondance, et la règle est écrite : toute correspondance de chaîne se vérifie en contexte avant d'être comptée.

Deux : le champ pays mélangeait les formats ("CH" et "Switzerland" sur des lignes différentes), donc les comptages par pays ne collaient pas aux statistiques publiées jusqu'à l'ajout d'une colonne normalisée avec code pays. Trois : un chiffre de tête (24 titres Head of AI) n'était pas reproductible parce que sa définition vivait dans la tête de qui l'avait compté ; il a fallu la geler par écrit (titres commençant par Head of AI, Head of Artificial Intelligence ou Head of Data & AI : 22 plus 0 plus 2) pour que tout recomptage futur donne pareil. Et quatre : les moteurs de portails bloqués biaisent l'échantillon vers les employeurs à ATS public, et 5 lignes n'ont atteint que le niveau résumé. Ce biais n'a pas pu être éliminé ; il a pu être déclaré, et il l'est dans la méthodologie et dans chaque pièce qui utilise le dataset.

La gouvernance de la donnée : les règles qui ont fait le reste

Tout le système tient à des règles d'intégrité écrites avant de lancer le premier agent : aucune offre ne s'invente ni ne s'embellit ; chaque ligne conserve son URL ; les miroirs et les estimations s'étiquettent sur la ligne même ; les lignes hors fenêtre ou hors région se conservent dans le dataset marquées hors périmètre, au lieu d'être effacées, pour que le nettoyage soit inspectable ; et les définitions et règles de rédaction voyagent avec les données pour que les chiffres ne mutent pas en se citant. C'est la même gouvernance que nous appliquons à tout ce que publie cette maison, appliquée à la recherche : les agents font le travail, les règles décident ce qui compte comme vérité, et une personne signe.

La conséquence pratique pour toute entreprise : ce niveau de rigueur ne renchérit pas le projet, il le rend moins cher. Les deux corrections de l'audit ont coûté des heures ; la même erreur découverte par un lecteur après publication aurait coûté la crédibilité de l'étude entière. En recherche avec agents, la gouvernance n'est pas le frein : c'est ce qui convertit la vitesse en quelque chose de publiable.

Comment répliquer ce sprint de recherche dans votre entreprise

Le même motif sert pour toute question de marché qui vit dans des sources publiques dispersées : ce que demandent les appels d'offres de votre secteur, ce que promettent les concurrents dans leurs fiches, ce qu'exigent les régulateurs dans chaque pays où vous vendez. Six étapes :

  1. Écrivez la question et le schéma avant tout prompt Une question concrète et un tableau vide : quels champs aura chaque ligne, lesquels sont littéraux et lesquels calculés. Si vous ne pouvez pas dessiner le tableau vide, vous ne savez pas encore ce que vous cherchez.
  2. Écrivez le contrat d'intégrité Trois règles minimales : littéral ou vide (jamais estimé), URL d'origine sur chaque ligne, et toute anomalie étiquetée sur la ligne même. Ce document est plus important que le choix du modèle.
  3. Divisez le terrain en segments et lancez un agent par segment Par géographie, langue ou catégorie : ce qui produit des lots petits et cohérents. Chaque agent livre au même schéma. Le parallélisme est ce qui comprime des semaines en un jour.
  4. Instrumentez l'exécution dès la première minute Enregistrez tokens, temps d'agent et heures humaines de revue pendant que cela se produit. C'est l'étape que nous avons sautée et c'est pourquoi ce cas ne peut pas publier son coût par offre : apprenez de notre trou.
  5. Gelez les définitions et calculez les statistiques une seule fois Chaque chiffre que vous citerez se définit par écrit et se calcule contre le dataset, et le résultat se garde dans un fichier. Ensuite, tout le monde cite le fichier, personne ne recompte de mémoire.
  6. Faites auditer par quelqu'un qui n'a pas construit le pipeline Une autre personne ou un autre système recompte chaque chiffre de tête depuis le dataset brut, la publication restant bloquée jusqu'à ce que tous se reproduisent. Budgétez une demi-journée : c'est l'assurance la moins chère du projet.

Vers où cela évolue (lu en juillet 2026)

L'immédiat est déjà décidé : l'extension du corpus à 150-300 offres avec les mêmes définitions gelées, la mesure des tokens et des heures dès la première minute, et la publication de l'étude complète avec le dataset ouvert. Le structurel est plus intéressant : les agents de recherche s'améliorent chaque trimestre en navigation et en langues, donc le coût de répéter ce sprint baisse pendant que sa valeur monte, et cela transforme l'étude de marché en quelque chose qui se réexécute chaque trimestre au lieu de se commander une fois par an. L'avantage compétitif se déplace de l'accès aux données (qui devient bon marché) vers ce que presque personne ne monte : le contrat d'intégrité, les définitions gelées et l'audit indépendant qui rendent citable un dataset produit par des agents. Qui aura cette infrastructure publiera de l'évidence pendant que ses concurrents publieront des opinions.

Ce cas est le deuxième système en production documenté dans ce lab, après l'opération éditoriale avec agents. Le cadre général, dans Systèmes d'IA.

Questions fréquentes

Comment évitez-vous que les agents inventent des offres ou des données ?
Par le contrat, pas par la confiance : les champs de texte se copient littéralement de l'offre, ce qui n'est pas visible reste vide au lieu d'être estimé, et chaque ligne porte l'URL où l'offre a été vue, si bien que toute ligne peut se vérifier contre sa source. Par-dessus, un audit indépendant a recompté chaque statistique de tête contre le dataset brut avant usage. Il n'a pas trouvé de lignes inventées ; il a trouvé deux erreurs de comptage, exactement le type de défaillance que ce design existe pour attraper.
Combien a coûté la production du dataset ?
Un jour de capture avec six agents en parallèle plus une passe d'audit, dans des abonnements déjà souscrits et sans coût de plateforme additionnel. Le coût exact en tokens, nous ne le savons pas parce que nous ne l'avons pas mesuré sur cette exécution, et nous préférons vous le dire plutôt qu'inventer un chiffre : l'extension à 150-300 offres tournera instrumentée dès la première minute et son coût par offre sera publié. Pour estimer un tel projet dans votre entreprise, la structure de coût (tokens, abonnements, supervision humaine) est détaillée avec calculateur dans le blueprint d'opération de contenu.
Pourquoi des agents et pas un scraper classique ?
Parce que le travail n'était pas de télécharger des pages mais de les lire. Les sources étaient hétérogènes (ATS d'entreprise, portails, pages carrières en quatre langues), beaucoup bloquent l'accès automatisé massif, et la valeur était d'extraire des champs sémantiques (responsabilités littérales, ligne de reporting, nuances de salaire comme "surpaie selon expérience") qu'un scraper à sélecteurs ne comprend pas. Un agent navigue des sources irrégulières et extrait du sens ; le contrat d'intégrité et l'audit lui retirent le risque qu'il apporte en échange. Pour des pages uniformes et stables, un scraper classique reste moins cher : ce n'était pas cette tâche.
Mon équipe peut-elle répliquer cela sans développeurs ?
Le motif oui ; l'ambition initiale doit être moindre. Avec un outil d'agents généraliste et sans écrire de code, on peut exécuter la petite version : une question, un schéma de tableau, le contrat d'intégrité (littéral ou vide, URL par ligne), deux ou trois agents par segment et une personne qui recompte les chiffres avant usage. Ce qui exige du métier, c'est la phase des statistiques gelées et de l'audit scripté. Commencez par la petite version sur une question qui compte pour vous ; si le résultat change une de vos décisions, vous savez que la version instrumentée vaut la peine.
Quand l'étude complète sera-t-elle publiée ?
Quand le corpus passera de 79 à entre 150 et 300 offres avec les mêmes définitions gelées, le même audit et l'exécution instrumentée. Publier le pilote comme si c'était l'étude aurait été plus rapide et pire : l'échantillon pilote alimente déjà des pièces qui citent honnêtement sa taille et ses biais, et l'étude sortira avec le dataset ouvert pour que quiconque puisse recompter.

Sources

Plus de cas et la méthode, dans Systèmes d'IA : agents, équipes et résultats.