Blog

Le corpus : ce que l’agent IA a le droit de lire

31 août 2026 La Rédaction 3 min read

Quand on parle d’IA citoyenne, un mot revient tout le temps : le corpus. C’est le cœur technique et politique de la démarche. Voici, le plus simplement possible, ce que ça veut dire.

Un agent IA ne sait rien par lui-même

C’est contre-intuitif, mais c’est le point de départ. Notre point de départ, en tout cas. Notre agent IA n’a pas de connaissances stockées quelque part sur Niort. Il ne « sait » pas les horaires de la médiathèque. Rien. Ce qu’il sait faire, c’est juste lire des documents qu’on lui donne, y chercher ce qui répond à votre question, et vous restituer la réponse en français simple. On appelle ça la recherche augmentée (RAG, en jargon technique).

Le corpus, c’est l’ensemble des documents qu’on lui donne à lire. Rien d’autre n’entre.

Quand on sait pas, on sait pas. Point.

Imaginez quelqu’un au guichet de la mairie, un jour de prise de poste. Cette personne ne répond pas de mémoire : elle a devant elle une pile de classeurs. Les délibérations du conseil municipal. La FAQ du site de la Ville. Les données ouvertes de l’agglo.

Elle lit, elle trouve, elle répond, et elle vous montre la page. Le corpus, ce sont ces classeurs.

Deux conséquences immédiates. Si un document n’est pas dans la pile, l’agent ne peut pas inventer la réponse : il dit qu’il ne sait pas. Et si la réponse est fausse, ce n’est pas « l’IA » qui a déraillé — c’est un document précis, identifiable, qu’on peut aller contester.

Ce qu’il y a dedans au démarrage

Les six premiers mois, nous limitons volontairement la pile. Le site de la Ville de Niort pour tout ce qui est factuel et administratif. Le site de l’agglomération. Puis deux ou trois sources complémentaires définies avec le comité éditorial. Cinq à dix sources indexées, pas cent. Un petit corpus bien tenu vaut mieux qu’un gros corpus approximatif. On élargit ensuite, mais selon des règles.

Qui décide de ce qui entre ?

C’est là que ça devient intéressant. Choisir les sources, c’est choisir ce que l’agent peut dire. C’est une décision éditoriale, donc politique.

Nous ne voulons pas que cette décision appartienne à un actionnaire, ni à un prestataire technique, ni à un seul élu. Elle appartient à deux dispositifs publics : une charte des sources, qui fixe les critères d’entrée (fiabilité, fraîcheur, intérêt général), et un comité éditorial mixte, qui tranche les cas litigieux et publie ses décisions.

Chaque réponse cite ses sources. Un bouton « cette réponse est inexacte » permet à n’importe qui de signaler un problème, qui remonte au comité.

Pourquoi c’est le vrai sujet

On nous demande souvent quel modèle d’IA nous utilisons. Mistral pour commencer, un modèle open-source auto-hébergé ensuite. La réponse est honnête, mais elle passe à côté de l’essentiel.

Le modèle est interchangeable. Dans trois ans, trois mois, trois jours, il aura changé. Ce qui reste, ce qui a de la valeur, ce qui appartient au territoire, c’est le corpus : la liste des sources, la charte qui les gouverne, et l’historique des arbitrages.

On n’arbitre pas une IA. On arbitre son corpus. C’est pour ça que nous y passons autant de temps.