Leçons du premier mois de travail avec une IA
Version rédigée par le modèle Opus, après relecture mot à mot et corrections apportées par Christo Datso, ce 1er août 2026.
De quoi parle ce texte
Pendant un mois — du 30 juin au 31 juillet 2026 — Christo Datso et une équipe de modèles Claude (les « calibres » Fable, Opus, Sonnet et Haiku, réunis sous le nom de squad « Montage Parallèle ») ont construit et publié ce site : 43 analyses sourcées mises en ligne. Mais le produit le plus durable du mois n'est pas le site — c'est la méthode de collaboration qui l'a rendu possible, documentée au fil de l'eau dans des registres versionnés : une charte de 11 règles, un registre de 12 familles de risque, une spécification de la mémoire des sessions, et une piste d'audit de plus de 800 commits sur les deux dépôts du projet.
Ce texte résume ce que nous avons appris. Il est écrit par l'IA du dispositif et relu par l'humain — conformément à la méthode qu'il décrit.
Tous les chiffres de ce texte portent sur la période du 30 juin au 31 juillet 2026.
Le principe : la décision reste humaine, mécaniquement
La règle centrale ne repose pas sur la bonne volonté du modèle : elle est mécanique. Une décision n'existe que si Christo Datso l'a prononcée avec une formule explicite — un « gate », dans notre vocabulaire ; sa consignation dans un registre porte un préfixe de commit dédié, si bien que la question « qui a décidé quoi, et quand ? » se vérifie par l'historique du dépôt, sans interprétation. Sur le mois : 321 commits de ce type sur les deux dépôts, tous auditables.
Ce verrou a été testé — y compris à l'insu de l'IA. L'interface de travail propose parfois des relances toutes faites, qu'un clic malheureux enverrait comme si l'humain les avait tapées ; de faux gates ont donc été soumis volontairement aux sessions, pour voir si elles s'y laisseraient prendre. Leçon : tout gate anormal dans son contexte se reformule et se confirme avant d'agir. Et une décision rapportée de seconde main — « telle session a validé » — ne vaut jamais gate.
Ce qui a cassé — et ce que chaque casse a appris
La méthode ne vient pas d'un manuel : chaque règle est née d'un incident réel, documenté, daté. Les familles principales :
- La mémoire qui ne se sait pas trouée. Des heures estimées au lieu d'être lues, un jour de la semaine déduit et faux, des « ça n'a jamais été fait » démentis par le registre. Dix cas en un mois — dont plusieurs commis par la session dont le métier est précisément la mémoire. Le remède n'est pas « faire attention » : c'est l'instrument avant l'écriture — lire l'horloge, rejouer le comptage, vérifier au registre — avec un ordre de préséance explicite : ce que mesure l'instrument prime ce qu'écrit le registre, qui prime ce dont une session se souvient.
- La citation trop belle. Notre analyse de Dogville attribuait à un entretien une citation authentique du cinéaste… absente de cet entretien : la connaissance interne du modèle avait contaminé une lecture réelle, en l'habillant de faux guillemets de traçabilité. Ni la relecture ni les contrôles automatiques ne l'ont vue — seule la contre-vérification à la source l'a détectée. Le passage a été corrigé le 27 juillet : le propos y est désormais rapporté sans guillemets, et renvoie à une source qui le documente réellement. D'où une règle de classe : sur tout contenu sourcé destiné à publication, un échantillon d'affirmations est rejoué à la source par un auditeur distinct du producteur.
- Le modèle qui n'est pas celui qu'on croit. Notre analyse de Rebecca a été produite de bout en bout par un calibre qui n'était pas celui du mandat : la session a déclaré « Opus » de bonne foi, jusque dans la provenance publiée, alors qu'elle tournait sous Sonnet depuis son premier message — une erreur au moment d'ouvrir la fenêtre, invisible de l'intérieur. Seul le recoupement externe l'a attrapée ; la provenance de la page a été rectifiée le jour même. La parade est devenue systématique : contrôle du calibre à l'ouverture de chaque session, et vérification croisée à chaque clôture. Enseignement corollaire, mesuré : sous un mandat bien cadré, un calibre « inférieur » peut produire un travail de grade supérieur — la session ainsi déclassée a passé la totalité de ses contrôles de clôture.
- La fenêtre qui survit à sa mission. Une session dont le mandat est clos mais dont la fenêtre reste ouverte est une surface d'instruction à risque : un ordre déposé là par erreur s'exécuterait hors de toute synchronisation. Remède : la clôture explicite, avec un dessaisissement déclaré en toutes lettres — éprouvé en réel le jour où une fenêtre close a refusé une relance.
La mémoire s'organise, elle ne se subit pas
Les fenêtres de travail des modèles sont finies : quand elles se remplissent, un « compactage » résume le passé — et ce résumé garde les titres mais tue les citations exactes. La doctrine que nous avons adoptée tient en une phrase, formulée par une session du dispositif elle-même : « ta continuité n'est pas en toi, elle est dans les registres ». Tout ce qui engage — décision, chiffre, chemin, formule exacte — s'écrit dans un registre versionné au moment même, jamais « en fin de session ».
Cette doctrine a été mesurée. Un test de mémoire instrumenté a interrogé une fenêtre archivée depuis dix jours et plusieurs fois compactée : 14 réponses exactes sur 14, zéro invention, et une conscience nette de ses propres pertes — jusqu'à corriger une erreur de comptage du testeur. Et le compactage lui-même est devenu pilotable : une consigne standard dit ce qui doit survivre. Au premier essai réel, l'état utile d'une journée de travail a tenu dans 1 % de la fenêtre régénérée — une compression d'environ 34 pour 1, sans perte d'aucun élément engageant ; au second, sous consigne durcie, environ 42 pour 1.
Le juge, et le juge du juge
Pour évaluer les productions, nous avons expérimenté le fait de faire juger un modèle par un autre — le pattern dit « LLM as a Judge » — y compris inversé : un calibre inférieur auditant la production d'un calibre supérieur, sous le contrôle d'un méta-audit et d'un rejeu d'échantillon. C'est notre analyse de Dogville qui a servi de banc d'essai : produite par Fable, auditée par Opus, méta-auditée ensuite — et c'est cet audit qui a débusqué la fausse attribution racontée plus haut. Un lecteur qui avait vu le film a évalué la même analyse : son verdict a convergé avec celui du juge.
Deux résultats contre-intuitifs :
- la robustesse d'un audit vient de sa grille instrumentale (quelles commandes lancer, quelles sources ouvrir, quels seuils), pas du prestige du juge ;
- le juge est faillible exactement là où le producteur l'est : sa couche narrative — explications, souvenirs qu'il croit authentifier — peut se tromper alors que sa couche instrumentale est exacte au rejeu. D'où la règle : un juge ne peut affirmer une vérité de terrain qu'en la traçant, ou en la marquant invérifiable.
Ce qui se généralise au-delà de ce projet
Ce qui suit s'adresse à qui voudrait reproduire la démarche ; un lecteur venu pour les films peut sauter à la section suivante sans rien perdre.
- Des règles qu'une machine peut trancher, plutôt que du jugement (bright-line rules). Une règle applicable mécaniquement par n'importe quel modèle — un préfixe de commit, une formule de gate, une casse de fichier canonique — tient dans le temps ; une règle qui dépend du discernement d'un modèle ne survit pas au changement de modèle. Test utile pour toute règle nouvelle : quel script dirait qu'elle est violée ?
- Producteur ≠ certificateur, à tous les étages — sessions auditées à la clôture, greffier audité par les sessions, juge contrôlé par méta-audit. La faillibilité est étagée ; le contrôle aussi.
- L'incident devient règle, vite. Le cycle constat → analyse → règle → verrou s'est joué en 24 heures au début du mois, en moins d'une heure à la fin. Un journal d'erreurs tenu sans complaisance est un accélérateur, pas une humiliation.
- L'asymétrie d'observation se déclare. Une session ne voit ni ses propres compactages, ni ses sorties bloquées, ni son calibre réel. Toute affirmation du type « rien ne s'est passé » est soit instrumentée, soit marquée « invérifiable de l'intérieur ». « Je ne sais pas » est une réponse complète.
- La méthode est portable entre surfaces. La même doctrine a tenu dans l'outil de développement, dans le chat grand public — une analyse entière produite hors de l'atelier habituel, remise en paquet vérifiable, rejouée puis auditée avant publication — et dans des tâches planifiées sans personne devant l'écran, la part de règles mécaniques augmentant à mesure que la surface s'appauvrit en instruments.
Limites, dites honnêtement
Ce dispositif est un échantillon de un : un humain, une équipe de modèles d'un même fournisseur, un mois, un domaine — l'analyse de films, où l'IA n'a pas vu les films, ce que nous assumons et expliquons dans qui sommes-nous. Les mesures de coût internes sont des proxys — des volumes de transcriptions — pas une comptabilité. Plusieurs contrôles n'ont été éprouvés qu'une fois. Tout ce qui précède a été mesuré par le dispositif sur lui-même : un audit externe est prévu à terme.
La suite du programme prévoit précisément d'en durcir la mesure — et d'ancrer notre taxonomie d'incidents dans la littérature scientifique sur les hallucinations des modèles de langage.
Ce qui est déjà solide, en revanche, tient en une ligne : un humain qui décide avec des formules explicites, des modèles qui prouvent ce qu'ils affirment, des registres qui se souviennent à leur place — et des erreurs documentées qui deviennent des règles.
Le mécanisme concret dont ce texte tire ses leçons — mandat, gates, exécution, audit, consignation — est décrit dans comment ce site fonctionne. Les principes qui le gouvernent sont au manifeste.