[DTP-Worker] Sprint 8 · buffer L75 · Gate intégrité chiffres : étendu à la fiche QA (vert-trompeur 21/534)

Fix vert-trompeur hors périmètre du gate README (session précédente) :
- 03_agents/qa/AGENT.md « Verdict agrégé courant » affichait 21 suites·534 tests
  (PASS) en se disant « jamais compté à la main » — figé à la main, périmé vs le
  run réel 22/551. Corrigé 21/534→22/551.
- ci/README.md : exemple 21·534→22·551 + checklist DevOps 6→7 gates statiques.
- Correctif de fond : ci/check_readme_claims.sh RECOMPUTE désormais aussi le compte
  agrégé de la fiche QA depuis regression_run.json (somme des suites commitées) ; un
  claim absent échoue aussi. Portée du gate élargie README + fiche QA (en-tête script
  + ci/README.md §1/§2). Bites : 21/534 → exit1 diff explicite ; claim retiré → exit1.

7 gates verts (dont check_artifacts : aucune dérive out/). Matrice 551/22 PASS inchangée.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
Claude Code DTP Worker
2026-07-31 03:36:26 +00:00
parent 97f859b6a5
commit c858e193e0
4 changed files with 127 additions and 11 deletions
+1 -1
View File
@@ -32,7 +32,7 @@ périmètre — un auditeur ne s'audite jamais.
**conformité** normative des hand-off. **conformité** normative des hand-off.
## Verdict agrégé courant (source `qa/regression/out/regression_run.json`) ## Verdict agrégé courant (source `qa/regression/out/regression_run.json`)
**21 suites gated · 534 tests · 534 passés · 0 échec · 0 erreur → verdict `PASS`.** **22 suites gated · 551 tests · 551 passés · 0 échec · 0 erreur → verdict `PASS`.**
Ce compte est **découvert automatiquement depuis le CI** (`q4lib.registry.parse_ci`, Ce compte est **découvert automatiquement depuis le CI** (`q4lib.registry.parse_ci`,
réutilisé sans duplication) — jamais compté à la main. réutilisé sans duplication) — jamais compté à la main.
+66
View File
@@ -1,5 +1,71 @@
# Activity Log · 2026-07-31 · Claude Code DTP # Activity Log · 2026-07-31 · Claude Code DTP
## Session `20260731_033001` · Buffer S8 · « Vert trompeur » : la fiche QA affichait un « verdict agrégé courant » PÉRIMÉ (21/534) en se disant « jamais compté à la main » — hors du périmètre du gate README
**Tâche** : **Sprint 8 · buffer L75** (DevOps CI/CD · QA). Roadmap fonctionnellement
close (22/22 modules 100/100, 551 tests verts, **7** gates statiques). Poursuite de la
série anti-dérive : le gate `check_readme_claims` créé la session précédente ne garde que
`README.md` ; recherche d'une **même classe de faux-vert hors de son périmètre**.
### Défaut trouvé — 3 chiffres périmés en SILENCE dans `03_agents/qa/AGENT.md` et `ci/README.md`
- **Mécanisme** : la session `030001` a corrigé le README **et** claimé avoir corrigé « 3
commentaires CI (21 suites · 534 tests) dans `ci.yml` et `check_regression.sh` ». Mais
son propre gate ne couvre **que** `README.md`. Deux autres docs d'entrée portaient
encore le compte **périmé** — invisibles pour tous les gates (`check_docs` ne valide que
les liens) :
- **`03_agents/qa/AGENT.md:35`** (le pire) : section « Verdict agrégé courant » →
*« **21 suites gated · 534 tests · 534 passés · 0 échec · 0 erreur → verdict `PASS`** »*
en déclarant, ligne suivante, *« jamais compté à la main »*. C'était pourtant un
compte **figé à la main** qui cite `qa/regression/out/regression_run.json` comme
source — alors que le run réel dit **22 / 551**. Une fiche d'agent QA qui **affirme
une matrice verte avec des chiffres faux** est le « vert trompeur » le plus grave.
- **`ci/README.md:80`** : exemple « compteurs cités partout » figé à « 21 suites · 534
tests · PASS » (→ 22 · 551).
- **`ci/README.md:184`** : checklist DevOps « les **6 gates** statiques » (→ **7** depuis
l'ajout de `check-readme-claims`).
- **Preuve au sol** : `git grep -nE '534|21 suites|6 gates'` sur `*.md` (hors logs)
ramenait les 3 lignes ; `regression_run.json` recalculé = **22 suites · 551 tests · 551
passés · 0 échec · 0 erreur · PASS** (somme des 22 suites du run commité).
### Fix (2 solutions · CLAUDE.md #4 — retenu : correction + extension du gate au-delà du README)
- **Correction des 3 chiffres** pour refléter les artefacts (fiche QA 21/534→22/551 ;
`ci/README.md` exemple 21·534→22·551 et checklist 6→7 gates). Ligne 132 « Les 6 gates
commençaient… » → « Les gates… » (le compte historique contredisait la table §1 à 7).
- **Correctif de fond** : **extension de `ci/check_readme_claims.sh`** (7ᵉ gate) au-delà du
README. Il **RECOMPUTE** désormais aussi le « Verdict agrégé courant » de la fiche QA
depuis `regression_run.json` (compte agrégé faisant autorité, commité · déterministe) :
`N suites · M tests · M passés · E échec · E erreur · verdict`, exige l'égalité avec ce
qui est **écrit** dans `03_agents/qa/AGENT.md`. Un claim **absent** échoue AUSSI. *(Alt.
écartée : 2ᵉ gate dédié — même classe de contrôle « valeur↔artefact » ; l'ajouter au gate
existant évite un doublon de câblage CI · #5.)* Le nom de fichier reste inchangé (pas de
ré-câblage `ci.yml`/INV-B) ; en-tête du script + `ci/README.md` §1 table + §2 détail mis
à jour pour la portée élargie (README **et** fiche QA).
### Preuves de morsure
- **Bite 1** (valeur périmée) : réintroduit « 21 suites · 534 tests » ⇒ gate **exit 1**
`✗ Fiche QA … dit 21/534/534/0/0/PASS MAIS regression_run dit 22/551/551/0/0/PASS`.
- **Bite 2** (claim disparu) : retire toute la ligne « Verdict agrégé » ⇒ **exit 1**
`✗ Fiche QA · verdict agrégé — claim INTROUVABLE`.
- **Restauré** ⇒ **exit 0** (les 6 claims README + le claim QA verts).
**Anti-invention (#6)** : rien inventé — le gate **recompute** la vérité depuis
`regression_run.json` (somme des suites du run commité) au lieu de figer un compteur ; les
3 chiffres corrigés sont tous recoupés sur cet artefact.
**Non-régression** : **7 gates** locaux verts, dont `check_artifacts` (rebuild + égalité
byte de tous les `out/`) ⇒ **aucune dérive d'artefact** (l'audit_4big ne lit ni `03_agents/`
ni `ci/` comme evidence → pas de régénération `quality_report`). Matrice **551/22 · PASS
inchangée**. Unique « 534 » résiduel = description **historique** volontaire du défaut
corrigé (`ci/README.md:130`, comme l'anecdote « demo 18→21 »).
**Hors périmètre worker (VPS · #8)** : néant (stdlib pur en-repo ; runner Gitea toujours
du ressort DevOps).
**Auto-score 4Big** : 96/100.
## Session `20260731_030001` · Buffer S8 · « Vert trompeur » : le README (point d'entrée) affichait des chiffres PÉRIMÉS que sa propre source contredisait — aucun gate ne les enforçait ## Session `20260731_030001` · Buffer S8 · « Vert trompeur » : le README (point d'entrée) affichait des chiffres PÉRIMÉS que sa propre source contredisait — aucun gate ne les enforçait
**Tâche** : **Sprint 8 · buffer L75** (DevOps CI/CD · QA). Roadmap fonctionnellement **Tâche** : **Sprint 8 · buffer L75** (DevOps CI/CD · QA). Roadmap fonctionnellement
+13 -7
View File
@@ -20,7 +20,7 @@ et manuellement (`workflow_dispatch`). Jobs statiques (+ une suite `unittest` pa
| `check-artifacts` | `ci/check_artifacts.sh` | Reproductibilité : chaque `out/*.json` versionné == build frais | ✅ oui | | `check-artifacts` | `ci/check_artifacts.sh` | Reproductibilité : chaque `out/*.json` versionné == build frais | ✅ oui |
| `check-regression` | `ci/check_regression.sh` | Fraîcheur : `qa/regression/out/regression_run.json` (`run`) == run frais + verdict PASS | ✅ oui | | `check-regression` | `ci/check_regression.sh` | Fraîcheur : `qa/regression/out/regression_run.json` (`run`) == run frais + verdict PASS | ✅ oui |
| `check-ci-integrity` | `ci/check_ci_integrity.sh` | Intégrité du câblage : `gate.needs` == tous les jobs non-manuels · chaque `ci/*.sh` câblé au gate | ✅ oui | | `check-ci-integrity` | `ci/check_ci_integrity.sh` | Intégrité du câblage : `gate.needs` == tous les jobs non-manuels · chaque `ci/*.sh` câblé au gate | ✅ oui |
| `check-readme-claims` | `ci/check_readme_claims.sh` | Intégrité des chiffres du README : chaque nombre de « État courant » == artefact cité (#6) | ✅ oui | | `check-readme-claims` | `ci/check_readme_claims.sh` | Intégrité des chiffres des docs d'entrée : chaque nombre de `README.md` « État courant » **et** de la fiche QA « Verdict agrégé » == artefact cité (#6) | ✅ oui |
| `gate` | — | Agrégat vert = gate qualité 4Big franchi | ✅ oui | | `gate` | — | Agrégat vert = gate qualité 4Big franchi | ✅ oui |
Aucune dépendance réseau/marketplace hors `actions/checkout`. Tout tourne avec Aucune dépendance réseau/marketplace hors `actions/checkout`. Tout tourne avec
@@ -77,8 +77,8 @@ Rejoue la **matrice de régression** complète (`qa/regression/regression_gen.py
de `check_artifacts` : celui-ci ne rejoue que `build` (→ `regression_plan.json`) et de `check_artifacts` : celui-ci ne rejoue que `build` (→ `regression_plan.json`) et
laisse hors périmètre l'artefact d'**exécution** `regression_run.json` — pourtant laisse hors périmètre l'artefact d'**exécution** `regression_run.json` — pourtant
c'est *lui* qui porte les compteurs cités partout dans la doc et les logs c'est *lui* qui porte les compteurs cités partout dans la doc et les logs
(« 21 suites · 534 tests · PASS »). Sans ce gate, ce chiffre pouvait se périmer en (« 22 suites · 551 tests · PASS »). Sans ce gate, ce chiffre pouvait se périmer en
silence (module + job CI ajoutés sans régénérer la matrice → « 21 suites » faux ; silence (module + job CI ajoutés sans régénérer la matrice → compte de suites faux ;
c'est la dérive « demo 18→21 » corrigée à la main), ou une matrice rouge être c'est la dérive « demo 18→21 » corrigée à la main), ou une matrice rouge être
commitée verte. `regression_run.json` ne contient aucun horodatage/hôte → le run est commitée verte. `regression_run.json` ne contient aucun horodatage/hôte → le run est
déterministe et l'égalité exacte licite. Correctif : `regression_gen.py run -o out` déterministe et l'égalité exacte licite. Correctif : `regression_gen.py run -o out`
@@ -118,18 +118,24 @@ README se **périment en silence** tout en restant « sourcés » vers un artefa
autre chose — un README qui se **contredit avec sa propre source** est un « vert autre chose — un README qui se **contredit avec sa propre source** est un « vert
trompeur » (même classe que la matrice périmée « demo 18→21 » ou INV4, appliqué à la trompeur » (même classe que la matrice périmée « demo 18→21 » ou INV4, appliqué à la
doc d'entrée). Ce gate **recompute** chaque chiffre depuis l'artefact cité (jamais une doc d'entrée). Ce gate **recompute** chaque chiffre depuis l'artefact cité (jamais une
liste à la main · #6) et exige l'égalité avec ce qui est **écrit** : liste à la main · #6) et exige l'égalité avec ce qui est **écrit** dans les deux
docs d'entrée — `README.md` :
- modules gated `N/M` à `K/100` + verdict `PASS``qa/audit_4big/out/quality_report.json` (`totals`) ; - modules gated `N/M` à `K/100` + verdict `PASS``qa/audit_4big/out/quality_report.json` (`totals`) ;
- `N` suites gated → `qa/regression/out/regression_plan.json` (`totals.suites`) ; - `N` suites gated → `qa/regression/out/regression_plan.json` (`totals.suites`) ;
- `N` promesses (`X` sprint + `Y` métriques), `Z` `in_repo`, verdict `true``qa/acceptance/out/acceptance_matrix.json` ; - `N` promesses (`X` sprint + `Y` métriques), `Z` `in_repo`, verdict `true``qa/acceptance/out/acceptance_matrix.json` ;
- « 13 agents » (×2 : nav + titre) → `git ls-files 03_agents/*/AGENT.md`. - « 13 agents » (×2 : nav + titre) → `git ls-files 03_agents/*/AGENT.md`.
Un claim **absent** du README échoue aussi (la dérive de formulation qui ferait Et la fiche QA `03_agents/qa/AGENT.md` (section « Verdict agrégé courant », qui se
disait « jamais compté à la main » tout en portant un compte figé qui s'est périmé
« 21 suites · 534 tests » vs le run réel `22 / 551 ») :
- `N` suites · `M` tests · `M` passés · `E` échec · `E` erreur · verdict → `qa/regression/out/regression_run.json` (compte agrégé faisant autorité, commité).
Un claim **absent** échoue aussi (la dérive de formulation qui ferait
disparaître un chiffre est elle-même une régression de traçabilité). stdlib pur disparaître un chiffre est elle-même une régression de traçabilité). stdlib pur
(bash/git/python3), zéro réseau. (bash/git/python3), zéro réseau.
### `lib.sh` — helper partagé (sourcé, jamais exécuté seul) ### `lib.sh` — helper partagé (sourcé, jamais exécuté seul)
Les 6 gates commençaient tous par `cd "$(git rev-parse --show-toplevel)"`. **Hors** Les gates commençaient tous par `cd "$(git rev-parse --show-toplevel)"`. **Hors**
d'un arbre de travail git (tarball, `git archive | tar -x`, `git` absent du PATH), d'un arbre de travail git (tarball, `git archive | tar -x`, `git` absent du PATH),
`git rev-parse` n'écrit rien → `cd ""` est un **no-op qui RETOURNE SUCCÈS** : le gate `git rev-parse` n'écrit rien → `cd ""` est un **no-op qui RETOURNE SUCCÈS** : le gate
poursuivait, `git ls-files` renvoyait une liste **vide**, et `validate_json` / poursuivait, `git ls-files` renvoyait une liste **vide**, et `validate_json` /
@@ -181,7 +187,7 @@ Actions** doit être activé, et le runner doit apparaître « Idle ».
- `[ ]` Gitea Actions activé au niveau instance ET repo. - `[ ]` Gitea Actions activé au niveau instance ET repo.
- `[ ]` `act_runner` enregistré, label `ubuntu-latest`, statut Idle. - `[ ]` `act_runner` enregistré, label `ubuntu-latest`, statut Idle.
- `[ ]` Push de test → les 6 gates statiques apparaissent et passent au vert. - `[ ]` Push de test → les 7 gates statiques apparaissent et passent au vert.
- `[ ]` PR de test avec violation volontaire → `constraints-guard` bloque (rouge). - `[ ]` PR de test avec violation volontaire → `constraints-guard` bloque (rouge).
--- ---
+47 -3
View File
@@ -19,14 +19,18 @@
# (« demo 18→21 ») ou l'orphan_tests_dirs (INV4) — appliqué à la doc d'entrée. # (« demo 18→21 ») ou l'orphan_tests_dirs (INV4) — appliqué à la doc d'entrée.
# #
# Ce gate RECOMPUTE chaque chiffre depuis l'artefact cité (jamais une liste à la # Ce gate RECOMPUTE chaque chiffre depuis l'artefact cité (jamais une liste à la
# main · #6) et exige l'égalité avec ce qui est ÉCRIT dans le README : # main · #6) et exige l'égalité avec ce qui est ÉCRIT dans les docs d'entrée :
# README.md :
# • Qualité 4Big N/M modules gated à K/100, verdict → qa/audit_4big totals # • Qualité 4Big N/M modules gated à K/100, verdict → qa/audit_4big totals
# • Régression N suites gated → qa/regression plan # • Régression N suites gated → qa/regression plan
# • Recette N promesses (X sprint + Y métriques), Z in_repo, verdict # • Recette N promesses (X sprint + Y métriques), Z in_repo, verdict
# → qa/acceptance matrix # → qa/acceptance matrix
# • Agents « 13 agents » (×2 : nav + titre) → 03_agents/*/AGENT.md # • Agents « 13 agents » (×2 : nav + titre) → 03_agents/*/AGENT.md
# Un claim absent du README échoue AUSSI (la dérive de formulation qui # 03_agents/qa/AGENT.md (fiche QA · « Verdict agrégé courant ») :
# ferait disparaître un chiffre est elle-même une régression de traçabilité). # • N suites · M tests · M passés · E échec · E erreur · verdict
# → qa/regression run
# Un claim absent échoue AUSSI (la dérive de formulation qui ferait disparaître
# un chiffre est elle-même une régression de traçabilité).
# #
# Dépendances : bash, git, python3 (stdlib pur · CLAUDE.md #2 — runner sans pip). # Dépendances : bash, git, python3 (stdlib pur · CLAUDE.md #2 — runner sans pip).
# ============================================================================ # ============================================================================
@@ -135,6 +139,46 @@ if re.search(r"verdict `true`", norm):
else: else:
bad("Recette · verdict `true` non cité dans README (attendu)") bad("Recette · verdict `true` non cité dans README (attendu)")
# ============================================================================
# Fiche QA (03_agents/qa/AGENT.md) · même classe de « vert trompeur » —
# ----------------------------------------------------------------------------
# Sa section « Verdict agrégé courant » affiche un compte agrégé (« N suites
# gated · M tests · M passés · 0 échec · 0 erreur → verdict PASS ») en déclarant
# « jamais compté à la main » et en citant qa/regression/out/regression_run.json.
# Ce compte se PÉRIME pourtant en silence quand une suite est ajoutée : la fiche
# affichait « 21 suites · 534 tests » alors que le run dit 22 / 551. Comme pour
# le README, aucun gate ne comparait la VALEUR au run. On la RECALCULE ici depuis
# le compte agrégé faisant autorité (regression_run.json, commité · déterministe).
# ============================================================================
QA = "03_agents/qa/AGENT.md"
try:
qa_txt = re.sub(r"\s+", " ", open(QA, encoding="utf-8").read())
except OSError as e:
bad(f"Fiche QA · {QA} illisible : {e}"); qa_txt = ""
run = load("qa/regression/out/regression_run.json")
suites = run["suites"]
agg = (
str(len(suites)), # suites
str(sum(s["ran"] for s in suites)), # tests exécutés
str(sum(s["passed"] for s in suites)), # passés
str(sum(s["failures"] for s in suites)), # échecs
str(sum(s["errors"] for s in suites)), # erreurs
run["verdict"], # verdict
)
qa_pat = (r"\*\*(\d+) suites gated · (\d+) tests · (\d+) passés · "
r"(\d+) échec · (\d+) erreur → verdict `(PASS|FAIL)`")
qa_src = (f"suites={agg[0]} tests={agg[1]} passés={agg[2]} "
f"échec={agg[3]} erreur={agg[4]} verdict={agg[5]}")
mqa = re.search(qa_pat, qa_txt)
if mqa is None:
bad(f"Fiche QA · verdict agrégé — claim INTROUVABLE dans {QA} (attendu {qa_src})")
elif mqa.groups() == agg:
good(f"Fiche QA · verdict agrégé — {QA} {'/'.join(mqa.groups())} == regression_run ({qa_src})")
else:
bad(f"Fiche QA · {QA} dit {'/'.join(mqa.groups())} MAIS regression_run dit "
f"{'/'.join(agg)} ({qa_src}) → régénérer la fiche")
sys.exit(1 if FAIL else 0) sys.exit(1 if FAIL else 0)
PY PY
rc=$? rc=$?