From 0730bf9dad97bbf65dfd026310dc8af693702ae5 Mon Sep 17 00:00:00 2001
From: pr-daaif
Date: Wed, 22 Jul 2026 10:44:03 +0100
Subject: [PATCH] =?UTF-8?q?docs(r5):=20amender=20l'=C3=A9cran=20Voix=20?=
=?UTF-8?q?=E2=80=94=20la=20transcription=20alimente=20aussi=20le=20corpus?=
MIME-Version: 1.0
Content-Type: text/plain; charset=UTF-8
Content-Transfer-Encoding: 8bit
L'écran 6 (dictée, jamais construite — option « si budget temps ») dit
maintenant explicitement que la description relue et jointe à l'OT
rejoint le corpus de l'assistant à la clôture, anonymisée comme les
bilans codés. Idée discutée avec le référent (transcription locale via
faster-whisper envisagée, moteur/calibrage tranchés dans le détail),
maquette amendée et validée — implémentation non demandée pour
l'instant.
Co-Authored-By: Claude Fable 5
---
docs/02-design/maquettes/maquette-r5.html | 8 +++++-
docs/journal/journal.md | 31 +++++++++++++++++++++++
2 files changed, 38 insertions(+), 1 deletion(-)
diff --git a/docs/02-design/maquettes/maquette-r5.html b/docs/02-design/maquettes/maquette-r5.html
index 469da78..d1ab975 100644
--- a/docs/02-design/maquettes/maquette-r5.html
+++ b/docs/02-design/maquettes/maquette-r5.html
@@ -496,7 +496,10 @@ loi 09-08 : l'anonymisation à l'ingestion est dite, pas cachée dans une CGU.
Intention : l'option « si budget temps » du
cadrage : dicter au lieu de taper, mains sales sur le palier. L'audio est transcrit puis
PURGÉ immédiatement (loi 09-08) — le bandeau le dit au moment même. La transcription devient la
-description libre de l'écran 4 : même circuit, même validation humaine.
+description libre de l'écran 4 : même circuit, même validation humaine. Amendement (22/07) :
+une fois relue et jointe à l'OT, cette description vit dans le bilan (champ note) — et, à la clôture,
+rejoint le corpus de l'assistant comme les autres bilans, anonymisée par le même pipeline (D4). Le
+technicien le sait dès l'écran de relecture : rien de cité n'est caché a posteriori.
@@ -543,6 +546,9 @@ description libre de l'écran 4 : même circuit, même validation humaine.
✨ Suggérer les codes depuis ce texte
Joindre la description à l'OT
+
🛡 À la clôture de l'OT, ce texte (anonymisé)
+ rejoindra le corpus de l'assistant — comme les bilans déjà codés, pour aider les prochaines
+ interventions sur ce parc.
diff --git a/docs/journal/journal.md b/docs/journal/journal.md
index 105b4e5..4b86c03 100644
--- a/docs/journal/journal.md
+++ b/docs/journal/journal.md
@@ -4,6 +4,37 @@ Trace chronologique des sessions (la plus récente en premier). Le **playbook**
---
+## 2026-07-22 — Pr. Daaif (+ Claude) — Idée backlog : transcription audio → corpus (maquette amendée, pas codée)
+
+**Actions**
+
+- Discussion de conception (aucun code) : étendre l'écran « Voix » de R5 (dictée, jamais construite — option
+ « si budget temps ») pour que la transcription relue, une fois jointe à l'OT, **alimente aussi le corpus** de
+ l'assistant à la clôture — pas seulement la description libre ponctuelle de la suggestion.
+- Écarté : Ollama local pour les embeddings du corpus (déjà 100 % locaux via `fastembed`, aucun gain — pertinent
+ plutôt pour remplacer l'API Claude opt-in de génération, piste non creusée).
+- Moteur retenu pour une future transcription locale : `faster-whisper` (CTranslate2, MIT, CPU) — même
+ philosophie que les embeddings. Point de vigilance identifié : Whisper transcrit mal le darija, probable en
+ mélange avec le français sur le terrain.
+- Point d'accroche trouvé dans le schéma existant : `InterventionReport.note` (texte libre) existe déjà en base
+ et en UI mais n'est **pas encore indexé** dans le corpus (`indexer_bilans` ne reprend que les libellés codés).
+- Gap identifié dans `anonymisation.py` : reconnaît seulement les noms CONNUS de la base, pas de NER générale —
+ risque de fuite plus élevé sur de la parole libre que sur des libellés codés.
+- **Maquette amendée et validée** (`maquette-r5.html`, écran 6 « Voix ») : bandeau d'intention et carte
+ « Et ensuite » disent maintenant explicitement que le texte (anonymisé) rejoint le corpus à la clôture de l'OT.
+
+**Décisions**
+
+- Pas de prototype de mesure préalable (contrairement au calibrage des embeddings R5) — le calibrage
+ français/darija se fera plus tard si besoin.
+- **Implémentation non demandée pour l'instant** — la maquette est validée, le code attend un prochain feu vert.
+
+**Prochaine étape** : reprendre sur demande du référent — implémentation cohérente avec le flux esquissé (audio
+jamais persisté, transcription → `InterventionReport.note` → corpus à la clôture), moteur et calibrage déjà
+tranchés, pas à rediscuter.
+
+---
+
## 2026-07-19 — Pr. Daaif (+ Claude) — Recette terrain mobile sur iPhone 15 Pro : les 7 points validés (ADR-005)
**Actions**