feat(r5): dictée — audio local (faster-whisper) → note → corpus (ADR-004 §5)

Écran Voix R5 (maquetté, jamais construit) implémenté sur décision du
référent : open-source et local, pas d'API externe.

- apps/ai : faster-whisper (CTranslate2, CPU, MIT) opt-in
  (AI_TRANSCRIPTION=off|locale|deterministe, défaut off) ; endpoint
  /internal/transcrire — l'audio ne survit JAMAIS à l'appel (fichier
  temporaire supprimé quoi qu'il arrive) ; indexer_bilans inclut
  désormais InterventionReport.note anonymisée (champ existant depuis
  R2, jamais eu d'écran jusqu'ici) ; 29 pytest.
- Contrat (77 opérations) : POST /assistant/transcribe (multipart).
- API : proxy multipart vers siop2-ai (WORK_ORDERS.edit — même droit
  que la saisie du bilan) ; 2 tests e2e (80 tests API au total).
- Mobile : expo-audio + expo-file-system, bouton dicter/terminer sur
  l'écran de clôture, purge locale après transcription, « Joindre la
  description à l'OT » (corrige un bug latent : enfilerBilan ignorait
  silencieusement les mises à jour de note).
- Docker : siop2-ai embarque le modèle Whisper au build (1,54→2,19 Go),
  construit et vérifié (transcription réelle en conteneur, non-root).
- Vérifié réellement : transcription fidèle (voix de synthèse
  française) en direct, bout en bout via l'API, dans le conteneur
  Docker construit, et chaîne corpus complète (note → clôture →
  réindexation → recherche sémantique).
- Base de dev locale réinitialisée avec accord explicite du référent
  (prisma migrate reset, bloqué par défaut pour un agent IA) après
  pollution par les tests manuels de la recette terrain précédente.

Reste : test tactile sur iPhone physique (bouton dicter) — bloqué par
une connexion USB qui ne s'est pas rétablie malgré câble/port/
redémarrage essayés à plusieurs reprises, reporté comme la recette
Android.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
pr-daaif
2026-07-22 11:55:47 +01:00
parent 0730bf9dad
commit 59ed6f3952
28 changed files with 782 additions and 20 deletions

View File

@@ -51,6 +51,23 @@
réseau privé — la règle d'or ESLint d'ADR-001 concerne le code TypeScript de l'API,
la topologie « MinIO jamais exposé » du runbook reste respectée.
5. **Transcription (dictée, R5 D5) : locale, opt-in, jamais de persistance de l'audio.**
Amendement du 22/07/2026 — le référent choisit `faster-whisper` (CTranslate2, CPU,
licence MIT) plutôt qu'une API externe, même philosophie que les embeddings : « open
source et local ». `AI_TRANSCRIPTION=off` par défaut (endpoint refuse proprement,
503) ; `locale` charge le modèle (taille configurable par `AI_TRANSCRIPTION_MODEL`,
défaut `small`) ; `deterministe` en tests/CI (aucune dépendance audio). Le flux :
l'audio ne transite qu'une fois vers `siop2-ai` (multipart, jamais écrit sur disque
par `siop2-api`), un fichier temporaire le temps de l'inférence côté `siop2-ai`,
**supprimé aussitôt quoi qu'il arrive** — succès ou erreur (loi 09-08, D5). Seul le
texte transcrit revient, à relire par l'humain (D1) avant tout usage : suggestion de
bilan immédiate, et/ou sauvegarde dans `InterventionReport.note` — qui, à la clôture
de l'OT, rejoint le corpus comme les libellés codés (même pipeline d'anonymisation,
D4). **Point de vigilance non calibré** (décision explicite du référent : pas de
prototype de mesure préalable, contrairement au choix du modèle d'embeddings) :
Whisper transcrit mal le darija, probable en mélange avec le français sur le
terrain — à mesurer sur des enregistrements réels si la qualité déçoit en recette.
## Conséquences
- L'anonymisation (D4) s'applique **à l'ingestion** — les index ne contiennent jamais
@@ -58,3 +75,11 @@
- Le mode extractif est le contrat de base : toute recette R5 doit passer SANS clé API.
- Si le partenaire veut un jour une génération 100 % locale (llama.cpp…), seul le point 3
change — interface `Generateur` prévue pour ça.
- La dictée (point 5) est opt-in et sans mesure de qualité préalable : à recetter avec
attention avant toute promesse de qualité au client, en particulier en darija.
- Implémentée et vérifiée le 22/07/2026 : transcription réelle (français, voix de
synthèse) juste et rapide en local, bout en bout via l'API NestJS, et dans l'image
Docker de production construite pour l'occasion (modèle embarqué, aucun téléchargement
au démarrage). **Reste** : le test tactile sur iPhone physique (bouton dicter, permission
micro) n'a pas pu se jouer — blocage USB persistant malgré câble/port/redémarrage
multiples, reporté comme la recette Android (attend un accès matériel qui fonctionne).