Files
siop2/apps/ai/src/siop_ai/transcription.py
pr-daaif 59ed6f3952 feat(r5): dictée — audio local (faster-whisper) → note → corpus (ADR-004 §5)
Écran Voix R5 (maquetté, jamais construit) implémenté sur décision du
référent : open-source et local, pas d'API externe.

- apps/ai : faster-whisper (CTranslate2, CPU, MIT) opt-in
  (AI_TRANSCRIPTION=off|locale|deterministe, défaut off) ; endpoint
  /internal/transcrire — l'audio ne survit JAMAIS à l'appel (fichier
  temporaire supprimé quoi qu'il arrive) ; indexer_bilans inclut
  désormais InterventionReport.note anonymisée (champ existant depuis
  R2, jamais eu d'écran jusqu'ici) ; 29 pytest.
- Contrat (77 opérations) : POST /assistant/transcribe (multipart).
- API : proxy multipart vers siop2-ai (WORK_ORDERS.edit — même droit
  que la saisie du bilan) ; 2 tests e2e (80 tests API au total).
- Mobile : expo-audio + expo-file-system, bouton dicter/terminer sur
  l'écran de clôture, purge locale après transcription, « Joindre la
  description à l'OT » (corrige un bug latent : enfilerBilan ignorait
  silencieusement les mises à jour de note).
- Docker : siop2-ai embarque le modèle Whisper au build (1,54→2,19 Go),
  construit et vérifié (transcription réelle en conteneur, non-root).
- Vérifié réellement : transcription fidèle (voix de synthèse
  française) en direct, bout en bout via l'API, dans le conteneur
  Docker construit, et chaîne corpus complète (note → clôture →
  réindexation → recherche sémantique).
- Base de dev locale réinitialisée avec accord explicite du référent
  (prisma migrate reset, bloqué par défaut pour un agent IA) après
  pollution par les tests manuels de la recette terrain précédente.

Reste : test tactile sur iPhone physique (bouton dicter) — bloqué par
une connexion USB qui ne s'est pas rétablie malgré câble/port/
redémarrage essayés à plusieurs reprises, reporté comme la recette
Android.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-22 11:55:47 +01:00

55 lines
2.3 KiB
Python

"""Transcription audio (dictée R5, ADR-004 §5) : l'audio ne survit JAMAIS à
cet appel — un fichier temporaire le temps de l'inférence, supprimé aussitôt,
quoi qu'il arrive (D5, loi 09-08). Seul le texte transcrit est retourné ; la
relecture humaine reste le seul contenu conservé, dans l'OT (D1).
"""
import os
import tempfile
from typing import Protocol
class Transcripteur(Protocol):
def transcrire(self, audio: bytes, extension: str) -> str: ...
class TranscripteurLocal:
"""faster-whisper (CTranslate2, CPU, licence MIT) — chargé paresseusement,
jamais importé en test. Modèle et langue forcée en français : le mélange
français/darija du terrain reste un point de vigilance non calibré (pas
de mesure préalable demandée par le référent, 22/07/2026) — à revoir sur
échantillons réels si la qualité déçoit en recette."""
def __init__(self, modele: str) -> None:
from faster_whisper import WhisperModel # import différé (dépendance optionnelle)
self._modele = WhisperModel(modele, device="cpu", compute_type="int8")
def transcrire(self, audio: bytes, extension: str) -> str:
fd, chemin = tempfile.mkstemp(suffix=f".{extension}")
try:
with os.fdopen(fd, "wb") as f:
f.write(audio)
segments, _ = self._modele.transcribe(chemin, language="fr", vad_filter=True)
return " ".join(segment.text.strip() for segment in segments).strip()
finally:
os.remove(chemin) # D5 — l'audio ne doit JAMAIS survivre à l'appel
class TranscripteurDeterministe:
"""Tests/CI : pas de modèle, pas de dépendance audio réelle — renvoie un
texte stable dérivé de la taille du fichier (même interface)."""
def transcrire(self, audio: bytes, extension: str) -> str:
return f"transcription déterministe ({len(audio)} octets, .{extension})"
def construire_transcripteur(mode: str, modele: str) -> Transcripteur | None:
"""None si la dictée n'est pas activée (AI_TRANSCRIPTION=off, défaut) —
l'appelant doit alors refuser proprement (503), pas planter."""
if mode == "off":
return None
if mode == "deterministe":
return TranscripteurDeterministe()
return TranscripteurLocal(modele)