mirror of
https://github.com/siop-spelev/siop2.git
synced 2026-08-08 20:51:53 +00:00
feat(r5): dictée — audio local (faster-whisper) → note → corpus (ADR-004 §5)
Écran Voix R5 (maquetté, jamais construit) implémenté sur décision du référent : open-source et local, pas d'API externe. - apps/ai : faster-whisper (CTranslate2, CPU, MIT) opt-in (AI_TRANSCRIPTION=off|locale|deterministe, défaut off) ; endpoint /internal/transcrire — l'audio ne survit JAMAIS à l'appel (fichier temporaire supprimé quoi qu'il arrive) ; indexer_bilans inclut désormais InterventionReport.note anonymisée (champ existant depuis R2, jamais eu d'écran jusqu'ici) ; 29 pytest. - Contrat (77 opérations) : POST /assistant/transcribe (multipart). - API : proxy multipart vers siop2-ai (WORK_ORDERS.edit — même droit que la saisie du bilan) ; 2 tests e2e (80 tests API au total). - Mobile : expo-audio + expo-file-system, bouton dicter/terminer sur l'écran de clôture, purge locale après transcription, « Joindre la description à l'OT » (corrige un bug latent : enfilerBilan ignorait silencieusement les mises à jour de note). - Docker : siop2-ai embarque le modèle Whisper au build (1,54→2,19 Go), construit et vérifié (transcription réelle en conteneur, non-root). - Vérifié réellement : transcription fidèle (voix de synthèse française) en direct, bout en bout via l'API, dans le conteneur Docker construit, et chaîne corpus complète (note → clôture → réindexation → recherche sémantique). - Base de dev locale réinitialisée avec accord explicite du référent (prisma migrate reset, bloqué par défaut pour un agent IA) après pollution par les tests manuels de la recette terrain précédente. Reste : test tactile sur iPhone physique (bouton dicter) — bloqué par une connexion USB qui ne s'est pas rétablie malgré câble/port/ redémarrage essayés à plusieurs reprises, reporté comme la recette Android. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -7,7 +7,7 @@ from contextlib import asynccontextmanager
|
||||
from dataclasses import asdict
|
||||
|
||||
import asyncpg
|
||||
from fastapi import Depends, FastAPI, Header, HTTPException
|
||||
from fastapi import Depends, FastAPI, Header, HTTPException, UploadFile
|
||||
from pydantic import BaseModel, Field
|
||||
|
||||
from .assistant import repondre, suggerer_bilan
|
||||
@@ -16,6 +16,7 @@ from .embeddings import construire_embeddeur
|
||||
from .generation import construire_generateur
|
||||
from .ingestion import reindexer_tout
|
||||
from .recherche import chercher
|
||||
from .transcription import construire_transcripteur
|
||||
|
||||
|
||||
@asynccontextmanager
|
||||
@@ -26,6 +27,9 @@ async def cycle_de_vie(app: FastAPI):
|
||||
app.state.generateur = construire_generateur(
|
||||
reglages.ai_generation, reglages.ai_api_key, reglages.ai_model
|
||||
)
|
||||
app.state.transcripteur = construire_transcripteur(
|
||||
reglages.ai_transcription, reglages.ai_transcription_model
|
||||
)
|
||||
app.state.pool = await asyncpg.create_pool(reglages.database_url, min_size=1, max_size=5)
|
||||
yield
|
||||
await app.state.pool.close()
|
||||
@@ -50,6 +54,7 @@ async def sante() -> dict:
|
||||
"status": "ok",
|
||||
"service": "siop2-ai",
|
||||
"generation": reglages.ai_generation, # « off » = extractif — jamais la clé
|
||||
"transcription": reglages.ai_transcription,
|
||||
}
|
||||
|
||||
|
||||
@@ -113,3 +118,16 @@ async def suggerer(corps: RequeteSuggestion) -> dict:
|
||||
seuil_confiance_forte=app.state.reglages.ai_seuil_confiance_forte,
|
||||
)
|
||||
return {"suggestions": [asdict(s) for s in suggestions]}
|
||||
|
||||
|
||||
@app.post("/internal/transcrire", dependencies=[Depends(verifier_jeton)])
|
||||
async def transcrire(fichier: UploadFile) -> dict:
|
||||
"""Dictée opt-in (R5 D5, loi 09-08) : l'audio ne persiste JAMAIS — un
|
||||
fichier temporaire le temps de l'inférence, supprimé aussitôt (voir
|
||||
transcription.py). 503 propre si AI_TRANSCRIPTION=off (défaut)."""
|
||||
if app.state.transcripteur is None:
|
||||
raise HTTPException(status_code=503, detail="Transcription non activée (AI_TRANSCRIPTION=off)")
|
||||
audio = await fichier.read()
|
||||
extension = (fichier.filename or "audio.m4a").rsplit(".", 1)[-1]
|
||||
texte = app.state.transcripteur.transcrire(audio, extension)
|
||||
return {"texte": texte}
|
||||
|
||||
@@ -29,6 +29,10 @@ class Reglages(BaseSettings):
|
||||
ai_seuil_pertinence: float = 0.45
|
||||
ai_seuil_suggestion: float = 0.40
|
||||
ai_seuil_confiance_forte: float = 0.55
|
||||
# Dictée opt-in (R5 D5, ADR-004 §5) : « off » (défaut — endpoint refuse
|
||||
# proprement), « locale » (faster-whisper, CPU) ou « deterministe » (CI).
|
||||
ai_transcription: str = "off"
|
||||
ai_transcription_model: str = "small" # tiny|base|small|medium|large-v3
|
||||
|
||||
model_config = {"env_prefix": "", "case_sensitive": False}
|
||||
|
||||
@@ -43,4 +47,6 @@ def charger_reglages() -> Reglages:
|
||||
raise ValueError("AI_GENERATION doit valoir « off » ou « api »")
|
||||
if reglages.ai_generation == "api" and not reglages.ai_api_key:
|
||||
raise ValueError("AI_GENERATION=api exige AI_API_KEY (voir ADR-004 §3)")
|
||||
if reglages.ai_transcription not in ("off", "locale", "deterministe"):
|
||||
raise ValueError("AI_TRANSCRIPTION doit valoir « off », « locale » ou « deterministe »")
|
||||
return reglages
|
||||
|
||||
@@ -119,7 +119,7 @@ async def indexer_bilans(
|
||||
await cnx.execute('DELETE FROM "RagChunk" WHERE "sourceType" = \'WORK_ORDER\'')
|
||||
bilans = await cnx.fetch(
|
||||
'''
|
||||
SELECT wo.id, wo.reference, wo.title, wo."completedAt",
|
||||
SELECT wo.id, wo.reference, wo.title, wo."completedAt", ir.note,
|
||||
a.reference AS asset_ref, a.brand, a.model,
|
||||
(SELECT json_object_agg(rv.field, rv.label)
|
||||
FROM "InterventionReport" ir2
|
||||
@@ -137,10 +137,13 @@ async def indexer_bilans(
|
||||
for bilan in bilans:
|
||||
champs = json.loads(bilan["bilan"]) if bilan["bilan"] else {}
|
||||
codes = " ; ".join(f"{champ} : {label}" for champ, label in champs.items())
|
||||
# note (D5) : dictée ou saisie libre relue par l'humain — même pipeline
|
||||
# d'anonymisation que le reste, aucun traitement à part.
|
||||
note = f" Description libre : {bilan['note']}." if bilan["note"] else ""
|
||||
contenu = anonymiser(
|
||||
f"Intervention {bilan['reference']} — {bilan['title']}. "
|
||||
f"Appareil {bilan['asset_ref']} ({bilan['brand']} {bilan['model'] or ''}). "
|
||||
f"Bilan codé : {codes}.",
|
||||
f"Bilan codé : {codes}.{note}",
|
||||
noms,
|
||||
)
|
||||
quand = bilan["completedAt"].date().isoformat() if bilan["completedAt"] else "date inconnue"
|
||||
|
||||
54
apps/ai/src/siop_ai/transcription.py
Normal file
54
apps/ai/src/siop_ai/transcription.py
Normal file
@@ -0,0 +1,54 @@
|
||||
"""Transcription audio (dictée R5, ADR-004 §5) : l'audio ne survit JAMAIS à
|
||||
cet appel — un fichier temporaire le temps de l'inférence, supprimé aussitôt,
|
||||
quoi qu'il arrive (D5, loi 09-08). Seul le texte transcrit est retourné ; la
|
||||
relecture humaine reste le seul contenu conservé, dans l'OT (D1).
|
||||
"""
|
||||
|
||||
import os
|
||||
import tempfile
|
||||
from typing import Protocol
|
||||
|
||||
|
||||
class Transcripteur(Protocol):
|
||||
def transcrire(self, audio: bytes, extension: str) -> str: ...
|
||||
|
||||
|
||||
class TranscripteurLocal:
|
||||
"""faster-whisper (CTranslate2, CPU, licence MIT) — chargé paresseusement,
|
||||
jamais importé en test. Modèle et langue forcée en français : le mélange
|
||||
français/darija du terrain reste un point de vigilance non calibré (pas
|
||||
de mesure préalable demandée par le référent, 22/07/2026) — à revoir sur
|
||||
échantillons réels si la qualité déçoit en recette."""
|
||||
|
||||
def __init__(self, modele: str) -> None:
|
||||
from faster_whisper import WhisperModel # import différé (dépendance optionnelle)
|
||||
|
||||
self._modele = WhisperModel(modele, device="cpu", compute_type="int8")
|
||||
|
||||
def transcrire(self, audio: bytes, extension: str) -> str:
|
||||
fd, chemin = tempfile.mkstemp(suffix=f".{extension}")
|
||||
try:
|
||||
with os.fdopen(fd, "wb") as f:
|
||||
f.write(audio)
|
||||
segments, _ = self._modele.transcribe(chemin, language="fr", vad_filter=True)
|
||||
return " ".join(segment.text.strip() for segment in segments).strip()
|
||||
finally:
|
||||
os.remove(chemin) # D5 — l'audio ne doit JAMAIS survivre à l'appel
|
||||
|
||||
|
||||
class TranscripteurDeterministe:
|
||||
"""Tests/CI : pas de modèle, pas de dépendance audio réelle — renvoie un
|
||||
texte stable dérivé de la taille du fichier (même interface)."""
|
||||
|
||||
def transcrire(self, audio: bytes, extension: str) -> str:
|
||||
return f"transcription déterministe ({len(audio)} octets, .{extension})"
|
||||
|
||||
|
||||
def construire_transcripteur(mode: str, modele: str) -> Transcripteur | None:
|
||||
"""None si la dictée n'est pas activée (AI_TRANSCRIPTION=off, défaut) —
|
||||
l'appelant doit alors refuser proprement (503), pas planter."""
|
||||
if mode == "off":
|
||||
return None
|
||||
if mode == "deterministe":
|
||||
return TranscripteurDeterministe()
|
||||
return TranscripteurLocal(modele)
|
||||
Reference in New Issue
Block a user