feat(r5): recette sans clé API + durcissement production siop2-ai

Recette (mode extractif, aucune clé) — elle a invalidé le modèle R5.1 :
- MiniLM-384 classait la page-réponse DERRIÈRE des passages sans rapport
  (0,24 vs 0,41 sur la question type du plan) → bascule mesurée vers
  paraphrase-multilingual-mpnet-base-v2 (768 d, local/CPU), ADR-004 amendé
  avec le banc comparatif (e5-large écarté : 2,2 Go, scores compressés).
- Migration r5_embeddings_mpnet : pgvector 384 → 768, index vidé
  (re-dérivable par « Réindexer tout »).
- Découpage affiné (~350 caractères) : la phrase-réponse ne se noie plus,
  l'extrait cité est lisible ; seuils par défaut recalés 0,45/0,40/0,55.
- Rejouée après bascule : réponse sourcée p. 2 en tête, refus honnête
  chiffré, suggestions étagées — 16/16 Playwright, 78 API, 23 pytest.
- Revue pixel publiée (6 écrans réels vs maquettes, 3 arbitrages).

Durcissement :
- apps/ai/Dockerfile : uv, modèle ONNX téléchargé AU BUILD (ADR-004 §1),
  non-root, healthcheck ; répétition locale conteneurisée validée
  (healthz, reindex via MinIO/pgvector, 401 sans jeton, refus de boot
  api-sans-clé, réponse sourcée depuis le conteneur).
- Compose Dokploy : siop2-ai interne (jamais sur dokploy-network,
  AI_SERVICE_TOKEN requis, génération opt-in, seuils par env) ;
  siop2-api branché (AI_SERVICE_URL).
- Runbook §5-6 : service IA en production, calibrage des seuils sur le
  corpus client, réindexation post-déploiement.

Le tag release/r5 attend la validation de la revue pixel par le référent.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
pr-daaif
2026-07-17 21:24:33 +01:00
parent 28eecc1fb9
commit b69c54ed0f
15 changed files with 213 additions and 23 deletions

9
apps/ai/.dockerignore Normal file
View File

@@ -0,0 +1,9 @@
.venv
.pytest_cache
.ruff_cache
__pycache__
tests
README.md
.env
.env.example
Dockerfile

38
apps/ai/Dockerfile Normal file
View File

@@ -0,0 +1,38 @@
# SIOP V2 — image du service IA (siop2-ai, ADR-004).
# Contexte de build : apps/ai (le service est autonome, pas de dépendance au
# monorepo). Étage 1 : uv sync + téléchargement du modèle ONNX AU BUILD
# (ADR-004 §1 — jamais au démarrage) ; étage 2 : runtime minimal non-root.
# Ce service n'est JAMAIS exposé publiquement : seul siop2-api le contacte,
# porteur du secret AI_SERVICE_TOKEN (ADR-004 §4).
FROM ghcr.io/astral-sh/uv:python3.11-bookworm-slim AS builder
WORKDIR /app
ENV UV_LINK_MODE=copy \
FASTEMBED_CACHE_PATH=/opt/fastembed
# Manifestes d'abord (cache de couche), puis le code. L'installation du projet
# reste éditable (.pth → /app/src) : src est donc copié dans l'image finale.
COPY pyproject.toml uv.lock ./
RUN uv sync --frozen --no-install-project --no-dev \
--extra embeddings --extra generation
COPY src src
RUN uv sync --frozen --no-dev \
--extra embeddings --extra generation
# Le modèle d'embeddings est EMBARQUÉ dans l'image : pas de téléchargement au
# boot (démarrage prévisible, marche sans accès à Hugging Face en production).
RUN uv run python -c "from siop_ai.embeddings import EmbeddeurLocal; EmbeddeurLocal()"
FROM python:3.11-slim-bookworm
WORKDIR /app
ENV PATH=/app/.venv/bin:$PATH \
FASTEMBED_CACHE_PATH=/opt/fastembed
RUN useradd --system --create-home siop
COPY --from=builder --chown=siop:siop /app/.venv /app/.venv
COPY --from=builder --chown=siop:siop /app/src /app/src
COPY --from=builder --chown=siop:siop /opt/fastembed /opt/fastembed
USER siop
EXPOSE 8000
HEALTHCHECK --interval=30s --timeout=5s --start-period=40s --retries=3 \
CMD python -c "import urllib.request,sys; sys.exit(0 if urllib.request.urlopen('http://localhost:8000/healthz', timeout=4).status==200 else 1)"
CMD ["uvicorn", "siop_ai.app:app", "--host", "0.0.0.0", "--port", "8000"]

View File

@@ -30,8 +30,8 @@ CHAMPS_BILAN = {
}
# Défauts — surchargés par la config (AI_SEUIL_*) : calibrage en recette.
SEUIL_PERTINENCE = 0.30 # en dessous : le corpus ne porte pas la réponse
SEUIL_SUGGESTION = 0.35
SEUIL_PERTINENCE = 0.45 # en dessous : le corpus ne porte pas la réponse
SEUIL_SUGGESTION = 0.40
SEUIL_CONFIANCE_FORTE = 0.55

View File

@@ -26,8 +26,8 @@ class Reglages(BaseSettings):
ai_model: str = "claude-opus-4-8"
# Seuils de similarité — constantes de départ, calibrables par env
# (recette sur corpus réel ; abaissés en CI e2e — embeddeur déterministe).
ai_seuil_pertinence: float = 0.30
ai_seuil_suggestion: float = 0.35
ai_seuil_pertinence: float = 0.45
ai_seuil_suggestion: float = 0.40
ai_seuil_confiance_forte: float = 0.55
model_config = {"env_prefix": "", "case_sensitive": False}

View File

@@ -1,14 +1,19 @@
"""Découpage du texte en extraits indexables — pur et testé.
Paragraphes regroupés jusqu'à ~900 caractères, avec un chevauchement de
Paragraphes regroupés jusqu'à ~350 caractères, avec un chevauchement de
queue pour ne pas couper une prescription en deux. Un extrait trop long est
scindé sur les phrases.
Le grain est court À DESSEIN (recette R5) : sur des pages entières, la phrase
qui répond se noie dans son contexte et les scores question→passage ne
séparent plus le pertinent du voisin de domaine ; à ~350 caractères, la marge
revient — et l'extrait cité à l'écran reste lisible d'un coup d'œil.
"""
import re
TAILLE_CIBLE = 900
CHEVAUCHEMENT = 150
TAILLE_CIBLE = 350
CHEVAUCHEMENT = 80
TAILLE_MINIMALE = 40 # en deçà : bruit (titres orphelins, numéros de page)

View File

@@ -1,13 +1,17 @@
"""Embeddeurs (ADR-004) : le vrai modèle local ONNX, et un déterministe pour
tests/CI — même interface, mêmes 384 dimensions, aucun téléchargement en test.
tests/CI — même interface, mêmes dimensions (DIMENSIONS), aucun téléchargement en test.
"""
import hashlib
import math
from typing import Protocol
DIMENSIONS = 384
MODELE_LOCAL = "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2"
DIMENSIONS = 768
# mpnet remplace MiniLM-384 : décision de recette R5 (journal 17/07) — sur le
# banc français, MiniLM classait la page-réponse DERRIÈRE des passages sans
# rapport (0,24 vs 0,41) ; mpnet rétablit le classement et une marge
# signal/bruit exploitable (≥ 0,46 vs ≤ 0,42).
MODELE_LOCAL = "sentence-transformers/paraphrase-multilingual-mpnet-base-v2"
class Embeddeur(Protocol):

View File

@@ -13,9 +13,11 @@ from siop_ai.embeddings import EmbeddeurDeterministe
def test_les_seuils_sont_ordonnes():
# pertinence < suggestion < confiance forte : un extrait tout juste
# pertinent ne devient jamais une suggestion « forte » par accident.
assert 0 < SEUIL_PERTINENCE <= SEUIL_SUGGESTION < SEUIL_CONFIANCE_FORTE < 1
# Pertinence et suggestion vivent dans des pipelines distincts (question →
# passages vs description → libellés) : pas d'ordre imposé entre eux.
# L'invariant : une suggestion tout juste retenue n'est jamais « forte ».
assert 0 < SEUIL_PERTINENCE < 1
assert 0 < SEUIL_SUGGESTION < SEUIL_CONFIANCE_FORTE < 1
def test_champs_bilan_couvrent_les_six_champs_du_contrat():

View File

@@ -0,0 +1,8 @@
-- Décision de recette R5 (journal 17/07) : le modèle d'embeddings passe de
-- MiniLM (384 dims) à paraphrase-multilingual-mpnet-base-v2 (768 dims) —
-- MiniLM classait la page-réponse derrière des passages sans rapport.
-- Les chunks sont re-dérivables : on vide l'index et on change la dimension ;
-- une réindexation (bouton « Réindexer tout » ou /assistant/reindex) reconstruit tout.
TRUNCATE "RagChunk";
ALTER TABLE "RagChunk" DROP COLUMN "embedding";
ALTER TABLE "RagChunk" ADD COLUMN "embedding" vector(768) NOT NULL;

View File

@@ -536,7 +536,7 @@ model RagChunk {
/// Repère humain de la source : « p. 42 », « bilan du 17/07/2026 »…
locator String
content String
embedding Unsupported("vector(384)")
embedding Unsupported("vector(768)")
createdAt DateTime @default(now())
@@index([documentId])

View File

@@ -50,7 +50,8 @@ export default function PageBibliotheque() {
<div className="entete-page">
<h1>Bibliothèque corpus de l'assistant</h1>
<span className="filajout">
{documents?.length ?? 0} documents · {indexes} indexés · {tailleLisible(totalOctets)}
{documents?.length ?? 0} document{(documents?.length ?? 0) > 1 ? 's' : ''} · {indexes}{' '}
indexé{indexes > 1 ? 's' : ''} · {tailleLisible(totalOctets)}
</span>
<div className="actions">
{administreCorpus ? (