mirror of
https://github.com/siop-spelev/siop2.git
synced 2026-08-08 12:41:54 +00:00
feat(r5): recette sans clé API + durcissement production siop2-ai
Recette (mode extractif, aucune clé) — elle a invalidé le modèle R5.1 : - MiniLM-384 classait la page-réponse DERRIÈRE des passages sans rapport (0,24 vs 0,41 sur la question type du plan) → bascule mesurée vers paraphrase-multilingual-mpnet-base-v2 (768 d, local/CPU), ADR-004 amendé avec le banc comparatif (e5-large écarté : 2,2 Go, scores compressés). - Migration r5_embeddings_mpnet : pgvector 384 → 768, index vidé (re-dérivable par « Réindexer tout »). - Découpage affiné (~350 caractères) : la phrase-réponse ne se noie plus, l'extrait cité est lisible ; seuils par défaut recalés 0,45/0,40/0,55. - Rejouée après bascule : réponse sourcée p. 2 en tête, refus honnête chiffré, suggestions étagées — 16/16 Playwright, 78 API, 23 pytest. - Revue pixel publiée (6 écrans réels vs maquettes, 3 arbitrages). Durcissement : - apps/ai/Dockerfile : uv, modèle ONNX téléchargé AU BUILD (ADR-004 §1), non-root, healthcheck ; répétition locale conteneurisée validée (healthz, reindex via MinIO/pgvector, 401 sans jeton, refus de boot api-sans-clé, réponse sourcée depuis le conteneur). - Compose Dokploy : siop2-ai interne (jamais sur dokploy-network, AI_SERVICE_TOKEN requis, génération opt-in, seuils par env) ; siop2-api branché (AI_SERVICE_URL). - Runbook §5-6 : service IA en production, calibrage des seuils sur le corpus client, réindexation post-déploiement. Le tag release/r5 attend la validation de la revue pixel par le référent. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
9
apps/ai/.dockerignore
Normal file
9
apps/ai/.dockerignore
Normal file
@@ -0,0 +1,9 @@
|
||||
.venv
|
||||
.pytest_cache
|
||||
.ruff_cache
|
||||
__pycache__
|
||||
tests
|
||||
README.md
|
||||
.env
|
||||
.env.example
|
||||
Dockerfile
|
||||
38
apps/ai/Dockerfile
Normal file
38
apps/ai/Dockerfile
Normal file
@@ -0,0 +1,38 @@
|
||||
# SIOP V2 — image du service IA (siop2-ai, ADR-004).
|
||||
# Contexte de build : apps/ai (le service est autonome, pas de dépendance au
|
||||
# monorepo). Étage 1 : uv sync + téléchargement du modèle ONNX AU BUILD
|
||||
# (ADR-004 §1 — jamais au démarrage) ; étage 2 : runtime minimal non-root.
|
||||
# Ce service n'est JAMAIS exposé publiquement : seul siop2-api le contacte,
|
||||
# porteur du secret AI_SERVICE_TOKEN (ADR-004 §4).
|
||||
|
||||
FROM ghcr.io/astral-sh/uv:python3.11-bookworm-slim AS builder
|
||||
WORKDIR /app
|
||||
ENV UV_LINK_MODE=copy \
|
||||
FASTEMBED_CACHE_PATH=/opt/fastembed
|
||||
|
||||
# Manifestes d'abord (cache de couche), puis le code. L'installation du projet
|
||||
# reste éditable (.pth → /app/src) : src est donc copié dans l'image finale.
|
||||
COPY pyproject.toml uv.lock ./
|
||||
RUN uv sync --frozen --no-install-project --no-dev \
|
||||
--extra embeddings --extra generation
|
||||
COPY src src
|
||||
RUN uv sync --frozen --no-dev \
|
||||
--extra embeddings --extra generation
|
||||
|
||||
# Le modèle d'embeddings est EMBARQUÉ dans l'image : pas de téléchargement au
|
||||
# boot (démarrage prévisible, marche sans accès à Hugging Face en production).
|
||||
RUN uv run python -c "from siop_ai.embeddings import EmbeddeurLocal; EmbeddeurLocal()"
|
||||
|
||||
FROM python:3.11-slim-bookworm
|
||||
WORKDIR /app
|
||||
ENV PATH=/app/.venv/bin:$PATH \
|
||||
FASTEMBED_CACHE_PATH=/opt/fastembed
|
||||
RUN useradd --system --create-home siop
|
||||
COPY --from=builder --chown=siop:siop /app/.venv /app/.venv
|
||||
COPY --from=builder --chown=siop:siop /app/src /app/src
|
||||
COPY --from=builder --chown=siop:siop /opt/fastembed /opt/fastembed
|
||||
USER siop
|
||||
EXPOSE 8000
|
||||
HEALTHCHECK --interval=30s --timeout=5s --start-period=40s --retries=3 \
|
||||
CMD python -c "import urllib.request,sys; sys.exit(0 if urllib.request.urlopen('http://localhost:8000/healthz', timeout=4).status==200 else 1)"
|
||||
CMD ["uvicorn", "siop_ai.app:app", "--host", "0.0.0.0", "--port", "8000"]
|
||||
@@ -30,8 +30,8 @@ CHAMPS_BILAN = {
|
||||
}
|
||||
|
||||
# Défauts — surchargés par la config (AI_SEUIL_*) : calibrage en recette.
|
||||
SEUIL_PERTINENCE = 0.30 # en dessous : le corpus ne porte pas la réponse
|
||||
SEUIL_SUGGESTION = 0.35
|
||||
SEUIL_PERTINENCE = 0.45 # en dessous : le corpus ne porte pas la réponse
|
||||
SEUIL_SUGGESTION = 0.40
|
||||
SEUIL_CONFIANCE_FORTE = 0.55
|
||||
|
||||
|
||||
|
||||
@@ -26,8 +26,8 @@ class Reglages(BaseSettings):
|
||||
ai_model: str = "claude-opus-4-8"
|
||||
# Seuils de similarité — constantes de départ, calibrables par env
|
||||
# (recette sur corpus réel ; abaissés en CI e2e — embeddeur déterministe).
|
||||
ai_seuil_pertinence: float = 0.30
|
||||
ai_seuil_suggestion: float = 0.35
|
||||
ai_seuil_pertinence: float = 0.45
|
||||
ai_seuil_suggestion: float = 0.40
|
||||
ai_seuil_confiance_forte: float = 0.55
|
||||
|
||||
model_config = {"env_prefix": "", "case_sensitive": False}
|
||||
|
||||
@@ -1,14 +1,19 @@
|
||||
"""Découpage du texte en extraits indexables — pur et testé.
|
||||
|
||||
Paragraphes regroupés jusqu'à ~900 caractères, avec un chevauchement de
|
||||
Paragraphes regroupés jusqu'à ~350 caractères, avec un chevauchement de
|
||||
queue pour ne pas couper une prescription en deux. Un extrait trop long est
|
||||
scindé sur les phrases.
|
||||
|
||||
Le grain est court À DESSEIN (recette R5) : sur des pages entières, la phrase
|
||||
qui répond se noie dans son contexte et les scores question→passage ne
|
||||
séparent plus le pertinent du voisin de domaine ; à ~350 caractères, la marge
|
||||
revient — et l'extrait cité à l'écran reste lisible d'un coup d'œil.
|
||||
"""
|
||||
|
||||
import re
|
||||
|
||||
TAILLE_CIBLE = 900
|
||||
CHEVAUCHEMENT = 150
|
||||
TAILLE_CIBLE = 350
|
||||
CHEVAUCHEMENT = 80
|
||||
TAILLE_MINIMALE = 40 # en deçà : bruit (titres orphelins, numéros de page)
|
||||
|
||||
|
||||
|
||||
@@ -1,13 +1,17 @@
|
||||
"""Embeddeurs (ADR-004) : le vrai modèle local ONNX, et un déterministe pour
|
||||
tests/CI — même interface, mêmes 384 dimensions, aucun téléchargement en test.
|
||||
tests/CI — même interface, mêmes dimensions (DIMENSIONS), aucun téléchargement en test.
|
||||
"""
|
||||
|
||||
import hashlib
|
||||
import math
|
||||
from typing import Protocol
|
||||
|
||||
DIMENSIONS = 384
|
||||
MODELE_LOCAL = "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2"
|
||||
DIMENSIONS = 768
|
||||
# mpnet remplace MiniLM-384 : décision de recette R5 (journal 17/07) — sur le
|
||||
# banc français, MiniLM classait la page-réponse DERRIÈRE des passages sans
|
||||
# rapport (0,24 vs 0,41) ; mpnet rétablit le classement et une marge
|
||||
# signal/bruit exploitable (≥ 0,46 vs ≤ 0,42).
|
||||
MODELE_LOCAL = "sentence-transformers/paraphrase-multilingual-mpnet-base-v2"
|
||||
|
||||
|
||||
class Embeddeur(Protocol):
|
||||
|
||||
@@ -13,9 +13,11 @@ from siop_ai.embeddings import EmbeddeurDeterministe
|
||||
|
||||
|
||||
def test_les_seuils_sont_ordonnes():
|
||||
# pertinence < suggestion < confiance forte : un extrait tout juste
|
||||
# pertinent ne devient jamais une suggestion « forte » par accident.
|
||||
assert 0 < SEUIL_PERTINENCE <= SEUIL_SUGGESTION < SEUIL_CONFIANCE_FORTE < 1
|
||||
# Pertinence et suggestion vivent dans des pipelines distincts (question →
|
||||
# passages vs description → libellés) : pas d'ordre imposé entre eux.
|
||||
# L'invariant : une suggestion tout juste retenue n'est jamais « forte ».
|
||||
assert 0 < SEUIL_PERTINENCE < 1
|
||||
assert 0 < SEUIL_SUGGESTION < SEUIL_CONFIANCE_FORTE < 1
|
||||
|
||||
|
||||
def test_champs_bilan_couvrent_les_six_champs_du_contrat():
|
||||
|
||||
@@ -0,0 +1,8 @@
|
||||
-- Décision de recette R5 (journal 17/07) : le modèle d'embeddings passe de
|
||||
-- MiniLM (384 dims) à paraphrase-multilingual-mpnet-base-v2 (768 dims) —
|
||||
-- MiniLM classait la page-réponse derrière des passages sans rapport.
|
||||
-- Les chunks sont re-dérivables : on vide l'index et on change la dimension ;
|
||||
-- une réindexation (bouton « Réindexer tout » ou /assistant/reindex) reconstruit tout.
|
||||
TRUNCATE "RagChunk";
|
||||
ALTER TABLE "RagChunk" DROP COLUMN "embedding";
|
||||
ALTER TABLE "RagChunk" ADD COLUMN "embedding" vector(768) NOT NULL;
|
||||
@@ -536,7 +536,7 @@ model RagChunk {
|
||||
/// Repère humain de la source : « p. 42 », « bilan du 17/07/2026 »…
|
||||
locator String
|
||||
content String
|
||||
embedding Unsupported("vector(384)")
|
||||
embedding Unsupported("vector(768)")
|
||||
createdAt DateTime @default(now())
|
||||
|
||||
@@index([documentId])
|
||||
|
||||
@@ -50,7 +50,8 @@ export default function PageBibliotheque() {
|
||||
<div className="entete-page">
|
||||
<h1>Bibliothèque — corpus de l'assistant</h1>
|
||||
<span className="filajout">
|
||||
{documents?.length ?? 0} documents · {indexes} indexés · {tailleLisible(totalOctets)}
|
||||
{documents?.length ?? 0} document{(documents?.length ?? 0) > 1 ? 's' : ''} · {indexes}{' '}
|
||||
indexé{indexes > 1 ? 's' : ''} · {tailleLisible(totalOctets)}
|
||||
</span>
|
||||
<div className="actions">
|
||||
{administreCorpus ? (
|
||||
|
||||
Reference in New Issue
Block a user