feat(r5.1): socle apps/ai — ingestion anonymisée + recherche sémantique

ADR-004 : embeddings locaux sur CPU (fastembed ONNX,
paraphrase-multilingual-MiniLM-L12-v2, 384 dims — les textes du client
ne quittent jamais le serveur), pgvector dans le Postgres existant
(RagChunk possédé par Prisma, migration r5_ia + état de corpus sur
Document), génération opt-in (mode extractif par défaut : la recette
passe sans clé API), service siop2-ai jamais exposé — joint par l'API
NestJS seule (X-Service-Token).

apps/ai (FastAPI + uv) : pipeline PDF MinIO → texte paginé (pypdf) →
anonymisation D4 (e-mails, téléphones marocains, noms connus de la
base, insensible casse/accents — fonction pure testée) → découpage
avec chevauchement (testé) → embeddings → RagChunk localisé (« p. 42 »,
« bilan du 17/07 »). Bilans codés clôturés ingérés. Exclusion de
corpus (D3) appliquée à l'ingestion ET à la lecture.

14 pytest + ruff, embeddeur déterministe en CI (aucun téléchargement),
job CI ai (uv), deploy en dépend. Vérifié en réel avec le vrai modèle :
corpus seedé réindexé en 7 s (PDF réel → 31 extraits paginés + 3
bilans), recherche sémantique concluante, e-mails → ⟨contact⟩,
0 identité dans les chunks (contrôle SQL).

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
pr-daaif
2026-07-17 12:22:15 +01:00
parent 199fce69d0
commit 837dcba1db
22 changed files with 2564 additions and 4 deletions

View File

@@ -133,6 +133,19 @@ jobs:
- run: pnpm --filter @siop/mobile typecheck - run: pnpm --filter @siop/mobile typecheck
- run: pnpm --filter @siop/mobile test - run: pnpm --filter @siop/mobile test
ai:
name: ai (pytest + ruff — uv)
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v5
- uses: astral-sh/setup-uv@v5
- run: uv sync
working-directory: apps/ai
- run: uv run ruff check src tests
working-directory: apps/ai
- run: uv run pytest
working-directory: apps/ai
e2e: e2e:
name: e2e (parcours démo Playwright) name: e2e (parcours démo Playwright)
runs-on: ubuntu-latest runs-on: ubuntu-latest
@@ -195,7 +208,7 @@ jobs:
deploy: deploy:
name: deploy (Dokploy — siop2.apps.enset.top) name: deploy (Dokploy — siop2.apps.enset.top)
if: github.event_name == 'push' && github.ref == 'refs/heads/main' if: github.event_name == 'push' && github.ref == 'refs/heads/main'
needs: [lint, contract, api, web, mobile, e2e] needs: [lint, contract, api, web, mobile, ai, e2e]
runs-on: ubuntu-latest runs-on: ubuntu-latest
environment: production environment: production
steps: steps:

6
.gitignore vendored
View File

@@ -7,3 +7,9 @@ coverage/
*.tsbuildinfo *.tsbuildinfo
test-results/ test-results/
playwright-report/ playwright-report/
# Python (apps/ai)
.venv/
__pycache__/
.pytest_cache/
.ruff_cache/

View File

@@ -60,5 +60,6 @@ pnpm + Turborepo. `apps/api` : NestJS, Prisma, PostgreSQL (pgvector + PostGIS),
- **R4.3 — file & verrou** : verrou optimiste serveur (`baseUpdatedAt` 409 contextualisé, toute écriture avance la version, web inchangé, ADR-003 sécurité/routage mobile) ; file persistée rejouée dans l'ordre (propagation de version intra-lot, arrêt sur conflit, patchs optimistes, photos D5 compressées en file), écran Synchro & conflits (rejouer sur version à jour / abandonner), préchargement parc+référentiels, purge complète à la déconnexion. Recette « mode avion » 13/13 en Expo web (conflit tranché par l'humain, serveur DONE + bilan), 17 tests jest-expo, 74 tests API. - **R4.3 — file & verrou** : verrou optimiste serveur (`baseUpdatedAt` 409 contextualisé, toute écriture avance la version, web inchangé, ADR-003 sécurité/routage mobile) ; file persistée rejouée dans l'ordre (propagation de version intra-lot, arrêt sur conflit, patchs optimistes, photos D5 compressées en file), écran Synchro & conflits (rejouer sur version à jour / abandonner), préchargement parc+référentiels, purge complète à la déconnexion. Recette « mode avion » 13/13 en Expo web (conflit tranché par l'humain, serveur DONE + bilan), 17 tests jest-expo, 74 tests API.
- 🏁 **R4 CLOSE (17/07/2026, tag `release/r4`)** : posé sur décision du référent avec la recette « mode avion » validée 13/13 en Expo web piloté ; **la recette sur téléphone (Expo Go — vrai mode avion, scan caméra) est reportée et reste due avant toute production client mobile**. - 🏁 **R4 CLOSE (17/07/2026, tag `release/r4`)** : posé sur décision du référent avec la recette « mode avion » validée 13/13 en Expo web piloté ; **la recette sur téléphone (Expo Go — vrai mode avion, scan caméra) est reportée et reste due avant toute production client mobile**.
- **R5 — maquettes rédigées** (17/07) : `maquette-r5.html`, 6 écrans (assistant RAG à citations sources document/page/extrait, refus explicite hors corpus, suggestion de bilan web+mobile à validation humaine, corpus & ingestion administrable, voix opt-in avec purge) + 5 décisions à acter (aucune écriture automatique, sourcé ou silencieux, corpus fermé, anonymisation 09-08, voix purgée). - **R5 — maquettes rédigées** (17/07) : `maquette-r5.html`, 6 écrans (assistant RAG à citations sources document/page/extrait, refus explicite hors corpus, suggestion de bilan web+mobile à validation humaine, corpus & ingestion administrable, voix opt-in avec purge) + 5 décisions à acter (aucune écriture automatique, sourcé ou silencieux, corpus fermé, anonymisation 09-08, voix purgée).
- 🔄 **Reprise ici** : validation des maquettes + 5 décisions R5 par le référent R5.1 socle `apps/ai` (FastAPI/uv, ADR-004 modèles/embeddings pgvector). Restes : recette R4 sur appareil, redéploiement Dokploy de `release/r3`. - **R5 — maquettes + décisions D1-D5 VALIDÉES par le référent (17/07)** ; **R5.1 socle `apps/ai`** : ADR-004 (embeddings locaux fastembed 384d, pgvector via migration Prisma `r5_ia` (`RagChunk` + corpus sur Document), génération opt-in mode extractif par défaut, service jamais exposé joint par l'API seule), pipeline d'ingestion anonymisé D4 (fonction pure testée, PDF paginés + bilans codés), `/internal/reindex` + `/internal/search` sous jeton de service, 14 pytest + ruff + job CI `ai` (embeddeur déterministe en CI). Vérifié en réel : corpus seedé indexé en 7 s, recherche sémantique concluante, 0 identité dans les chunks.
- 🔄 **Reprise ici** : R5.2 assistant au contrat (proxy NestJS authentifié `siop2-ai`, « sourcé ou silencieux » en mode extractif) + suggestion de codes de bilan. Restes : recette R4 sur appareil, redéploiement Dokploy de `release/r3`.
- Détail quotidien : `docs/journal/journal.md`. Dépôt : `siop-spelev/siop2` (privé), jalons R0R5. - Détail quotidien : `docs/journal/journal.md`. Dépôt : `siop-spelev/siop2` (privé), jalons R0R5.

29
apps/ai/README.md Normal file
View File

@@ -0,0 +1,29 @@
# @siop/ai — service IA (R5)
FastAPI + uv (ADR-001), **jamais exposé** : seule l'API NestJS le contacte avec
`X-Service-Token` (ADR-004 §4). Maquettes et décisions D1-D5 validées le 17/07/2026.
## Lancer (dev)
```bash
cd apps/ai
uv sync --extra embeddings # le vrai modèle ONNX (CPU, ~120 Mo au premier run)
uv run uvicorn siop_ai.app:app --port 8000
# CI / tests : uv sync && uv run pytest (embeddeur déterministe, aucun téléchargement)
```
Variables (défauts dev dans `config.py`) : `DATABASE_URL`, `MINIO_*`,
`AI_SERVICE_TOKEN`, `AI_EMBEDDINGS=locale|deterministe`, `AI_GENERATION=off|api`.
## Ce que porte R5.1 (socle)
- **Ingestion anonymisée (D4)** : PDF de la bibliothèque (MinIO) page par page +
bilans codés clôturés → anonymisation (e-mails, téléphones, noms connus de la
base) → découpage → embeddings locaux → `RagChunk` (pgvector, schéma Prisma).
- **Recherche sémantique** `/internal/search` : extraits sourcés (document + page
ou bilan daté) avec score — la brique de « sourcé ou silencieux » (D2).
- `/internal/reindex` idempotent ; l'exclusion de corpus (`Document.inCorpus`,
D3) s'applique à l'ingestion ET à la lecture.
La suite : R5.2 assistant (mode extractif puis génération opt-in) + suggestion de
bilan ; R5.3 écrans ; durcissement : Dockerfile + compose Dokploy (`siop2-ai`).

40
apps/ai/pyproject.toml Normal file
View File

@@ -0,0 +1,40 @@
[project]
name = "siop-ai"
version = "0.1.0"
description = "SIOP V2 — service IA (R5) : ingestion anonymisée, recherche sémantique, assistant sourcé (ADR-004)"
requires-python = ">=3.11"
dependencies = [
"fastapi>=0.115",
"uvicorn[standard]>=0.32",
"pydantic-settings>=2.6",
"asyncpg>=0.30",
"pypdf>=5.1",
"minio>=7.2",
]
[project.optional-dependencies]
# Le vrai modèle (ONNX, CPU) — absent des tests/CI (embeddeur déterministe).
embeddings = ["fastembed>=0.4"]
[dependency-groups]
dev = [
"pytest>=8.3",
"pytest-asyncio>=0.24",
"httpx>=0.27",
"ruff>=0.8",
]
[build-system]
requires = ["hatchling"]
build-backend = "hatchling.build"
[tool.hatch.build.targets.wheel]
packages = ["src/siop_ai"]
[tool.pytest.ini_options]
testpaths = ["tests"]
asyncio_mode = "auto"
[tool.ruff]
line-length = 100
src = ["src", "tests"]

View File

@@ -0,0 +1 @@
"""SIOP V2 — service IA (R5). L'IA propose, l'humain valide (D1)."""

View File

@@ -0,0 +1,62 @@
"""Anonymisation à l'ingestion (D4, loi 09-08) : identités et coordonnées ne
partent JAMAIS dans les index vectoriels ni dans les prompts.
Fonction pure, testée : e-mails, téléphones (formats marocains et
internationaux), et les noms de personnes CONNUS de la base (utilisateurs,
gardiens, contacts tiers) fournis par l'appelant.
"""
import re
import unicodedata
JETON_PERSONNE = "⟨personne⟩"
JETON_CONTACT = "⟨contact⟩"
_EMAIL = re.compile(r"[\w.+-]+@[\w-]+\.[\w.-]+")
# 06 12 34 56 78 · 0612345678 · +212 6 12 34 56 78 · 05 22-34-56-78…
_TELEPHONE = re.compile(r"(?:\+?\d{1,3}[\s.-]?)?(?:0|\(0\))?\d(?:[\s.-]?\d{2}){4}")
def _sans_accents(texte: str) -> str:
return "".join(
c for c in unicodedata.normalize("NFD", texte) if unicodedata.category(c) != "Mn"
)
def anonymiser(texte: str, noms_connus: list[str] | None = None) -> str:
"""Remplace coordonnées et noms connus par des jetons neutres.
Les noms sont remplacés insensiblement à la casse ET aux accents
(« Idrissi » attrape « idrissi »), prénom seul compris quand il est
assez long pour ne pas mutiler le texte technique.
"""
resultat = _EMAIL.sub(JETON_CONTACT, texte)
resultat = _TELEPHONE.sub(JETON_CONTACT, resultat)
for nom in sorted(noms_connus or [], key=len, reverse=True):
nom = nom.strip()
if len(nom) < 3:
continue
morceaux = [nom] + [m for m in nom.split() if len(m) >= 4]
for morceau in morceaux:
motif = re.compile(
r"\b" + re.escape(_sans_accents(morceau)) + r"\b", re.IGNORECASE
)
# on cherche sur une copie sans accents mais on remplace l'original
copie = _sans_accents(resultat)
sortie: list[str] = []
position = 0
for correspondance in motif.finditer(copie):
sortie.append(resultat[position : correspondance.start()])
sortie.append(JETON_PERSONNE)
position = correspondance.end()
sortie.append(resultat[position:])
resultat = "".join(sortie)
# jetons collés en double (« prénom nom » remplacés séparément)
resultat = re.sub(
rf"{re.escape(JETON_PERSONNE)}(\s+{re.escape(JETON_PERSONNE)})+",
JETON_PERSONNE,
resultat,
)
return resultat

View File

@@ -0,0 +1,62 @@
"""Service IA — JAMAIS exposé publiquement (ADR-004 §4) : seule l'API NestJS
le contacte, avec le secret partagé `X-Service-Token`. Les permissions des
utilisateurs restent l'affaire de l'API — ici, un seul appelant de confiance.
"""
from contextlib import asynccontextmanager
from dataclasses import asdict
import asyncpg
from fastapi import Depends, FastAPI, Header, HTTPException
from pydantic import BaseModel, Field
from .config import Reglages, charger_reglages
from .embeddings import construire_embeddeur
from .ingestion import reindexer_tout
from .recherche import chercher
@asynccontextmanager
async def cycle_de_vie(app: FastAPI):
reglages = charger_reglages()
app.state.reglages = reglages
app.state.embeddeur = construire_embeddeur(reglages.ai_embeddings)
app.state.pool = await asyncpg.create_pool(reglages.database_url, min_size=1, max_size=5)
yield
await app.state.pool.close()
app = FastAPI(title="SIOP V2 — service IA (R5)", lifespan=cycle_de_vie)
def verifier_jeton(
x_service_token: str = Header(default=""),
) -> None:
reglages: Reglages = app.state.reglages
if x_service_token != reglages.ai_service_token:
raise HTTPException(status_code=401, detail="Jeton de service invalide")
@app.get("/healthz")
async def sante() -> dict:
"""Sonde interne (compose/Dokploy) — ne révèle rien du corpus."""
return {"status": "ok", "service": "siop2-ai"}
@app.post("/internal/reindex", dependencies=[Depends(verifier_jeton)])
async def reindexer() -> dict:
async with app.state.pool.acquire() as cnx:
resultat = await reindexer_tout(cnx, app.state.reglages, app.state.embeddeur)
return asdict(resultat)
class RequeteRecherche(BaseModel):
question: str = Field(min_length=3, max_length=500)
limite: int = Field(default=5, ge=1, le=10)
@app.post("/internal/search", dependencies=[Depends(verifier_jeton)])
async def rechercher(corps: RequeteRecherche) -> dict:
async with app.state.pool.acquire() as cnx:
extraits = await chercher(cnx, app.state.embeddeur, corps.question, corps.limite)
return {"extraits": [asdict(e) for e in extraits]}

View File

@@ -0,0 +1,32 @@
"""Configuration — validée au démarrage, comme l'API NestJS (même philosophie)."""
from pydantic_settings import BaseSettings
class Reglages(BaseSettings):
# Postgres partagé (schéma possédé par Prisma — apps/api)
database_url: str = "postgresql://siop:siop@localhost:5432/siop"
# MinIO en direct sur le réseau privé (ADR-004 §4 — jamais exposé)
minio_endpoint: str = "localhost"
minio_port: int = 9000
minio_use_ssl: bool = False
minio_access_key: str = "siop"
minio_secret_key: str = "siop-minio"
minio_bucket: str = "siop2"
# Le service n'est JAMAIS public : seul l'API NestJS le contacte,
# porteuse de ce secret partagé (ADR-004 §4).
ai_service_token: str = "dev-only-ai-token"
# Embeddings : « locale » (fastembed ONNX) ou « deterministe » (tests/CI)
ai_embeddings: str = "locale"
# Génération : « off » (mode extractif, défaut honnête) ou « api » (opt-in)
ai_generation: str = "off"
model_config = {"env_prefix": "", "case_sensitive": False}
def charger_reglages() -> Reglages:
reglages = Reglages()
# asyncpg ne comprend pas le paramètre ?schema= de Prisma
if "?" in reglages.database_url:
reglages.database_url = reglages.database_url.split("?")[0]
return reglages

View File

@@ -0,0 +1,52 @@
"""Découpage du texte en extraits indexables — pur et testé.
Paragraphes regroupés jusqu'à ~900 caractères, avec un chevauchement de
queue pour ne pas couper une prescription en deux. Un extrait trop long est
scindé sur les phrases.
"""
import re
TAILLE_CIBLE = 900
CHEVAUCHEMENT = 150
TAILLE_MINIMALE = 40 # en deçà : bruit (titres orphelins, numéros de page)
def _phrases(texte: str) -> list[str]:
return [p.strip() for p in re.split(r"(?<=[.!?;])\s+", texte) if p.strip()]
def decouper(texte: str) -> list[str]:
paragraphes = [p.strip() for p in re.split(r"\n\s*\n", texte) if p.strip()]
extraits: list[str] = []
courant = ""
def pousser() -> None:
nonlocal courant
nettoye = courant.strip()
if len(nettoye) >= TAILLE_MINIMALE:
extraits.append(nettoye)
courant = ""
for paragraphe in paragraphes:
paragraphe = re.sub(r"\s+", " ", paragraphe)
if len(courant) + len(paragraphe) + 1 > TAILLE_CIBLE and courant:
queue = courant[-CHEVAUCHEMENT:]
pousser()
courant = queue + " "
while len(paragraphe) > TAILLE_CIBLE:
phrases = _phrases(paragraphe)
if len(phrases) <= 1:
courant += paragraphe[:TAILLE_CIBLE]
paragraphe = paragraphe[TAILLE_CIBLE - CHEVAUCHEMENT :]
pousser()
continue
morceau = ""
while phrases and len(morceau) + len(phrases[0]) + 1 <= TAILLE_CIBLE:
morceau += phrases.pop(0) + " "
courant += morceau
pousser()
paragraphe = " ".join(phrases)
courant += paragraphe + " "
pousser()
return extraits

View File

@@ -0,0 +1,53 @@
"""Embeddeurs (ADR-004) : le vrai modèle local ONNX, et un déterministe pour
tests/CI — même interface, mêmes 384 dimensions, aucun téléchargement en test.
"""
import hashlib
import math
from typing import Protocol
DIMENSIONS = 384
MODELE_LOCAL = "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2"
class Embeddeur(Protocol):
def encoder(self, textes: list[str]) -> list[list[float]]: ...
class EmbeddeurDeterministe:
"""Sac de tri-grammes haché puis normalisé : stable, sans réseau, et les
textes proches partagent des composantes — assez pour tester le circuit
complet (ingestion → pgvector → similarité)."""
def encoder(self, textes: list[str]) -> list[list[float]]:
return [self._un(t) for t in textes]
def _un(self, texte: str) -> list[float]:
vecteur = [0.0] * DIMENSIONS
mots = texte.lower().split()
grammes = mots + [" ".join(mots[i : i + 3]) for i in range(max(0, len(mots) - 2))]
for gramme in grammes:
empreinte = hashlib.sha256(gramme.encode()).digest()
indice = int.from_bytes(empreinte[:4], "big") % DIMENSIONS
signe = 1.0 if empreinte[4] % 2 == 0 else -1.0
vecteur[indice] += signe
norme = math.sqrt(sum(v * v for v in vecteur)) or 1.0
return [v / norme for v in vecteur]
class EmbeddeurLocal:
"""fastembed (ONNX, CPU) — chargé paresseusement, jamais importé en test."""
def __init__(self) -> None:
from fastembed import TextEmbedding # import différé (dépendance optionnelle)
self._modele = TextEmbedding(model_name=MODELE_LOCAL)
def encoder(self, textes: list[str]) -> list[list[float]]:
return [vecteur.tolist() for vecteur in self._modele.embed(textes)]
def construire_embeddeur(mode: str) -> Embeddeur:
if mode == "deterministe":
return EmbeddeurDeterministe()
return EmbeddeurLocal()

View File

@@ -0,0 +1,175 @@
"""Ingestion du corpus (D3) : bibliothèque R3 (PDF, MinIO) + bilans codés.
Chaque texte passe par l'anonymisation (D4) AVANT découpage et embeddings.
Les chunks vivent dans `RagChunk` (pgvector, schéma possédé par Prisma).
"""
import io
import json
from dataclasses import dataclass
import asyncpg
from minio import Minio
from pypdf import PdfReader
from .anonymisation import anonymiser
from .config import Reglages
from .decoupage import decouper
from .embeddings import Embeddeur
@dataclass
class ResultatIngestion:
documents_indexes: int
documents_ignores: int
bilans_indexes: int
extraits: int
def _vecteur_sql(vecteur: list[float]) -> str:
return "[" + ",".join(f"{v:.6f}" for v in vecteur) + "]"
async def noms_a_anonymiser(cnx: asyncpg.Connection) -> list[str]:
"""Toutes les identités connues de la base (D4) : utilisateurs, gardiens,
contacts tiers, demandeurs du portail."""
lignes = await cnx.fetch(
'''
SELECT "displayName" AS nom FROM "User"
UNION SELECT "guardianName" FROM "Location" WHERE "guardianName" IS NOT NULL
UNION SELECT "contactName" FROM "Partner" WHERE "contactName" IS NOT NULL
'''
)
return [ligne["nom"] for ligne in lignes if ligne["nom"]]
def extraire_texte_pdf(octets: bytes) -> list[tuple[str, str]]:
"""[(texte, localisation)] par page — la citation doit pointer la page."""
lecteur = PdfReader(io.BytesIO(octets))
pages: list[tuple[str, str]] = []
for numero, page in enumerate(lecteur.pages, start=1):
texte = page.extract_text() or ""
if texte.strip():
pages.append((texte, f"p. {numero}"))
return pages
async def indexer_documents(
cnx: asyncpg.Connection,
reglages: Reglages,
embeddeur: Embeddeur,
noms: list[str],
) -> tuple[int, int, int]:
minio = Minio(
f"{reglages.minio_endpoint}:{reglages.minio_port}",
access_key=reglages.minio_access_key,
secret_key=reglages.minio_secret_key,
secure=reglages.minio_use_ssl,
)
documents = await cnx.fetch(
'SELECT id, "fileName", "storageKey", "contentType", "inCorpus" FROM "Document"'
)
indexes, ignores, total_extraits = 0, 0, 0
for doc in documents:
# réindexation idempotente : on repart de zéro pour ce document
await cnx.execute('DELETE FROM "RagChunk" WHERE "documentId" = $1', doc["id"])
if not doc["inCorpus"] or doc["contentType"] != "application/pdf":
await cnx.execute(
'UPDATE "Document" SET "indexedAt" = NULL, "chunkCount" = 0 WHERE id = $1',
doc["id"],
)
ignores += 1
continue
reponse = minio.get_object(reglages.minio_bucket, doc["storageKey"])
try:
octets = reponse.read()
finally:
reponse.close()
reponse.release_conn()
extraits: list[tuple[str, str]] = []
for texte_page, localisation in extraire_texte_pdf(octets):
texte_sur = anonymiser(texte_page, noms)
extraits += [(morceau, localisation) for morceau in decouper(texte_sur)]
if extraits:
vecteurs = embeddeur.encoder([contenu for contenu, _ in extraits])
await cnx.executemany(
'''
INSERT INTO "RagChunk"
(id, "sourceType", "documentId", locator, content, embedding)
VALUES (gen_random_uuid(), 'DOCUMENT', $1, $2, $3, $4::vector)
''',
[
(doc["id"], localisation, contenu, _vecteur_sql(vecteur))
for (contenu, localisation), vecteur in zip(extraits, vecteurs)
],
)
await cnx.execute(
'UPDATE "Document" SET "indexedAt" = now(), "chunkCount" = $2 WHERE id = $1',
doc["id"],
len(extraits),
)
indexes += 1
total_extraits += len(extraits)
return indexes, ignores, total_extraits
async def indexer_bilans(
cnx: asyncpg.Connection, embeddeur: Embeddeur, noms: list[str]
) -> tuple[int, int]:
"""Les bilans codés clôturés — « sur votre parc, ce réglage a déjà… »."""
await cnx.execute('DELETE FROM "RagChunk" WHERE "sourceType" = \'WORK_ORDER\'')
bilans = await cnx.fetch(
'''
SELECT wo.id, wo.reference, wo.title, wo."completedAt",
a.reference AS asset_ref, a.brand, a.model,
(SELECT json_object_agg(rv.field, rv.label)
FROM "InterventionReport" ir2
JOIN "ReferenceValue" rv ON rv.id IN (
ir2."doorStateId", ir2."cabinPositionId", ir2."anomalyId",
ir2."externalCauseId", ir2."actionTakenId", ir2."componentConcernedId")
WHERE ir2."workOrderId" = wo.id) AS bilan
FROM "WorkOrder" wo
JOIN "InterventionReport" ir ON ir."workOrderId" = wo.id
JOIN "Asset" a ON a.id = wo."assetId"
WHERE wo.status = 'DONE'
'''
)
lignes = []
for bilan in bilans:
champs = json.loads(bilan["bilan"]) if bilan["bilan"] else {}
codes = " ; ".join(f"{champ} : {label}" for champ, label in champs.items())
contenu = anonymiser(
f"Intervention {bilan['reference']}{bilan['title']}. "
f"Appareil {bilan['asset_ref']} ({bilan['brand']} {bilan['model'] or ''}). "
f"Bilan codé : {codes}.",
noms,
)
quand = bilan["completedAt"].date().isoformat() if bilan["completedAt"] else "date inconnue"
lignes.append((bilan["id"], f"bilan du {quand}", contenu))
if lignes:
vecteurs = embeddeur.encoder([contenu for _, _, contenu in lignes])
await cnx.executemany(
'''
INSERT INTO "RagChunk"
(id, "sourceType", "workOrderId", locator, content, embedding)
VALUES (gen_random_uuid(), 'WORK_ORDER', $1, $2, $3, $4::vector)
''',
[
(wo_id, localisation, contenu, _vecteur_sql(vecteur))
for (wo_id, localisation, contenu), vecteur in zip(lignes, vecteurs)
],
)
return len(lignes), len(lignes)
async def reindexer_tout(
cnx: asyncpg.Connection, reglages: Reglages, embeddeur: Embeddeur
) -> ResultatIngestion:
noms = await noms_a_anonymiser(cnx)
docs_ok, docs_non, extraits_docs = await indexer_documents(cnx, reglages, embeddeur, noms)
bilans, extraits_bilans = await indexer_bilans(cnx, embeddeur, noms)
return ResultatIngestion(
documents_indexes=docs_ok,
documents_ignores=docs_non,
bilans_indexes=bilans,
extraits=extraits_docs + extraits_bilans,
)

View File

@@ -0,0 +1,57 @@
"""Recherche sémantique dans le corpus (pgvector, distance cosinus).
Ne renvoie QUE des extraits sourcés — la brique de « sourcé ou silencieux ».
"""
from dataclasses import dataclass
import asyncpg
from .embeddings import Embeddeur
from .ingestion import _vecteur_sql
@dataclass
class ExtraitTrouve:
source_type: str
document_id: str | None
work_order_id: str | None
titre: str # nom de fichier ou référence d'OT
locator: str
content: str
score: float # similarité cosinus (0..1)
async def chercher(
cnx: asyncpg.Connection,
embeddeur: Embeddeur,
question: str,
limite: int = 5,
) -> list[ExtraitTrouve]:
vecteur = _vecteur_sql(embeddeur.encoder([question])[0])
lignes = await cnx.fetch(
'''
SELECT c."sourceType", c."documentId", c."workOrderId", c.locator, c.content,
1 - (c.embedding <=> $1::vector) AS score,
COALESCE(d."fileName", wo.reference, '?') AS titre
FROM "RagChunk" c
LEFT JOIN "Document" d ON d.id = c."documentId"
LEFT JOIN "WorkOrder" wo ON wo.id = c."workOrderId"
WHERE c."documentId" IS NULL OR d."inCorpus" -- l'exclusion D3 s'applique aussi à la lecture
ORDER BY c.embedding <=> $1::vector
LIMIT $2
''',
vecteur,
limite,
)
return [
ExtraitTrouve(
source_type=ligne["sourceType"],
document_id=str(ligne["documentId"]) if ligne["documentId"] else None,
work_order_id=str(ligne["workOrderId"]) if ligne["workOrderId"] else None,
titre=ligne["titre"],
locator=ligne["locator"],
content=ligne["content"],
score=float(ligne["score"]),
)
for ligne in lignes
]

View File

@@ -0,0 +1,33 @@
"""D4 (loi 09-08) : rien d'identifiant ne doit survivre à l'ingestion."""
from siop_ai.anonymisation import JETON_CONTACT, JETON_PERSONNE, anonymiser
def test_emails_et_telephones_marocains():
texte = "Appeler M. Alami au 06 12 34 56 78 ou +212 5 22 34 56 78, sinon gardien@residence.ma"
resultat = anonymiser(texte, ["M. Alami"])
assert "06 12" not in resultat
assert "+212" not in resultat
assert "gardien@residence.ma" not in resultat
assert resultat.count(JETON_CONTACT) == 3
def test_noms_connus_meme_sans_accents_ni_casse():
texte = "Intervention validée par salma idrissi puis contrôlée par AHMED BENALI."
resultat = anonymiser(texte, ["Salma Idrissi", "Ahmed Benali"])
assert "idrissi" not in resultat.lower()
assert "benali" not in resultat.lower()
assert resultat.count(JETON_PERSONNE) == 2
def test_prenom_seul_est_attrape_mais_pas_les_mots_courts():
resultat = anonymiser("Vu avec Ahmed sur site.", ["Ahmed Benali"])
assert "Ahmed" not in resultat
# « NC-31 » ou « vis » ne doivent jamais être mutilés par un nom court
resultat2 = anonymiser("Contact NC-31 réglé, vis serrées.", ["N. C."])
assert "NC-31" in resultat2
def test_le_texte_technique_reste_intact():
texte = "Serrer les coulisseaux au couple de 25 N·m ; jeu latéral 0,5 mm."
assert anonymiser(texte, ["Salma Idrissi"]) == texte

37
apps/ai/tests/test_app.py Normal file
View File

@@ -0,0 +1,37 @@
"""Le service n'est jamais public : sans le jeton de service, 401 partout
(la santé exceptée — sonde d'infra qui ne révèle rien)."""
from fastapi.testclient import TestClient
from siop_ai.app import app
def test_sante_publique_interne():
reponse = _client_sans_db().get("/healthz")
assert reponse.status_code == 200
assert reponse.json()["service"] == "siop2-ai"
def test_endpoints_internes_refuses_sans_jeton():
client = _client_sans_db()
assert client.post("/internal/reindex").status_code == 401
assert client.post("/internal/search", json={"question": "couple de serrage ?"}).status_code == 401
def test_question_trop_courte_rejetee_avant_tout():
reponse = _client_sans_db().post(
"/internal/search",
json={"question": "ab"},
headers={"X-Service-Token": "dev-only-ai-token"},
)
assert reponse.status_code == 422
def _client_sans_db() -> TestClient:
"""TestClient HORS gestionnaire de contexte : le lifespan (pool DB,
modèle d'embeddings) ne tourne pas — on pose l'état minimal. Les tests
d'intégration DB se font en local (recette), pas en CI (convention R5.1)."""
from siop_ai.config import charger_reglages
app.state.reglages = charger_reglages()
return TestClient(app, raise_server_exceptions=False)

View File

@@ -0,0 +1,24 @@
from siop_ai.decoupage import CHEVAUCHEMENT, TAILLE_CIBLE, decouper
def test_texte_court_un_seul_extrait():
extraits = decouper("Serrer les vis de fixation des coulisseaux au couple de 25 N·m.")
assert len(extraits) == 1
def test_les_miettes_sont_ecartees():
assert decouper("p. 3\n\n7\n\n") == []
def test_long_texte_decoupe_avec_chevauchement():
paragraphe = "La procédure de maintenance impose un contrôle mensuel des organes. " * 40
extraits = decouper(paragraphe)
assert len(extraits) >= 2
assert all(len(e) <= TAILLE_CIBLE + CHEVAUCHEMENT for e in extraits)
def test_paragraphes_courts_regroupes():
texte = "\n\n".join(f"Étape {i} : vérifier le verrouillage de la porte palière." for i in range(6))
extraits = decouper(texte)
assert len(extraits) == 1
assert "Étape 0" in extraits[0] and "Étape 5" in extraits[0]

View File

@@ -0,0 +1,26 @@
from siop_ai.embeddings import DIMENSIONS, EmbeddeurDeterministe
def test_dimensions_et_normalisation():
[vecteur] = EmbeddeurDeterministe().encoder(["couple de serrage des guides"])
assert len(vecteur) == DIMENSIONS
assert abs(sum(v * v for v in vecteur) - 1.0) < 1e-6
def test_stable_et_discriminant():
embeddeur = EmbeddeurDeterministe()
a1 = embeddeur.encoder(["couple de serrage des coulisseaux de guides"])[0]
a2 = embeddeur.encoder(["couple de serrage des coulisseaux de guides"])[0]
b = embeddeur.encoder(["planning des congés du personnel administratif"])[0]
cosinus = lambda x, y: sum(p * q for p, q in zip(x, y)) # noqa: E731 — vecteurs normés
assert a1 == a2
assert cosinus(a1, b) < 0.35 < cosinus(a1, a1)
def test_textes_proches_plus_similaires_que_textes_eloignes():
embeddeur = EmbeddeurDeterministe()
question = embeddeur.encoder(["quel couple de serrage pour les guides ?"])[0]
notice = embeddeur.encoder(["serrer les coulisseaux de guides au couple de 25 N·m"])[0]
horsujet = embeddeur.encoder(["le syndic organise une assemblée générale annuelle"])[0]
cosinus = lambda x, y: sum(p * q for p, q in zip(x, y)) # noqa: E731
assert cosinus(question, notice) > cosinus(question, horsujet)

1734
apps/ai/uv.lock generated Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,33 @@
-- CreateEnum
CREATE TYPE "RagSourceType" AS ENUM ('DOCUMENT', 'WORK_ORDER');
-- AlterTable
ALTER TABLE "Document" ADD COLUMN "chunkCount" INTEGER NOT NULL DEFAULT 0,
ADD COLUMN "inCorpus" BOOLEAN NOT NULL DEFAULT true,
ADD COLUMN "indexedAt" TIMESTAMP(3);
-- CreateTable
CREATE TABLE "RagChunk" (
"id" UUID NOT NULL,
"sourceType" "RagSourceType" NOT NULL,
"documentId" UUID,
"workOrderId" UUID,
"locator" TEXT NOT NULL,
"content" TEXT NOT NULL,
"embedding" vector(384) NOT NULL,
"createdAt" TIMESTAMP(3) NOT NULL DEFAULT CURRENT_TIMESTAMP,
CONSTRAINT "RagChunk_pkey" PRIMARY KEY ("id")
);
-- CreateIndex
CREATE INDEX "RagChunk_documentId_idx" ON "RagChunk"("documentId");
-- CreateIndex
CREATE INDEX "RagChunk_workOrderId_idx" ON "RagChunk"("workOrderId");
-- AddForeignKey
ALTER TABLE "RagChunk" ADD CONSTRAINT "RagChunk_documentId_fkey" FOREIGN KEY ("documentId") REFERENCES "Document"("id") ON DELETE CASCADE ON UPDATE CASCADE;
-- AddForeignKey
ALTER TABLE "RagChunk" ADD CONSTRAINT "RagChunk_workOrderId_fkey" FOREIGN KEY ("workOrderId") REFERENCES "WorkOrder"("id") ON DELETE CASCADE ON UPDATE CASCADE;

View File

@@ -233,6 +233,7 @@ model WorkOrder {
completedAt DateTime? completedAt DateTime?
cancelledAt DateTime? cancelledAt DateTime?
events WorkOrderEvent[] events WorkOrderEvent[]
ragChunks RagChunk[]
checklist ChecklistItem[] checklist ChecklistItem[]
report InterventionReport? report InterventionReport?
request Request? request Request?
@@ -513,7 +514,36 @@ model Document {
uploadedById String? @db.Uuid uploadedById String? @db.Uuid
uploadedBy User? @relation(fields: [uploadedById], references: [id]) uploadedBy User? @relation(fields: [uploadedById], references: [id])
createdAt DateTime @default(now()) createdAt DateTime @default(now())
// R5 (D3) : le corpus est visible et réversible, document par document.
inCorpus Boolean @default(true)
indexedAt DateTime? // null = jamais indexé
chunkCount Int @default(0)
chunks RagChunk[]
@@index([assetId]) @@index([assetId])
@@index([workOrderId]) @@index([workOrderId])
} }
/// R5 — extraits indexés du corpus (ADR-004) : bibliothèque + bilans codés,
/// ANONYMISÉS À L'INGESTION (D4). Écrit par apps/ai, schéma possédé par Prisma.
model RagChunk {
id String @id @default(uuid()) @db.Uuid
sourceType RagSourceType
documentId String? @db.Uuid
document Document? @relation(fields: [documentId], references: [id], onDelete: Cascade)
workOrderId String? @db.Uuid
workOrder WorkOrder? @relation(fields: [workOrderId], references: [id], onDelete: Cascade)
/// Repère humain de la source : « p. 42 », « bilan du 17/07/2026 »…
locator String
content String
embedding Unsupported("vector(384)")
createdAt DateTime @default(now())
@@index([documentId])
@@index([workOrderId])
}
enum RagSourceType {
DOCUMENT
WORK_ORDER
}

View File

@@ -0,0 +1,43 @@
# ADR-004 — Modèles et topologie du service IA (R5)
- **Statut** : acceptée (R5.1, 17 juillet 2026)
- **Contexte** : les maquettes R5 et les décisions D1-D5 sont validées (l'IA propose/l'humain
valide, sourcé ou silencieux, corpus fermé, anonymisation 09-08, voix purgée). Reste à
trancher COMMENT : quels modèles, où tournent-ils, qui parle à qui. Contraintes : serveur
Dokploy du partenaire (CPU, pas de GPU garanti), corpus en français, données d'un client
marocain (loi 09-08), CI sans secret, démo qui marche sans dépendance externe.
## Décision
1. **Embeddings : locaux, sur CPU**`fastembed` (ONNX, sans PyTorch) avec
`sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2` (384 dimensions, multilingue, ~120 Mo, registre fastembed). Les textes du
client ne quittent JAMAIS le serveur pour l'indexation ni pour la recherche. Le modèle est
téléchargé au build de l'image (pas au démarrage). En **tests/CI : embeddeur déterministe
par hachage** (pas de téléchargement, pas de flottement) derrière la même interface.
2. **Stockage vectoriel : pgvector** dans le PostgreSQL existant (extension déjà installée
depuis R0) — table `RagChunk` gérée par la **migration Prisma** (le schéma reste la
propriété d'`apps/api`, source unique). Pas de base vectorielle de plus à opérer.
3. **Génération (réponses rédigées de l'assistant) : opt-in par configuration.**
- Sans clé (`AI_GENERATION=off`, défaut) : l'assistant fonctionne en **mode extractif**
il montre les meilleurs extraits sourcés et une synthèse templatée, sans LLM. La démo,
la CI et un déploiement sans budget API restent pleinement fonctionnels et honnêtes.
- Avec clé (`AI_GENERATION=api` + `AI_API_KEY`) : rédaction par un LLM externe, sur textes
DÉJÀ anonymisés (D4), avec l'obligation de citer les extraits fournis — jamais au-delà.
- La **suggestion de codes de bilan** n'utilise PAS de LLM : similarité sémantique
(embeddings locaux) entre la description et les libellés des référentiels + les bilans
historiques du parc. Déterministe, testable, explicable (« 9 bilans similaires »).
4. **Topologie** : `apps/ai` (FastAPI/uv, conteneur `siop2-ai`) n'est **jamais exposé**
réseau interne Dokploy uniquement, comme MinIO. Les utilisateurs passent par l'API NestJS
(auth JWT + matrice de permissions réutilisées) qui proxifie vers `siop2-ai`
(`AI_SERVICE_URL` + secret partagé `AI_SERVICE_TOKEN`). `apps/ai` lit Postgres
(métadonnées, bilans, écriture des chunks) et MinIO (octets des PDF) en direct sur le
réseau privé — la règle d'or ESLint d'ADR-001 concerne le code TypeScript de l'API,
la topologie « MinIO jamais exposé » du runbook reste respectée.
## Conséquences
- L'anonymisation (D4) s'applique **à l'ingestion** — les index ne contiennent jamais
d'identités ; le mode génératif n'envoie donc que des textes déjà nettoyés.
- Le mode extractif est le contrat de base : toute recette R5 doit passer SANS clé API.
- Si le partenaire veut un jour une génération 100 % locale (llama.cpp…), seul le point 3
change — interface `Generateur` prévue pour ça.

View File

@@ -4,6 +4,23 @@ Trace chronologique des sessions (la plus récente en premier). Le **playbook**
--- ---
## 2026-07-17 — Pr. Daaif (+ Claude) — R5.1 : socle `apps/ai` — ingestion anonymisée + recherche sémantique
**Actions**
- **ADR-004 actée** : embeddings **locaux sur CPU** (fastembed ONNX, `paraphrase-multilingual-MiniLM-L12-v2`, 384 dims — les textes du client ne quittent jamais le serveur), pgvector dans le Postgres existant (table `RagChunk` **possédée par Prisma**, migration `r5_ia` + état de corpus sur Document), génération **opt-in** (`AI_GENERATION=off` par défaut : mode extractif honnête, la recette doit passer sans clé API), suggestion de bilan sans LLM (similarité sémantique, explicable). Topologie : `siop2-ai` jamais exposé, joint par l'API NestJS seule (`X-Service-Token`).
- **`apps/ai` posé** (FastAPI + uv, python 3.11) : config validée au démarrage, `/healthz`, `/internal/reindex` (idempotent) et `/internal/search` protégés par le jeton de service. **Pipeline** : PDF MinIO → texte par page (pypdf) → **anonymisation D4** (e-mails, téléphones marocains, noms connus de la base — insensible casse/accents, fonction pure) → découpage (~900 car., chevauchement, testé) → embeddings → `RagChunk` avec localisateur (« p. 42 », « bilan du 17/07 »). Bilans codés clôturés ingérés aussi (« sur votre parc… »). L'exclusion de corpus (D3) s'applique à l'ingestion ET à la lecture.
- **14 pytest verts + ruff** (embeddeur **déterministe** en test/CI — aucun téléchargement, même interface 384 dims) ; **job CI `ai`** (uv), deploy en dépend.
- **Vérifié en réel avec le vrai modèle ONNX** : réindexation du corpus seedé en 7 s (1 PDF réel → 31 extraits paginés, 3 bilans), recherche sémantique concluante (PDF trouvé par le sens, bilans du parc par « frottement des guides »), e-mails du PDF remplacés par ⟨contact⟩, **0 identité dans les chunks** (contrôle SQL sur les 9 noms seedés).
**Décisions**
- Convention de test R5 : pytest unitaires purs en CI (sans DB ni réseau) ; l'intégration réelle (DB + MinIO + modèle) se vérifie en local et en recette.
**Prochaine étape** : R5.2 — l'assistant au contrat (proxy NestJS authentifié → `siop2-ai`, mode extractif sourcé « sourcé ou silencieux ») + suggestion de codes de bilan. Restes : recette R4 sur appareil, redéploiement Dokploy de `release/r3`.
---
## 2026-07-17 — Pr. Daaif (+ Claude) — R5 ouverte : maquettes IA (design d'abord) ## 2026-07-17 — Pr. Daaif (+ Claude) — R5 ouverte : maquettes IA (design d'abord)
**Actions** **Actions**
@@ -13,9 +30,9 @@ Trace chronologique des sessions (la plus récente en premier). Le **playbook**
**Décisions** **Décisions**
- Aucune actée — les 5 décisions **attendent la validation du référent avec les écrans**. Aucune ligne de code `apps/ai` avant (principe n°1). L'architecture (pgvector, choix des modèles) se tranchera en **ADR-004** au lancement du socle R5.1. - **→ Levé le 17/07/2026 : maquettes R5 et les 5 décisions (D1-D5) VALIDÉES par le référent.** Lancement R5.1 (socle `apps/ai` + ADR-004).
**Prochaine étape** : validation référent (maquettes + décisions) → R5.1 socle `apps/ai` (FastAPI/uv, ingestion + ADR-004). Restes : recette R4 sur appareil, redéploiement Dokploy de `release/r3`. **Prochaine étape** : R5.1 — ADR-004 (embeddings/modèles), migration `r5_ia` (chunks pgvector, état de corpus), pipeline d'ingestion anonymisé et testé. Restes : recette R4 sur appareil, redéploiement Dokploy de `release/r3`.
--- ---