diff --git a/.env.example b/.env.example index d389f52..164acba 100644 --- a/.env.example +++ b/.env.example @@ -9,12 +9,11 @@ AWS_SESSION_TOKEN= AWS_S3_ENDPOINT=minio.lab.sspcloud.fr AWS_DEFAULT_REGION=us-east-1 -# Bucket et préfixes du projet -S3_BUCKET=mon-bucket -S3_PREFIX_RAW=evaluation-ecrit/raw -S3_PREFIX_GROUND_TRUTH=evaluation-ecrit/ground_truth # Répertoire S3 où déposer les prédictions finies (export post-run), pour relancer # notebooks et site Quarto sans réexécuter le pipeline. Jamais dans Git. +# Les chemins des DONNÉES d'entrée (imagettes, CSV de codes experts) ne sont pas +# ici : ils vivent dans le YAML de chaque expérience (configs/scoring/*.yaml), +# pour qu'un run reste reproductible à partir de sa seule config. S3_PREDICTIONS_PREFIX=s3://projet-production-ecrits-depp/predictions # ─── Service de modèles (vLLM via llm.lab) ────────────────────── diff --git a/.gitignore b/.gitignore index 9cc388c..616e692 100644 --- a/.gitignore +++ b/.gitignore @@ -19,7 +19,18 @@ !website/slides/img/**/*.jpg !website/img/**/*.png +# ─── Sorties de run : jamais dans Git ────────────────────────── +# Les logs de benchmark contiennent des extraits de copies (transcriptions +# d'élèves mineurs) : les versionner ferait sortir des données du SSP Cloud. +logs/ +checkpoints/ + # ─── MLflow (suivi local, ne pas versionner) ─────────────────── +# mlflow.db était suivi par Git malgré cette règle (un .gitignore n'a aucun +# effet sur un fichier déjà indexé) : il a été retiré de l'index. C'était un +# vestige d'une version antérieure du code, où le scoring était tracé dans +# MLflow ; il l'est désormais dans Langfuse, MLflow ne servant plus qu'au +# fine-tuning HTR sur GPU. mlflow.db mlruns/ mlartifacts/ diff --git a/README.md b/README.md index d2896af..776e59d 100644 --- a/README.md +++ b/README.md @@ -446,7 +446,7 @@ evaluation_dictee/ │ ├── 04_diagnostic.ipynb ← inspection copie par copie │ └── 05_analyse_transcription_htr.ipynb ← analyse HTR ├── website/ ← site Quarto (archi, résultats, métriques, fine-tuning) -├── tests/ ← 83 tests unitaires (pytest) +├── tests/ ← 155 tests unitaires (pytest) └── docs/ ← décisions, grille de codage, schéma du pipeline ``` diff --git a/mlflow.db b/mlflow.db deleted file mode 100644 index b3cccc2..0000000 Binary files a/mlflow.db and /dev/null differ diff --git a/src/evaluation_dictee/config.py b/src/evaluation_dictee/config.py index b36640a..89f1afc 100644 --- a/src/evaluation_dictee/config.py +++ b/src/evaluation_dictee/config.py @@ -19,7 +19,6 @@ class Secrets(BaseSettings): aws_access_key_id: str = "" aws_secret_access_key: str = "" aws_s3_endpoint: str = "minio.lab.sspcloud.fr" - s3_bucket: str = "" # Répertoire S3 où sont déposées les prédictions finies (JAMAIS dans Git : les # transcriptions sont des données d'élèves mineurs). Sert à relancer notebooks # et site Quarto sans réexécuter le pipeline. Surchargé par S3_PREDICTIONS_PREFIX.