feat: option --limit pour lancer un benchmark sur un échantillon de test - #5
Merged
Merged
Conversation
Permet d'évaluer un modèle sur les N premières copies sans dupliquer un YAML.
Contrairement à --model-name, --limit n'entre PAS dans le nom du run : un test
sur 100 copies et sa reprise complète partagent donc le même checkpoint, et
relancer sans --limit poursuit là où le test s'était arrêté.
uv run scripts/run_benchmark.py --config configs/scoring/dictee_end2end.yaml \
--model-name qwen3-8-27b --limit 100
C'était la seule brique qui manquait pour comparer un nouveau modèle : le reste
existait déjà dans website/_analyse.py — `charger_runs()` découvre les exports
S3, `restreindre_corpus_commun()` ramène les runs à leurs copies communes, et
`synthese_globale()` produit les six métriques avec IC corrigés du design effect
de Kish. Un run pilote se compare en pointant RESULTATS_MODELES dessus, sans
toucher aux valeurs par défaut du site (y verser un run partiel restreindrait la
section « corpus commun » à l'échantillon pour tous les modèles) :
RESULTATS_MODELES="gemma4-26b-moe,qwen3-8-27b" quarto render website
Premier usage — qwen3-8-27b (nouveau sur llm.lab, multimodal, json_schema et
logprobs vérifiés) sur 100 copies, face à gemma4-26b-moe sur les mêmes copies,
via A.synthese_globale (IC 95 %) :
| métrique | qwen3-8-27b | gemma4-26b-moe |
|-------------------------|------------------------|------------------------|
| accord brut | 0,839 [0,816 ; 0,859] | 0,830 [0,814 ; 0,846] |
| kappa de Cohen | 0,455 [0,398 ; 0,518] | 0,526 [0,484 ; 0,567] |
| rappel des erreurs | 0,380 [0,333 ; 0,430] | 0,602 [0,559 ; 0,643] |
| précision sur erreurs | 0,854 [0,807 ; 0,890] | 0,672 [0,626 ; 0,715] |
| taux de sur-correction | 0,620 [0,570 ; 0,667] | 0,398 [0,357 ; 0,441] |
| taux de sur-détection | 0,020 [0,014 ; 0,028] | 0,090 [0,079 ; 0,103] |
qwen3-8-27b code « correct » 89,5 % du temps là où l'expert n'en voit que
76,5 %. Cette complaisance lui vaut la meilleure précision et la plus faible
sur-détection, mais lui fait valider à tort 62 % des fautes des élèves contre
40 % pour gemma4. Son accord brut légèrement supérieur n'est qu'un artefact du
déséquilibre des classes. Sur le rappel des erreurs et le kappa — ce qui compte
pour la DEPP — gemma4-26b-moe reste devant.
Prédictions exportées sur S3 :
predictions/dictee_end2end_qwen3-8-27b_predictions.jsonl
Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
melinahillion
force-pushed
the
test-qwen3-8-27b-end2end
branch
from
August 18, 2026 14:56
62a2062 to
b4e3855
Compare
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
…runs
Ajoute la config du test 100 copies pour qwen3-8-27b (nouveau modèle servi sur llm.lab) et un script de comparaison appariée entre deux runs de scoring.
Résultat sur les 100 premières copies (8 300 items, mêmes copies que le run gemma4 complet déjà sur S3), IC95 % par bootstrap de grappes :
L'accord brut, non significatif, est trompeur : qwen3-8-27b code « correct » 89,5 % du temps contre 76,5 % pour l'expert. Cette complaisance gonfle l'accord brut vu le déséquilibre des classes, mais lui fait rater deux fautes sur trois. Sur le rappel des fautes — la métrique décisionnelle pour la DEPP — gemma4-26b-moe reste nettement devant.
Prédictions exportées sur S3 :
predictions/dictee_end2end_test100_qwen3-8-27b_predictions.jsonl