Skip to content

feat: option --limit pour lancer un benchmark sur un échantillon de test - #5

Merged
melinahillion merged 1 commit into
mainfrom
test-qwen3-8-27b-end2end
Aug 18, 2026
Merged

feat: option --limit pour lancer un benchmark sur un échantillon de test#5
melinahillion merged 1 commit into
mainfrom
test-qwen3-8-27b-end2end

Conversation

@melinahillion

Copy link
Copy Markdown
Collaborator

…runs

Ajoute la config du test 100 copies pour qwen3-8-27b (nouveau modèle servi sur llm.lab) et un script de comparaison appariée entre deux runs de scoring.

Résultat sur les 100 premières copies (8 300 items, mêmes copies que le run gemma4 complet déjà sur S3), IC95 % par bootstrap de grappes :

métrique qwen3-8-27b gemma4-26b-moe Δ (IC95 %)
accord brut 83,9 % 83,0 % +0,8 pt [-0,4 ; +2,1] ns
kappa de Cohen 0,455 0,526 -0,071 [-0,117 ; -0,025]
rappel des fautes 35,8 % 57,7 % -21,9 pts [-26,8 ; -16,9]
sur-correction 1,8 % 7,6 % -5,7 pts [-6,7 ; -4,8]

L'accord brut, non significatif, est trompeur : qwen3-8-27b code « correct » 89,5 % du temps contre 76,5 % pour l'expert. Cette complaisance gonfle l'accord brut vu le déséquilibre des classes, mais lui fait rater deux fautes sur trois. Sur le rappel des fautes — la métrique décisionnelle pour la DEPP — gemma4-26b-moe reste nettement devant.

Prédictions exportées sur S3 :
predictions/dictee_end2end_test100_qwen3-8-27b_predictions.jsonl

Permet d'évaluer un modèle sur les N premières copies sans dupliquer un YAML.
Contrairement à --model-name, --limit n'entre PAS dans le nom du run : un test
sur 100 copies et sa reprise complète partagent donc le même checkpoint, et
relancer sans --limit poursuit là où le test s'était arrêté.

    uv run scripts/run_benchmark.py --config configs/scoring/dictee_end2end.yaml \
        --model-name qwen3-8-27b --limit 100

C'était la seule brique qui manquait pour comparer un nouveau modèle : le reste
existait déjà dans website/_analyse.py — `charger_runs()` découvre les exports
S3, `restreindre_corpus_commun()` ramène les runs à leurs copies communes, et
`synthese_globale()` produit les six métriques avec IC corrigés du design effect
de Kish. Un run pilote se compare en pointant RESULTATS_MODELES dessus, sans
toucher aux valeurs par défaut du site (y verser un run partiel restreindrait la
section « corpus commun » à l'échantillon pour tous les modèles) :

    RESULTATS_MODELES="gemma4-26b-moe,qwen3-8-27b" quarto render website

Premier usage — qwen3-8-27b (nouveau sur llm.lab, multimodal, json_schema et
logprobs vérifiés) sur 100 copies, face à gemma4-26b-moe sur les mêmes copies,
via A.synthese_globale (IC 95 %) :

| métrique                | qwen3-8-27b            | gemma4-26b-moe         |
|-------------------------|------------------------|------------------------|
| accord brut             | 0,839 [0,816 ; 0,859]  | 0,830 [0,814 ; 0,846]  |
| kappa de Cohen          | 0,455 [0,398 ; 0,518]  | 0,526 [0,484 ; 0,567]  |
| rappel des erreurs      | 0,380 [0,333 ; 0,430]  | 0,602 [0,559 ; 0,643]  |
| précision sur erreurs   | 0,854 [0,807 ; 0,890]  | 0,672 [0,626 ; 0,715]  |
| taux de sur-correction  | 0,620 [0,570 ; 0,667]  | 0,398 [0,357 ; 0,441]  |
| taux de sur-détection   | 0,020 [0,014 ; 0,028]  | 0,090 [0,079 ; 0,103]  |

qwen3-8-27b code « correct » 89,5 % du temps là où l'expert n'en voit que
76,5 %. Cette complaisance lui vaut la meilleure précision et la plus faible
sur-détection, mais lui fait valider à tort 62 % des fautes des élèves contre
40 % pour gemma4. Son accord brut légèrement supérieur n'est qu'un artefact du
déséquilibre des classes. Sur le rappel des erreurs et le kappa — ce qui compte
pour la DEPP — gemma4-26b-moe reste devant.

Prédictions exportées sur S3 :
predictions/dictee_end2end_qwen3-8-27b_predictions.jsonl

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
@melinahillion
melinahillion force-pushed the test-qwen3-8-27b-end2end branch from 62a2062 to b4e3855 Compare August 18, 2026 14:56
@melinahillion melinahillion changed the title feat: benchmark qwen3-8-27b en end_to_end + script de comparaison de … feat: option --limit pour lancer un benchmark sur un échantillon de test Aug 18, 2026
@melinahillion
melinahillion merged commit 0d8d2a6 into main Aug 18, 2026
1 check passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant