Évaluation : comment savoir que le système s'est amélioré
De quoi est fait un bon ensemble
Des cas réels du terrain, classés en catégories, incluant des cas limites et ceux sans bonne réponse. Pour chaque cas : entrée, et une réponse désirée ou un critère d'acceptation.
Chaque incident trouvé en production ajoute une ligne. Ainsi l'ensemble grandit aux bons endroits.
Trois méthodes de notation
Des règles automatiques — structure correcte, bon nombre, source citée. Peu coûteux et précis là où c'est possible.
Évaluation par modèle selon des critères écrits — rapide et peu coûteux, et nécessite une calibration par rapport au jugement humain.
Revue humaine d'un échantillon — coûteux, et l'ancre de la vérité.
Comment lire les résultats
Comparez à la version précédente, pas à un score absolu. Et vérifiez par ventilation de catégorie — une moyenne stable cache souvent une chute dans une catégorie qui est justement le cas important.
Pour aller plus loin
Exécutez l'ensemble dans le pipeline de build et bloquez une fusion quand une métrique clé baisse. Et ajoutez un échantillon du trafic en direct pour la revue humaine hebdomadaire — un ensemble fixe vieillit, et le terrain produit toujours des cas auxquels vous n'aviez pas pensé.