La justesse mesurée sur les 120 messages est optimiste : ces messages ont servi à régler les règles et les consignes. Elle dit ce que le moteur a appris de ce corpus, pas ce qu’il ferait sur du courrier nouveau. De combien elle est optimiste reste inconnu : je ne la publie donc pas.
Plusieurs modèles locaux ont été mesurés dans les mêmes conditions. Leur classement relatif garde sa valeur : il a servi à choisir le modèle.
Sur le jeu réservé, seule une base de comparaison sans modèle a été mesurée : un classement par mots-clés, figé avant l’écriture du jeu. Elle rend 29 décisions sur 60 et laisse 31 messages « à trier ». Elle repère les 5 messages ambigus, mais abandonne aussi 26 messages qui ne l’étaient pas.
Aucune de ces 29 décisions n’est fausse. Ce n’est pas une mesure de fiabilité : cette base s’abstient dès qu’elle doute.
La mesure qui manque : le moteur complet, avec son modèle, n’a pas encore été mesuré sur le jeu réservé.
Le jeu réservé et son protocole ont le même auteur : ce n’est pas une validation externe.
Les 6 instructions déguisées sont toutes détectées, mais par des règles écrites en regardant ces 6 messages. Cela ne prouve rien sur une formulation nouvelle.
Tout le courrier est inventé. Seul un pilote sur une vraie boîte dirait ce que l’assistant ferait chez un client.