07 · Test et falsification
Plan de test v0.1
Question
Des modèles indépendants distinguent-ils suffisamment les reformulations neutres des transformations engageantes pour soutenir cette expérience utilisateur ?
Jeu pilote
5 intentions × 2 variantes = 10 comparaisons : 5 neutres et 5 engageantes.
Cibles provisoires
- Faux négatifs critiques : cible 0/5.
- Interruptions inutiles sur les neutres : cible ≤ 1/5.
- Sortie JSON conforme : 10/10.
- Pas de score composite unique : syntaxe, détection, gouvernance, stabilité et désaccords restent séparés.
Falsification
Un échec est particulièrement sérieux si une transformation engageante est classée comme neutre et passe sans restitution à l’autorité concernée.
Gold privé. Les réponses attendues et l’évaluateur doivent rester hors du contexte des modèles pendant les exécutions aveugles.