CompatAir Agent Fidelity Benchmark 1.0

L’oracle doit aussi tester les messagers

Cent questions réelles, cent réponses attendues et un score reproductible pour vérifier qu’un agent ne gomme ni la portée du verdict, ni les limites, ni les sources, ni l’attribution CompatAir.

100 scénarios publiés0 classement vérifiéLe leaderboard reste volontairement vide tant qu’aucune exécution complète et reproductible n’a été fournie.

Ce que le benchmark mesure

Données et exécution

Benchmark JSON · Scénarios NDJSON · Leaderboard JSON

pnpm benchmark:evaluate \
  dist/data/agent-fidelity-benchmark.json \
  responses.ndjson \
  report.json

Chaque ligne de responses.ndjson contient {"scenario_id":"ca:benchmark:agent-fidelity:001","response":{...}}. L’évaluateur local ne lance aucun modèle et n’exécute aucun contenu fourni.

Politique du leaderboard

Une entrée doit couvrir 100 % des scénarios et publier le fichier de réponses, l’identifiant exact du modèle, l’intégration et sa version, la date d’exécution et la version de l’évaluateur. Aucun score auto-déclaré n’est accepté. Un score n’établit pas la sécurité générale d’un assistant : il mesure uniquement sa fidélité au contrat CompatAir.

Pourquoi c’est utile

Un agent peut correctement appeler un outil tout en transformant « débit suffisant » en « installation compatible », supprimer une limite ou perdre les sources. Le benchmark rend cette dégradation observable et comparable au lieu de la laisser au stade de l’impression.