StateWatch : un benchmark pour la vérification d'états persistants sur caméras fixes
Les benchmarks vision-langage existants ne mesurent pas ce dont une caméra surveillée a besoin : un état décrit est-il vrai dans une zone, sous des clauses, avec une confiance calibrée.
Les benchmarks façonnent ce que les modèles apprennent à bien faire. Les benchmarks vision-langage publics récompensent le sous-titrage, les questions-réponses sur des photos du web, la lecture de documents et la compréhension de graphiques. Aucun ne pose la question qu’une caméra surveillée pose toute la journée : cet état décrit tient-il, dans cette zone de cette caméra fixe, sous les clauses écrites par l’exploitant, avec une confiance sur laquelle on peut agir et peu de fausses alertes. StateWatch est le benchmark que nous construisons pour mesurer cela. Ce billet décrit sa conception avant qu’aucun chiffre n’existe, pour que la conception ne puisse pas être ajustée aux chiffres.1
Ce qui manque aux benchmarks existants
Trois choses. D’abord la persistance : un état qui compte sur un site est un état qui dure, et la question « est-il apparu, a-t-il persisté, a-t-il disparu » ne peut pas être posée à une seule photo. Ensuite les clauses : « ignore les marchandises dans les racks », « seulement si elle touche le sol » font partie de la tâche, et un benchmark sans elles mesure la mauvaise compétence. Enfin le point de fonctionnement : un site se soucie des fausses alertes à haut rappel et de la signification de la confiance, pas d’une exactitude moyennée sur des items faciles.
Les données de vidéosurveillance d’entrepôt pour construire tout cela existent à peine. PhysicalAI SmartSpaces est la seule source publique, utilisable commercialement, multi-caméras, d’entrepôt, et elle a été faite pour le suivi d’objets : rien n’y est bloqué, obstrué, saturé ou manquant. LOCO a les objets mais pas les caméras. Tout le reste est du campus, de la circulation, du commerce ou de la délinquance. La vraie vidéosurveillance d’entrepôt à grande échelle n’existe que sur les sites des clients et ne les quitte que sous accord de données, floutée, le CSE informé.1
Deux pistes
| SW-Frame | SW-Clip | |
|---|---|---|
| Entrée | Une image, plus une image antérieure optionnelle de la même caméra | Quatre à huit images, à quelques minutes d’écart |
| Question | Une question portant une clause, et une zone | Un état à suivre sur la séquence |
| Sortie | Un verdict JSON avec des points dans l’image et une courte description ancrée | L’apparition, la persistance et la levée de l’état, avec les heures |
| Ce qu’elle mesure | La qualité de décision sous clauses, sur négatifs difficiles | La cohérence temporelle et le délai de détection |
Chaque item porte une zone, une clause, une étiquette de condition (jour, infrarouge de nuit, niveau de compression, occlusion) et, quand cela s’applique, un jumeau contrefactuel : la même image avec la clause ou la zone changée, pour que le respect des clauses soit noté sur des paires plutôt que deviné à partir de moyennes.
Les mesures
Ce sont des mesures de décision, choisies pour correspondre à la façon dont un site vit un modèle :
- l’exactitude équilibrée, pour que la distribution très négative ne cache pas les manqués ;
- les fausses alertes pour 1 000 négatifs à 90 % de rappel, le point de fonctionnement d’un système d’alerte ;
- l’erreur de calibration attendue du champ de confiance, qui conditionne les alertes ;
- le taux de respect des clauses sur les paires contrefactuelles ;
- la cohérence : l’accord des verdicts entre images à quelques minutes d’écart sans changement d’état ;
- le délai de détection sur la piste clips ;
- un score de fidélité pour les courtes descriptions, jugées contre les faits de référence.
Références et classement
En zero-shot : Gemini 3.x Flash et Pro, GPT-5.x, Claude, Qwen3.5 4B et 9B, les tailles Qwen3.8, Qwen3.6-35B-A3B, InternVL3, Gemma 3, chacun avec et sans raisonnement, avec et sans schéma de sortie « preuves d’abord ». Affinés : les modèles Camly par étape d’entraînement. Le classement est séparé par classe de taille (jusqu’à 4B, jusqu’à 10B, jusqu’à 35B, plus grand, API fermée) et par coût, parce qu’un modèle 4B proche d’une API de pointe pour un centième du prix est un résultat en soi.1
Jeux, licence, hébergement
| Jeu | Items | Composition |
|---|---|---|
| Jeu de développement public | 3 000 | CC BY 4.0 ; construit sur SmartSpaces et des scènes mises en scène ; aucune image de pilote |
| Test caché | 2 000 | Vrais positifs mis en scène, images de pilotes sous accord ; renouvelé chaque année |
Le jeu public sert au développement et à quiconque veut reproduire les chiffres. Le test caché est noté sur soumission, pour que personne, nous compris, ne s’y ajuste. Le harnais est écrit pour lmms-eval ou VLMEvalKit et hébergé dans l’Union européenne. Les images de pilotes n’entrent dans le test caché que sous accord de données, floutées, le CSE du site informé ; elles n’entrent jamais dans le jeu public.
Quand il devient public
Pas avant les mois sept à neuf du plan, et seulement une fois le travail sur le modèle terminé. Si le modèle Camly 9B bat toutes les API sur au moins deux des trois affirmations (fausses alertes sur négatifs difficiles, respect des clauses, cohérence et calibration) sur le jeu caché, StateWatch v1 est publié avec une étude d’accord humain (300 items, trois annotateurs), une fiche de données et un article. Sinon, le benchmark est publié quand même, avec les API en tête du classement. C’est aussi un résultat honnête et utile : une mesure publique de ce dont la surveillance déployée par caméra a réellement besoin.1
Si vous exploitez des caméras d’entrepôt et souhaitez des scènes mises en scène sur votre site dans le test caché, ou si vous travaillez sur les modèles vision-langage et voulez figurer au premier classement, nous aimerions vous entendre avant que le jeu de développement soit figé.
Sources
- Camly AI, Beating frontier models with a small VLM: research plan, octobre 2026.
- NVIDIA, jeu de données PhysicalAI SmartSpaces ; LOCO, Logistics Objects in Context (pages des jeux de données, par leur nom).