Pourquoi un modèle de 9 milliards de paramètres peut battre les API de pointe pour vérifier l'état d'un entrepôt
Un petit modèle vision-langage ne décrira pas mieux une image quelconque que Gemini ou GPT. Il n'en a pas besoin. Sur une question étroite, posée sur des caméras fixes, il peut gagner là où ça compte.
Les caméras de Camly ne demandent pas à un modèle de décrire le monde. Elles posent une seule question étroite, encore et encore : cet état est-il vrai, dans cette zone, sur cette caméra fixe, sous ces clauses, et pourquoi. Nous pensons qu’un modèle de 4 à 27 milliards de paramètres, entraîné exactement sur cette distribution, peut battre une API de pointe sur ce qui décide du succès d’un déploiement. Ce billet explique pourquoi nous le croyons, comment nous comptons le mesurer, et ce que nous n’avons pas encore mesuré.1
La question est étroite, et c’est le point
« Décris cette image » est une tâche ouverte. Les modèles de pointe y sont très bons, et un petit modèle ne les rattrapera pas sur ce terrain. « L’issue de secours B est-elle dégagée, en ignorant les marchandises stockées dans le rack voisin, en ne comptant une palette que si elle touche le sol ? » est une tâche fermée, avec une réponse oui ou non, une confiance, et une courte justification ancrée dans l’image. Elle est posée des milliers de fois par jour sur les mêmes caméras, sous les mêmes clauses.
Sur cette tâche, quatre choses comptent en déploiement, et aucune n’est « la compréhension générale des images » :
- les fausses alertes sur les négatifs difficiles, parce qu’un site cesse de lire les alertes après une semaine de bruit ;
- le respect des clauses d’exclusion, parce que chaque zone vient avec des règles « ignore ceci » écrites par l’exploitant ;
- la cohérence dans le temps, parce que la même scène à quelques minutes d’écart doit recevoir le même verdict, sinon les épisodes clignotent ;
- le coût par image, parce que des vérifications périodiques sur toutes les caméras d’un site s’additionnent.
Pourquoi c’est gagnable
La distribution. La photographie du web est à hauteur d’œil, centrée, bien éclairée. La vidéosurveillance est en plongée, grand angle, compressée, souvent en infrarouge monochrome la nuit, avec l’objet d’intérêt sur trente pixels. Les modèles de pointe sont forts mais n’ont pas été entraînés là-dessus. Un petit modèle entraîné dessus, si.
Les clauses. « Ignore les marchandises dans les racks » et « une palette n’est dans la zone que si elle touche le sol » sont des connaissances du métier. Un prompt peut les porter, mais pas de façon fiable : l’API lit la clause, elle n’a jamais été entraînée sur la paire d’images où la clause renverse la réponse. Un modèle entraîné sur des paires contrefactuelles, même image, clause changée, apprend la clause comme une règle et non comme une indication.
La calibration. Le champ de confiance conditionne les alertes. Les modèles de pointe émettent des nombres assurés qui ne sont pas calibrés. Un modèle entraîné peut être récompensé directement pour sa calibration.
Le coût. Un modèle de 9 milliards de paramètres sur un GPU installé sur site est, d’après notre étude d’inférence précédente, deux ordres de grandeur moins cher par image qu’une API cloud, et les images ne quittent pas le site.
Quatre affirmations, et comment chacune sera mesurée
| Affirmation | Mesure | Pourquoi un petit modèle peut gagner |
|---|---|---|
| C1 Moins de fausses alertes sur les négatifs difficiles à rappel égal | Fausses alertes pour 1 000 images négatives à 90 % de rappel, par condition | Les négatifs difficiles (marchandises à côté de l’issue, une personne qui traverse, une ombre) forment la moitié de la distribution d’entraînement, avec des étiquettes exactes |
| C2 Respect des clauses et conditionnement par zone | Part des paires contrefactuelles correctement répondues | Les paires sont générées par construction ; le modèle est entraîné sur la paire, l’API ne fait que lire la clause |
| C3 Cohérence et calibration dans le temps | Accord des verdicts entre images à quelques minutes d’écart sans changement d’état ; erreur de calibration attendue ; délai de détection sur les clips | La cohérence est récompensée directement pendant l’affinage par renforcement ; une API est sans état et non calibrée par conception |
| C4 (support) Coût | Jetons, secondes et euros pour 1 000 images, sur un GPU de site et sur les API | Un modèle 9B sur site est environ cent fois moins cher par image |
Les cibles que nous nous sommes fixées, comme hypothèses : des fausses alertes sur négatifs difficiles au moins divisées par deux par rapport à la meilleure API à 90 % de rappel (H1), et une fidélité de description à moins de 3 points de la meilleure API tout en étant plus de cent fois moins cher (H7).1
À quoi servent COCO et SA-1B
Pas au pré-entraînement. Les encodeurs visuels des modèles candidats ont déjà vu des milliards de paires image-texte ; un passage de plus sur 118 000 photos COCO ne change rien, et le domaine est de toute façon le mauvais.2 COCO, LVIS, POPE et RefCOCO servent de tests de régression dans la porte de publication : un affinage ne doit pas perdre l’ancrage général. SA-1B et SA-V servent de bibliothèque d’objets segmentés à composer dans de vraies images d’entrepôt ; la licence pour les produits dérivés reste à vérifier.3
L’échelle des modèles
| Modèle | Rôle | Empreinte (LoRA bf16) |
|---|---|---|
| Qwen3.5-4B | Candidat edge, GPU de site le moins cher, première cible d’affinage | environ 10 Go |
| Qwen3.5-9B | Le modèle produit | environ 22 Go |
| Famille Qwen3.8 | Génération plus récente : toute l’échelle en zero-shot d’abord ; s’il existe une taille sous 10B, elle remplace Qwen3.5 comme base. Tailles et licence à vérifier à la sortie | à vérifier |
| Qwen3.8-27B | Borne haute pour le sur site ; enseignant pour la distillation | environ 56 Go, tient dans un DGX Spark pour l’inférence et le LoRA |
Tous sont des poids publics de la famille Qwen.4
Ce que nous n’avons pas encore fait
Rien de ce qui précède n’est un résultat. C’est un plan avec des cibles, écrit avant la première mesure pour que la mesure ne puisse pas le tordre. L’ordre est : le produit d’abord. Un jeu d’évaluation figé et une échelle zero-shot dans les deux premiers mois, qui à eux seuls peuvent changer le modèle livré ; un affinage supervisé et une porte de publication aux mois trois et quatre ; l’affinage par renforcement ensuite. Un article scientifique ne vient que si le modèle 9B bat toutes les API sur au moins deux des affirmations C1 à C3, sur un jeu de test caché avec de vrais positifs. Sinon, le benchmark est publié quand même, avec les API en tête, et c’est aussi un résultat utile.
Si vous exploitez un entrepôt et voulez vos caméras dans l’évaluation, ou si vous travaillez sur les modèles vision-langage et voulez comparer sur les mêmes items, les deux billets suivants décrivent le benchmark et le moteur de données.
Sources
- Camly AI, Beating frontier models with a small VLM: research plan, octobre 2026.
- COCO, Common Objects in Context. cocodataset.org
- Meta AI, Segment Anything 1 Billion (SA-1B). ai.meta.com
- Famille de modèles Qwen sur Hugging Face. huggingface.co/Qwen