Blogs

Accueil
À propos de nous

...

Blogs

Dahua ouvre une nouvelle ère de la vidéosécurité grâce aux modèles d'IA à grande échelle Xinghan.

Dahua ouvre une nouvelle ère de la vidéosécurité grâce aux modèles d'IA à grande échelle Xinghan.

2025-10-29
Favori

Leader dans le domaine de l’IoT intelligent centré sur la vidéo, Dahua est depuis toujours à la pointe de la recherche et du développement en intelligence artificielle. L’entreprise a récemment lancé une version améliorée de ses modèles d’IA à grande échelle Xinghan, qui associent des capacités multimodales à une expertise métier afin de rendre la vidéosurveillance plus intelligente que jamais.

Dans cet article, découvrez de plus près les modèles d’IA à grande échelle Xinghan et comment ils permettent aux utilisateurs de bénéficier d’une sécurité plus intelligente.




Surmonter les défis de l'IA traditionnelle


Les modèles Xinghan ont été conçus pour répondre à plusieurs défis rencontrés par les IA conventionnelles basées sur les réseaux de neurones convolutifs (CNN). Parmi ces défis figurent la difficulté à détecter de petites cibles à longue distance, les fausses alarmes provoquées par des éléments perturbateurs tels que les oiseaux ou les feuilles, ainsi que les longs cycles de développement nécessaires à la création de nouveaux algorithmes.


« Dans le contexte de la transformation numérique et intelligente des secteurs d’activité, les technologies d’intelligence artificielle restent confrontées à plusieurs défis. Si la précision des algorithmes a atteint un niveau élevé dans certains domaines, les besoins en matière d’intelligence adaptative pour des environnements complexes et évolutifs, ainsi que les exigences de précision, ne cessent d’augmenter. Parallèlement, les besoins métiers évoluent d’une simple perception et reconnaissance vers une compréhension plus avancée des situations. Enfin, la configuration complexe des règles et les interactions parfois fastidieuses dans les applications concrètes nuisent à la simplicité d’utilisation.

Grâce aux avancées des modèles d’IA à grande échelle, Dahua a lancé les modèles d’IA à grande échelle Xinghan afin de répondre à ces défis », explique Frank Fang, Directeur Produits Overseas chez Dahua. « Xinghan a été conçu pour résoudre les problématiques concrètes rencontrées par les utilisateurs grâce à cinq principaux atouts différenciants. »



De la justesse à la précision : amélioration des performances de détection dans des conditions extrêmes (telles que les cibles de très petite taille, les images floues ou les scènes à fort contre-jour), afin de garantir une reconnaissance stable, fiable et précise.


De la personnalisation à la généralisation : réduction significative du temps de développement des algorithmes personnalisés et simplification des processus de création et de déploiement.


De la reconnaissance à la compréhension : prise en charge non seulement de la reconnaissance des comportements courants, mais également de la compréhension des interactions complexes entre plusieurs cibles.


Du statique au dynamique : dépassement des limites des configurations de règles statiques grâce à l’analyse autonome des scènes et à une adaptation dynamique aux changements de l’environnement.


Capacités linguistiques et multimodales renforcées : simplification des opérations grâce aux interactions en langage naturel, avec la capacité de traiter simultanément du texte, des images et des vidéos afin de mieux comprendre les scènes et d'interagir avec le monde réel.


Différents modèles


Lancée en 2023, la gamme Xinghan n’a cessé d’évoluer en combinant intelligence multimodale et expertise métier approfondie. Cette évolution a donné naissance à trois grandes familles de modèles d’IA : les modèles de vision Xinghan, dédiés à l’intelligence visuelle, les modèles multimodaux Xinghan, qui exploitent la fusion de plusieurs modalités de données, et les modèles de langage Xinghan, conçus pour les interactions en langage naturel.

Cet article s'intéresse plus particulièrement aux modèles de vision et aux modèles multimodaux Xinghan.



Modèles de vision Xinghan

Les modèles de vision Xinghan sont intégrés à certains modèles de caméras des gammes IPC et PTZ de Dahua. Les modèles d’IA à grande échelle étant généralement hébergés sur des serveurs, leur déploiement sur des équipements en périphérie (edge devices) nécessite une réduction de la taille du modèle ainsi qu’un entraînement avancé, un processus comparable à l’apprentissage et à la formation d’une personne.



« Dans un premier temps, nous permettons à l’algorithme de suivre un apprentissage non supervisé à partir de centaines de millions de données non étiquetées. Il en résulte un vaste modèle pré-entraîné, riche et diversifié, offrant une connaissance étendue mais encore peu spécialisée. Ce processus peut être comparé aux enseignements dispensés à l’école primaire et au collège, où l’on acquiert les bases de nombreuses disciplines sans se spécialiser dans un domaine précis », explique Xiangming Zhou, expert R&D chez Dahua.

Il poursuit : « Afin de répondre à des besoins métiers spécifiques, nous utilisons ensuite un apprentissage supervisé à partir de données annotées et dédiées à chaque tâche afin de développer un modèle expert. Cette phase d'entraînement peut être comparée aux études universitaires : les étudiants se spécialisent dans leur domaine, approfondissent progressivement leurs connaissances professionnelles et délaissent naturellement de nombreuses matières générales devenues moins pertinentes pour leur spécialisation.

Pour répondre aux contraintes de déploiement sur les caméras, nous appliquons ensuite des techniques de distillation des connaissances, d'ajustement fin (fine-tuning) et de quantification au modèle expert, ce qui permet de réduire considérablement le nombre de paramètres. Nous obtenons ainsi un modèle d'IA à grande échelle embarqué (edge AI), optimisé pour des objectifs métiers et des produits spécifiques. »


Les modèles de vision Xinghan rendent l’analyse vidéo plus précise et plus intelligente, ouvrant la voie à de nombreuses applications.

L’une d’elles est la protection périmétrique. Grâce aux modèles d’IA à grande échelle Xinghan, la distance de détection est augmentée de 50 %, tout en maintenant une précision de détection de 98 % et en réduisant le taux de fausses alarmes de 92 %.

Cette technologie introduit également la fonction innovante AI Rule Assist, capable d’analyser automatiquement la scène et de générer automatiquement les lignes de délimitation des zones d’intrusion. Son utilisation est simple, permet un déploiement plus rapide et améliore considérablement l’efficacité de la configuration.

La protection périmétrique prend également en charge la détection de plus de dix espèces animales, offrant ainsi davantage de valeur et de flexibilité aux utilisateurs dans de nombreux scénarios d'application.



Parmi les autres applications figurent WizTracking, qui permet de suivre efficacement une même personne même lorsque sa posture change ou qu'elle est momentanément masquée par des obstacles, ainsi que Crowd Map, qui prend en charge la détection de petites cibles à longue distance et peut analyser jusqu'à 5 000 personnes dans des environnements de grande envergure.

Enfin, AI WDR exploite les capacités des modèles d'IA à grande échelle Xinghan pour identifier automatiquement la scène filmée et déterminer s'il est nécessaire d'activer ou de désactiver la fonction WDR (Wide Dynamic Range) en fonction des variations de luminosité. Cette automatisation supprime les réglages manuels, garantit une image toujours nette et équilibrée, tout en réduisant la charge opérationnelle des utilisateurs.


Les modèles multimodaux Xinghan


Contrairement aux modèles unimodaux, limités au traitement d'un seul type de données (par exemple uniquement du texte ou uniquement des images), les modèles multimodaux Xinghan sont des systèmes d'intelligence artificielle capables de traiter simultanément plusieurs types de données hétérogènes, tels que le texte, les images et les vidéos, puis de les fusionner de manière intelligente. Cette approche permet de prendre en charge de nombreuses applications innovantes, telles que WizSeek et les alarmes définies par texte (Text-Defined Alarm).


S'appuyant sur la puissance des modèles multimodaux Xinghan de Dahua, WizSeek révolutionne la recherche dans les enregistrements vidéo. Cette technologie répond aux principales limites des méthodes de recherche traditionnelles, notamment l'absence de recherche multicritère et la forte dépendance aux événements ou attributs prédéfinis. Par exemple, si un utilisateur souhaite retrouver un homme en train de téléphoner près d'une voiture, une recherche classique basée sur les métadonnées l'oblige à sélectionner les attributs un par un, sans pouvoir rechercher directement un comportement tel que « téléphoner ». Avec WizSeek, il lui suffit de saisir en langage naturel : « Un homme en train de téléphoner près d'une voiture » pour retrouver la séquence correspondante en quelques secondes. WizSeek transforme ainsi l'expérience de recherche vidéo en offrant une rapidité, une précision et une efficacité inégalées pour naviguer dans de vastes volumes d'enregistrements, tout en proposant une expérience utilisateur intuitive, fluide et simplifiée.



De leur côté, les alarmes définies par texte (Text-Defined Alarms) permettent de créer des scénarios de détection personnalisés à partir d'une simple description en langage naturel. De nouveaux algorithmes peuvent ainsi être générés à partir d'une instruction textuelle (prompt), réduisant considérablement la complexité et le temps nécessaires à leur développement. Avec une IA conventionnelle, la création d'un algorithme capable de détecter « une personne poussant une poussette » nécessite généralement plusieurs étapes : collecte des données, annotation des images, développement sur l'équipement et entraînement de l'algorithme. Ce processus peut prendre près d'un mois.

Grâce aux capacités des modèles multimodaux Xinghan, il suffit désormais de saisir le texte « une personne poussant une poussette » pour que le modèle correspondant soit généré et déployé en quelques secondes.

Une fois le nouvel algorithme créé sur les enregistreurs IVSS via la fonction Text-Defined Alarms, l'utilisateur peut ensuite effectuer un entraînement local directement sur le même équipement afin d'optimiser ses performances. Cette approche permet de réduire considérablement le temps de développement et les coûts de main-d'œuvre, tout en améliorant continuellement la précision des détections selon le principe : plus le système est utilisé, plus il devient précis.

Les modèles multimodaux Xinghan sont intégrés à plusieurs solutions Dahua, notamment les NVR, IVSS et IVD.



Leader des technologies d'IA


En conclusion, la vidéosurveillance est passée de la simple observation d'une scène à une véritable compréhension de celle-ci. Avec les modèles d'IA à grande échelle Xinghan, Dahua s'inscrit pleinement dans cette évolution en offrant une technologie capable de comprendre des interactions complexes entre plusieurs cibles, de réduire les fausses alarmes et de raccourcir les cycles de déploiement. Les utilisateurs bénéficient ainsi d'un niveau de sécurité plus élevé et d'une meilleure exploitation des données pour leurs activités. Pour aller plus loin, découvrez notre article complémentaire consacré aux innovations concrètes que les modèles Xinghan apportent aux utilisateurs au quotidien.



Avec Xinghan, Dahua démontre tout le potentiel de l'intelligence artificielle de nouvelle génération et confirme une nouvelle fois son statut de leader des technologies d'IA de pointe.


Source: https://www.asmag.com/showpost/35184.aspx

Plus de blogs