Cisco Talos a présenté CAIRN, un outil de recherche conçu pour détecter, classer et établir des relations entre des échantillons de logiciels malveillants intégrant l’intelligence artificielle. Ce projet propose une méthodologie basée sur les métadonnées, permettant d’étudier ces programmes sans avoir à télécharger ni exécuter leurs binaires, en se concentrant sur des traces telles que références à des fournisseurs de modèles, modèles d’instructions, mécanismes d’orchestration et autres artefacts liés à l’utilisation de l’IA.
Les clés de CAIRN en 30 secondes
- CAIRN est une suite d’outils de Cisco Talos pour analyser les malware intégrés à l’IA.
- Le système fonctionne uniquement avec des métadonnées, sans téléchargement ni exécution des binaires analysés.
- Il utilise jusqu’à 24 filtres, règles YARA, regroupement sémantique et graphes de relations.
- Talos a observé une évolution, passant de fonctions optionnelles d’IA à des échantillons dotés d’une autonomie accrue.
- Cisco a publié CAIRN en tant que projet de recherche, invitant la communauté à enrichir et étendre ses filtres et règles.
L’approche de Talos repose sur une idée simple : lorsqu’un logiciel malveillant incorpore de l’intelligence artificielle, il laisse également des traces associées à cette intégration. Ces indices peuvent inclure des références à des services de modèles, des structures d’appels à des outils, des éléments désignant des modèles exécutés localement ou même des textes destinés à influencer des systèmes automatisés d’analyse.
Talos désigne ces éléments sous le nom “artefacts cognitifs” et s’en sert comme points de départ pour une méthodologie d’investigation centrée sur les métadonnées. Celle-ci permet d’établir des relations entre des échantillons sans s’appuyer initialement sur une analyse directe du code du malware.
CAIRN signifie Cognitive Artifact Intelligence Research Network et est présenté comme un ensemble d’outils destiné à localiser, classer et suivre l’évolution de malwares intégrant de l’intelligence artificielle. Open source, le projet vise à faire évoluer ses résultats grâce à la contribution communautaire.
La société définit le malware intégré à l’IA comme tout programme qui exploite, attaque ou compromet des systèmes d’intelligence artificielle et leurs écosystèmes. Cela inclut aussi bien l’intégration fonctionnelle de l’IA dans une chaîne d’attaque que la compromission de crédentiels ou d’infrastructures associées.
Une recherche centrée sur les métadonnées
CAIRN fonctionne sans télécharger ni exécuter les fichiers analysés. Il exploite des informations déjà disponibles sur ces échantillons, telles que les chaînes extraites, le comportement observé dans des sandboxes ou encore les détections antivirus.
L’outil dispose de jusqu’à 24 filtres visant à repérer des indices relatifs à l’IA. Certains cherchent des références à des fournisseurs de modèles, d’autres détectent des schémas de code liés à des frameworks d’IA ou des signaux d’exécution de modèles locaux.
Par ailleurs, certains filtres ciblent la détection de textes utilisés pour tenter d’échapper aux systèmes d’analyse basés sur l’IA, ou identifient des signals propres aux outils d’agents. L’objectif n’est pas d’affirmer automatiquement qu’un indicateur prouve la présence d’un malware doté d’IA, mais plutôt de générer des candidats à un examen approfondi ultérieur.
Les résultats sont stockés dans une base de données SQLite et traités à l’aide de règles YARA. Talos a structuré sa classification en trois niveaux :
- Tier 1 (T1) : identifie les artefacts primitifs liés à l’IA, comme des références à des services ou des structures d’appel spécifiques. Son rôle est de signaler la présence d’éléments liés à cette technologie.
- Tier 2 (T2) : apporte un contexte comportemental. La combinaison d’indicateurs peut suggérer une utilisation opérationnelle de l’IA, sans toutefois établir une attribution définitive.
- Tier 3 (T3) : vise à repérer des familles de malware avec une empreinte opérationnelle confirmée, en s’appuyant sur des traces plus substantielles. Cependant, Talos insiste sur la nécessité de valider ces conclusions par analyse approfondie, notamment par ingénierie inverse.
Cette approche distingue la simple présence de références à l’IA d’une intégration réellement fonctionnelle. En effet, certains programmes peuvent contenir des chaînes évoquant des outils d’IA sans pour autant les utiliser concrètement.
CAIRN combine YARA, graphes et analyse sémantique
L’un des éléments clés de CAIRN est son explorateur de relations. Il construit un graphe reliant des échantillons par le biais de leurs métadonnées, telles que domaines, certificats, indicateurs d’envoi ou autres identifiants.
Lorsqu’un chercheur repère un échantillon intéressant, il peut utiliser ces connexions pour découvrir d’autres variantes, structurées sur une infrastructure partagée ou liées à une même campagne.
Ce système permet d’étendre une investigation depuis un fichier précis vers un ensemble plus large. Talos invite à poser des questions comme : existe-t-il d’autres variantes d’une même famille ? Partagent-elles la même infrastructure ? Quels sont les chargeurs ou composants additionnels utilisés dans une campagne ?
CAIRN intègre également des règles YARA pour la classification. Contrairement aux règles classiques, qui sont généralement élaborées après une ingénierie inverse complète, celles de CAIRN doivent fonctionner uniquement avec l’information visible dans les métadonnées accessibles.
Bien que cette approche limite la précision par rapport à une analyse complète du binaire, elle permet de couvrir un volume supérieur d’échantillons sans nécessité de télécharger chaque fichier. Talos considère que cette méthode peut venir en complément des techniques traditionnelles d’analyse.
Une autre facette importante réside dans la découverte sémantique. CAIRN exploite des modèles d’embeddings pour repérer des échantillons présentant des similitudes dans leurs métadonnées, même si les chaînes visibles ne sont pas identiques.
Pour cela, il construit une représentation imbriquée en combinant labels antivirus, domaines, URL, fragments de contenu, ressources d’exécutables et comportements observés lors d’exécutions en sandboxes.
Ce processus peut utiliser des techniques comme UMAP et HDBSCAN pour visualiser ces similitudes sous forme de regroupements. Talos précise que figurer dans un même groupe ne garantit pas que deux échantillons appartiennent à une même famille, mais que ces regroupements constituent des pistes à approfondir.
Une évolution rapide du malware doté d’IA détectée par Talos
Les premières analyses avec CAIRN remontent à juillet 2025, période où Talos a identifié les premiers cas de malware intégrant l’IA, tels que LAMEHUG, associé par la société au travail du CERT-UA.
L’un des principaux constats est une tendance vers une autonomie croissante. Selon leurs observations, la progression est passée d’un simple modèle de langage optionnel à la conception de systèmes complexes avec plusieurs modèles et mécanismes de coordination, capables de fonctionner sans intervention humaine.
Les recherches évoquent également des tentatives de propagation d’astuces conçues pour compliquer l’analyse par IA, qui se répandent entre différents acteurs. Par exemple, une technique visant à orienter les systèmes automatisés a été retrouvée dans des échantillons indépendants.
Il est toutefois important de noter que la simple détection d’indicateurs d’IA ne garantit pas qu’un échantillon en fasse usage de façon fonctionnelle. Les faux positifs restent fréquents, notamment avec certains logiciels empaquetés ou compilés.
C’est pourquoi CAIRN privilégie une approche par signal pour orienter la recherche, mais la confirmation d’une utilisation réelle nécessite une analyse approfondie et souvent une ingénierie inverse.
La publication de CAIRN vise à accompagner cette montée en puissance en fournissant une méthodologie permettant de repérer des tendances émergentes et de relier des échantillons à une échelle plus Large. Talos espère ainsi que la communauté pourra enrichir les filtres, règles et mécanismes de classification pour suivre l’évolution du malware avec IA.
Ce projet, ouvert et modulaire, doit rester une initiative de recherche afin de ne pas alimenter des alarmes infondées. Son intérêt réside dans la capacité à fournir aux équipes de sécurité des outils pour analyser plus efficacement ces menaces émergentes.
En partageant le code et la méthodologie, Talos souhaite que chercheurs et experts puissent contribuer à faire évoluer CAIRN, dans l’objectif de maintenir une capacité d’analyse adaptée à l’évolution rapide des attaques utilisant l’IA.
Questions fréquentes
Qu’est-ce que CAIRN de Cisco Talos ?
CAIRN est une plateforme d’outils développée par Cisco Talos pour détecter, classer et relier des malwares qui intègrent l’intelligence artificielle.
CAIRN exécute-t-il les fichiers malveillants ?
Non. La méthode repose uniquement sur des métadonnées ; il n’est pas nécessaire de télécharger ni d’exécuter les binaires pour la première étape de détection et de mise en relation des échantillons.
Quelles techniques utilise CAIRN ?
CAIRN combine des filtres d’acquisition, des règles YARA, l’analyse de relations à l’aide de graphes et la découverte sémantique via des modèles d’embeddings.
CAIRN peut-il confirmer seul qu’un malware utilise l’IA ?
Pas forcément. Talos souligne que les indicateurs initiaux doivent être validés par une analyse approfondie de chaque échantillon, souvent à travers de l’ingénierie inverse, pour déterminer si une utilisation fonctionnelle de l’IA est réellement présente.
Via : blog.talosintelligence