HiddenLayer est une plateforme de sécurité dédiée aux modèles IA/ML : détection d’attaques adverses, de prompt injection, de jailbreak et d’exfiltration de modèle en production. L’équipe de recherche publie régulièrement des analyses sur les limites structurelles des garde-fous à base de LLM, notamment le fait qu’un classificateur de sécurité de la même famille que le modèle qu’il surveille hérite souvent des mêmes angles morts. Utilisée par les équipes qui déploient des modèles en production et veulent une couche de détection indépendante de l’inférence elle-même.
🔵 Défensif
$ hiddenlayer scan model --source huggingface --model-id org/model-name --output report.json
La commande produit un rapport JSON listant les comportements adverses détectés (backdoors, payloads sérialisés malveillants, patterns d’exfiltration) et un score de risque par artefact du modèle ; un code de sortie non nul permet de bloquer l’intégration du modèle dans un pipeline CI/CD tant que le rapport n’a pas été revu.