Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Octopii — Un scanner d'Informations Personnellement Identifiables (PII) propulsé par l'IA. | Kitploit
Outils/GitHubGitHub/redhuntlabs/octopii
OSINT (Renseignement de Sources Ouvertes)Exfiltration de DonnéesCollecte d'InformationsProtection de la Vie PrivéeApprentissage Automatique
GitHubredhuntlabs/octopii

Octopii

Un scanner d'Informations Personnellement Identifiables (PII) propulsé par l'IA.

Voir le dépôt
74164il y a 1 anVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Site web

Octopii

root@kitploit:~
⠀⠀⠀⠀⠀⠀⠀⣤⣤⣄⣀⡀⠀⠀⠀⢀⣠⣤⣤⣄⡀⠀⠀⠀⢀⣀⣠⣤⣤⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠸⣿⣿⡿⠿⢿⣷⡄⢠⣿⣿⣿⣿⣿⣿⡄⢀⣾⡿⠿⢿⣿⣿⠇⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠈⠉⠀⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⠀⠉⠁⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⣠⣤⡀⠀⠀⠀⠀⠀⠀⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⠀⠀⠀⠀⠀⠀⢀⣤⣄⠀⠀⠀
⠸⣿⣿⣿⣿⣿⣿⣿⣿⣦⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⣴⣿⣿⣿⣿⣿⣿⣿⣿⠇⠀⠀
⠀⠉⠉⠁⠀⠀⠀⠀⣿⣿⠀⢸⣿⡇⠀⠉⣿⣿⣿⣿⠉⠀⢸⣿⡇⠀⣿⣿⠀⠀⠀⠀⠈⠉⠉⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⣿⣿⣀⣈⣻⣿⣿⣿⣿⣿⣿⣿⣿⣿⣿⣟⣁⣀⣿⣿⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀       
⠀⠀⠀⠀⠀⠀⠀⠀⠘⠿⠿⠿⠿⠿⣿⣿⣿⣿⣿⣿⣿⣿⠿⠿⠿⠿⠿⠃⠀⠀⠀⠀⠀⠀⠀ 
⠀⠀⠀⠀⠀⠀⢀⣤⣤⣤⣤⣤⣤⣴⣿⣿⣿⡇⢸⣿⡿⣿⣦⣤⣤⣤⣤⣤⣤⡀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⢸⣿⠋⠉⠉⠉⠉⠉⠉⢸⣿⡇⢸⣿⡇⠈⠉⠉⠉⠉⠉⠙⣿⣧⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⢰⣿⣿⣦⠀⢰⣿⣿⣦⠀⢸⣿⡇⢸⣿⡇⠀⣰⣿⣿⡆⠀⣴⣿⣿⡆⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠈⠻⠿⠋⠀⠘⣿⣿⠃⠀⢸⣿⡇⢸⣿⡇⠀⠘⣿⣿⠃⠀⠙⠿⠟⠁⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⢻⣿⣦⣤⣼⣿⠃⠘⣿⣧⣄⣤⣿⡟⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠉⠛⠛⠛⠁⠀⠀⠈⠛⠛⠛⠋⠀⠀⠀

⠀⠀⠀⠀⠀⠀      ⠀O C T O P I I⠀⠀⠀⠀
Copyright © 2023 RedHunt Labs Private Limited

Octopii est un scanner d'informations personnelles identifiables (PII) qui utilise la reconnaissance optique de caractères (OCR), des listes d'expressions régulières et le traitement du langage naturel (NLP) pour rechercher des pièces d'identité gouvernementales, des adresses, des e-mails, etc., dans des images, PDF et documents accessibles publiquement.

Les fuites de PII sont souvent négligées dans le domaine de la cybersécurité. Chez RedHunt Labs, nous cherchons toujours des moyens différents et innovants de proposer des solutions de cybersécurité dont les organisations et les services ont besoin. Nous avons rencontré un nombre important d'organisations dont les serveurs sont mal configurés. Cela provoque des fuites constantes de PII des employés et des clients, donnant aux parties malveillantes des informations sensibles sur leurs origines, leurs numéros d'identification, leurs coordonnées et leur localisation.

C'est pourquoi nous avons créé Octopii, un outil pour démontrer et détecter à quel point il est facile d'automatiser la découverte et l'extraction de PII et de documents sensibles divulgués sur Internet.

Utilisation

Installation des dépendances

  1. Installez toutes les dépendances via pip install -r requirements.txt.
  2. Installez l'assistant Tesseract localement via sudo apt install tesseract-ocr -y sur Ubuntu ou sudo pacman -Syu tesseract sur Arch Linux.
  3. Installez les définitions de langue Spacy localement via python -m spacy download en_core_web_sm.

Une fois ces étapes effectuées, vous êtes prêt.

Exécution

Pour exécuter Octopii, tapez

root@kitploit:~
python3 octopii.py <emplacement à analyser>

où <emplacement à analyser> est un fichier ou un répertoire.

Octopii prend actuellement en charge l'analyse locale via le chemin du système de fichiers, les URL S3 et les listes de répertoires ouverts Apache. Vous pouvez également fournir des URL d'images individuelles ou des fichiers comme argument.

Exemple

Nous avons fourni un dossier dummy-pii/ contenant des exemples de PII pour vous permettre de tester Octopii. Passez-le en argument et vous obtiendrez le résultat suivant :

root@kitploit:~
owais@artemis ~ $ python3 octopii.py dummy-pii/

Recherche de PII dans dummy-pii/dummy-drivers-license-nebraska-us.jpg
{
    "file_path": "dummy-pii/dummy-drivers-license-nebraska-us.jpg",
    "pii_class": "Nebraska Driver's License",
    "country_of_origin": "United States",
    "faces": 1,
    "identifiers": [],
    "emails": [],
    "phone_numbers": [
        "4000002170"
    ],
    "addresses": [
        "Nebraska"
    ]
}

Recherche de PII dans dummy-pii/dummy-PAN-India.jpg
{
    "file_path": "dummy-pii/dummy-PAN-India.jpg",
    "pii_class": "Permanent Account Number",
    "country_of_origin": "India",
    "faces": 0,
    "identifiers": [],
    "emails": [],
    "phone_numbers": [],
    "addresses": [
        "INDIA"
    ]
}

...

Un fichier nommé output.txt est créé, contenant la sortie de l'outil. Ce fichier est complété séquentiellement en temps réel.

Fonctionnement

Octopii utilise Tesseract pour la reconnaissance optique de caractères (OCR) et NLTK pour le traitement automatique du langage naturel (NLP) afin de détecter les chaînes d'informations personnelles identifiables. Cela se fait via les étapes suivantes :

1. Entrée et importation

Octopii analyse les images (jpg et png) et les documents (pdf, doc, txt, etc.). Il prend en charge 3 sources :

  1. Amazon Simple Storage Service (S3) : parcourt le XML des URL de conteneurs S3
  2. Liste de répertoire ouvert : parcourt les listes de répertoires ouverts Apache et analyse les fichiers
  3. Système de fichiers local : peut accéder aux fichiers et dossiers dans les systèmes de fichiers de type UNIX (macOS et systèmes d'exploitation basés sur Linux)

Les images sont détectées via Python Imaging Library (PIL) et ouvertes avec OpenCV. Les PDF sont convertis en une liste d'images et analysés via OCR. Les types de fichiers texte sont lus sous forme de chaînes et analysés sans OCR.

2. Détection des visages

Une technique de classification binaire de détection d'image - connue sous le nom de "cascade de Haar" - est utilisée pour détecter les visages dans les images. Un modèle de cascade pré-entraîné est fourni dans ce dépôt, contenant des données de cascade pour OpenCV. Plusieurs visages peuvent être détectés dans la même image de PII, et le nombre de visages détectés est renvoyé.

3. Nettoyage de l'image et lecture du texte

Les images sont ensuite "nettoyées" pour l'extraction de texte avec les étapes de transformation d'image suivantes :

  1. Rotation automatique
  2. Conversion en niveaux de gris
  3. Monochrome
  4. Seuil moyen
  5. Seuil gaussien
  6. Désinclinaison 3x

Illustration du filtrage d'image

Étant donné que ces étapes suppriment les données d'image (y compris les couleurs des photographies), ce processus de nettoyage d'image se produit après la tentative de détection des visages.

4. Reconnaissance optique de caractères (OCR)

Tesseract est utilisé pour extraire toutes les chaînes de texte d'une image/fichier. Elles sont ensuite tokenisées en une liste de chaînes, séparées par des caractères de nouvelle ligne ('\n') et des espaces (' '). Les textes brouillés, tels que les chaînes null et les caractères uniques, sont écartés de cette liste, ce qui donne une liste « intelligible » de mots potentiels.

Cette liste de mots est ensuite introduite dans une fonction de vérification de similarité. Cette fonction utilise la correspondance de motifs Gestalt pour comparer chaque mot extrait du document PII avec une liste de mots-clés, présente dans definitions.json. Cette vérification a lieu une fois par nettoyage. Le nombre de fois qu'un mot apparaît dans la liste de mots-clés est compté et utilisé pour dériver un score de confiance. Lorsque les mots-clés d'une définition particulière apparaissent de manière répétée dans ces analyses, cette définition obtient le score le plus élevé et est choisie comme classe PII prédite.

Octopii vérifie également les sous-chaînes PII sensibles telles que les e-mails, les numéros de téléphone et les identifiants uniques courants des documents gouvernementaux à l'aide d'expressions régulières. Il peut également extraire des données de géolocalisation telles que les adresses et les pays à l'aide du traitement automatique du langage naturel.

4. Sortie

La sortie comprend les éléments suivants :

  • file_path : où se trouve le fichier contenant les PII
  • pii_class : le type de PII que ce fichier contient
  • country_of_origin : l'origine de ces PII
  • identifiers : identifiants, codes ou numéros uniques pouvant être utilisés pour cibler la personne mentionnée dans les PII
  • emails et phone_numbers : informations de contact dans le fichier
  • addresses : toute forme de données de géolocalisation dans les PII. Cela peut être utilisé pour trianguler la localisation d'un individu

Contribuer

Cliquez ici pour lire comment vous pouvez contribuer à Octopii.


Crédits

  • BeautifulSoup
  • Tesseract
  • SciKit
  • OpenCV et Python Image Library
  • Spaces - DigitalOcean

...et bien d'autres

Avertissement

Cet outil est destiné uniquement à des fins de recherche et d'éducation. RedHunt Labs et les autres contributeurs à ce projet déclinent toute responsabilité en cas d'utilisation malveillante de cet outil.

Licence

Licence MIT

Copyright © 2023 RedHunt Labs Private Limited.

Par Owais Shaikh

  • Travail : [email protected]
  • Personnel : [email protected]
Télécharger l’outil