Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
Octopii — Сканер личной идентифицируемой информации (PII) на основе ИИ. | Kitploit
Инструменты/GitHubGitHub/redhuntlabs/octopii
OSINT (Разведка открытых источников)Эксфильтрация данныхСбор информацииКонфиденциальностьМашинное Обучение
GitHubredhuntlabs/octopii

Octopii

Сканер личной идентифицируемой информации (PII) на основе ИИ.

Репозиторий
74164831 год назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Сайт

Octopii

root@kitploit:~
⠀⠀⠀⠀⠀⠀⠀⣤⣤⣄⣀⡀⠀⠀⠀⢀⣠⣤⣤⣄⡀⠀⠀⠀⢀⣀⣠⣤⣤⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠸⣿⣿⡿⠿⢿⣷⡄⢠⣿⣿⣿⣿⣿⣿⡄⢀⣾⡿⠿⢿⣿⣿⠇⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠈⠉⠀⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⠀⠉⠁⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⣠⣤⡀⠀⠀⠀⠀⠀⠀⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⠀⠀⠀⠀⠀⠀⢀⣤⣄⠀⠀⠀
⠸⣿⣿⣿⣿⣿⣿⣿⣿⣦⠀⢸⣿⡇⢸⣿⣿⣿⣿⣿⣿⡇⢸⣿⡇⠀⣴⣿⣿⣿⣿⣿⣿⣿⣿⠇⠀⠀
⠀⠉⠉⠁⠀⠀⠀⠀⣿⣿⠀⢸⣿⡇⠀⠉⣿⣿⣿⣿⠉⠀⢸⣿⡇⠀⣿⣿⠀⠀⠀⠀⠈⠉⠉⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⣿⣿⣀⣈⣻⣿⣿⣿⣿⣿⣿⣿⣿⣿⣿⣟⣁⣀⣿⣿⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀       
⠀⠀⠀⠀⠀⠀⠀⠀⠘⠿⠿⠿⠿⠿⣿⣿⣿⣿⣿⣿⣿⣿⠿⠿⠿⠿⠿⠃⠀⠀⠀⠀⠀⠀⠀ 
⠀⠀⠀⠀⠀⠀⢀⣤⣤⣤⣤⣤⣤⣴⣿⣿⣿⡇⢸⣿⡿⣿⣦⣤⣤⣤⣤⣤⣤⡀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⢸⣿⠋⠉⠉⠉⠉⠉⠉⢸⣿⡇⢸⣿⡇⠈⠉⠉⠉⠉⠉⠙⣿⣧⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⢰⣿⣿⣦⠀⢰⣿⣿⣦⠀⢸⣿⡇⢸⣿⡇⠀⣰⣿⣿⡆⠀⣴⣿⣿⡆⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠈⠻⠿⠋⠀⠘⣿⣿⠃⠀⢸⣿⡇⢸⣿⡇⠀⠘⣿⣿⠃⠀⠙⠿⠟⠁⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⢻⣿⣦⣤⣼⣿⠃⠘⣿⣧⣄⣤⣿⡟⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀
⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠀⠉⠛⠛⠛⠁⠀⠀⠈⠛⠛⠛⠋⠀⠀⠀

⠀⠀⠀⠀⠀⠀      ⠀O C T O P I I⠀⠀⠀⠀
Copyright © 2023 RedHunt Labs Private Limited

Octopii — это сканер персонально идентифицируемой информации (PII), использующий оптическое распознавание символов (OCR), списки регулярных выражений и обработку естественного языка (NLP) для поиска правительственных удостоверений, адресов, электронных писем и других данных в изображениях, PDF-файлах и документах, находящихся в общедоступных местах.

Утечки PII часто остаются незамеченными в сфере кибербезопасности. В RedHunt Labs мы постоянно ищем новые и инновационные способы создания решений для кибербезопасности, необходимых организациям и сервисам. Мы столкнулись со значительным количеством организаций, у которых серверы настроены неправильно. Это приводит к постоянной утечке PII сотрудников и клиентов, предоставляя злоумышленникам конфиденциальную информацию об их происхождении, идентификационных номерах, контактных данных и местоположении.

Именно поэтому мы создали Octopii — инструмент для демонстрации и обнаружения того, насколько легко автоматизировать поиск и извлечение утекших PII и конфиденциальных документов в Интернете.

Использование

Установка зависимостей

  1. Установите все зависимости с помощью pip install -r requirements.txt.
  2. Установите вспомогательную программу Tesseract локально: sudo apt install tesseract-ocr -y на Ubuntu или sudo pacman -Syu tesseract на Arch Linux.
  3. Установите языковые определения Spacy локально: python -m spacy download en_core_web_sm.

После установки вышеуказанного всё готово.

Запуск

Для запуска Octopii введите:

root@kitploit:~
python3 octopii.py <путь для сканирования>

где <путь для сканирования> — это файл или каталог.

Octopii в настоящее время поддерживает локальное сканирование через файловую систему, URL-адреса S3 и открытые каталоги Apache. Вы также можете указать отдельные URL-адреса изображений или файлы в качестве аргумента.

Пример

Мы предоставили папку dummy-pii/ с образцами PII для тестирования Octopii. Передайте её в качестве аргумента, и вы получите следующий вывод:

root@kitploit:~
owais@artemis ~ $ python3 octopii.py dummy-pii/

Searching for PII in dummy-pii/dummy-drivers-license-nebraska-us.jpg
{
    "file_path": "dummy-pii/dummy-drivers-license-nebraska-us.jpg",
    "pii_class": "Nebraska Driver's License",
    "country_of_origin": "United States",
    "faces": 1,
    "identifiers": [],
    "emails": [],
    "phone_numbers": [
        "4000002170"
    ],
    "addresses": [
        "Nebraska"
    ]
}

Searching for PII in dummy-pii/dummy-PAN-India.jpg
{
    "file_path": "dummy-pii/dummy-PAN-India.jpg",
    "pii_class": "Permanent Account Number",
    "country_of_origin": "India",
    "faces": 0,
    "identifiers": [],
    "emails": [],
    "phone_numbers": [],
    "addresses": [
        "INDIA"
    ]
}

...

Создаётся файл output.txt, содержащий вывод инструмента. Этот файл последовательно дополняется в реальном времени.

Принцип работы

Octopii использует Tesseract для оптического распознавания символов (OCR) и NLTK для обработки естественного языка (NLP) с целью обнаружения строк персонально идентифицируемой информации. Это осуществляется с помощью следующих шагов:

1. Ввод данных и импорт

Octopii сканирует изображения (jpg и png) и документы (pdf, doc, txt и т.д.). Он поддерживает 3 источника:

  1. Amazon Simple Storage Service (S3): обходит XML из URL-адресов контейнеров S3
  2. Открытые каталоги: обходит открытые каталоги Apache и ищет файлы
  3. Локальная файловая система: может получать доступ к файлам и папкам в UNIX-подобных файловых системах (macOS и ОС на базе Linux)

Изображения обнаруживаются с помощью Python Imaging Library (PIL) и открываются с помощью OpenCV. PDF-файлы преобразуются в список изображений и сканируются с помощью OCR. Текстовые файлы считываются в строки и сканируются без OCR.

2. Обнаружение лиц

Для обнаружения лиц на изображениях используется метод бинарной классификации — «каскад Хаара». В этом репозитории предоставлена предварительно обученная модель каскада, содержащая данные каскада для использования в OpenCV. На одном изображении PII можно обнаружить несколько лиц, и возвращается количество обнаруженных лиц.

3. Очистка изображения и чтение текста

Затем изображения «очищаются» для извлечения текста с помощью следующих шагов преобразования:

  1. Автоматический поворот
  2. Преобразование в оттенки серого
  3. Монохром
  4. Средний порог
  5. Гауссов порог
  6. 3-кратное дескевинг

Иллюстрация фильтрации изображений

Поскольку эти шаги удаляют данные изображения (включая цвета на фотографиях), этот процесс очистки изображения выполняется после попытки обнаружения лиц.

4. Оптическое распознавание символов (OCR)

Tesseract используется для извлечения всех текстовых строк из изображения/файла. Затем они токенизируются в список строк, разделённых символами новой строки ('\n') и пробелами (' '). Искажённый текст, такой как строки null и одиночные символы, удаляется из этого списка, что приводит к «понятному» списку потенциальных слов.

Этот список слов затем подаётся в функцию проверки сходства. Эта функция использует сопоставление шаблонов Гештальта для сравнения каждого слова, извлечённого из документа PII, со списком ключевых слов, присутствующих в файле definitions.json. Эта проверка выполняется один раз после каждой очистки. Подсчитывается количество вхождений слов из списка ключевых слов, и на основе этого вычисляется оценка достоверности. Когда ключевые слова определённого определения многократно появляются в этих сканированиях, это определение получает наивысшую оценку и выбирается в качестве прогнозируемого класса PII.

Octopii также проверяет чувствительные подстроки PII, такие как адреса электронной почты, номера телефонов и распространённые уникальные идентификаторы государственных удостоверений, с помощью регулярных выражений. Он также может извлекать данные геолокации, такие как адреса и страны, с помощью обработки естественного языка.

4. Вывод

Вывод состоит из следующих полей:

  • file_path: путь к файлу, содержащему PII
  • pii_class: тип PII, содержащийся в этом файле
  • country_of_origin: происхождение этой PII
  • identifiers: уникальные идентификаторы, коды или номера, которые могут быть использованы для идентификации лица, указанного в PII
  • emails и phone_numbers: контактная информация в файле
  • addresses: любые данные геолокации в PII. Они могут быть использованы для определения местоположения человека

Вклад

Нажмите здесь, чтобы узнать, как вы можете внести вклад в Octopii.


Благодарности

  • BeautifulSoup
  • Tesseract
  • SciKit
  • OpenCV и Python Image Library
  • Spaces - DigitalOcean

...и многие другие

Отказ от ответственности

Этот инструмент предназначен только для исследовательских и образовательных целей. RedHunt Labs и другие участники этого проекта не несут ответственности за злонамеренное использование этого инструмента.

Лицензия

Лицензия MIT

Copyright © 2023 RedHunt Labs Private Limited.

Автор: Owais Shaikh

  • Рабочая почта: [email protected]
  • Личная почта: [email protected]
Скачать инструмент