
Извлекает структурированную информацию о киберугрозах (CTI) из PDF, DOCX и TXT документов с помощью LLMs. Генерирует цепочки атак MITRE ATT&CK, возможности обнаружения и комплексные графы связей сущностей.
Мощный автономный инструмент командной строки для извлечения данных киберразведки (CTI) из документов с использованием больших языковых моделей и расширенных возможностей структурированного вывода.
# Скопируйте или загрузите папку standalone-tdo
cd standalone-tdo
# Создайте виртуальное окружение (рекомендуется)
python -m venv .venv
source .venv/bin/activate # В Windows: .venv\Scripts\activate
# Установите зависимости
pip install -r requirements.txt
Инструмент использует переменные окружения, загружаемые из файла .env:
# Скопируйте пример конфигурации
cp env.example .env
# Отредактируйте .env, указав свои настройки
# Обязательные переменные:
GEMINI_API_KEY=ваш-ключ-api-google-ai-здесь
GEMINI_MODEL=gemini-2.5-flash
Получение ключа API Gemini:
.envДоступные модели:
gemini-2.5-flash-preview-05-20 (рекомендуется — быстрая и экономичная)gemini-2.5-pro-preview-06-05 (более мощная, медленнее)# Обработка одного файла со всеми функциями
python tdo_bulk.py report.pdf --flow --opps
# Обработка нескольких файлов
python tdo_bulk.py file1.pdf file2.docx file3.txt
# Обработка всех файлов в каталоге с параллельными рабочими потоками
python tdo_bulk.py reports/ -j 4
# Генерация комплексного анализа с оценкой
python tdo_bulk.py report.pdf --flow --opps --eval-opps
usage: tdo_bulk.py [options] FILE [FILE ...]
Позиционные аргументы:
FILE Один или несколько файлов или каталогов для обработки
Основные опции:
-o, --output DIR Выходной каталог (по умолчанию: ./extracted_data)
--csv FILE Экспорт сводки в CSV-файл
-j, --jobs N Количество параллельных рабочих потоков (по умолчанию: 1)
--retries N Количество повторных попыток LLM (по умолчанию: 2)
--backoff SEC База экспоненциальной задержки (по умолчанию: 1.5)
Функции анализа:
--flow Генерация JSON цепочки атак
--opps Генерация возможностей обнаружения угроз
--eval-opps Оценка качества возможностей обнаружения
--debug-opps Показать отладочную информацию для генерации возможностей
Управление выводом:
-q, --quiet Минимальный вывод на консоль
-v, --verbose Логирование отладочного уровня
-h, --help Показать справку и выйти
# Базовое извлечение CTI
python tdo_bulk.py threat_report.pdf
# Полный анализ со всеми функциями
python tdo_bulk.py apt_report.pdf --flow --opps --eval-opps
# Пакетная обработка с параллельными рабочими потоками
python tdo_bulk.py reports_folder/ -j 8 --flow --opps
# Экспорт результатов в CSV
python tdo_bulk.py *.pdf --csv results.csv
# Тихий режим для автоматизации
python tdo_bulk.py reports/ -q -o /var/soc/cti --opps
Для каждого обработанного файла инструмент генерирует:
{filename}_extracted.json: Структурированные данные CTI с комплексной схемой{filename}_{timestamp}.md: Отчёт в формате Markdown, удобный для чтения, со всем анализом--flow)--opps)| Тип сущности | Описание | Ключевые свойства |
|---|---|---|
| ThreatActor | Киберугрозные группы | aliases, primary_motivation, first_seen |
| Tool | Легитимное программное обеспечение | family, capabilities, kill_chain_phases |
| Malware | Вредоносное программное обеспечение | family, capabilities, first_seen, last_seen |
| Technique | Техники MITRE ATT&CK | id (T1234), description, kill_chain_phases |
| Tactic | Тактики MITRE ATT&CK | id (TA0001), description |
| Infrastructure | IP-адреса, домены, URL | type, tags, first_seen, last_seen |
| Indicator | Хеши файлов, шаблоны | value, pattern, valid_from, valid_until |
| Vulnerability | Записи CVE | id, cvss_score, affected_software |
| Campaign | Именованные кампании атак | objective, status, first_seen |
| Identity | Целевые организации | type, description |
| CourseOfAction | Меры реагирования, патчи | type, description |
| Source | Происхождение документа | filename, document_title, file_size_mb |
Отношения атрибуции и субъектов:
USES_TOOL, USES_TECHNIQUE, CONDUCTS, ATTRIBUTED_TO, TARGETSТехнические отношения:
TOOL_IMPLEMENTS_TECHNIQUE, HOSTS_ON, COMMUNICATES_WITH, VARIANT_OFDROPS, DOWNLOADS, INDICATES, OBSERVED_ON, EXPLOITSПродвинутые отношения:
MITIGATES, DETECTS, IS_SUBTECHNIQUE_OF, FLOW_CONTAINS_STEPFLOW_USED_BY_ACTOR, OBSERVES, SOURCED_FROMВсе отношения поддерживают свойства, такие как confidence, source, first_seen, last_seen.
Инструмент генерирует основанные на доказательствах возможности обнаружения со следующими характеристиками:
{
"id": "opp-001",
"name": "Detect PowerShell Process Injection",
"technique_id": "T1055",
"artefacts": ["powershell.exe with WriteProcessMemory calls"],
"behaviours": ["Process injection into legitimate processes"],
"rationale": "APT groups commonly use PowerShell for process injection",
"confidence": 0.8,
"source": "PowerShell used for process injection (T1055)",
"evidence": [
"• PowerShell executes WriteProcessMemory calls (line 45)",
"• Relationship: ThreatActor USES_TECHNIQUE T1055"
]
}
Расширенные цепочки атак предоставляют: