
자율적 레드 팀 플랫폼; 다중 에이전트 공격 보안 메타 하네스
▄▄▄█████▓▓█████ ███▄ ▄███▓ ██▓███ ▓█████ ██████ ▄▄▄█████▓
▓ ██▒ ▓▒▓█ ▀ ▓██▒▀█▀ ██▒▓██░ ██▒▓█ ▀ ▒██ ▒ ▓ ██▒ ▓▒
▒ ▓██░ ▒░▒███ ▓██ ▓██░▓██░ ██▓▒▒███ ░ ▓██▄ ▒ ▓██░ ▒░
░ ▓██▓ ░ ▒▓█ ▄ ▒██ ▒██ ▒██▄█▓▒ ▒▒▓█ ▄ ▒ ██▒░ ▓██▓ ░
▒██▒ ░ ░▒████▒▒██▒ ░██▒▒██▒ ░ ░░▒████▒▒██████▒▒ ▒██▒ ░
▒ ░░ ░░ ▒░ ░░ ▒░ ░ ░▒▓▒░ ░ ░░░ ▒░ ░▒ ▒▓▒ ▒ ░ ▒ ░░
░ ░ ░ ░░ ░ ░░▒ ░ ░ ░ ░░ ░▒ ░ ░ ░
░ ░ ░ ░ ░░ ░ ░ ░ ░ ░
░ ░ ░ ░ ░ ░
당신이 이미 사용 중인 AI 코딩 에이전트를 제로데이 헌터로 바꿔주는 멀티에이전트 오펜시브 시큐리티 프레임워크.
당신의 AI 코딩 에이전트는 이미 해커입니다 — T3MP3ST가 무기고를 쥐어줍니다.
권한이 있는 대상에 지시하면 킬 체인이 자동으로 실행됩니다: 정찰 → 익스플로잇 → 보고서, 브라우저 War Room이나 CLI에서, 당신이 이미 로그인한 에이전트(Claude Code, Codex, Hermes) 또는 완전히 오프라인으로 실행하는 모델(Ollama, LM Studio, vLLM)에 의해 구동됩니다. 새 API 키, 클라우드 테넌트, 두 번째 청구서는 없습니다. 당신의 에이전트가 두뇌이고, T3MP3ST는 그 주위에 조립된 전쟁 기계입니다. 자체 호스팅 스톰. 키리스 워페어. ⚡
그리고 그 결과를 믿으라고 요구하지 않습니다. XBOW의 자체 104개 챌린지 제품군에서 90.1% pass@1을 기록했습니다 — XBOW가 자체 보고한 85%보다 높은 점수이며, 힌트 없는 CTF 해결과 모델이 본 적 없는 실제 포스트-컷오프 CVE에 대한 콜드 헌트도 포함됩니다. 이 README의 모든 숫자는 하나의 명령(npm run verify-claims)으로 커밋된 데이터에서 다시 계산됩니다. 임무에 대해 크게 말하고, 빌드에 대해 정직합니다 — 상태 테이블은 무엇이 실제로 작동하는지, 무엇이 스캐폴딩인지, 무엇이 아직 로드맵인지 정확히 표시합니다. 전체 영수증은 벤치마크에 있습니다.
세 가지가 이 프레임워크를 차별화합니다:
npm run verify-claims는 모두를 다시 도출하며, 24/24 초록색입니다. 재현할 수 없는 주장은 출시되지 않습니다. 절대 신뢰만 요구하는 숫자는 없습니다.바로가기 → 빠른 시작 · 헌팅 대상 · 현재 출시된 기능 · 벤치마크 · 아키텍처 · 문서
T3MP3ST는 공격적인 보안 도구로, 승인된 테스트, 연구, 교육을 위해 제작되었습니다. 오직 소유하고 있거나 명시적, 서면 승인을 받은 시스템에만 지시하십시오. 무단 컴퓨터, 네트워크 또는 데이터 접근은 대부분의 관할권에서 불법입니다 — 이 소프트웨어를 사용하는 방법과 법 및 행동 규칙을 준수하는 것은 전적으로 귀하의 책임입니다. 폭풍을 당신의 대상에 가져오세요, 다른 사람의 것이 아닙니다.
T3MP3ST는 AGPL-3.0 라이선스에 따라 "있는 그대로" 제공되며, 어떠한 손해, 손실 또는 오용에 대한 보증이나 책임도 없습니다. 저자는 무단 활동을 지지, 지원 또는 묵인하지 않습니다. 허가를 받으십시오. 범위를 지키십시오. 위협이 되지 마십시오. 🫡
오펜시브 시큐리티는 수년간의 경험과 값비싼 도구 뒤에 있습니다. T3MP3ST 뒤에 있는 가설은 조정된 에이전트 떼가 초대를 받지 못한 사람들에게 실제 버그 헌팅을 가능하게 할 수 있다는 것입니다. 웹 앱, CTF, 스마트 계약, 소스 코드, 임베디드/로보틱스 OSS 전반에 걸쳐 말이죠. 이것은 야심찬 가설이며, 아래 섹션들은 이미 작동하는 것과 여전히 가설인 것을 신중하게 분리합니다.
실행 중인 War Room으로 가는 가장 빠른 경로 (키리스, 설정 약 2분; 임무 시간은 대상에 따라 다름):
npm install
npm run server # War Room → http://127.0.0.1:3333/ui/
War Room에서 Settings를 열고 로컬 에이전트(Claude Code / Codex / Hermes)를 연결하세요. 그런 다음 Op Admiral에게 일반 영어로 대상을 설명하고 실행하세요. 연결한 에이전트가 두뇌입니다. 키가 필요 없습니다.
키를 사용하고 싶으신가요? 하나를 설정하고 연결 단계를 건너뛰세요:
export OPENROUTER_API_KEY=... # 또는 VENICE_API_KEY / ANTHROPIC_API_KEY / OPENAI_API_KEY
export XAI_API_KEY=... # Grok Build (grok-build-0.1) — xAI의 코딩 모델, 네이티브 도구 호출
느린 로컬 에이전트에게 더 많은 시간을 주려면 각 CLI 호출에 T3MP3ST_LOCAL_AGENT_TIMEOUT_MS, 임무 작업에 T3MP3ST_TASK_TIMEOUT_MS, 계획 요청에 T3MP3ST_GENERAL_TIMEOUT_MS를 설정하십시오. 값은 밀리초입니다.
또는 완전히 오프라인으로 자신의 모델에서 실행하세요 — 키도, 클라우드도 필요 없습니다. 기본적으로 Ollama를 사용합니다; OpenAI 호환 서버(LM Studio, vLLM, llama.cpp)로 지정할 수 있습니다:
ollama serve && ollama pull llama3 # 또는 OpenAI 호환 서버
export TEMPEST_LOCAL_BASE_URL=http://localhost:11434/api # LM Studio: http://localhost:1234/v1
export TEMPEST_LOCAL_MODEL=llama3
npx tempest # → "Change default provider" → local
도구 호출은 모든 로컬 모델에서 작동합니다 (텍스트로 구동됨), 따라서 네이티브 함수 호출이 없는 모델에서도 Arsenal이 실행됩니다.
직접 숫자를 확인하세요:
npm run verify-claims # bench/에 커밋된 JSON에서 모든 헤드라인을 다시 도출
라이브러리/SDK 사용법, 전체 HTTP API, MCP 설정은 docs/에 있습니다.
프레임워크는 8개 운영자 킬 체인이며, 이 테이블은 허튼소리를 하지 않을 것입니다. Recon은 살아있는 도구 기반 엔진입니다 — 그리고 이빨은 이미 현실적입니다: XBEN에서 90.1% pass@1, 보류된 10개 중 8개의 포스트-컷오프 CVE를 정확한 파일/라인/CWE에 고정, 그리고 현재 공급업체 조정을 위해 초안이 보류될 정도로 살아있는 조정된 공개 제보 파이프라인입니다. 입증되지 않은 것은 떼(swarm)입니다. 각 하위 운영자(Exploiter, Infiltrator, Exfiltrator, Ghost)는 recon과 동일한 실제 도구 기반 ReAct 루프를 실행하지만(스텁이 아닌 실제 익스플로잇 도구), 헤드라인 숫자는 단일 에이전트에서 나온 것이지 조정된 8-운영자 셀에서 나온 것이 아니며, 엔드-투-엔드 떼 익스플로잇은 벤치마킹되지 않았고 여전히 신뢰할 수 없습니다. 엔진은 현실적입니다. 떼는 아직 실력을 입증하는 중인 부분입니다. 입증한 부분은 크게 말하고, 나머지는 솔직하게 말합니다.
기능별 전체 분석: FEATURES.md.
오늘날 폭풍이 도달하는 곳 — 그리고 향할 곳. 다른 모든 것과 동일한 규율: 도메인은 그 뒤에 영수증이 있을 때만 ✅입니다.
클래스/분대 아키텍처는 새로운 도메인이 포크보다 구성한다는 것을 의미합니다 — 각각은 로드아웃(전문 클래스 + 무기고 + 대상 어댑터 + 벤치마크)입니다. 🚧 도메인은 숫자가 생길 때까지 어둡게 출시됩니다.
헤드라인 결과. 각각은 npm run verify-claims로 커밋된 JSON에서 다시 계산됩니다. 전체 방법론과 주의사항은 링크된 문서에 있습니다.
이것들을 읽는 방법:
verify-claims가 통과/실패를 다시 계산합니다. 원시 단계별 기록은 운영자 개인정보 보호를 위해 제거되므로, 채점된 평결을 다시 확인하는 것이지 원시 도구 출력을 확인하는 것이 아닙니다. 제로 조작, 모든 푸시에서 실행되는 안티-피팅 가드로 적용됨.숫자가 자랑이 아닙니다 — 영수증이 자랑입니다. 키리스 오픈 소스 하네스로서 당신이 신뢰하라고 요구하는 대신 다시 실행할 수 있는 도구를 제공합니다: 복제하고, npm run verify-claims를 실행하면, 위의 모든 평결이 커밋된 오라클에서 당신 앞에서 다시 계산됩니다.
더 자세한 읽을거리: WALL_FORENSICS (챌린지별 실패), CYBENCH, INTEGRITY_LEDGER (오염 감사 및 모든 철회), OBSIDIVM (자체 라이브 웹 범위).
┌─────────────────────────────────────────────────────────────────┐
│ T3MP3ST COMMAND │
├─────────────────────────────────────────────────────────────────┤
│ MISSION CONTROL ◄── TARGET MODEL ──► ARSENAL (TOOLS) │
│ ▲ │
│ AGENT CELL: RECON · SCANNER · EXPLOITER · INFILTRATOR · │
│ EXFILTRATOR · GHOST · COORDINATOR · ANALYST │
│ ▲ │
│ EVIDENCE VAULT · CREDENTIAL STORE · FINDINGS LEDGER │
│ ▲ │
│ OPSEC LAYER · COMMS CHANNEL · LLM BACKBONE │
└─────────────────────────────────────────────────────────────────┘
운영자는 MITRE ATT&CK 및 Cyber Kill Chain 단계에 매핑됩니다 (recon은 라이브, 이후 단계는 스캐폴딩됨):
제공자: OpenRouter, Venice, Anthropic, OpenAI, 또는 키리스 로컬 에이전트 (Claude Code / Codex / Hermes). OPENROUTER_API_KEY / VENICE_API_KEY / ANTHROPIC_API_KEY를 설정하거나, Settings에서 에이전트를 연결하십시오.
통합: node dist/mcp-server.js는 MCP 인식 에이전트에 security_recon을 노출합니다. npm run server는 HTTP API를 시작합니다 (POST /api/mission/start, GET /api/mission/status 등). 전체 참조는 docs/에 있습니다.
레드팀이 성직자가 되어서는 안 됩니다. 어댑터, 프롬프트 팩, 런북, 새로운 무기고 도구 또는 버그 보고서를 가져오세요.
하나의 규칙, 타협 불가: 여기의 모든 것은 승인된 테스트 전용입니다. 소유, 범위 지정, 또는 동의한 대상. 방어자를 위해 구축하십시오, 그렇지 않으면 여기서 구축하지 마십시오.
npm run verify-claims가 계속 초록색을 유지해야 합니다.릴리스 프로세스 및 게이트: RELEASE_CHECKLIST.
AGPL-3.0. LICENSE 참조.
Fortes fortuna iuvat — 운명은 용감한 자를 돕는다.
⊰•-•✧ LOVE PLINY ✧•-•⊱ 🌩️
| 도메인 | 설명 | 상태 |
|---|
| 🕸️ 웹 앱 | 블랙박스, 외부 공격자 정찰 → 익스플로잇 (XBEN 제품군) | ✅ 안정적 |
| 🚩 CTF | 힌트 없음, 샌드박스 격리 해결 (Cybench) | ✅ 안정적 |
| 🤖 로보틱스 / OT / 임베디드 | OSS 취약점 헌팅을 위한 조정된 공개 제보 파이프라인 (OSV + 라이브 PoC + 반박자) | ✅ 파이프라인 안정적 |
| 📂 소스 코드 | 블라인드 마스터 빌더 분해를 통한 화이트박스 리포지토리 분석 | ⚠️ Python 전용 입력 |
| 💰 스마트 계약 | Damn Vulnerable DeFi | ⚠️ 재현, 새로운 발견 아님 |
| ☁️ 클라우드 (IaC) | 오설정 탐지 벤치마크 (cloud:bench) + 옵트인 클라우드 무기고 (aws/az/gcloud + scoutsuite/cloudfox/pmapper; pacu 게이트됨) | 🚧 IaC 오설정 스캐폴딩 — 라이브 클라우드 익스플로잇은 아직 벤치마킹되지 않음 |
| 📱 모바일 | 내장 정적 분석기 (매니페스트 오설정 + 비밀/평문 탐지, mobile:bench) + 옵트인 무기고 (mobsfscan/objection/drozer; frida 게이트됨) | 🚧 정적 탐지 스캐폴딩 — 동적 익스플로잇은 벤치마킹되지 않음 |
| 🔩 바이너리 / 역공학 | 디컴파일 출력 싱크 탐지 (안전하지 않은 복사 / 포맷 문자열 / 명령어 주입 / 정수 오버플로우, binary:bench) + 옵트인 무기고 (ghidra/radare2/objdump/checksec/strings; gdb 게이트됨) | 🚧 정적 싱크 탐지 스캐폴딩 — 해결/pwn은 벤치마킹되지 않음 |
| 구성 요소 | 상태 | 비고 |
|---|
재현 가능한 측정 (verify-claims) | ✅ 안정적 | 모든 헤드라인이 커밋된 아티팩트에서 다시 계산됨 |
| Recon 엔진 | ✅ 안정적 | nmap / DNS / HTTP / 지문인식 구동; 모든 발견이 실제 도구 출력으로 추적됨 |
| Mission 엔진 + War Room + Op Admiral | ✅ 안정적 | 연결된 로컬 에이전트를 통해 키리스 |
| Arsenal, MCP 서버, HTTP API | ✅ 안정적 | 기본 35개의 내장 도구; 옵트인 T3MP3ST_FULL_ARSENAL (+48개 어댑터, 위험한 포스트-익스플로잇 드라이버(metasploit, hydra)는 인간 승인 게이트 뒤에 있음)로 83개 — 두 개수 모두 verify-claims를 통해 재도출됨. MCP를 통한 security_recon |
| 이그레스 범위 격리 | ✅ 안정적 (기본 켜짐) | 미션 대상이 설정되면 내장 네트워크 도구가 범위 외부 공용 호스트를 거부함 — 대상/서브도메인, 루프백/프라이빗이 아님 (SCOPE DENIED) — 기본 도구 실행기가 아닌 강화된 기본값 |
| 조정된 공개 제보 파이프라인 | ✅ 안정적 | OSV 참신성 + 라이브 PoC + 반박자 패널 + CVSS; 초안만, 인간이 전송 |
| 화이트박스 소스 분석 | ⚠️ 실험적 | Python 전용 정규식 입력; 다중 모델 분해는 토큰을 더 많이 소모함, 더 적지 않음 |
| DeFi (Damn Vulnerable DeFi) | ⚠️ 실험적 | 알려진 익스플로잇 클래스 재현; 새로운 발견 아님 |
| Exploiter / Infiltrator / Exfiltrator / Ghost | ⚠️ 실험적 | 실제 도구 기반 ReAct 루프 실행 (recon과 동일한 엔진); 조정된 떼로 입증되지 않음 — 단일 에이전트가 벤치마킹된 경로이며, 라이브 떼 익스플로잇은 여전히 신뢰할 수 없음 |
| 고급 모듈 (클라우드, 지속성, 떼, 인지) | 🚧 계획됨 | src/stubs/에 인터페이스만 있음 |
| 자기 개선 루프 | 🧪 연구 | 현재 교훈 + 제안 기록; 이를 계획에 다시 공급하는 것은 로드맵 |
| 도메인 | 범위 | 상태 |
|---|
| 🕸️ 웹 | 앱, API, 인증 흐름, OWASP Top 10 | ✅ 핵심 — XBEN 90.1% pass@1 |
| 📂 코드 | 화이트박스 소스 감사, SAST 스타일 취약점 헌팅 | ✅ 입증됨 (헌트 결과) — 보류된 CVE-Zero: 단일 에이전트 8/10 정확한 파일/라인/CWE, 10/10 발견 (7개 언어); 리포지토리 입력 엔진 자체는 여전히 ⚠️ 실험적 |
| 🚩 CTF | 워게임, 연습장, 챌린지 | ✅ 입증됨 — Cybench 23/40 힌트 없음 |
| 🔌 네트워크 / 인프라 | 정찰, 서비스/스택 지문인식; 측면 이동 + 권한 상승 | ✅ 정찰 (라이브 nmap/DNS/HTTP 엔진) · ⚠️ 측면 이동/권한 상승 실험적 |
| 🤖 임베디드 / IoT / OT | 펌웨어, 로보틱스, ICS/SCADA OSS | ✅ CVE 파이프라인 라이브 — 조정된 공개 제보 초안이 공급업체에 대해 보류됨 |
| 📦 공급망 | 의존성 감사, 확인 없이 설치 | ⚠️ 실제 — 전용 클래스; 보류된 세트에서 CWE-829 적중 |
| 💰 블록체인 | 스마트 계약, DeFi, Solidity | ⚠️ 재현 전용 — Damn Vulnerable DeFi, 새로운 발견 아님 |
| ☁️ 클라우드 | AWS/GCP/Azure 오설정, IAM, 서버리스 | 🚧 개발 중 |
| 📱 모바일 | Android/iOS 앱 보안 | 🚧 개발 중 |
| 🏢 아이덴티티 / AD | Kerberos, pass-the-hash, AD 공격 | 🚧 개발 중 |
| 🔐 바이너리 / 역공학 | 오버플로우, ROP, 익스플로잇 개발 | 🚧 개발 중 — 전문 도구 필요 |
| 제품군 | 결과 | 맥락 |
|---|
| XBEN — XBOW의 104개 챌린지 제품군, 블랙박스 | pass@1 평균 90.1% (Wilson-95 86.2–92.9), 최저 91/104 · gpt-5.5 | XBOW는 동일한 제품군에서 85%를 자체 보고함; 우리는 커밋된 아티팩트(개인정보 보호를 위해 원시 기록 제거)에서 채점된 평결을 다시 도출함 |
| XBEN — 화이트박스 (별도 보고) | pass@1 98.7%, best-ball 104/104 · gpt-5.5 | 블랙박스 숫자와 혼합되지 않음 |
| Cybench — 40개 작업 학술 벤치, Opus 4.8, 힌트 없음 | 23/40 (58%) 힌트 없음, 단일 실행 pass@1 (verify-claims 적용) | 원시 점수 기록 아님 (Anthropic: 76.5% pass@10); 모든 플래그가 커밋된 오라클에 대해 채점됨 |
| CVE-Zero — 10개의 실제 포스트-컷오프 (2026) CVE, 보류됨, 7개 언어 | 단일 에이전트 8/10 정확한 파일/라인/CWE (모두 정확함 확인, 안정적) · 10/10 발견 (전체 팩) | 암기 및 피팅 방지 증명: 포스트-컷오프, 강화된 프롬프트는 이들에 대해 튜닝된 적 없음; verify-claims가 다시 계산함. n=10, 방향적; 여기서 떼의 장점은 회상이며, 조정이 솔로를 이긴다는 증명이 아님 |
| 문서 | 내용 |
|---|
| FEATURES.md | 기능별 상태 ([x] 출시 / [~] 부분 / [ ] 계획) |
| SCOPE_AND_AUTHORIZATION | 권한 모델, 범위 영수증, 증거 및 재테스트 규칙 |
| VERIFIED_PROVENANCE | 발견 결과가 모델 주장이 아닌 도구 증명이 되는 방법 |
| TEAM_PREVIEW | 첫 실행 경로 및 검토 스크립트 |
| INSTALL_MATRIX | macOS / Linux 준비 상태 테이블 |
| ARSENAL_ACTIVATION_PLAN | 선택적 외부 도구 설정 |
| CYBENCH · WALL_FORENSICS · INTEGRITY_LEDGER · COGNITIVE_ARCHITECTURE | 벤치마크 방법론 |
| RELEASE_CHECKLIST | 릴리스가 통과해야 하는 게이트 |
| 운영자 | 단계 | MITRE | 기능 |
|---|
| Recon | 정찰 | TA0043 | OSINT, 네트워크 발견, 자산 열거 |
| Scanner | 탐색 | TA0007 | 취약점 스캐닝, 서비스 지문인식 |
| Exploiter | 초기 접근 | TA0001 | 익스플로잇, 페이로드 전달 |
| Infiltrator | 측면 이동 | TA0008 | 포스트-익스플로잇, 권한 상승 |
| Exfiltrator | 수집 / 유출 | TA0009/10 | 데이터 추출, 자격 증명 수집 |
| Ghost | 지속성 | TA0003 | 지속성, 은밀함, 정리 |
| Coordinator | 명령 및 제어 | TA0011 | 미션 제어, 오케스트레이션 |
| Analyst | 분석 | — | 패턴 분석, 보고 |