Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
autonomous-offensive-llm-handbook — 자율적 공격형 LLM 에이전트를 위한 결정론적 하네스 및 핸드북으로, 인가, 범위, 증거 게이트를 강제하여 재현 가능하고 정직한 침투 테스트를 보장합니다. | Kitploit
도구/GitHubGitHub/mouteee/autonomous-offensive-llm-handbook
Vulnerability AnalysisPenetration TestingPapers & ResearchLearning & EducationRed TeamingCurated ResourcesAI Security
GitHubmouteee/autonomous-offensive-llm-handbook

autonomous-offensive-llm-handbook

자율적 공격형 LLM 에이전트를 위한 결정론적 하네스 및 핸드북으로, 인가, 범위, 증거 게이트를 강제하여 재현 가능하고 정직한 침투 테스트를 보장합니다.

저장소 보기
410시간 19분 전아직 검토되지 않음

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

모델이 제안하면, 코드가 처리한다

자율 공격 에이전트를 위한 결정론적 하네스. 모델은 확률적이다. 호스트 애플리케이션이 권한 부여, 허용된 작업, 증거 기록 및 승인을 소유한다. 동결된 입력과 정책을 재생하면 그러한 제어 결정을 재현할 수 있다; 라이브 대상이나 모델 응답을 반복 가능하게 만들지는 않는다.

여기서 시작하세요

  • 오프라인 하네스 랩 실행: 실행 가능한 컨트롤과 완전한 보고서를 갖춘 권장 학습 경로.
  • 포트 매니페스트 검사: 측정된 필드와 알 수 없는 필드, 도구 요구사항, 규칙, 증거 픽스처 및 정확한 승인된 출처.
  • 구현 읽기 및 그 적대적 테스트.
  • 역사적 빌드 매뉴얼 및 실패 박물관 읽고 각 컨트롤이 왜 존재하는지 확인.
root@kitploit:~
python3 -m pip install -r requirements.txt
python3 -m harness.demo --out /tmp/harness-report.json
diff -u harness/report.json /tmp/harness-report.json
python3 -m pytest tests/test_harness.py

이 릴리스는 CPython 3.14에서 검증되었습니다. 이전 Python 버전은 릴리스 증거에 포함되지 않습니다; 이전 버전을 사용하는 경우, 결과에 의존하기 전에 아래의 전체 게이트 시퀀스를 실행하세요.

단계별로 구축하세요: 경계(Bound) 부작용 경계와 단계 순서를 설정; 기술(Describe) 측정된 사실과 카탈로그를 통해 대상을 설명; 증명(Prove) 캡처와 독립적인 정책 술어를 통해 주장을 입증; 권한 부여, 게이트, 완료 및 누락된 작업을 관리. 개발 순서는 런타임 순서가 아닙니다: 권한 부여와 게이트가 디스패치보다 먼저입니다.

제어 및 회계(Control and account)

공개 랩은 네트워크 요청을 하지 않으며 모델을 호출하지 않습니다. 그 증명 술어는 합성적이며, 호스트와 어댑터는 신뢰되며, 모든 발견은 인간 검토가 필요하다고 표시됩니다. 랩은 개인의 승인 또는 보고서 서명 워크플로우를 구현하지 않습니다. 축어적 인용은 인용 무결성을 확립하지만, 악용 가능성은 아닙니다. 더 적은 모델 호출과 더 적은 재작업은 설계 목표이지, 코퍼스로 측정된 절감이 아닙니다.

역사적 사례 연구

아래 장들은 이전 core/ 및 walkthrough/ 구현과 그 공개된 결함을 설명합니다. 그 결여된 모델 호출 검증기는 그 역사적 경로에서 여전히 부재합니다. 새로운 harness/ 패키지는 별도의 오프라인 제어 참조입니다; 코퍼스나 역사적 모듈을 소급적으로 수리하지 않습니다. 역사적 구성 요소를 복사하기 전에 07장의 경계와 수정 사항을 읽으세요.

유능한 모델을 호스트에 겨누고, 도구 상자를 건네주고 침투 테스트를 실행하라고 말하면, 그것은 합리적인 일을 할 것입니다. 내일 다시 실행하면 또 다른 합리적인 일을 할 것이며, 어느 실행도 다른 실행이 잡은 것을 왜 건너뛰었는지 말해주지 않습니다. 이 핸드북은 모델에게 더 작은 작업을 주장합니다: 모든 결정을 올바르게 내릴 수 있는 가장 저렴한 계층에 맡기고, 모델 용량은 이미 가진 것에서 도출할 수 없는 답에만 사용하세요. 테이블이 내릴 수 있는 결정부터 모델이 필요한 소수의 결정까지의 그 순서가 00장 제목의 그라디언트입니다. 장들은 작동하는 공격 보안 에이전트와 그 실패가 요구한 컨트롤을 따릅니다.

역사적 시스템에는 두 가지 오케스트레이션 경로가 있습니다. 서버 주도 경로에서 오케스트레이터는 자체 단계 목록을 유지하고 해당 단계가 허용하는 도구만 모델에 제공합니다. 에이전트 주도 경로에서 오케스트레이팅 모델은 실행을 계획하고 도구를 직접 호출하며, 그 아래 계층은 구축되지만 항상 참조되지는 않습니다. 공유 쓰기 경로는 기록된 작업과 발견을 검토 가능하게 만들지만, 사용 가능한 셸은 그것을 우회할 수 있습니다. 발명된 엔드포인트는 캡처된 응답을 얻지만, 자동 취약점 판정은 아닙니다. 심각도 거버너는 올릴 수 없습니다; 별도의 검증기의 역사적 상향 게이트는 인용을 확인하지만 악용 가능성을 확립하지 않습니다. 권한 부여는 모든 나가는 요청이 아닌 도구 경계에서 요청됩니다. 보고 장들은 아무것도 찾지 못한 스캔과 문 앞에서 거부된 스캔을 구분합니다. 의도와 집행 사이의 이러한 차이는 사례 연구의 일부이며, 새 하네스에 복사할 속성이 아닙니다.

첫 장 이후의 모든 장은 그 컨트롤이 여전히 무엇을 잘못하는지 인정하며 끝나고, 정직성 섹션은 그것을 보여주는 측정값을 담고 있습니다. 나머지를 신뢰할지 결정한다면 먼저 정직성 섹션을 읽으세요: 코퍼스는 한 시스템의 운영 역사이며, 선택된 공개 대상 실행은 저자가 기록한 집계로, 두 개의 제외된 실행이 옆에 게시되어 있고, 결정론적 계층이 실제로 얼마나 기여하는지 보여줄 절제 연구는 실행되지 않았습니다. 저장소는 선택된 실행의 원시 발견, 지상 진실 또는 매처를 포함하지 않으므로, 기록된 정밀도는 여기서 독립적으로 재현할 수 없습니다. 설계 논증은 측정된 것이 아니라 논증된 것이며, 05장은 그 말로 명시합니다.

다섯 가지 법칙

00장에서 표준이며, 여기에 복사되었습니다. 각각은 설계 의도이며, 법칙 끝에 명명된 장은 이 시스템이 그에 대해 평가되는 곳입니다: 어떤 부분이 구조적으로 유지되고, 어떤 부분이 두 오케스트레이션 경로 중 하나에서만 유지되며, 어떤 부분이 오케스트레이터의 좋은 행동에 의존하고, 어떤 부분이 아직 유지되지 않는지.

  1. 모델이 제안하고, 결정론적 코드가 처리한다. 모델에게 대상, 원시 저장소 또는 심각도에 대한 최종 발언권에 대한 직접 접근이 아닌 제안 인터페이스를 제공하세요. 결정론적 코드는 허용된 작업을 검증, 실행 및 기록합니다. 역사적 시스템은 모든 곳에서 그 경계를 강제하지 않습니다: 두 오케스트레이터 모두 셸에 도달할 수 있고, 그 쓰기 경로는 실행 없이 발견을 저장하는 하위 명령을 담고 있습니다. 발명된 엔드포인트는 404, 로그인 페이지 또는 애플리케이션 셸을 반환할 수 있습니다; 응답을 기록하고 주장을 별도로 판단하세요. 공유 작성자는 샌드박스가 아닙니다. 01장과 02장.

  2. 과거에 대한 주장은 인용해야 합니다. 미래에 대한 제안은 실행해야 합니다. 이것들은 다른 종류의 진술이며 다른 게이트가 필요합니다. 이미 관찰된 것에 대한 주장은 자체 캡처를 인용해야 합니다; 일치하는 인용은 인용 무결성을 확립하지만, 결론이 참이라는 것은 아닙니다. 역사적 게이트는 누출됩니다: 아무것도 통과하지 않아도 배치당 항목을 유지하고, 한 오케스트레이션 경로에서는 호출자가 제공한 신뢰도가 검사를 대신할 수 있습니다. 제안된 테스트는 그것이 만들지 않은 관찰을 인용하여 검증될 수 없습니다. 권한 부여, 범위, 게이트 및 예산 검사가 허용한 후에만 실행될 수 있으며, 그 결과는 여전히 해석이 필요합니다. 법칙은 모든 제안을 실행할 권한이 아닙니다. 02장.

  3. 심각도는 기본적으로 낮아지고 증거에 대해서만 올라갑니다. 결정론적 거버너는 심각도를 낮추거나 발견을 오탐으로 표시할 수 있으며, 올릴 수는 없습니다. 그것은 그 권한을 제한합니다; 결론을 올바르게 만들지는 않습니다. 과소 보고는 실제 취약점을 숨길 수 있으므로, 모든 하향 규칙은 일치 및 반례 테스트와 검토 가능한 이유가 필요합니다. 역사적 상향 엔드포인트는 축어적 인용을 확인하지만 계약이 요청하는 작성된 점수를 강제하지 않습니다. 인용만으로는 악용 가능성 증거가 아닙니다. 캡처를 발견에 바인딩하고, 검토된 도메인 증명 정책을 적용하며, 별도의 인간 검토 및 서명 프로세스를 유지하세요. 03장.

  4. 범위는 함수이지, 문장이 아닙니다. 프롬프트에 작성된 권한 부여는 컨텍스트 창의 다른 모든 지시와 경쟁합니다. 운영자의 허가를 검토 가능한 정책으로 인코딩하고 모든 나가는 작업 전에 그것을 강제하며, 거부 기록을 유지하세요. 역사적 가드는 부족합니다: 모든 요청이 아닌 도구 경계에서 요청되고, 일부 호스트 경계를 넓히며, 킬 스위치 아래 또는 대상 없이 구성될 때 열린 실패(fail open)합니다. 랩은 신뢰된 콜백 전에 목록에 없는 출처를 거부하지만, 전송 격리는 여전히 어댑터에 속합니다. 정책 결정은 그것이 평가하는 권한 부여와 목적지만큼만 정확합니다. 04장.

  5. 하지 않은 것을 보고하세요. 아무것도 찾지 못한 스캔과 아무것도 도달할 수 없었던 스캔은 다른 스캔이며, 그것들을 동일하게 렌더링하는 보고서는 생략으로 거짓말하는 것입니다. 커버리지, 게이트 상태 및 건너뛴 각 호스트와 그 이유의 원장은 발견 옆의 산출물에 속합니다. 그것은 역사적 보고서가 충족하지 못한 요구사항입니다: 가장 약한 분모에 대해 계산되고 다른 것을 명명하는 라벨 아래에서 커버리지만 도착했습니다. 랩은 계획된 도구 및 URL 작업, 실행된 작업, 오류 및 건너뜀을 회계합니다; 그 분모는 취약점 커버리지를 측정하지 않습니다. 05장.

장들

장주제
00장: 결정론 그라디언트 (소스)변동성이 능력 문제가 아닌 설계 문제인 이유, 네 계층 및 다섯 가지 법칙
01장: 고정 절차 (소스)단계 머신, 결정론적 도구 점수화, 파일의 카운터로서의 사전 확률, 그리고 당신이 원하는 것을 말하지 않는 턴 비율
02장: 좁은 허리 (소스)부작용당 하나의 작성자, 스키마 검증 및 수리 루프, 그리고 주장과 제안이 다른 게이트가 필요한 이유
03장: 비대칭 신뢰 (소스)확대할 수 없는 거버너, 증거에 대해서만 올릴 수 있는 검증기, 그리고 증명할 수 없는 공격 체인
04장: 코드로서의 범위 (소스)함수로서의 권한 부여, 건너뜀 원장, 어떤 함수도 결정해서는 안 되는 바닥, 그리고 선택된 실행에 기록된 범위 지정 격차
05장: 스캔이 도달할 수 없었던 것 (소스)기록된 값으로서의 도달 가능성, 커버리지 분모, 통합, 정직한 부분 결과 및 자신의 시스템을 평가하는 방법
06장: 직접 구축 (소스)순서가 있는 매뉴얼: 각 단계는 그것이 보호하는 불변식을 명시하고, 공개 트리가 그것을 담고 있는 곳마다 강제 파일, 테스트 및 커밋된 산출물을 명명합니다
07장: 하네스 랩 ()

참조 구현

core/ 아래의 역사적 코드는 읽고, 실행하고, 동의하지 않기 위해 여기에 있습니다. 그것은 클린룸이며 의도적으로 라이브 테스터로서 비기능적입니다: 프로파일링, 관련성 점수화, 스케줄링 및 도구 호출 검증은 실제이며 실행 가능하고, 와이어에 패킷을 놓을 모든 것은 보류됩니다. ls core/*.py를 실행하여 여기에 쓰인 수치를 신뢰하는 대신 무엇이 포함되는지 확인하세요 — 모듈이 추가되는 순간 낡은 주장의 종류입니다. 이후 장들이 의존하는 컨트롤이 그 중에 있습니다: 쓰기 경로는 core/store_protocol.py, 심각도 거버너는 core/severity_governor.py, 범위 가드는 core/scope_guard.py, 게이트 검사는 core/gate_check.py, 단계 머신은 walkthrough/run.py입니다. 역사적 모델 호출 검증기는 보류됩니다. 06장이 그것을 명시합니다; 07장은 별도의 결정론적 증거 가드를 제공하며, 그 검증기도 인간 승인 워크플로우도 아닙니다. 그들의 작업을 분리하세요: 근거 비평가는 인용 포함을 확인하고, 거버너는 심각도를 제한하며, 상향 경로는 독립적으로 검토된 증명 정책을 충족해야 합니다. 그들 중 어느 것도 인간 검토 및 서명을 대체하지 않습니다.

walkthrough/는 커밋된 픽스처 위에서 그 단계 머신을 구동하고 장들이 인용하는 산출물을 walkthrough/artifacts/에 씁니다. 커밋된 사본을 건드리지 않으려면 --out 디렉토리를 받는 python3 -m walkthrough.run으로 재생성하고, tests/test_walkthrough_is_in_sync.py는 새로운 인메모리 실행을 그 사본들과 바이트 단위로 비교하므로, 재실행 없이 편집된 픽스처는 배송되는 대신 빨갛게 표시됩니다. 그 게이트가 잡지 못하는 것은 두 곳 모두에서 잘못된 산출물이며, 그 자체의 docstring이 그렇게 말합니다.

숫자들

모든 장의 모든 수치는 data/stats.json의 키로 해석되거나, 그 수치가 무엇인지 그리고 왜 대상에서 측정된 것이 아닌지 명명하는 주석을 담고 있습니다. 00장부터 05장 및 이 README에 걸쳐, 13개의 주석은 코드의 상수 또는 속성을 명명하고, 35개는 숫자 검사가 읽을 수 없는 철자 수량을 다루며, 5개는 HTTP 상태 코드를 명명하고, 1개는 이 저장소 자체의 두 게시된 스냅샷 간의 비교를 명명합니다. 통계 파일은 게시된 창이 있는 동결된 스냅샷이지 라이브 쿼리가 아니며, 05장은 파이프라인을 재실행해도 그것을 재현하지 못하는 이유를 설명합니다.

05장은 공개된 의도적으로 취약한 애플리케이션에 대한 시스템의 F1을 보고하고 OWASP ZAP 수동 스캔 점수 옆에 배치합니다. 이 저장소는 산술을 증명하고 네 개의 집계 점수 파일을 data/stats.json과 동기화합니다; 두 도구가 통제된 헤드투헤드로 평가되었음을 증명하는 데 필요한 원시 발견, 지상 진실 항목, 매처, 대상 식별자 또는 실행 식별자는 포함하지 않습니다. 그 쌍을 공정한 벤치마크가 아닌 역사적, 저자 기록 데이터 포인트로 취급하세요. 표본 크기, 그것이 따라서 보고하지 않는 분포, 그리고 각각이 제외된 이유와 함께 제외된 실행은 모두 그 장에 있습니다.

모든 수치가 제자리 값으로 해석되고 모든 코드 인용이 core/로의 링크로 바뀐 장들의 생성된 사본은 GitHub에서 읽기 위해 렌더링된 트리에 있습니다; 그것은 scripts/render.py에 의해 생성되고 tests/test_rendered_is_in_sync.py에 의해 소스와 보조를 맞춥니다.

저장소를 게시하는 경우 PUBLICATION.md를 따르세요. 새 공개 저장소에 기록이 없는 스냅샷을 게시하세요; 개발 저장소의 가시성을 변경하지 말고 깨끗한 작업 트리가 도달 가능한 Git 기록을 지웠다고 가정하지 마세요. 필수 사전 커밋 scripts/publication_gate.sh는 비공개 차단 목록이 실제로 병합되고, 공개 Git 작성자 신원이 승인된 값과 일치하며, 스테이징 저장소에 이전 refs, 객체 또는 reflogs가 없는 경우에만 게시를 거부합니다.

scripts/audit.sh는 식별자를 위해 저장소를 훑고, scripts/prose_check.sh 및 scripts/verify_claims.sh는 산문을 훑으며, tests/test_gates.sh는 여전히 발화하는지 증명하기 위해 위반을 심습니다, 그리고 테스트 스위트는 장들이 그것에 대해 말하는 것에 대해 참조 구현을 유지합니다. 장은 다음 각각이 통과할 때까지 완료되지 않습니다:

root@kitploit:~
python3 -m pip install -r requirements.txt
                                      # pytest, 그리고 그 외에는 아무것도 없음: core/ 아래의
                                      #   모든 모듈은 표준 라이브러리 전용
export HANDBOOK_ROOT=.
bash scripts/audit.sh .               # 항상 게시된 패턴; 고용주, 클라이언트
                                      #   및 호스트 차단 목록은 존재하는 곳에서만, 그리고 그
                                      #   파일은 비공개이므로 어떤 클론도 그것을 담지 않음. 어느
                                      #   절반이 실행되었는지는 이 스크립트가 출력하는
                                      #   "sanitization scope:" 줄에 있으며 종료 상태가
                                      #   아니므로, 그 줄을 읽으세요
./scripts/prose_check.sh handbook     # 기계적 AI 표현
./scripts/verify_claims.sh handbook   # 인용, 인용되지 않은 숫자, 상호 참조,
                                      #   주장 앵커, 출처 귀속
./scripts/prose_check.sh README.md    # 두 게이트 모두 대상을 받고, 기본값은 handbook/이며,
./scripts/verify_claims.sh README.md  #   그래서 이 파일은 검사되려면 명명되어야 함
./tests/test_gates.sh                 # 심어진 위반에 대한 게이트, 트리, README 및 장 주장;
                                      #   장들의 자체 산문은 위의 handbook을 겨냥한
                                      #   산문 및 주장 게이트에 의해 다루어지며, 이
                                      #   스윕에 의해서는 아님
python3 -m pytest tests/              # 전체 스위트, 그리고 그것은 여기에 쓰인 수치 대신
                                      #   자체 개수를 출력함. 위의 모든 줄은 게이트 스크립트와
                                      #   그것들이 연결하는 pytest 파일을 실행하며, 그것들은 이
                                      #   문서에 관한 것입니다; 다섯 가지 법칙이 다루는 컨트롤의
                                      #   테스트 -- 심각도 거버너, 범위 가드, 게이트 검사, 공유
                                      #   쓰기 경로, 근거 비평가 -- 는 이 줄과 그 위의 어떤
                                      #   것으로도 도달됩니다. 그 중 하나의 중단은 커밋된
                                      #   walkthrough 산출물도 이동하는 경우에만 위의 줄을
                                      #   빨갛게 만듭니다

tests/test_chapter_claims.py는 그 스위트 안에서 훔칠 가치가 있는 것입니다. 그것은 참조 구현과 게시된 통계에 대한 단언을 보유하며, 각각은 그것이 뒷받침하는 축어적 문장에 고정되므로, 사실을 변경하는 편집은 조용히 배송되는 대신 테스트에 실패합니다.


테오도로스 무테시디스.

도구 다운로드
소스
권장 오프라인 참조: 경계를 강제하고, 완전한 보고서를 검사하며, 거부되어야 하는 것을 테스트
부록 A: 오케스트레이터 계약 (소스)모델에게 건네지는 도구, 비공개 원본에서 일반화됨
부록 B: 스키마 (소스)도구 호출, 발견 및 거버넌스 기록 형태, 각각이 보장하는 것과 보장하지 않는 것
부록 C: 실패 박물관 (소스)근본 원인과 각각을 제거하는 규칙이 있는 실제 오탐, 그리고 이 저장소가 고정할 수 있는 것들