#1Adversarial ML attack frameworks, evasion techniques, and model robustness evaluation tools.
Kitploit 추천

클라이언트 측에서 JavaScript를 통해 파일을 임베드하고 재구성하는 HTML 스머글링 페이지를 생성하며, 페이로드 인코딩, 청킹, 난독화, 피싱 유인 템플릿을 제공합니다.

공개적으로 보고된 프롬프트 인젝션 기법을 전달 방식, 인코딩, 전파 동작별로 분류하고, 확인된 모델, 출처, MITRE ATLAS 태그와 함께 정리한 추적기입니다.

객체 탐지기에 대한 백도어 공격을 손상, 확산 재구성, DBSCAN 합의 투표를 통해 무력화하는 블랙박스 입력 단계 정화 방어 기법.

Execute PowerShell code at the antimalware-light protection level.

이 저장소는 논문 "[Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting]"의 공식 구현을 포함하고 있습니다.

Empire는 Red Team과 침투 테스터를 지원하는 데 사용되는 사후 침투 및 적성 모의(adversary emulation) 프레임워크입니다.

Self-referenced local contrast for knowledge-poison detection in retrieval-augmented generation

LLM 기반 에이전트 집단 어그로 공격 프레임워크로, 적응형 다중 역할 전략을 사용하여 블랙박스 협업 필터링 추천 순위를 조작하면서 탐지를 회피합니다.


로그 확률에 대해 경량 동작 프로브를 훈련하여 LLM 컨텍스트 유출 공격을 탐지하며, vLLM 오프라인/서버 탐지 파이프라인을 포함합니다.

Offensive AI를 다루는 유용한 리소스의 선별된 목록

Evades LLM text watermarks by injecting Unicode variation selectors; includes the SynthID generator, mean-g detector, normalization defenses, and…

웹 기반 적대자 에뮬레이션 플랫폼으로, Go 에이전트를 통해 Windows 엔드포인트 전반에서 Atomic Red Team 테스트를 오케스트레이션하며, MITRE ATT&CK 매핑, APT 에뮬레이션 계획, 탐지 규칙 상관관계 분석을 제공합니다.

Bypass llm guardrails by confusing it with fabricated tool output.

검색 증강 언어 모델에 대한 중독 공격의 연구 구현으로, 위장된 문서를 사용하여 필터링 방어를 우회하고 잘못된 답변을 유도합니다.

침투 테스트(pen test) 또는 윤리적 해킹 작업의 익스플로잇 단계에서는 궁극적으로 대상 시스템 컴퓨터에서 코드가 실행되도록 시도해야 합니다. 백도어를 만들 때 안티바이러스 소프트웨어를 우회하는 간단한 방법은 다음과 같습니다!

정렬 가설을 신속하게 탐색할 수 있는 정렬 감사 에이전트

오류 분석, 공정성, 해석 가능성, 반사실적 분석, 인과 분석, 데이터 균형을 다루는 책임 있는 AI 모델 디버깅을 위한 대화형 대시보드 및 라이브러리.