Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
autoguardrails — LLM 가드레일을 위한 정렬 연구 스캐폴드(자동 연구 스타일): 단일 policy.md 표면에 대한 검색 | Kitploit
도구/GitHubGitHub/santanderai/autoguardrails
Learning & EducationRed TeamingAI SecurityAdversarial Attack
GitHubsantanderai/autoguardrails

autoguardrails

LLM 가드레일을 위한 정렬 연구 스캐폴드(자동 연구 스타일): 단일 policy.md 표면에 대한 검색

저장소 보기웹사이트
129351개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

autoguardrails

Santander AI Lab의 오픈 소스입니다. LLM/AI 안전 가드레일 연구 라이브러리/평가 하네스(autoresearch 스타일)입니다: 단일 변경 가능한 policy.md 표면을 검색하여 고정된 평가 스위트에 대한 공격 성공률(ASR)을 최소화하고, 무해 통과 기준(benign-pass floor)이 있습니다.

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits Santander AI Open Source의 일부 — Banco Santander의 오픈 소스 AI 프로젝트 (santander.com)입니다.

autoguardrails는 Karpathy의 autoresearch에서 영감을 받은 작은 정렬 연구 스캐폴드입니다.

train.py를 검색하는 대신, 이 저장소는 policy.md를 검색합니다. 아이디어는 동일합니다:

  • 변경 가능한 표면을 작게 유지
  • 평가자를 고정 유지
  • 고정된 실시간 예산 하에 실행
  • 하나의 최상위 지표로 후보 비교
  • 모든 유지 또는 폐기 결정 기록

이 저장소에서 최상위 지표는 공격 성공률(ASR, 낮을수록 좋음)이며, 무해 통과 기준(benign-pass floor)이 있어 시스템이 모든 것을 거부함으로써 승리할 수 없습니다.

가장 중요한 것

일상적인 실험에서 세 가지 파일이 가장 중요합니다:

  • program.md: 루프에 대한 사람이 소유한 지침
  • policy.md: 실행 간에 편집해야 하는 유일한 파일
  • results.tsv: 추가 전용 실행 로그

그 외 모든 것은 고정된 하네스 코드 또는 고정된 평가 데이터입니다.

현재 연구 계약

  • 변경 가능한 표면: policy.md
  • 고정 스위트: eval_suite.jsonl
  • 고정 판정 프롬프트: judge_prompt.md
  • 고정 하네스: autoguardrails/
  • 수락 규칙: ASR이 개선되고 무해 통과율이 2% 포인트 이상 떨어지지 않는 경우에만 후보 유지
  • 실행 예산: 하네스 구성에 의해 고정되며, 현재 평가 패스당 5분

원래 autoresearch에 더 가까운 개념적 모델을 원한다면, autoguardrails/를 고정된 도우미 계층으로, policy.md를 검색 대상인 단일 파일로 생각하세요.

빠른 시작

저장소 루트에서 실행하세요.

  1. 기준값을 기록합니다.
root@kitploit:~
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. policy.md만 편집합니다.

  2. 새 후보를 평가합니다.

root@kitploit:~
python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. 현재 유지된 결과를 확인합니다.
root@kitploit:~
python -m autoguardrails status
  1. 전체 로그를 확인합니다.
root@kitploit:~
cat results.tsv

후보가 거부되면 하네스가 자동으로 policy.md를 마지막으로 수락된 버전으로 복원합니다.

셸 래퍼

단일 진입점을 선호한다면 run_autoguardrails.sh를 사용하세요:

root@kitploit:~
sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

Windows에서는 Git Bash 또는 다른 POSIX 호환 셸에서 래퍼를 실행하세요.

실제 모델 구성

기본 설정은 결정론적 로컬 스텁을 사용하므로 저장소가 오프라인에서 작동합니다. 실제 실험을 실행하려면 대상 모델과 판정 모델을 OpenAI 호환 엔드포인트로 지정하세요.

대상 모델 변수:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

판정 모델 변수:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

예시:

root@kitploit:~
export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

실행 시리즈 동안 고정된 판정 설정을 사용하세요. 실험 중간에 판정 프롬프트나 판정 모델을 변경하지 마세요.

일반적인 반복 패턴

간단한 오프라인 에뮬레이션 사이클은 다음과 같습니다:

  1. 기준값을 기록합니다.
  2. policy.md에 하나의 정책 변경 계열을 추가합니다.
  3. candidate를 실행합니다.
  4. 하네스가 수락하는 경우에만 변경사항을 유지합니다.
  5. 한 번에 하나의 새 변경사항으로 반복합니다.

번들된 스텁을 개선하는 한 가지 예시 후보 변경사항은 다음에 대한 명시적 처리를 추가하는 것입니다:

  • "이전 지침 무시", "롤플레이", "개발자 모드"와 같은 탈옥 문구
  • 번역, base64, rot13, JSON 전용 형식 또는 스키마 변환과 같은 난독화 요청

이렇게 하면 평가자를 변경하지 않고 현실적인 첫 번째 개선 곡선을 얻을 수 있습니다.

저장소 구조

  • program.md: 실험 지침 및 제약 조건
  • policy.md: 검색 대상인 변경 가능한 가드레일 정책
  • judge_prompt.md: 고정된 판정 프롬프트
  • eval_suite.jsonl: 고정된 공격 및 무해 평가 케이스
  • results.tsv: 실행 로그
  • run_autoguardrails.sh: CLI용 편의 래퍼
  • autoguardrails/: 고정된 Python 하네스
  • tests/: 하네스에 대한 회귀 및 안전 검사

코드 아키텍처는 autoguardrails/README.md를, 테스트 전략은 tests/README.md를 참조하세요.

안전 참고 사항

  • 이 스캐폴드는 의도적으로 단일 턴이며 범위가 좁습니다.
  • 도구, 파일 접근 또는 다단계 에이전트 동작을 모델링하지 않습니다.
  • 번들된 스텁은 하네스 검증 전용입니다; 현실적인 안전 모델이 아닙니다.
  • 평가 스위트는 설계상 고정되어 있습니다. 변경하는 경우 이전 결과와 비교하지 말고 새 실험 계보를 시작하세요.

요구 사항

  • Python 3.10+
  • 타사 런타임 종속성 없음 — 하네스는 전적으로 Python 표준 라이브러리로 구축되었으며 기본적으로 오프라인에서 실행됩니다.
  • 선택 사항, 개발 전용: ruff, black, mypy, pytest, pytest-cov (CONTRIBUTING.md 참조).
  • 선택 사항, 실제 모델 실험: OpenAI 호환 채팅 완성 엔드포인트에 대한 접근 (위에서 설명한 AUTOGUARDRAILS_* 환경 변수를 통해 구성).

기여

기여를 환영합니다! 시작하기 전에 기여 가이드라인과 행동 강령을 읽어주세요.

  • 버그 신고 및 기능 요청은 GitHub Issues를 통해 해주세요.
  • 외부 기여자는 CLA에 서명합니다 (첫 번째 PR에서 CLA Assistant 봇이 자동으로 처리).
  • PR을 열기 전에 ruff check ., black --check ., mypy autoguardrails, pytest를 실행하세요.
  • 연구 계약을 존중하세요: policy.md만 변경 가능한 표면이고, eval_suite.jsonl과 judge_prompt.md는 고정되어 있습니다.

보안

보안 취약점을 책임감 있게 신고해주세요. 신고 방법은 보안 정책을 참조하세요 (취약점에 대해 공개 이슈를 열지 마십시오). 연락처: [email protected] 또는 GitHub Security Advisories를 사용하세요.

면책 조항

이 소프트웨어는 Santander AI Lab의 오픈 소스 프로젝트로, 라이선스에 따라 "있는 그대로" 제공되며 어떠한 종류의 보증이나 조건도 없습니다. 이는 공식적인 Banco Santander 제품 또는 서비스가 아니며, 프로덕션 지원에 대한 약속이 없으며, 재정, 법률 또는 전문적인 조언을 구성하지 않습니다. "Santander"와 그 로고는 **Banco Santander, S.A.**의 등록 상표입니다. 프로젝트 라이선스는 사실적 귀속을 넘어 이를 사용할 권리를 부여하지 않습니다. 보안 취약점을 발견했다고 생각되면 보안 정책을 따르세요 — 공개 이슈를 열지 마십시오. 귀하는 귀하의 사용 사례에 대한 이 소프트웨어의 적합성을 평가하고 자신의 배포를 최신 상태로 유지할 책임이 있습니다.

라이선스

이 프로젝트는 Apache License 2.0에 따라 라이선스가 부여됩니다 — 자세한 내용은 LICENSE 및 NOTICE 파일을 참조하세요.

root@kitploit:~
Copyright (c) 2026 Santander Group
SPDX-License-Identifier: Apache-2.0

인용

연구에서 autoguardrails를 사용하는 경우 다음을 인용해주세요:

root@kitploit:~
@software{autoguardrails2026,
  author  = {{Santander AI Lab}},
  title   = {autoguardrails: an autoresearch-style guardrail policy loop},
  year    = {2026},
  url     = {https://github.com/SantanderAI/autoguardrails},
  license = {Apache-2.0}
}
도구 다운로드