
CIFAR-10에서 OpenAI의 CLIP 모델을 위한 자동화된 고정밀 제로샷 평가 파이프라인입니다. 88.80% 정확도, Safetensors 보안 완화(CVE-2025-32434), AI Native(Trae) 워크플로를 특징으로 합니다.
이 프로젝트는 OpenAI의 CLIP (ViT-B/32) 모델을 전체 CIFAR-10 테스트 세트(10,000개 이미지)에서 평가하기 위한 강력하고 자동화된 파이프라인을 구현합니다. **AI 네이티브 워크플로우(Trae IDE)**를 사용하여 개발되었으며, **88.80%**의 높은 정밀도 제로샷 정확도를 달성합니다.
88.80% (제로샷)openai/clip-vit-base-patch32 (Safetensors 사용)
분석: 모델은 강한 대각선 우세를 보입니다. '사슴(Deer)' 과 '말(Horse)' 사이에서 통계적 편향이 관찰되며(15.4% 중복), 이는 CIFAR-10의 매우 낮은 32x32 해상도에서 유사한 골격 윤곽 때문일 가능성이 높습니다. 자동차(Automobile) 및 말(Horse) 범주가 가장 높은 정밀도(97.6%)를 달성했습니다.
CIFAR10Dataset을 개발하여 1D 바이트 배열을 효율적으로 3D RGB 텐서로 변환합니다.torch.utils.data.DataLoader와 tqdm을 통합하여 VRAM 오버플로 없이 10,000개 샘플을 관리합니다."a photo of a {label}"을 활용했습니다.scikit-learn을 통합하여 혼동 행렬을 계산하고 의미적 분류 오류에 대한 세부적인 시각을 제공합니다.이 프로젝트는 개발 중 직면한 여러 프로덕션 수준의 과제 해결을 문서화합니다:
.bin (Pickle) 파일을 차단합니다.use_safetensors=True를 통해 Safetensors 형식을 적용하여 제로 카피, 안전한 모델 로딩을 수행합니다.HF_HUB_DISABLE_SYMLINKS=1을 구현하고 수동 캐시 정리 프로토콜을 수립하여 크로스 플랫폼 호환성을 보장합니다.CLIPProcessor 파이프라인을 재설계하여 원시 uint8 입력을 올바르게 처리하고 정확도를 88.8%로 성공적으로 복원했습니다.HF_ENDPOINT 미러와 local_files_only=True를 구성했습니다.pip install torch transformers pillow numpy tqdm scikit-learn seaborn matplotlib
CIFAR-10 Python 버전을 다운로드하고 cifar-10-batches-py 폴더를 프로젝트 루트에 배치합니다.
# Windows에서는 미리 구성된 배치 파일을 실행하십시오:
.\run.bat
# 또는 Python을 통해 수동으로 실행:
python full_cifar_clip_eval.py
clip_eval_project/
├── full_cifar_clip_eval.py # 핵심 평가 스크립트
├── run.bat # 원클릭 실행 진입점
├── confusion_matrix.png # 혼동 행렬 결과
├── cifar-10-batches-py/ # CIFAR-10 원시 데이터
│ └── test_batch # 테스트 세트 데이터
└── README.md # 프로젝트 문서
이 프로젝트는 MIT 라이선스에 따라 라이선스가 부여됩니다. 자세한 내용은 LICENSE 파일을 참조하세요.