このプロジェクトは、OpenAIのCLIP (ViT-B/32)モデルをCIFAR-10テストセット全体(10,000枚の画像)で評価するための堅牢で自動化されたパイプラインを実装しています。**AIネイティブワークフロー(Trae IDE)を用いて開発され、高精度なゼロショット精度88.80%**を達成しています。
88.80%(ゼロショット)openai/clip-vit-base-patch32(Safetensors使用)
分析: モデルは強い対角優位性を示しています。'Deer'と'Horse'の間には統計的な偏りが観察され(15.4%の重複)、これはCIFAR-10の超低解像度32x32における類似した骨格輪郭によるものと考えられます。AutomobileとHorseカテゴリは最高の適合率(97.6%)を達成しました。
CIFAR10Datasetを開発し、1Dバイト配列を効率的に3D RGBテンソルに変換します。torch.utils.data.DataLoaderとtqdmを統合し、VRAMオーバーフローなく10,000サンプルを管理します。"a photo of a {label}"を使用して、テキストと画像の埋め込み間の意味的アライメントを最適化します。scikit-learnを統合して混同行列を計算し、意味的分類エラーを詳細に分析します。このプロジェクトでは、開発中に遭遇したいくつかの本番レベルの課題への対応を文書化しています。
.bin(Pickle)ファイルをブロックします。use_safetensors=TrueによりSafetensors形式を強制し、ゼロコピーで安全なモデルロードを実現しました。HF_HUB_DISABLE_SYMLINKS=1を設定し、手動キャッシュクリーンアッププロトコルを確立して、クロスプラットフォーム互換性を確保しました。CLIPProcessorパイプラインを再設計して生のuint8入力を正しく処理し、精度を88.8%に回復しました。HF_ENDPOINTミラーとlocal_files_only=Trueを設定し、オフラインでも高速に動作するようにしました。pip install torch transformers pillow numpy tqdm scikit-learn seaborn matplotlib
CIFAR-10のPython版をダウンロードし、cifar-10-batches-pyフォルダをプロジェクトルートに配置してください。
# Windowsでは、設定済みのバッチファイルを実行するだけです:
.\run.bat
# または手動でPythonを実行:
python full_cifar_clip_eval.py
clip_eval_project/
├── full_cifar_clip_eval.py # コア評価スクリプト
├── run.bat # ワンクリック実行エントリ
├── confusion_matrix.png # 混同行列の結果
├── cifar-10-batches-py/ # CIFAR-10生データ
│ └── test_batch # テストセットデータ
└── README.md # プロジェクトドキュメント
このプロジェクトはMITライセンスの下で提供されています。詳細についてはLICENSEファイルを参照してください。