
Automatisiert das Lösen von CAPTCHAs mit multimodalen KI-Modellen (GPT-4o, Gemini) und Selenium und unterstützt Text, Audio, Schieberegler-Puzzles und reCAPTCHA v2 über eine Befehlszeilenschnittstelle.
Dieses Projekt ist ein Python-basiertes Kommandozeilen-Tool, das große multimodale Modelle (LMMs) wie OpenAIs GPT-4o und Googles Gemini verwendet, um verschiedene Arten von CAPTCHAs automatisch zu lösen. Es nutzt Selenium für die Automatisierung von Webbrowsern, um mit Webseiten zu interagieren und CAPTCHAs in Echtzeit zu lösen.
Ein erfolgreich gelöstes CAPTCHA wird als GIF im Verzeichnis successful_solves gespeichert.
Ausführlicher Blogbeitrag: https://aydinnyunus.github.io/2025/12/08/ai-captcha-bypass/
Das Tool kann die folgenden CAPTCHA-Typen lösen, die auf den 2captcha.com/demo/-Seiten zu finden sind:
🔥 Warum Nutzer CapMonster.Cloud lieben
💡 Sehr hohe Erfolgsquoten (bis zu 99 %)
⚡ Superschnelle Lösungszeiten
💲 Erschwingliche, transparente Preise (Zahlung pro 1.000 CAPTCHAs)
🔌 Einfache Integration über API + Browser-Erweiterungen
⭐ Hervorragende Bewertungen auf TrustPilot, SourceForge, SaaSHub, AlternativeTo
--
🔗 Nützliche Links
💲 Preise & unterstützte CAPTCHA-Typen (25+ Typen unterstützt)
📘 API-Dokumentation
💡 Hauptwebsite → capmonster.cloud
⭐ Bewertungen → TrustPilot
Repository klonen:
git clone https://github.com/aydinnyunus/ai-captcha-bypass
cd ai-captcha-bypass
Abhängigkeiten installieren:
pip install -r requirements.txt
API-Schlüssel einrichten:
Erstellen Sie eine .env-Datei im Hauptverzeichnis, indem Sie die Beispieldatei kopieren:
cp .env.example .env
Öffnen Sie die .env-Datei und fügen Sie Ihre API-Schlüssel für OpenAI und/oder Google Gemini hinzu:
OPENAI_API_KEY="sk-..."
GOOGLE_API_KEY="..."
Das Hauptskript zum Ausführen des Lösers ist main.py. Sie müssen den zu testenden CAPTCHA-Typ angeben. Sie können auch den KI-Anbieter und das Modell angeben.
captcha_type: (Erforderlich) Der Typ des zu lösenden CAPTCHAs.
puzzle, text, complicated_text, recaptcha_v2, audio--provider: Der zu verwendende KI-Anbieter.
openai, gemini (Standard: openai)--model: Das spezifische zu verwendende Modell (z. B. gpt-4o, gemini-2.5-flash).--file: Pfad zu einer Audiodatei für den -Test. (Standard: )Einfaches Text-CAPTCHA mit OpenAI lösen (Standard):
python main.py text
Kompliziertes Text-CAPTCHA mit Gemini lösen:
python main.py complicated_text --provider gemini
reCAPTCHA-v2-Herausforderung mit Gemini lösen:
python main.py recaptcha_v2 --provider gemini
Ein Audio-CAPTCHA transkribieren:
python main.py audio --file files/radio.wav --provider openai
Ein Puzzle-CAPTCHA mit einem bestimmten OpenAI-Modell lösen:
python main.py puzzle --provider openai --model gpt-4o
Hier sind einige Beispiele, bei denen der Löser verschiedene CAPTCHA-Typen erfolgreich umgangen hat.
main.py: Der Haupteinstiegspunkt zum Ausführen der CAPTCHA-Löser-Tests. Verarbeitet Befehlszeilenargumente und ruft die entsprechenden Testfunktionen auf.ai_utils.py: Enthält alle Funktionen für die Interaktion mit den OpenAI- und Gemini-APIs. Hier werden Prompts definiert und API-Aufrufe durchgeführt.puzzle_solver.py: Implementiert die Logik speziell zum Lösen des mehrstufigen Schieberegler-Puzzle-CAPTCHAs.benchmark.py: Ein Skript zum Ausführen mehrerer Tests, um die Leistung und Erfolgsquote der verschiedenen Löser zu bewerten.requirements.txt: Eine Liste aller Python-Pakete, die für das Projekt benötigt werden.screenshots/: Verzeichnis, in dem Screenshots von CAPTCHAs temporär gespeichert werden.successful_solves/: Verzeichnis, in dem GIFs erfolgreicher Lösungen gespeichert werden.audiofiles/audio.mp3| CAPTCHA-Typ | OpenAI (GPT-4o) | Gemini (2.5 Pro) |
|---|
| reCAPTCHA v2 | ![]() | ![]() |
| Puzzle | ![]() | ![]() |
| Komplizierter Text | ![]() | ![]() |