
Automatiza la resolución de CAPTCHA con modelos de IA multimodales (GPT-4o, Gemini) y Selenium, compatible con texto, audio, rompecabezas de deslizamiento y reCAPTCHA v2 mediante una interfaz de línea de comandos.
Este proyecto es una herramienta de línea de comandos basada en Python que utiliza grandes modelos multimodales (LMM) como GPT-4o de OpenAI y Gemini de Google para resolver automáticamente varios tipos de CAPTCHA. Aprovecha Selenium para la automatización del navegador web e interactuar con las páginas web y resolver CAPTCHA en tiempo real.
Una resolución exitosa se registra como un GIF en el directorio successful_solves.
Publicación de blog detallada: https://aydinnyunus.github.io/2025/12/08/ai-captcha-bypass/
La herramienta puede resolver los siguientes tipos de CAPTCHA que se encuentran en las páginas 2captcha.com/demo/:
🔥 Por qué los usuarios aman CapMonster.Cloud
💡 Tasas de éxito muy altas (hasta el 99%)
⚡ Tiempos de resolución súper rápidos
💲 Precios transparentes y asequibles (pago por cada 1,000 CAPTCHA)
🔌 Integración sencilla mediante API + extensiones de navegador
⭐ Excelentes reseñas en TrustPilot, SourceForge, SaaSHub, AlternativeTo
--
🔗 Enlaces útiles
💲 Precios y tipos de CAPTCHA compatibles (más de 25 tipos compatibles)
📘 Documentación de la API
💡 Sitio web principal → capmonster.cloud
⭐ Reseñas → TrustPilot
Clona el repositorio:
git clone https://github.com/aydinnyunus/ai-captcha-bypass
cd ai-captcha-bypass
Instala las dependencias:
pip install -r requirements.txt
Configura tus claves de API:
Crea un archivo .env en el directorio raíz copiando el archivo de ejemplo:
cp .env.example .env
Abre el archivo .env y añade tus claves de API para OpenAI y/o Google Gemini:
OPENAI_API_KEY="sk-..."
GOOGLE_API_KEY="..."
El script principal para ejecutar el solucionador es main.py. Debes especificar el tipo de CAPTCHA a probar. También puedes especificar el proveedor de IA y el modelo.
captcha_type: (Obligatorio) El tipo de CAPTCHA a resolver.
puzzle, text, complicated_text, recaptcha_v2, audio--provider: El proveedor de IA a utilizar.
openai, gemini (Predeterminado: openai)--model: El modelo específico a utilizar (p. ej., gpt-4o, gemini-2.5-flash).--file: Ruta a un archivo de audio para la prueba . (Predeterminado: )Resuelve un CAPTCHA de texto simple usando OpenAI (predeterminado):
python main.py text
Resuelve un CAPTCHA de texto complicado usando Gemini:
python main.py complicated_text --provider gemini
Resuelve un reto reCAPTCHA v2 usando Gemini:
python main.py recaptcha_v2 --provider gemini
Transcribe un CAPTCHA de audio:
python main.py audio --file files/radio.wav --provider openai
Resuelve un CAPTCHA de rompecabezas usando un modelo específico de OpenAI:
python main.py puzzle --provider openai --model gpt-4o
Aquí hay algunos ejemplos del solucionador evadiendo exitosamente diferentes tipos de CAPTCHA.
main.py: El punto de entrada principal para ejecutar las pruebas del solucionador de CAPTCHA. Maneja los argumentos de línea de comandos y llama a las funciones de prueba adecuadas.ai_utils.py: Contiene todas las funciones para interactuar con las APIs de OpenAI y Gemini. Aquí es donde se definen los mensajes y se realizan las llamadas a la API.puzzle_solver.py: Implementa la lógica específicamente para resolver el CAPTCHA de rompecabezas deslizante de múltiples pasos.benchmark.py: Un script para ejecutar múltiples pruebas y evaluar el rendimiento y la tasa de éxito de los diferentes solucionadores.requirements.txt: Una lista de todos los paquetes de Python requeridos para el proyecto.screenshots/: Directorio donde se guardan temporalmente las capturas de pantalla de los CAPTCHA.successful_solves/: Directorio donde se guardan los GIF de las soluciones exitosas.audiofiles/audio.mp3| Tipo de CAPTCHA | OpenAI (GPT-4o) | Gemini (2.5 Pro) |
|---|
| reCAPTCHA v2 | ![]() | ![]() |
| Rompecabezas | ![]() | ![]() |
| Texto complicado | ![]() | ![]() |