
Scraper de contenido de 4chan

Un scraper completo para 4chan (Ahora eso es rápido.)
pepeScraper es un scraper que utiliza contexto para tus búsquedas y devuelve exactamente lo que deseas. (Estoy aprendiendo cómo hacer que un elemento se vea más cool de lo que realmente es)
Si usas Windows, solo ve a las versiones y descarga la última, luego instala las dependencias. Si quieres ayudar y tener acceso al código fuente, usa el código de abajo.
git clone https://github.com/JuaanReis/pepeScraper.git
cd ./pepeScraper
pip install -r requirements.txt
py main.py --help
Ni siquiera sé qué significa este meme (y que te jodan si lo sabes).
PepeScraper NO almacena nada automáticamente.
solo usa la API y crea un enlace directo a 4chan.
Sin registros, sin historial, sin bases de datos, sin copia de Facebook (tal vez entiendas).
Tienes la opción de guardar imágenes de los tableros, registros y resultados de salida, pero nada es automático
(a menos que elijas esta opción en el archivo de configuración)
Todo se almacena en RAM y se elimina cuando el programa termina. (Así es, tu mamá no se enterará de lo que buscaste.)
Por favor, no me demandes, no tengo dinero para pagar un abogado. (A veces ni siquiera hay suficiente dinero para comprar comida.)
Lo digo en serio, la pornografía puede destruir tu cerebro, tu cuerpo y tu familia (no importa cuántas veces escriba esto, lo ignorarás).
python main.py --keyword "pepe" --date 01/01/2025
Esto puede hacer que tu investigación sea quizás más segura (no sé si programé esto correctamente).
| Bandera | Descripción | Ejemplo |
|---|
--key <w> | Palabras clave utilizadas como base para la búsqueda y el scraping. | --key mustang |
--date <YYYY/MM/DD> | Fecha exacta en que se hizo la publicación OP. | --date 2024/01/10 |
--before <YYYY/MM/DD> | Publicaciones anteriores a la fecha dada hasta hoy. | --before 2023/05/01 |
--after <YYYY/MM/DD> | Publicaciones posteriores a la fecha dada hasta hoy. | --after 2024/02/01 |
--min-replies <n> | Número mínimo de respuestas que debe tener el hilo. | --min-replies 10 |
--max-replies <n> | Número máximo de respuestas que puede tener el hilo. | --max-replies 200 |
--board <board_name> | Nombre(s) del(os) tablero(s) a buscar. | --board g |
-T <n> | Número de hilos con los que trabajará el programa (cambia la velocidad, no el resultado). | -T 9 |
--op-only, -op | Considerar solo la publicación original (OP). | -op |
--no-op, -nop | Opuesto de --op-only, ignora la OP. | -nop |
--nsfw, -n | Habilitar publicaciones vulgares. | -n |
--nsfw-title, -nt | Habilitar títulos vulgares. | -nt |
--output, -o | Guardar los resultados en un archivo de texto (solo enlaces). | -o results.txt |
--download_image, -di | Descargar todas las imágenes del hilo. | -di |
--log <w> | Guardar registros en pepescraper/data/logs. | --log scan.log |
--all-boards, -ab | Mostrar todos los tableros. | -ab |
--proxy, -p <w> | Conectarse a través de un proxy. | -p http://127.0.0.1:8080 |
--title, -t | Aplicar el término de búsqueda al título. | -t |
--image, -i | Filtrar la búsqueda por palabra clave en la imagen. | -i |