
Scraper de contenu 4chan

Un scraper complet pour 4chan (Et c'est rapide.)
pepeScraper est un scraper qui utilise le contexte pour vos recherches et renvoie exactement ce que vous voulez. (J'apprends à rendre un objet plus cool qu'il ne l'est en réalité.)
Si vous utilisez Windows, allez simplement dans les releases et téléchargez la dernière version, puis installez les dépendances. Si vous voulez aider et avoir accès au code source, utilisez le code ci-dessous.
git clone https://github.com/JuaanReis/pepeScraper.git
cd ./pepeScraper
pip install -r requirements.txt
py main.py --help
Je ne sais même pas ce que ce meme signifie (et va te faire foutre si tu le sais).
PepeScraper ne stocke RIEN automatiquement.
il utilise uniquement l'API et crée un lien direct vers 4chan.
Pas de logs, pas d'historique, pas de bases de données, pas de copie Facebook (vous comprenez peut-être).
Vous avez la possibilité de sauvegarder les images des boards, les logs et les résultats de sortie, mais rien n'est automatique
(sauf si vous choisissez cette option dans le fichier de configuration)
Tout est stocké en RAM et supprimé lorsque le programme se termine. (C'est vrai, ta mère ne saura pas ce que tu as cherché.)
S'il vous plaît, ne me poursuivez pas en justice, je n'ai pas l'argent pour payer un avocat. (Parfois il n'y a même pas assez d'argent pour acheter à manger.)
Je suis sérieux, la pornographie peut détruire votre cerveau, votre corps et votre famille (peu importe combien de fois j'écris ceci, vous l'ignorerez).
python main.py --keyword "pepe" --date 01/01/2025
Cela peut rendre votre recherche peut-être plus sûre (je ne sais pas si j'ai bien programmé ceci).
| Drapeau | Description | Exemple |
|---|
--key <w> | Mots-clés utilisés comme base pour la recherche et le scraping. | --key mustang |
--date <YYYY/MM/DD> | Date exacte à laquelle le message OP a été posté. | --date 2024/01/10 |
--before <YYYY/MM/DD> | Messages antérieurs à la date donnée jusqu'à aujourd'hui. | --before 2023/05/01 |
--after <YYYY/MM/DD> | Messages postérieurs à la date donnée jusqu'à aujourd'hui. | --after 2024/02/01 |
--min-replies <n> | Nombre minimum de réponses que le fil doit avoir. | --min-replies 10 |
--max-replies <n> | Nombre maximum de réponses que le fil peut avoir. | --max-replies 200 |
--board <board_name> | Nom(s) du/des board(s) à rechercher. | --board g |
-T <n> | Nombre de threads avec lesquels le programme travaillera (modifie la vitesse, pas le résultat). | -T 9 |
--op-only, -op | Ne considérer que le message original (OP). | -op |
--no-op, -nop | Opposé de --op-only, ignore l'OP. | -nop |
--nsfw, -n | Activer les messages explicites. | -n |
--nsfw-title, -nt | Activer les titres explicites. | -nt |
--output, -o | Enregistrer les résultats dans un fichier texte (liens uniquement). | -o results.txt |
--download_image, -di | Télécharger toutes les images du fil. | -di |
--log <w> | Enregistrer les logs dans pepescraper/data/logs. | --log scan.log |
--all-boards, -ab | Afficher tous les boards. | -ab |
--proxy, -p <w> | Se connecter via un proxy. | -p http://127.0.0.1:8080 |
--title, -t | Appliquer le terme de recherche au titre. | -t |
--image, -i | Filtrer la recherche par mot-clé dans l'image. | -i |