
4chan-Inhalts-Scraper

Ein kompletter Scraper für 4chan (Und das schnell.)
pepeScraper ist ein Scraper, der Kontext für Ihre Suchanfragen nutzt und genau das zurückgibt, was Sie wollen. (Ich lerne gerade, wie man ein Tool cooler aussehen lässt, als es tatsächlich ist)
Wenn Sie Windows verwenden, gehen Sie einfach zu Releases und laden Sie die neueste Version herunter und installieren Sie dann die Abhängigkeiten. Wenn Sie helfen möchten und Zugriff auf den Quellcode haben, verwenden Sie den folgenden Code.
git clone https://github.com/JuaanReis/pepeScraper.git
cd ./pepeScraper
pip install -r requirements.txt
py main.py --help
Ich weiß nicht einmal, was dieses Meme bedeutet (und f*** dich, wenn du es tust).
PepeScraper speichert NICHT automatisch etwas.
Es nutzt nur die API und erstellt einen direkten Link zu 4chan.
Keine Logs, kein Verlauf, keine Datenbanken, keine Facebook-Kopie (vielleicht verstehen Sie).
Sie haben die Möglichkeit, Bilder der Boards, Logs und Ausgabeergebnisse zu speichern, aber nichts ist automatisch
(es sei denn, Sie wählen diese Option in der Konfigurationsdatei)
Alles wird im RAM gespeichert und gelöscht, wenn das Programm beendet wird. (Genau, deine Mutter wird nicht erfahren, wonach du gesucht hast.)
Bitte verklagen Sie mich nicht, ich habe kein Geld, um einen Anwalt zu bezahlen. (Manchmal reicht das Geld nicht einmal für Essen.)
Ich meine es ernst, Pornografie kann Ihr Gehirn, Ihren Körper und Ihre Familie zerstören (egal wie oft ich das schreibe, Sie werden es ignorieren).
python main.py --keyword "pepe" --date 01/01/2025
Dies kann Ihre Recherche vielleicht sicherer machen (ich weiß nicht, ob ich das richtig programmiert habe).
| Flag | Beschreibung | Beispiel |
|---|
--key <w> | Schlüsselwörter, die als Grundlage für die Suche und das Scraping dienen. | --key mustang |
--date <YYYY/MM/DD> | Genaues Datum, an dem der OP-Beitrag erstellt wurde. | --date 2024/01/10 |
--before <YYYY/MM/DD> | Beiträge vor dem angegebenen Datum bis heute. | --before 2023/05/01 |
--after <YYYY/MM/DD> | Beiträge nach dem angegebenen Datum bis heute. | --after 2024/02/01 |
--min-replies <n> | Mindestanzahl von Antworten, die der Thread haben muss. | --min-replies 10 |
--max-replies <n> | Maximale Anzahl von Antworten, die der Thread haben kann. | --max-replies 200 |
--board <board_name> | Name(n) des/der Boards, in dem/denen gesucht werden soll. | --board g |
-T <n> | Anzahl der Threads, mit denen das Programm arbeitet (ändert die Geschwindigkeit, nicht das Ergebnis). | -T 9 |
--op-only, -op | Nur den Originalbeitrag (OP) berücksichtigen. | -op |
--no-op, -nop | Gegenteil von --op-only, ignoriert den OP. | -nop |
--nsfw, -n | Vulgäre Beiträge aktivieren. | -n |
--nsfw-title, -nt | Vulgäre Titel aktivieren. | -nt |
--output, -o | Ergebnisse in eine Textdatei speichern (nur Links). | -o results.txt |
--download_image, -di | Alle Bilder aus dem Thread herunterladen. | -di |
--log <w> | Logs in pepescraper/data/logs speichern. | --log scan.log |
--all-boards, -ab | Alle Boards anzeigen. | -ab |
--proxy, -p <w> | Über einen Proxy verbinden. | -p http://127.0.0.1:8080 |
--title, -t | Suchbegriff auf den Titel anwenden. | -t |
--image, -i | Suche nach Schlüsselwort im Bild filtern. | -i |