
一个完整的4chan爬虫(现在速度快了。)
pepeScraper 是一个使用上下文进行搜索并精确返回你想要内容的爬虫。(我正在学习如何让一个东西看起来比实际更酷)
如果你使用Windows,直接前往发布页下载最新版本,然后安装依赖项。如果你想提供帮助并访问源代码,请使用下面的代码。
git clone https://github.com/JuaanReis/pepeScraper.git
cd ./pepeScraper
pip install -r requirements.txt
py main.py --help
我甚至不知道这个迷因是什么意思(如果你知道,去你的)。
PepeScraper 不会自动存储任何内容。
它只使用API并创建到4chan的直接链接。
没有日志,没有历史记录,没有数据库,没有Facebook副本(也许你懂)。
你可以选择保存板块的图片、日志和输出结果,但没有任何内容是自动的(除非你在配置文件中选择了这个选项)
所有内容都存储在RAM中,程序结束时删除。(没错,你妈妈不会发现你搜索了什么。)
请不要起诉我,我没有钱请律师。(有时连买食物的钱都不够。)
我是认真的,色情内容可以摧毁你的大脑、身体和家庭(无论我写多少次,你都会忽略它)。
python main.py --keyword "pepe" --date 01/01/2025
这可以让你的研究更安全(我不知道我编程是否正确)。
| 标志 | 描述 | 示例 |
|---|
--key <w> | 用作搜索和爬取基础的关键词。 | --key mustang |
--date <YYYY/MM/DD> | OP帖子发布的准确日期。 | --date 2024/01/10 |
--before <YYYY/MM/DD> | 给定日期之前到今天的帖子。 | --before 2023/05/01 |
--after <YYYY/MM/DD> | 给定日期之后到今天的帖子。 | --after 2024/02/01 |
--min-replies <n> | 帖子必须有的最低回复数。 | --min-replies 10 |
--max-replies <n> | 帖子可以有的最高回复数。 | --max-replies 200 |
--board <board_name> | 要搜索的板块名称。 | --board g |
-T <n> | 程序将处理的线程数(改变速度,不影响结果)。 | -T 9 |
--op-only, -op | 仅考虑原帖(OP)。 | -op |
--no-op, -nop | 与--op-only相反,忽略OP。 | -nop |
--nsfw, -n | 启用粗俗帖子。 | -n |
--nsfw-title, -nt | 启用粗俗标题。 | -nt |
--output, -o | 将结果保存到文本文件(仅链接)。 | -o results.txt |
--download_image, -di | 下载帖子的所有图片。 | -di |
--log <w> | 将日志保存在pepescraper/data/logs中。 | --log scan.log |
--all-boards, -ab | 显示所有板块。 | -ab |
--proxy, -p <w> | 通过代理连接。 | -p http://127.0.0.1:8080 |
--title, -t | 将搜索词应用于标题。 | -t |
--image, -i | 通过图片中的关键词过滤搜索。 | -i |