
4chan 콘텐츠 스크래퍼

4chan을 위한 완전한 스크래퍼 (정말 빠릅니다.)
pepeScraper는 검색 컨텍스트를 활용하여 원하는 결과를 정확히 반환하는 스크래퍼입니다. (실제보다 더 멋져 보이게 만드는 법을 배우는 중입니다)
Windows를 사용한다면, 릴리즈 페이지로 이동하여 최신 버전을 다운로드한 후 종속성을 설치하세요. 소스 코드에 접근하여 도움을 주고 싶다면 아래 코드를 사용하세요.
git clone https://github.com/JuaanReis/pepeScraper.git
cd ./pepeScraper
pip install -r requirements.txt
py main.py --help
이 밈이 무슨 뜻인지 저도 모릅니다 (안다면 엿 먹으세요).
PepeScraper는 자동으로 아무것도 저장하지 않습니다.
API만 사용하여 4chan에 대한 직접 링크를 생성합니다.
로그, 기록, 데이터베이스, Facebook 복사본이 없습니다 (아마 이해하실 겁니다).
게시판 이미지, 로그, 출력 결과를 저장할 수 있는 옵션이 있지만, 자동으로 저장되지는 않습니다 (구성 파일에서 이 옵션을 선택하지 않는 한)
모든 것은 RAM에 저장되며 프로그램이 종료되면 삭제됩니다. (맞아요, 엄마가 당신이 검색한 내용을 알지 못할 거예요.)
제발 고소하지 마세요, 변호사 비용을 낼 돈이 없어요. (때로는 음식을 살 돈도 충분하지 않습니다.)
진지합니다, 포르노는 당신의 뇌, 몸, 가족을 망칠 수 있습니다 (아무리 여러 번 써도 무시하시겠지만).
python main.py --keyword "pepe" --date 01/01/2025
이것이 당신의 연구를 더 안전하게 만들 수도 있습니다 (이걸 제대로 프로그래밍했는지 모르겠네요).
| 플래그 | 설명 | 예시 |
|---|
--key <w> | 검색 및 스크래핑의 기준이 되는 키워드. | --key mustang |
--date <YYYY/MM/DD> | OP 게시물이 작성된 정확한 날짜. | --date 2024/01/10 |
--before <YYYY/MM/DD> | 주어진 날짜 이전부터 오늘까지의 게시물. | --before 2023/05/01 |
--after <YYYY/MM/DD> | 주어진 날짜 이후부터 오늘까지의 게시물. | --after 2024/02/01 |
--min-replies <n> | 스레드가 가져야 하는 최소 답글 수. | --min-replies 10 |
--max-replies <n> | 스레드가 가질 수 있는 최대 답글 수. | --max-replies 200 |
--board <board_name> | 검색할 게시판의 이름. | --board g |
-T <n> | 프로그램이 작업할 스레드 수 (속도에 영향을 주지만 결과는 변경하지 않음). | -T 9 |
--op-only, -op | 원본 게시물(OP)만 고려. | -op |
--no-op, -nop | --op-only의 반대, OP를 무시. | -nop |
--nsfw, -n | 저속한 게시물 활성화. | -n |
--nsfw-title, -nt | 저속한 제목 활성화. | -nt |
--output, -o | 결과를 텍스트 파일에 저장 (링크만). | -o results.txt |
--download_image, -di | 스레드의 모든 이미지 다운로드. | -di |
--log <w> | 로그를 pepescraper/data/logs에 저장. | --log scan.log |
--all-boards, -ab | 모든 게시판 표시. | -ab |
--proxy, -p <w> | 프록시를 통해 연결. | -p http://127.0.0.1:8080 |
--title, -t | 검색어를 제목에 적용. | -t |
--image, -i | 이미지의 키워드로 검색 필터링. | -i |