
Google 검색 스크래퍼
참고: 더 이상 작동하지 않습니다. Google 팀이 제가 보고했을 때 합법적인 문제가 아니라고 말했지만, 이제는 조용히 수정했습니다.
goop은 CAPTCHA에 차단되거나 속도 제한에 걸리지 않고 Google 검색을 수행할 수 있습니다.
Facebook은 자체 스크래퍼를 위한 디버거 도구를 제공합니다.
흥미롭게도 Google은 이 디버거가 만드는 요청을 제한하지 않으므로(화이트리스트?), CAPTCHA에 차단되지 않고 Google 검색 결과를 스크래핑하는 데 사용할 수 있습니다.
Facebook이 관련되어 있으므로 각 요청마다 라이브러리에 Facebook 세션 Cookie를 제공해야 합니다.
pip install goop
from goop import goop
page_1 = goop.search('red shoes', '<your facebook cookie>')
page_2 = goop.search('red shoes', '<your facebook cookie>', page='1')
include_omitted_results = goop.search('red shoes', '<your facebook cookie>', page='8', full=True)
다음 구조의 dict가 반환됩니다.
{
"0": {
"url": "https://example.com",
"text": "Example webpage",
"summary": "This is an example webpage whose aim is to demonstrate the usage of ..."
},
"1": {
...
cli.py는 다음 명령으로 터미널에서 Google 검색을 수행하여 사용법을 보여줍니다.
python cli.py <query> <number_of_pages>

Google 검색 결과를 스크래핑하는 것은 불법입니다. 이 라이브러리는 단순히 우회에 대한 개념 증명입니다. 작성자는 최종 사용자의 행동에 대해 책임을 지지 않습니다.