
OnionSearch ist ein Skript, das URLs von verschiedenen .onion-Suchmaschinen sammelt.
👋 Hallo! Für geschäftliche Anfragen oder Kooperationen erreichen Sie mich bitte unter: [email protected]
📧 Verwenden Sie vorzugsweise Ihre geschäftliche E-Mail für Korrespondenz. Halten wir es kurz und bündig, und alles auf Englisch!
OnionSearch ist ein Python3-Skript, das URLs auf verschiedenen „.onion“-Suchmaschinen extrahiert.


pip3 install onionsearch
git clone https://github.com/megadose/OnionSearch.git
cd OnionSearch/
python3 setup.py install
Hilfe:
usage: onionsearch [-h] [--proxy PROXY] [--output OUTPUT]
[--continuous_write CONTINUOUS_WRITE] [--limit LIMIT]
[--engines [ENGINES [ENGINES ...]]]
[--exclude [EXCLUDE [EXCLUDE ...]]]
[--fields [FIELDS [FIELDS ...]]]
[--field_delimiter FIELD_DELIMITER] [--mp_units MP_UNITS]
search
positional arguments:
search The search string or phrase
optional arguments:
-h, --help show this help message and exit
--proxy PROXY Set Tor proxy (default: 127.0.0.1:9050)
--output OUTPUT Output File (default: output_$SEARCH_$DATE.txt), where $SEARCH is replaced by the first chars of the search string and $DATE is replaced by the datetime
--continuous_write CONTINUOUS_WRITE
Write progressively to output file (default: False)
--limit LIMIT Set a max number of pages per engine to load
--engines [ENGINES [ENGINES ...]]
Engines to request (default: full list)
--exclude [EXCLUDE [EXCLUDE ...]]
Engines to exclude (default: none)
--fields [FIELDS [FIELDS ...]]
Fields to output to csv file (default: engine name link), available fields are shown below
--field_delimiter FIELD_DELIMITER
Delimiter for the CSV fields
--mp_units MP_UNITS Number of processing units (default: core number minus 1)
[...]
Standardmäßig wird das Skript mit dem Parameter mp_units = cpu_count() - 1 ausgeführt. Das bedeutet, dass auf einem Rechner mit 4 Kernen
3 Scraping-Funktionen parallel laufen. Sie können mp_units auf jeden Wert setzen, es wird jedoch empfohlen, den Standardwert beizubehalten.
Sie können ihn auf 1 setzen, um alle Anfragen sequenziell auszuführen (Mehrprozessverhalten deaktivieren).
Bitte beachten Sie, dass das kontinuierliche Schreiben in eine CSV-Datei nicht umfassend mit der Mehrprozessfunktion getestet wurde und daher möglicherweise nicht wie erwartet funktioniert.
Bitte beachten Sie auch, dass die Fortschrittsbalken möglicherweise nicht korrekt angezeigt werden, wenn mp_units größer als 1 ist.
Dies hat keine Auswirkungen auf die Ergebnisse, also machen Sie sich keine Sorgen.
Um alle Suchmaschinen nach dem Wort „Computer“ zu durchsuchen:
onionsearch "computer"
Um alle Suchmaschinen außer „Ahmia“ und „Candle“ nach dem Wort „Computer“ zu durchsuchen:
onionsearch "computer" --exclude ahmia candle
Um nur „Tor66“, „DeepLink“ und „Phobos“ nach dem Wort „Computer“ zu durchsuchen:
onionsearch "computer" --engines tor66 deeplink phobos
Wie zuvor, aber die Anzahl der pro Suchmaschine zu ladenden Seiten auf 3 begrenzen:
onionsearch "computer" --engines tor66 deeplink phobos --limit 3
Bitte beachten Sie, dass die Liste der unterstützten Suchmaschinen (und ihre Schlüssel) in der Skripthilfe (-h) angegeben ist.
Standardmäßig wird die Datei am Ende des Prozesses geschrieben. Die Datei wird im CSV-Format erstellt und enthält die folgenden Spalten:
"engine","name of the link","url"
Sie können anpassen, was in die Ausgabedatei geschrieben wird, indem Sie die Parameter --fields und --field_delimiter verwenden.
Mit --fields können Sie die Ausgabefelder hinzufügen, entfernen oder neu anordnen. Der Standardmodus wird unten angezeigt. Stattdessen können Sie zum Beispiel
auswählen, Folgendes auszugeben:
"engine","name of the link","url","domain"
indem Sie --fields engine name link domain setzen.
Oder Sie können auch nur Folgendes ausgeben:
"engine","domain"
indem Sie --fields engine domain setzen.
Dies sind nur Beispiele, es gibt viele Möglichkeiten.
Schließlich können Sie auch das CSV-Trennzeichen ändern (Standard ist Komma), zum Beispiel: --field_delimiter ";".
Der Dateiname wird standardmäßig auf output_$DATE_$SEARCH.txt gesetzt, wobei $DATE das aktuelle Datum und $SEARCH die ersten
Zeichen der Suchzeichenfolge darstellt.
Sie können diesen Dateinamen mit --output beim Ausführen des Skripts ändern, zum Beispiel:
onionsearch "computer" --output "\$DATE.csv"
onionsearch "computer" --output output.txt
onionsearch "computer" --output "\$DATE_\$SEARCH.csv"
...
(Beachten Sie, dass das Dollarzeichen möglicherweise maskiert werden muss.)
In der erstellten CSV-Datei werden die Namen und URL-Zeichenfolgen so gut wie möglich bereinigt, es könnte jedoch noch Probleme geben…
Sie können wählen, ob die Ausgabe fortschreitend geschrieben werden soll (statt alles am Ende, was den Verlust der Ergebnisse verhindern würde,
falls etwas schiefgeht). Dazu müssen Sie --continuous_write True verwenden, wie folgt:
onionsearch "computer" --continuous_write True
Sie können dann den Unix-Befehl tail -f (tail follow) verwenden, um die Ergebnisse des Scrapings aktiv zu verfolgen oder zu überwachen.