
匿名ソースからの文書の安全な配布を可能にするために、ホモグリフとゼロ幅文字を除去するスクリプト。
ゼロ幅文字やホモグリフを除去することで、匿名情報源からの文書を安全に配布するためのテキストをサニタイズするツール。
メールやその他のテキストファイルをリークしようとする個人は、フィンガープリンティングを通じて特定されるリスクに直面します。 フィンガープリンティングは、文書の元の配布者が何らかのカナリアを埋め込んでいる場合によく発生します。 例えば、イーロン・マスクが2008年にリークに対して送ったメールでは、従業員ごとに微妙に異なる表現が使われていました。 この戦術は従業員に気付かれ、失敗に終わりました。また、より簡単な戦術として、テキストにほぼ見えない変更を加える方法も使われています。 SafeTextは、これらの変更を識別し除去するように設計されています。 具体的には、このツールはホモグリフ、ゼロ幅文字、その他の微妙な文字を除去します。 また、個人の場所を特定する可能性のある単語の綴りの独自性を識別しようと試みます。
SafeTextを使用するには、次のように呼び出します:
python safetext.py inputfile
出力例:
λ python safetext.py TestFile.txt
[*] Cleaning TestFile.txt to TestFile.txt.safe ...
[!] FOUND HOMOGLYPHIC CHARACTER CYRILLIC_large_H ON LINE 1
The message said: "(Н)ey, let's hang out!"
[!] FOUND a SPACE ON LINE # 2
Lorem*Ipsum*Dolor*Sit
[!] WARNING - Use of spelling (colour) that identifies country on line 3
[!] FOUND HOMOGLYPHIC CHARACTER GREEK_B ON LINE 5
[!] FOUND HOMOGLYPHIC CHARACTER GREEK_C ON LINE 5
Subject: (Β)udget (Ϲ)uts
[*] Output file closed
注意:該当する文字は括弧ではなく下線で示されます。 SafeTextは出力を infile.safe に出力します。