
Código de pesquisa para ataques de envenenamento no PGM-index, demonstrando como criar dados adversariais para degradar o desempenho de índices aprendidos.
Código oficial do nosso artigo, Poisoning Attacks on the PGM-index.
git clone [REPOSITORY LINK]
cd pgm-index-poisoning
git submodule update --init --recursive
./scripts/build.sh
Requer CMake (ver Dependências). As saídas são gravadas em build/ (binários em build/bin por padrão).
./scripts/download_alex_dataset.sh # ALEX
./scripts/download_mgbench.sh # mgbench
./scripts/download_sosd_datasets.sh # SOSD
./scripts/preprocess_alex_dataset.sh # ALEX
./scripts/preprocess_mgbench.sh # mgbench
./scripts/generate_synthetic_dataset.sh # sintético
Cada execução recebe um config JSON via ./scripts/run_experiment.sh <config.json>. Exemplos:
4.1 Maximizar o erro máximo (ex.: n=16, método consecutivo)
./scripts/run_experiment.sh "configs/experiments/poison_attack/maximize_maxerror_consec/baseline_n16.json"
4.2 Minimizar chaves legítimas cobertas (ex.: epsilon=2, método consecutivo)
./scripts/run_experiment.sh "configs/experiments/poison_attack/minimize_segment_length/baseline_epsilon2.json"
4.3 Maximizar m_opt (exemplo do PGM-index)
./scripts/run_experiment.sh "configs/experiments/poison_attack/inject_poisons_to_minimize_segment_length_swing_lambda_with_theta/baseline.json"
4.4 Limite superior de m_opt (exemplo dependente da instância)
./scripts/run_experiment.sh "configs/experiments/upper_bound/fix_w_per_block/baseline.json"
4.5 Executar todos os experimentos (lote)
Executa a lista completa de configs de experimentos em scripts/run_all_experiment.sh (edite esse arquivo para alterar o conjunto).
./scripts/run_all_experiment.sh
A partir da raiz do repositório:
./scripts/plot.sh
./scripts/print_table.sh
Figuras e logs são gravados em fig/. Instale primeiro as dependências Python: pip install -r requirements.txt.
g++, make e CMake (o script de build configura com CMake e compila com cmake --build, que normalmente invoca o Make).requirements.txt (scripts de gráficos / tabelas)../scripts/run_experiment.sh para analisar o JSON dos experimentos.Compile a imagem uma vez:
./docker_build.sh
docker_run.sh — Contêiner interativo: monta o repositório em /workspace, aloca 8 CPUs (0–7), abre um bash para que você possa compilar e executar comandos manualmente.docker_run_all.sh — Execução destacada: executa ./scripts/run_all_experiment.sh dentro do contêiner (8 CPUs) e grava a saída padrão em results/run_all.log.docker_run_all_single_cpu.sh — Igual ao docker_run_all.sh, mas com uma CPU e OMP_NUM_THREADS=1 para execuções de thread única.Todos os três usam a imagem pgm_poisoning:latest e as mesmas configurações de capacidade / volume dos scripts.
| Caminho | Função |
|---|
src/ | Fontes C++ (ataques, benchmarks PGM, ferramentas, limites superiores). |
configs/experiments/ | Configs JSON dos experimentos (caminhos sob poison_attack/, upper_bound/, etc.). |
scripts/ | Build, dados, run_experiment.sh, run_all_experiment.sh, plot.sh, print_table.sh. |
third_party/ | Submódulos Git (PGM-index, FITing-Tree, RadixSpline). |
data/, results/, fig/ | Dados, saídas das execuções e figuras / logs de tabelas gerados. |
plot/ | Scripts Python de plotagem e impressão de tabelas. |