Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
confusable-vision — 793 pares confundíveis ausentes do Unicode TR39, conjunto de dados cross-script inédito no mundo, pontuação SSIM com consciência de fonte em 230 fontes e mais de 22.000 caracteres | Kitploit
Ferramentas/GitHubGitHub/paultendo/confusable-vision
OSINT (Inteligência de Fontes Abertas)ReconhecimentoSegurança WebInteligência de AmeaçasSegurança da Cadeia de SuprimentosPapers e PesquisaAprendizado e EducaçãoRecursos Curados
GitHubpaultendo/confusable-vision

confusable-vision

793 pares confundíveis ausentes do Unicode TR39, conjunto de dados cross-script inédito no mundo, pontuação SSIM com consciência de fonte em 230 fontes e mais de 22.000 caracteres

1121há 5 diasAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Ver Repositório

confusable-vision

Pontuação empírica de similaridade de glifos usando raycasting de contorno vetorial. Renderiza pares de caracteres confusáveis Unicode em 245 fontes do sistema, mede a similaridade estrutural diretamente dos contornos das fontes (sem rasterização) e produz artefatos JSON com pontuações de distância contínua por fonte.

Resultados principais de 52,6 milhões de comparações de caracteres únicos e 190 milhões de comparações de múltiplos caracteres em 22.581 caracteres e 12 sistemas de escrita:

  • 249.976 pares confusáveis únicos de caractere único em 245 fontes, 12 scripts, 66 pares entre scripts. 764.395 descobertas totais no nível da fonte.
  • 2.524.275 pares confusáveis únicos de múltiplos caracteres (bigramas) incluindo rn/m em 95 fontes (33 abaixo da distância 0,40) e oy/Cirílico uk em 16 fontes.
  • Pontuações de distância contínua por fonte, não listas binárias. Cada par tem uma distância de raio medida por fonte, fornecendo confiança consciente da fonte para ferramentas de segurança downstream.
  • 305% mais descobertas que SDF, 29% mais rápido. A assinatura de raio de cinco camadas enriquecida é um superconjunto estrito das descobertas do SDF; pares exclusivos do SDF não se replicaram sob revisão manual.

A saída alimenta diretamente namespace-guard para deteção de confusáveis em tempo de execução em nomes de pacotes, nomes de domínio e identificadores.

Como funciona

O RaySpace emite raios paralelos através de contornos de fontes em 36 ângulos e captura cinco camadas de informação por glifo: contagens de cruzamento, posições de cruzamento, ângulos de cruzamento, distâncias ping (largura do traço em cada cruzamento) e ping max (largura do contador entre cruzamentos). Isso produz uma assinatura compacta por caractere por fonte. Duas assinaturas são comparadas com uma distância L1 ponderada em todas as cinco camadas.

Um filtro em cascata de três estágios torna a comparação exaustiva tratável:

  1. Filtro de largura de avanço (tolerância de 15%) elimina pares com larguras de caractere diferentes. Remove 63% dos candidatos.
  2. Comparação de raios (limiar 2,0, apertado para 1,0 para pares de scripts grandes). Remove outros 33%.
  3. Apenas 3,3% dos candidatos sobrevivem para se tornarem descobertas.

O banco de assinaturas (294.646+ entradas em 245 fontes; mais com --include-uppercase) é pré-calculado uma vez. A descoberta então é executada como aritmética single-threaded no banco, completando 52,6 milhões de comparações de pares em 31 minutos sem threads de trabalho ou GPU.

Início rápido

npm install

# 1. Construir o banco de assinaturas de raios (pré-requisito, ~24 min)
npx tsx scripts/build-signature-bank.ts

# 1b. Incluir maiúsculas Latin A-Z (opcional)
#     Por padrão, o banco inclui apenas codepoints IDNA PVALID (minúsculas,
#     dígitos, símbolos). Use --include-uppercase para adicionar maiúsculas A-Z,
#     útil para identificação de fontes e comparação visual de marcas registadas
#     onde as formas de glifos maiúsculos importam. O construtor é retomável,
#     então isto apenas calcula os codepoints adicionais.
npx tsx scripts/build-signature-bank.ts --include-uppercase

# 1c. Incluir intervalos arbitrários de codepoints (opcional)
npx tsx scripts/build-signature-bank.ts --extra-range=0041-005A

# 2. Descoberta de caractere único (22.581 chars, 12 scripts, ~36 min)
npx tsx scripts/discover-singlechar-sdf.ts --scorer=ray

# 3. Descoberta de múltiplos caracteres (bigramas) (676 bigramas, ~63 min)
npx tsx scripts/discover-multichar-sdf.ts --scorer=ray

# 4. Pontuar confusáveis multi-char conhecidos do TR39 (~5 min)
npx tsx scripts/score-multichar-sdf.ts --scorer=ray
Pipeline SSIM legado

O pipeline original baseado em SSIM pontuou 26,5 milhões de comparações em 230 fontes. Permanece funcional, mas é substituído pelo RaySpace para todas as tarefas de descoberta e pontuação.

# Pontuação de pares confusáveis do TR39
npx tsx scripts/build-index.ts          # Índice de renderização (~160s, 11.370 PNGs)
npx tsx scripts/score-all-pairs.ts      # Pontuar todos os pares (~65s, 235K comparações)

# Descoberta de confusáveis inéditos
npx tsx scripts/build-candidates.ts          # Conjunto de candidatos (~23K chars)
npx tsx scripts/build-index.ts --candidates  # Renderizar candidatos (~40min, 89K PNGs)
npx tsx scripts/score-candidates.ts          # Pontuar contra alvos Latinos (~15min, 2,9M comparações)

# Extrair descobertas de alta pontuação de ambos os pipelines
npx tsx scripts/extract-discoveries.ts

O que encontrou

Principais pares confusáveis (caractere único, distância média < 0,10)

FonteAlvoScriptsMédiaFontesZeros
w U+0077ԝ U+051DLatino-Cirílico0.0001919
j U+006Aϳ U+03F3Latino-Grego0.0132118
i U+0069і U+0456Latino-Cirílico0.0186250
s U+0073ѕ U+0455Latino-Cirílico0.0186246
c U+0063с U+0441Latino-Cirílico0.0196145
o U+006Fо U+043ELatino-Cirílico0.0206144
j U+006Aј U+0458Latino-Cirílico0.0216048
x U+0078х U+0445Latino-Cirílico0.0235950
p U+0070р U+0440Latino-Cirílico0.0246146
e U+0065е U+0435Latino-Cirílico0.0326144
a U+0061а U+0430Latino-Cirílico0.0426145

"Zeros" = fontes onde os contornos produzem assinaturas de raio bit-identicas (distância 0.000). Latino w/Cirílico ԝ é idêntico em todas as 19 fontes que contêm ambos os glifos.

Avanços entre scripts (caractere único)

FonteAlvoScriptsMédiaFontes
ο U+03BFჿ U+10FFGrego-Georgiano0.0572
ヘ U+30D8へ U+3078Katakana-Hiragana0.12211
丶 U+4E36ヽ U+30FDHan-Katakana0.1259
二 U+4E8Cニ U+30CBHan-Katakana0.24911
口 U+53E3ロ U+30EDHan-Katakana0.26811

O Georgiano Coda (U+10FF) forma um anel confusável de quatro vias com o Latino o, o Cirílico o e o Grego omicron, todos abaixo da distância 0.08.

Resultados principais de múltiplos caracteres

BigramaAlvoMédiaFontesNotas
ll॥ U+0965 (danda dupla Devanágari)0.1768Entre scripts
oyѹ U+0479 (uk Cirílico)0.32216Novo bigrama confusável entre scripts
rnm U+006D0.5319533 fontes abaixo de 0.40
blы U+044B (yeru Cirílico)0.79749Entre scripts

A descoberta oy/uk Cirílico é o destaque inédito: o bigrama Latino "oy" é visualmente idêntico à letra digráfica Cirílica uk (ѹ) a uma distância de 0.000 em Helvetica e 0.0005 em Arial Unicode MS.

Calibração de limiares

Limiar médioPares únicos de caractere únicoPares únicos de múltiplos caracteres
< 0.5013813
< 1.004.1741.631
< 1.5059.700(ruído)
< 2.00249.9762.524.275

Três níveis operacionais recomendados:

  • Estrito (< 0.50): 138 pares de caractere único, falsos positivos quase nulos. Adequado para bloqueio automático (registo IDN, validação de nomes de pacotes) onde falsos positivos têm custo real.
  • Padrão (< 1.00): 4.174 pares de caractere único, bom equilíbrio entre cobertura e precisão. Adequado para sinalização e revisão manual em ferramentas de segurança.
  • Exploratório (< 2.00): Conjunto completo de descobertas. Contém ruído no limite superior, mas útil para pesquisa, auditoria de fontes e construção de conjuntos de treino.

Consulta de fontes

Consulte quais pares confusáveis existem para uma fonte específica. Útil para designers de fontes a lançar um novo tipo de letra, fornecedores de navegadores a avaliar uma alteração de fonte do sistema, ou qualquer pessoa a escolher uma fonte de exibição para contextos sensíveis à segurança, como domínios IDN.

Baixar ferramenta