Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
Log in
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
SEW — LLM-जनित Python, Java, और C++ कोड में keyed, style-based watermarks को CST rewriting के माध्यम से embed और detect करता है, functional correctness बनाए रखता है और code-editing attacks का प्रतिरोध करता है। | Kitploit
उपकरण/GitHubGitHub/suhanmen/sew
स्थैतिक विश्लेषणकोड विश्लेषणक्रिप्टोग्राफीपेपर और शोधAI सुरक्षा
GitHubsuhanmen/sew

SEW

LLM-जनित Python, Java, और C++ कोड में keyed, style-based watermarks को CST rewriting के माध्यम से embed और detect करता है, functional correctness बनाए रखता है और code-editing attacks का प्रतिरोध करता है।

रिपॉजिटरी देखें
1113घं 13मि पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

SEW: LLM-जनित कोड का स्टाइल-एन्कोडेड वॉटरमार्किंग

GitHub Repo stars GitHub last commit GitHub contributors

Paper Link📖

📰 समाचार

  • 📢 नया! SEW पेपर arXiv पर उपलब्ध है: arXiv:2609.39414। (30 सितंबर, 2026)
  • 📢 आधिकारिक SEW कोड GitHub पर जारी कर दिया गया है। (30 सितंबर, 2026)

🔍 प्रेरणा

विशेषताटोकन-स्तरीय वॉटरमार्क (KGW, SWEET, Unigram, STONE, STA-1)पोस्ट-हॉक वॉटरमार्क (ACW, SrcMarker, RoSeMary)✨ SEW
पहुँचडिकोडिंग-समय (टोकन चयन को प्रभावित करता है)पोस्ट-हॉक (तैयार कोड को फिर से लिखता है)पोस्ट-हॉक (तैयार कोड को फिर से लिखता है, मॉडल-अज्ञेय)
कार्यात्मक शुद्धताप्रोग्राम को बदलता है (पता लगाने की क्षमता–शुद्धता का संतुलन)प्रोग्राम तोड़ सकता है (न्यूरल रीराइटिंग के लिए Java/C++ pass@1 ≈ 12%)संरक्षित (pass@1 बिना वॉटरमार्क वाले कोड के बराबर)
पूर्वानुमेयता—आवर्ती पैटर्न (10 वॉटरमार्क वाले प्रोग्रामों से पुनर्प्राप्त)कुंजी- और संदर्भ-निर्भर (प्रत्येक प्रोग्राम की संरचना के साथ विकल्प बदलते हैं)
पहचान (TPR@FPR5%)14–60%31–98%⚡ 98.7–99.5%

LLM-जनित कोड की वॉटरमार्किंग उद्गम-निर्धारण (provenance tracking) का समर्थन करती है। जनरेशन के दौरान टोकन चयन को संशोधित करने वाले वॉटरमार्क पता लगाने की क्षमता और कार्यात्मक शुद्धता के बीच संतुलन बनाते हैं, और उन्हें जनरेटिंग मॉडल पर नियंत्रण की आवश्यकता होती है। पोस्ट-हॉक विधियाँ इसके बजाय पूर्ण हो चुके कोड को पूर्वनिर्धारित रूपांतरणों या प्रशिक्षित न्यूरल मॉडलों के साथ वॉटरमार्क करती हैं, लेकिन उनके आवर्ती पैटर्न वॉटरमार्क को प्रोग्रामों के बीच पूर्वानुमेय बना देते हैं, और बिना वॉटरमार्क वाले कोड में पहले से ही सामान्य पैटर्न को वॉटरमार्क प्रमाण के रूप में गिना जाता है, जिससे गलत पहचान होती है। SEW पूछता है: क्या पहले से जनित प्रोग्राम की कोड शैली ऐसा वॉटरमार्क वहन कर सकती है जो निर्माण से ही सही हो, अनुमान लगाना कठिन हो, और मानव-लिखित कोड के विरुद्ध कैलिब्रेटेड हो?

✨ SEW के बारे में

SEW overview

SEW (Style-Encoded Watermarking) तीन घटकों के माध्यम से पहले से जनित कोड में वॉटरमार्क एम्बेड और डिटेक्ट करता है:

  1. कुंजीबद्ध, संदर्भ-निर्भर विकल्पों वाले कोड शैली नियम। शैली गाइडों और रूपांतरण नियमों से एकत्र किए गए अर्थपूर्ण रूप से समतुल्य शैली विकल्प (Python के लिए 29, Java के लिए 22, C++ के लिए 19; जैसे, x += 1 / x = x + 1, range(n) / range(0, n), if (c) s; / if (c) { s; }) कंक्रीट सिंटैक्स ट्री (CST) पर मिलाए जाते हैं। किसी साइट पर कौन-सा वेरिएंट लिया जाएगा यह एक गुप्त कुंजी और साइट के संरचनात्मक संदर्भ द्वारा तय होता है।
  2. शैली-प्राथमिकता अंशांकन। वॉटरमार्क प्रमाण का मूल्यांकन मानव-लिखित कोड में प्रत्येक शैली वेरिएंट की प्रायिकता के विरुद्ध किया जाता है, इसलिए जो शैलियाँ लोग पहले से पसंद करते हैं उनका महत्व कम होता है।
  3. संदर्भ-जागरूक शैली एकत्रीकरण। संरचनात्मक रूप से मेल खाते स्थानों पर जिन साइटों को एक ही शैली विकल्प सौंपा गया है, उन्हें एक वोट में संयोजित किया जाता है, ताकि एक ही विकल्प के बार-बार प्रयोग से प्रमाण बढ़ा-चढ़ाकर न गिना जाए।

पहचान के लिए केवल संदिग्ध कोड और कुंजी की आवश्यकता होती है — जनरेटिंग मॉडल, मूल कोड, या एम्बेडिंग के किसी रिकॉर्ड की नहीं।

🚀 SEW को मूल्यवान क्या बनाता है?

✅ मॉडल-अज्ञेय और निर्माण से ही सही — SEW केवल उन शैली साइटों को फिर से लिखता है जहाँ दोनों वेरिएंट का अर्थ समान होता है, इसलिए यह किसी भी मॉडल के आउटपुट पर काम करता है और pass@1 को बिना वॉटरमार्क वाले कोड के बराबर रखता है।

✅ कैलिब्रेटेड प्रमाण — मानव-लिखित कोड (LeetCode समाधान, मूल्यांकन डेटा से अलग) से अनुमानित शैली प्रायिकताओं के साथ एक पॉइसन-द्विपद परीक्षण मानव कोड पर गलत पहचान को कम रखता है।

✅ मजबूत और अनुमान लगाना कठिन — SEW फॉर्मेटिंग, लिंटिंग, टिप्पणी हटाने और वेरिएबल नाम बदलने के बावजूद अपनी पहचान बनाए रखता है, और वॉटरमार्क वाले प्रोग्रामों को देखने वाला प्रतिद्वंद्वी उसके शैली विकल्पों को उस तरह पुनर्प्राप्त नहीं कर सकता जैसे वह पोस्ट-हॉक बेसलाइनों के विकल्पों को पुनर्प्राप्त करता है।

📈 परिणाम

मुख्य परिणाम — CodeContests पर पहचान (TPR@FPR5% / AUROC, %), तीन LLM (Qwen3.5-9B, gemma-4-12B-it, gpt-oss-20b) पर औसत।

प्रकारविधिPythonJavaC++
टोकन-स्तरीयKGW48.33 / 80.5643.30 / 72.3159.31 / 84.54
SWEET59.92 / 85.1841.19 / 76.5660.01 / 87.24
Unigram57.45 / 88.9736.54 / 71.3747.05 / 71.13
STONE28.09 / 62.3314.38 / 62.9523.65 / 64.79
STA-135.26 / 66.2620.93 / 61.4844.71 / 73.72
पोस्ट-हॉकACW90.10 / 95.05––
SrcMarker90.21 / 97.8671.52 / 93.5869.88 / 81.55
RoSeMary97.86 / 97.3231.00 / 95.4681.26 / 89.44
SEW99.49 / 99.6498.70 / 98.9999.22 / 99.38

कार्यात्मक शुद्धता (वॉटरमार्क वाले कोड का pass@1, %; बिना वॉटरमार्क वाला कोड: 57.63 / 52.05 / 53.74)।

विधिPythonJavaC++
ACW56.00––
SrcMarker56.7811.8711.82
RoSeMary56.3911.7111.52
SEW57.6352.0553.74

कोड-संपादन हमलों के प्रति मजबूती (TPR@FPR5%, %, तीन LLM और तीन भाषाओं पर औसत; ACW: केवल Python)।

विधिकोई हमला नहींफॉर्मेटिंगलिंटिंगटिप्पणी हटानानाम बदलना
KGW50.3143.3149.9924.4843.26
SWEET53.7149.7953.0019.3448.83
ACW90.100.5193.5689.353.17
SrcMarker77.2077.2376.4277.2026.43
RoSeMary70.0467.0069.4270.0422.26
SEW99.1495.5798.9999.1499.14

तीन LLM और तीन प्रोग्रामिंग भाषाओं के साथ CodeContests पर हमारे प्रयोग दर्शाते हैं:

टूल डाउनलोड करें