
भाषा मॉडलों के लिए पूर्णतः स्वचालित सेंसरशिप हटाना
Heretic एक ऐसा उपकरण है जो महंगे पोस्ट-ट्रेनिंग के बिना ट्रांसफॉर्मर-आधारित भाषा मॉडलों से सेंसरशिप (उर्फ "safety alignment") हटाता है। यह डायरेक्शनल एब्लेशन के एक उन्नत कार्यान्वयन को, जिसे "एब्लिटरेशन" भी कहा जाता है (Arditi et al. 2024, Lai 2025 (1, 2)), Optuna द्वारा संचालित TPE-आधारित पैरामीटर ऑप्टिमाइज़र के साथ जोड़ता है।
यह दृष्टिकोण Heretic को पूर्णतः स्वचालित रूप से कार्य करने में सक्षम बनाता है। Heretic अस्वीकृतियों की संख्या और मूल मॉडल से KL डाइवर्जेंस को एक साथ न्यूनतम करके उच्च-गुणवत्ता वाले एब्लिटरेशन पैरामीटर खोजता है। इसका परिणाम एक डिसेंसर मॉडल होता है जो मूल मॉडल की अधिक से अधिक बुद्धिमत्ता को बनाए रखता है। Heretic का उपयोग करने के लिए ट्रांसफॉर्मर की आंतरिक कार्यप्रणाली की समझ आवश्यक नहीं है। वास्तव में, कोई भी व्यक्ति जो कमांड-लाइन प्रोग्राम चलाना जानता है, वह भाषा मॉडलों को डिसेंसर करने के लिए Heretic का उपयोग कर सकता है।
Heretic अधिकांश डेंस मॉडलों का समर्थन करता है, जिनमें कई मल्टीमॉडल मॉडल, कई अलग-अलग MoE आर्किटेक्चर, और यहाँ तक कि Qwen3.5 जैसे कुछ हाइब्रिड मॉडल भी शामिल हैं। शुद्ध स्टेट-स्पेस मॉडल और कुछ अन्य शोध आर्किटेक्चर अभी तक आउट-ऑफ़-द-बॉक्स समर्थित नहीं हैं।
डिफ़ॉल्ट कॉन्फ़िगरेशन के साथ बिना पर्यवेक्षण (unsupervised) चलने पर, Heretic ऐसे डिसेंसर मॉडल तैयार कर सकता है जो मानव विशेषज्ञों द्वारा मैन्युअल रूप से बनाए गए एब्लिटरेशन की गुणवत्ता को टक्कर देते हैं:
| मॉडल | "हानिकारक" प्रॉम्प्ट के लिए अस्वीकृतियाँ | मूल मॉडल से "हानिरहित" प्रॉम्प्ट के लिए KL डाइवर्जेंस |
|---|---|---|
| google/gemma-3-12b-it (मूल) | 97/100 | 0 (परिभाषा के अनुसार) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (हमारा) | 3/100 | 0.16 |
बिना किसी मानव प्रयास के निर्मित Heretic संस्करण, अन्य एब्लिटरेशनों के समान स्तर का अस्वीकृति दमन प्राप्त करता है, लेकिन बहुत कम KL डाइवर्जेंस के साथ, जो मूल मॉडल की क्षमताओं को कम क्षति का संकेत देता है। (आप Heretic की अंतर्निहित मूल्यांकन कार्यक्षमता का उपयोग करके उन संख्याओं को पुनः प्राप्त कर सकते हैं, जैसे heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic। ध्यान दें कि सटीक मान प्लेटफ़ॉर्म और हार्डवेयर पर निर्भर हो सकते हैं। उपरोक्त तालिका RTX 5090 पर PyTorch 2.8 का उपयोग करके संकलित की गई थी।)
बेशक, गणितीय मेट्रिक्स और स्वचालित बेंचमार्क कभी भी पूरी कहानी नहीं बताते, और मानवीय मूल्यांकन का विकल्प नहीं हो सकते। Heretic से निर्मित मॉडलों को उपयोगकर्ताओं द्वारा सराहा गया है (लिंक और ज़ोर जोड़े गए हैं):
"मैं पहले संशय में था, लेकिन मैंने अभी-अभी GPT-OSS 20B Heretic मॉडल डाउनलोड किया और वाह, कमाल है। यह संवेदनशील विषयों पर उचित रूप से स्वरूपित लंबे उत्तर देता है, ठीक उन्हीं बिना सेंसर वाले शब्दों का उपयोग करते हुए जिनकी आप एक बिना सेंसर वाले मॉडल से अपेक्षा करते हैं, विवरण और ऐसी ही चीज़ों के साथ मार्कडाउन प्रारूप की तालिकाएँ भी बनाता है। ऐसा लगता है कि यह अब तक इस मॉडल का सर्वश्रेष्ठ एब्लिटरेटेड संस्करण है..." (कमेंट का लिंक)
"Heretic GPT 20b अब तक आज़माए गए मेरे मॉडलों में सबसे अच्छा बिना सेंसर वाला मॉडल लगता है। यह मॉडल की बुद्धिमत्ता को नष्ट नहीं करता और यह उन प्रॉम्प्ट का उत्तर दे रहा है जिन्हें सामान्यतः बेस मॉडल अस्वीकार कर देता।" (कमेंट का लिंक)
"[Qwen3-4B-Instruct-2507-heretic] यह अब तक का सबसे अच्छा बिना-क्वांटाइज़ (unquantized) एब्लिटरेटेड मॉडल रहा है जिसे मैं 16gb vram पर चला पाया हूँ।" (कमेंट का लिंक)
Heretic मॉडलों का स्वतंत्र रूप से MMLU और GSM8K जैसे मानक मेट्रिक्स का उपयोग करके बेंचमार्क भी किया गया है, और पाया गया है कि वे प्रतिस्पर्धी एब्लिटरेशन उपकरणों द्वारा निर्मित मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं: 1, 2।
समुदाय ने Heretic के साथ 4000 से कहीं अधिक मॉडल बनाए और प्रकाशित किए हैं।
अपने हार्डवेयर के अनुरूप PyTorch 2.2+ स्थापित के साथ Python 3.10+ वातावरण तैयार करें। फिर चलाएँ:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Qwen/Qwen3-4B-Instruct-2507 को किसी भी उस मॉडल से बदलें जिसे आप डिसेंसर करना चाहते हैं।
[!IMPORTANT]
जबकि PyTorch 2.2, Heretic के कार्य करने के लिए आवश्यक PyTorch का न्यूनतम संस्करण है, कुछ मॉडलों और कॉन्फ़िगरेशनों को बाद के संस्करणों में पाए जाने वाले फीचर्स की आवश्यकता हो सकती है। उदाहरण के लिए, gpt-oss जैसे MXFP4-क्वांटाइज़ मॉडल लोड करना
torch.acceleratorका उपयोग करता है, जिसे PyTorch 2.6 में जोड़ा गया था।
[!TIP]
Heretic निर्भरता प्रबंधन के लिए uv का उपयोग करता है, और रिपॉजिटरी में प्रत्येक पैकेज संस्करण को पिन करने वाली एक
uv.lockफ़ाइल शामिल है। यदि आप पहले से uv का उपयोग करते हैं (और आपको शायद करना चाहिए!), तो आप केवल रिपो को क्लोन कर सकते हैं और Heretic कोuv run hereticके साथ चला सकते हैं, जो सुनिश्चित करता है कि आपकी निर्भरताएँ डेवलपर्स द्वारा उपयोग की जाने वाली निर्भरताओं से मेल खाती हैं, जिससे विश्वसनीयता और सुरक्षा में सुधार होता है।
यह प्रक्रिया पूर्णतः स्वचालित है और किसी कॉन्फ़िगरेशन की आवश्यकता नहीं है; हालाँकि, Heretic के पास कई कॉन्फ़िगरेशन पैरामीटर हैं जिन्हें अधिक नियंत्रण के लिए बदला जा सकता है। उपलब्ध कमांड-लाइन विकल्प देखने के लिए heretic --help चलाएँ, या यदि आप कॉन्फ़िगरेशन फ़ाइल का उपयोग करना पसंद करते हैं तो config.default.toml देखें।
प्रोग्राम चलाने की शुरुआत में, Heretic उपलब्ध हार्डवेयर का अधिकतम लाभ उठाने के लिए इष्टतम बैच साइज़ निर्धारित करने हेतु सिस्टम का बेंचमार्क करता है। RTX 3090 पर, डिफ़ॉल्ट कॉन्फ़िगरेशन के साथ, Qwen3-4B-Instruct-2507 को डिसेंसर करने में लगभग 20-30 मिनट लगते हैं। ध्यान दें कि Heretic bitsandbytes के साथ मॉडल क्वांटाइज़ेशन का समर्थन करता है, जो मॉडलों को संसाधित करने के लिए आवश्यक VRAM की मात्रा को काफी कम कर सकता है। क्वांटाइज़ेशन सक्षम करने के लिए quantization विकल्प को bnb_4bit पर सेट करें।