
किसी भी दस्तावेज़ों के संग्रह को नॉलेज ग्राफ में बदलें। LLM के माध्यम से संस्थाओं और संबंधों को निकालें, आपकी स्वीकृति पर डुप्लिकेट हटाएं। डोमेन मैप करें, छिपे हुए कनेक्शन खोजें, दस्तावेज़ों में पैटर्न देखें — वह ज्ञान जो बना रहता है और बढ़ता है, आपके और आपके AI एजेंटों के लिए। सब कुछ CLI से।
किसी भी दस्तावेज़ों के संग्रह को नॉलेज ग्राफ में बदलें.
कोई कोड नहीं, कोई डेटाबेस नहीं, कोई इंफ्रास्ट्रक्चर नहीं — बस एक CLI और आपके दस्तावेज़। PDFs, पेपर, लेख, या रिकॉर्ड डालें — एक ब्राउज़ करने योग्य नॉलेज ग्राफ प्राप्त करें जो दिखाता है कि सब कुछ कैसे जुड़ता है, मिनटों में। sift-kg LLM के माध्यम से संस्थाओं और संबंधों को निकालता है, आपकी मंजूरी के साथ डुप्लिकेट हटाता है, और एक इंटरैक्टिव व्यूअर उत्पन्न करता है जिसे आप अपने ब्राउज़र में एक्सप्लोर कर सकते हैं। किसी भी चीज़ के लिए कॉन्सेप्ट मैप, आपकी उंगलियों पर।
वही ग्राफ जो आपके विज़ुअलाइज़ेशन को शक्ति देता है, एक AI सेकंड ब्रेन के रूप में भी काम करता है। हर कोई Notion और Obsidian में नॉलेज बेस बनाने में महीनों बिता रहा है। उसके लिए किसके पास समय है? sift-kg वह संरचित मेमोरी है जिसे आप 2 साल के बजाय 2 मिनट में बनाते हैं। बस अपने दस्तावेज़ों की ओर इशारा करें और आपका AI समझता है कि सब कुछ कैसे जुड़ता है।
लाइव डेमो → sift-kg द्वारा पूरी तरह से उत्पन्न ग्राफ```bash pip install sift-kg
sift init # create sift.yaml + .env.example sift extract ./documents/ # extract entities & relations sift build # build knowledge graph sift resolve # find duplicate entities sift review # approve/reject merges interactively sift apply-merges # apply your decisions sift narrate # generate narrative summary sift view # interactive graph in your browser sift export graphml # export to Gephi, yEd, Cytoscape, SQLite, etc.
## यह कैसे काम करता है```
Documents (PDF, DOCX, text, HTML, and 75+ formats)
↓
Text Extraction (Kreuzberg, local) — with optional OCR (Tesseract, EasyOCR, PaddleOCR, or Google Cloud Vision)
↓
Schema Discovery (LLM designs entity/relation types from your data — or use a predefined domain)
↓
Entity & Relation Extraction (LLM, using discovered or predefined schema)
↓
Knowledge Graph (NetworkX, JSON)
↓
Entity Resolution (LLM proposes → you review)
↓
Narrative Generation (LLM)
↓
Interactive Viewer (browser) / Export (GraphML, GEXF, CSV, SQLite)
Every entity and relation links back to the source document and passage. You control what gets merged. The graph is yours.
sift.yaml in your project for persistent settingsdiscovered_domain.yaml for reuse and editing. Or use a structured domain (general, osint, academic) for fixed schemas, or define your own in YAMLsift search "SBF" finds entities by name or alias, with optional relation and description output--neighborhood, --top, --community, --source-doc, --min-confidence--ocr flag), with optional Google Cloud Vision fallback (--ocr-backend gcv)--max-cost to cap LLM spendingsift-kg generates structured knowledge that AI agents can operate from directly.
Point sift at your documents, notes, or project files. The output — a JSON knowledge graph — gives any AI agent a persistent, structured understanding of how everything in your world connects. No manual organization, no tagging, no wiki links. The structure emerges from the content.```bash sift extract ./my-stuff/ sift build sift topology # structural overview (JSON, for agents) sift query "topic" # entity neighborhood subgraph (JSON, for agents) sift search "X" --json # entity lookup (JSON, for agents) sift info --json # project stats (JSON, for agents)
यह ग्राफ सत्रों के बीच बना रहता है और वृद्धिशील रूप से बढ़ता है — नए दस्तावेज़ों को उसी आउटपुट निर्देशिका में निकालें और पुनः निर्माण करें। इकाई निष्कासन (एंटिटी डीडुप्लिकेशन) सुनिश्चित करता है कि ग्राफ बढ़ने पर भी सुसंगत बना रहे।
**यह आपके एजेंट को क्या देता है:**
- **संरचना** — सिर्फ टेक्स्ट चंक नहीं, बल्कि इकाइयाँ, संबंध, समुदाय, और वे कैसे जुड़े हैं
- **टोपोलॉजी** — कौन से ज्ञान समूह मौजूद हैं, उन्हें क्या जोड़ता है, क्या अलग-थलग है
- **स्थायित्व** — ग्राफ़ कॉन्टेक्स्ट विंडो रीसेट से बच जाता है। आपका एजेंट हर सत्र शून्य से शुरू करना बंद कर देता है
**बंडल किया गया एजेंट कौशल:** sift-kg `.agents/skills/sift-kg/SKILL.md` पर एक कौशल के साथ आता है जो एजेंटों को सिखाता है कि नॉलेज ग्राफ़ को स्थायी मेमोरी के रूप में कैसे उपयोग करें — सत्र अभिविन्यास, इकाई अन्वेषण, लिंक-ज्ञान-द्वीप तर्क, और आधारित सुझाव निर्माण।
## बंडल किए गए डोमेन
sift-kg विशेष डोमेन के साथ आता है जिनका आप बिना किसी बदलाव के उपयोग कर सकते हैं:```bash
sift domains # list available domains
sift extract ./docs/ --domain-name osint # use a bundled domain
एक डोमेन को sift.yaml में सेट करें ताकि आपको हर बार फ़्लैग की आवश्यकता न हो:```yaml
domain: academic
बंडल नामों (`schema-free`, `general`, `osint`, `academic`) या कस्टम YAML फ़ाइल के पथ के साथ काम करता है।
| डोमेन | फ़ोकस | मुख्य एंटिटी प्रकार | मुख्य संबंध प्रकार |
|--------|-------|------------------|--------------------|
| `schema-free` | आपके डेटा से स्वतः खोजा गया (डिफ़ॉल्ट) | *(LLM प्रति कॉर्पस डिज़ाइन करता है)* | *(LLM प्रति कॉर्पस डिज़ाइन करता है)* |
| `general` | सामान्य दस्तावेज़ विश्लेषण | PERSON, ORGANIZATION, LOCATION, EVENT, DOCUMENT | ASSOCIATED_WITH, MEMBER_OF, LOCATED_IN |
| `osint` | जाँच और FOIA | SHELL_COMPANY, FINANCIAL_ACCOUNT | BENEFICIAL_OWNER_OF, TRANSACTED_WITH, SIGNATORY_OF |
| `academic` | साहित्य समीक्षा और विषय मैपिंग | CONCEPT, THEORY, METHOD, SYSTEM, FINDING, PHENOMENON, RESEARCHER, PUBLICATION, FIELD, DATASET | SUPPORTS, CONTRADICTS, EXTENDS, IMPLEMENTS, EXPLAINS, PROPOSED_BY, USES_METHOD, APPLIED_TO, INVESTIGATES |