
إعادة تنفيذ خالص بلغة Rust لمكتبة libxml2
إعادة تنفيذ نقي بلغة Rust لمكتبة libxml2 — مكتبة تحليل XML/HTML القياسية الفعلية في عالم المصادر المفتوحة.
أصبحت libxml2 غير مدعومة رسميًا منذ ديسمبر 2025 مع مشاكل أمنية معروفة. تهدف xmloxide إلى أن تكون بديلاً آمنًا للذاكرة وعالي الأداء ينجح في نفس مجموعات اختبار المطابقة.
unsafe في الواجهة العامةhtml5::sax) تغلف المحلل دون بناء شجرة DOMcss::select) تشمل الأدوات المركبة والفئات الزائفة والبحث السريع بـ #idmatches()، replace()، tokenize()، upper-case()، lower-case()، abs()، min()، max()، والمزيد)serde لتسلسل/إلغاء تسلسل XML من/إلى أنواع Rustasync للتحليل من مصادر tokio::io::AsyncReadxmllint — أداة سطر أوامر لتحليل XML والتحقق منه والاستعلام عنهDocument مستقل ويمكن إرساله (Send) ومشاركته بين الخيوط (Sync)include/xmloxide.h) للتضمين في مشاريع C/C++encoding_rs (المكتبة ليس لها تبعيات أخرى؛ clap مخصص لسطر الأوامر فقط)use xmloxide::Document;
let doc = Document::parse_str("<root><child>Hello</child></root>").unwrap();
let root = doc.root_element().unwrap();
assert_eq!(doc.node_name(root), Some("root"));
assert_eq!(doc.text_content(root), "Hello");
use xmloxide::Document;
use xmloxide::serial::serialize;
let doc = Document::parse_str("<root><child>Hello</child></root>").unwrap();
let xml = serialize(&doc);
assert_eq!(xml, "<root><child>Hello</child></root>");
use xmloxide::Document;
use xmloxide::xpath::{evaluate, XPathValue};
let doc = Document::parse_str("<library><book><title>Rust</title></book></library>").unwrap();
let root = doc.root_element().unwrap();
let result = evaluate(&doc, root, "count(book)").unwrap();
assert_eq!(result.to_number(), 1.0);
use xmloxide::sax::{parse_sax, SaxHandler, DefaultHandler};
use xmloxide::parser::ParseOptions;
struct MyHandler;
impl SaxHandler for MyHandler {
fn start_element(&mut self, name: &str, _: Option<&str>, _: Option<&str>,
_: &[(String, String, Option<String>, Option<String>)]) {
println!("Element: {name}");
}
}
parse_sax("<root><child/></root>", &ParseOptions::default(), &mut MyHandler).unwrap();
use xmloxide::html::parse_html;
let doc = parse_html("<p>Hello <br> World").unwrap();
let root = doc.root_element().unwrap();
assert_eq!(doc.node_name(root), Some("html"));
use xmloxide::css::select;
use xmloxide::Document;
let doc = Document::parse_str(r#"<div><p class="intro">Hello</p><p>World</p></div>"#).unwrap();
let root = doc.root_element().unwrap();
let intros = select(&doc, root, "p.intro").unwrap();
assert_eq!(intros.len(), 1);
assert_eq!(doc.text_content(intros[0]), "Hello");
use xmloxide::html5::parse_html5;
let doc = parse_html5("<p>Hello <b>world</b>").unwrap();
let root = doc.root_element().unwrap();
assert_eq!(doc.node_name(root), Some("html"));
كما أن تحليل القطع (الخوارزمية التي تقف وراء innerHTML) مدعوم:
use xmloxide::html5::{parse_html5_with_options, Html5ParseOptions};
let opts = Html5ParseOptions {
scripting: false,
fragment_context: Some("body".to_string()),
};
let doc = parse_html5_with_options("<p>fragment</p>", &opts).unwrap();
use xmloxide::html5::sax::{Html5SaxHandler, parse_html5_sax};
struct LinkExtractor { hrefs: Vec<String> }
impl Html5SaxHandler for LinkExtractor {
fn start_element(&mut self, name: &str, attrs: &[(String, String)], _sc: bool) {
if name == "a" {
if let Some((_, href)) = attrs.iter().find(|(n, _)| n == "href") {
self.hrefs.push(href.clone());
}
}
}
}
let mut handler = LinkExtractor { hrefs: Vec::new() };
parse_html5_sax(r#"<a href="https://github.com/jonwiggins/xmloxide/blob/main/page">Link</a>"#, &mut handler);
assert_eq!(handler.hrefs, vec!["/page"]);
use xmloxide::parser::{parse_str_with_options, ParseOptions};
let opts = ParseOptions::default().recover(true);
let doc = parse_str_with_options("<root><unclosed>", &opts).unwrap();
for diag in &doc.diagnostics {
eprintln!("{}", diag);
}
# تحليل وطباعة منسقة
xmllint --format document.xml
# تحقق مقابل مخطط
xmllint --schema schema.xsd document.xml
xmllint --relaxng schema.rng document.xml
xmllint --schematron schema.sch document.xml
xmllint --dtdvalid schema.dtd document.xml
# استعلام XPath
xmllint --xpath "//title" document.xml
# XML قانوني
xmllint --c14n document.xml
# تحليل HTML
xmllint --html page.html
| الوحدة | الوصف |
|---|---|
tree | شجرة DOM قائمة على الساحة (Document، NodeId، NodeKind) |
parser | محلل تنازلي متكرر لـ XML 1.0 مع استرداد الأخطاء |
parser::push | محلل دفعي/متزايد للإدخال المجزأ |
html | محلل HTML 4.01 متسامح مع الأخطاء |
html5 | محلل WHATWG HTML الحي (محلل الرموز + باني الشجرة) |
html5::sax | واجهة دفق شبيهة بـ SAX لـ HTML5 (لا تُبنى شجرة DOM) |
css | محرك محددات CSS للاستعلام عن أشجار المستندات |
sax | محلل دفق يعتمد على الأحداث بتقنية SAX2 |
reader | واجهة تحليل سحب XmlReader |
serial | مسلسلات XML وHTML وHTML5، بالإضافة إلى XML قانوني (C14N) |
xpath | محلل ومقيّم تعبيرات XPath 1.0+ |
validation::dtd | تحليل DTD والتحقق منه |
validation::relaxng | التحقق من مخطط RelaxNG |
validation::xsd | التحقق من XML Schema (XSD) |
validation::schematron | التحقق القائم على قواعد ISO Schematron |
serde_xml | تسلسل/إلغاء تسلسل Serde لـ XML (ميزة اختيارية serde) |
async_xml | تحليل غير متزامن عبر tokio::io::AsyncRead (ميزة اختيارية async) |
xinclude | تضمين المستندات وفقًا لـ XInclude 1.0 |
catalog | كتالوجات XML من OASIS لحل URIs |
encoding | كشف ترميز الأحرف وتحويله |
ffi | روابط FFI بلغة C/C++ (include/xmloxide.h) |