ProbSPARQL Extends Knowledge Graph Querying for Uncertain Numeric Data

Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab· July 22, 2026 View original

Summary

ProbSPARQL is a new SPARQL extension designed to query knowledge graphs containing multi-dimensional, uncertain numeric data, addressing a critical gap in current RDF and SPARQL technologies. It models uncertain values as random variables with probabilistic RDF literal datatypes, supporting distribution-aware expressions, filters, and divergence-based joins for applications like circular factory data.

The SFB 1574 Circular Factory project faces a significant challenge in integrating data about returned products into a shared knowledge graph, particularly because this data often includes multi-dimensional, uncertain numeric measurements from sensors. Existing RDF and SPARQL technologies lack native capabilities to effectively query and analyze such uncertain data, which is crucial for downstream processes like triage, validation, and reassembly planning. To bridge this gap, ProbSPARQL has been developed as an upward-compatible extension to SPARQL. This new framework models uncertain numeric values as random variables, with their distributions encoded using probabilistic RDF literal datatypes. ProbSPARQL supports advanced features such as distribution-aware expressions, probabilistic filters, and divergence-based joins. Implemented on Apache Jena ARQ and exposed via a Fuseki-compatible layer, its applicability was demonstrated using real-world measurement fragments and scalability was assessed on benchmarks up to 1.5 million triples, showing feasible in-engine execution and performance benefits over application-layer post-processing.

Why it matters

For professionals dealing with knowledge graphs and sensor data, ProbSPARQL offers a powerful new way to manage and query inherently uncertain, multi-dimensional numeric information, enabling more robust decision-making.

How to implement this in your domain

  1. 1Explore ProbSPARQL for knowledge graph projects involving uncertain sensor or measurement data.
  2. 2Consider encoding uncertain numeric values using probabilistic RDF literal datatypes.
  3. 3Leverage distribution-aware expressions and probabilistic filters for advanced data analysis.
  4. 4Evaluate the performance benefits of in-engine execution for complex queries with uncertain data.

Who benefits

ManufacturingIoTEnvironmental MonitoringHealthcareLogistics

Key takeaways

  • Current SPARQL struggles with multi-dimensional, uncertain numeric data in knowledge graphs.
  • ProbSPARQL extends SPARQL to natively support querying such uncertain data.
  • It models uncertain values as random variables with probabilistic RDF literal datatypes.
  • The extension enables distribution-aware expressions, filters, and divergence-based joins.

Original post by Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab

"arXiv:2607.18262v1 Announce Type: new Abstract: The SFB 1574 Circular Factory is building a shared knowledge graph infrastructure for integrating data about returned products. A central challenge is that circular-factory data include numeric measurements that (i) originate from s…"

View on X

Originally posted by Jingcheng Wu, Ratan Bahadur Thapa, Daniel Hernandez, Hongkuan Zhou, Steffen Staab on X · view source

Want to go deeper?

Turn these trends into skills with Learnijoy's hands-on AI & tech courses.

Explore courses