
rdflib 解析 json-ld 时忽略嵌套属性(如 author.name 或 about.name),根本原因在于输入格式不符合 json-ld 规范:使用数组根节点或分散的独立对象会破坏上下文绑定与主体标识,导致嵌套结构无法展开为 rdf 三元组。
rdflib 解析 json-ld 时忽略嵌套属性(如 author.name 或 about.name),根本原因在于输入格式不符合 json-ld 规范:使用数组根节点或分散的独立对象会破坏上下文绑定与主体标识,导致嵌套结构无法展开为 rdf 三元组。
RDFLib 的 json-ld 解析器严格遵循 JSON-LD 1.1 规范,其核心要求是:所有资源必须通过明确的 @id(或隐式主体)锚定,且嵌套对象需作为“值”出现在主图(@graph)中实体的属性位置,而非独立顶层对象。
你原始代码中的 JSON-LD 是一个 JSON 数组,包含三个独立对象(含 @context 单独成项)。这种结构在 JSON-LD 中属于 非标准用法:
- 第一项 {"@context": "https://schema.org/"} 仅定义上下文,不构成 RDF 图;
- 后续对象虽有 @type 和 @id,但因缺乏统一 @graph 容器,rdflib 无法将其关联为同一数据集内的互连资源;
- 更关键的是:author、about 等嵌套对象被直接内联(如 "author": {"@type": "Person", "name": "John Doe"}),而 rdflib 默认不会将此类内联对象自动提升为具名资源并展开其属性——除非它们被显式赋予 @id 并置于 @graph 顶层。
✅ 正确做法是使用 @graph 数组封装所有资源,并确保:
- 每个资源(包括嵌套实体如 Person、DefinedTerm)都有唯一 @id;
- 嵌套关系通过 @id 引用表达(如 "author": {"@id": "https://example.com/"}),而非内联对象;
- @context 使用对象形式显式映射前缀(推荐 "@vocab": "https://schema.org/"),避免歧义。
以下是可被 rdflib 完整解析的合规 JSON-LD 示例:
{
"@context": {
"@vocab": "https://schema.org/"
},
"@graph": [
{
"@id": "https://example.com/glossary/#definedTermSet",
"@type": "DefinedTermSet"
},
{
"@id": "https://example.com/",
"@type": "Person",
"name": "John Doe"
},
{
"@id": "https://example.com/glossary/term/",
"@type": "WebPage",
"about": {"@id": "https://example.com/glossary/term/#definedTerm"},
"abstract": "Just my glossary Term",
"author": {"@id": "https://example.com/"},
"dateModified": "2024-03-08T14:54:13+02:00",
"datePublished": "2024-03-08T07:52:13+02:00",
"name": "My Glossary Term",
"url": "https://example.com/glossary/term/"
},
{
"@id": "https://example.com/glossary/term/#definedTerm",
"@type": "DefinedTerm",
"inDefinedTermSet": {"@id": "https://example.com/glossary/#definedTermSet"},
"name": "My Term"
}
]
}
配合 Python 代码验证:
from rdflib import Dataset
from rdflib.namespace import Namespace, NamespaceManager
SCH = Namespace("https://schema.org/")
g = Dataset()
g.namespace_manager.bind("sch", SCH, override=True)
# 使用上述合规 JSON-LD 字符串(赋值给 local_input)
g.parse(data=local_input, format="json-ld", publicID="https://example.com/")
print(f"Total triples: {len(g)}") # 输出远大于 2(通常 ≥ 15)
# 查看所有三元组(简化输出)
for s, p, o, ctx in g:
if str(p) == "https://schema.org/name":
print(f"{s} → name → {o}")
⚠️ 注意事项:
- ❌ 避免将 @context 放在数组第一项——它应作为顶层键与 @graph 并列;
- ❌ 不要内联无 @id 的嵌套对象(如 "author": {"name": "John"})——这会被视为 JSON 值(Literal),而非 RDF 资源;
- ✅ 若必须保留内联语义(如临时数据),可启用 --framed 模式或使用 rdflib-jsonld 的扩展选项,但生产环境强烈推荐显式 @id + @graph 结构;
- ✅ 使用 g.serialize(format="ttl") 可导出 Turtle 格式,直观验证所有嵌套属性是否已正确展开为三元组。
总结:rdflib 不是“不解析嵌套”,而是严格遵循 JSON-LD 规范——只有符合 @graph + 显式 @id + 引用式关系的数据,才能被无损转换为 RDF 图。修正结构后,name、about、inDefinedTermSet 等所有属性都将生成完整三元组。










