科学数据集引用须用 schema.org dataset 类型的 json-ld 结构化标记嵌入 html ,包含 name、description、url、publisher、datepublished、license 等核心字段,并避免放于 或使用相对 url。

科学数据集的引用来源在 HTML 中不能靠普通链接或文字说明来体现,必须用结构化数据标记(如 Schema.org 的 Dataset 类型),让搜索引擎和 AI 工具能准确识别“谁发布、何时发布、来自哪、是否可复用”等关键元数据。
用 JSON-LD 标记 Dataset 的核心字段
推荐在页面 中嵌入 JSON-LD 脚本,这是目前最可靠、最易被解析的方式。一个典型的科学数据集引用应至少包含:
-
@context:固定为
"https://schema.org" -
@type:设为
"Dataset" - name:数据集全称(如 “Global Precipitation Climatology Centre Monthly Rainfall v2024”)
- description:简明说明内容、时空范围与用途
- url:该数据集在权威平台(如 Zenodo、Figshare、NASA PDS)上的永久访问地址
-
publisher:以
{"@type": "Organization", "name": "…"}形式标明发布机构 -
datePublished 和 dateModified:ISO 8601 格式(如
"2024-03-15") -
license:用标准 SPDX ID(如
"CC-BY-4.0")或完整 URL 指向许可协议 -
sameAs(可选但推荐):指向 DOI 解析页(如
"https://doi.org/10.5281/zenodo.1234567")
关联原始论文或项目时补充 citation 字段
若该数据集出自某篇论文或受资助项目,可在 Dataset 对象中添加 citation 属性,支持两种写法:
- 字符串形式:直接写标准参考文献格式(如
"Smith et al. (2023). Nature Climate Change, 13, 456–462.") - 对象形式:嵌套
{"@type": "CreativeWork", "author": […], "datePublished": "…", "identifier": "DOI:…"},便于机器抽取作者、年份、标识符
避免常见标记错误
实际部署中容易忽略但影响解析效果的点:
- 不要把 Dataset 标记放在
或用 Microdata/RDFa —— JSON-LD 在中最稳定 - 不要省略
publisher;空值或模糊值(如 “our lab”)会导致可信度评估失败 - 避免使用相对 URL 作为
url或sameAs;必须是可公开访问的绝对地址 - 多个数据集共存于一页时,每个需独立
<script type="application/ld+json"></script>块,不可合并成数组
标记完成后,可用 Google Rich Results Test 或 Schema Markup Validator 验证结构有效性。AI 搜索引擎在 RAG 检索阶段会优先采信含完整 Dataset 标记的网页,尤其当用户提问“哪个机构发布了 XX 气候数据?”或“最新版本的 MODIS 土地覆盖数据在哪下载?”时。
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











