JSON-LD、microdata 与可见 HTML:AI 到底优先解析哪一种?
· Visora
JSON-LD、microdata 与可见 HTML:AI 到底优先解析哪一种?
结构化数据告诉搜索引擎和 AI 助手一个页面是什么意思,但你选择的格式很关键。Google 官方支持三种:JSON-LD、microdata 和 RDFa。然而到了 AI 生成式回答这里,JSON-LD 已经在默默成为真正会被读到的那一种。
简短答案是:如果你的数据放在 JSON-LD 的 script 标签里,AI 引擎通常能找到并解析它。如果它只以散落在 HTML 里的 microdata 属性存在,许多基于大模型的系统会直接漏掉。如果它只是没有标记的可见纯文本,能提取,但更慢、更容易出错。
为什么 JSON-LD 对 AI 引擎更有利
JSON-LD 把结构化信息集中在独立的一两个 script 块里,与可见内容分开。这种干净的分隔让它成为爬虫或大语言模型最容易定位的格式。Google 明确表示优先推荐 JSON-LD,多数 schema 生成器和电商平台也默认输出它。AI 助手读取页面原始 HTML 时,往往会先抓 JSON-LD,因为它位置可预期、容易找到。
microdata 和 RDFa 直接嵌在 HTML 元素里,用属性标签标注。它们合法,Google 也能解析,但对于一个不跑完整 schema 校验器的模型来说,这更嘈杂。一个想回答购物问题的模型,希望快速找到价格、库存和发货数据,JSON-LD 一次性把这些交给它。
三种格式的现实排序
实际解析成功率大致是这样:
1. head 里的 JSON-LD:在 Google、ChatGPT 和 Perplexity 之间成功率最高。 2. 普通的可见 HTML 文本:稳定能找到,但模型必须自己解读,所以措辞很重要。 3. microdata 或 RDFa 属性:合法标记,但恰恰是最不被 LLM 引擎稳定识别的一类,因为它们往往只读原始 HTML、不跑 schema 工具。
一个有用的心智模型:JSON-LD 是机器可读的答案,可见文本是模型在结构化数据缺失或不清晰时读取的兜底。两者最好协同工作、说同一件事。
如何把关键页面迁到 JSON-LD
1. 先看你的平台输出哪种格式。不少 Shopify 主题和 WordPress GEO 插件已经输出 JSON-LD,你也许只需要检查,不需要重做。 2. 对每个商品页,确认 Price、Availability 和 SKU 放在 JSON-LD 的 Product 或 Offer 块里,而不是只放在 microdata 中。 3. 核对结构化数据与可见页面讲的是同一个故事。如果标记写着有货、页面文字却写着缺货,引擎可能两个都不信。 4. 用校验工具或免费的扫描查看模型实际能提取哪些字段,然后优先修掉它报告缺失的部分。
可见 HTML 才是真正的兜底
即使 JSON-LD 很干净,如果可见页面隐藏了关键事实,价值也会打折。有些引擎,尤其是 agentic 购物助手,会读取渲染后的文本,忽略它们无法信任的标记。所以两者是一对:JSON-LD 负责快速可靠的提取,清晰完整的可见句子则是给那些只读文本的模型上的保险。
这就是 GEO 工作中反复出现的同一条经验:让结构化数据与可读内容一致,不要只依赖标记。
FAQ
*我需要把三种格式都加上吗?*
不需要。JSON-LD 加清晰的可见文本就够。再叠 microdata 只是增加维护成本、几乎没有额外收益,而且三个副本一旦漂移还会产生冲突信号。
*WordPress 插件和 Shopify 应用呢?*
两大生态都越来越默认输出 JSON-LD。启用一个维护良好的插件、输出合法 JSON-LD,通常比自己手写 microdata 更好,因为插件会随 schema.org 词汇演进而更新。
*我怎么知道 AI 引擎真的读了我的结构化数据?*
最直接的办法是问一个助手它能从你的商品 URL 提取到什么,或运行一个展示可提取字段的扫描。如果结果里价格或库存是空的,说明引擎没读到你的 JSON-LD,就该去检查标记了。
Visora 的免费扫描在 geovisora.com/audit,会读取你的商品 URL 并显示模型今天能提取哪些结构化字段,让你看到 JSON-LD 是否真的传了过去——以及先修什么。如果不确定是标记还是可见文本的短板,/faq 会在你动手前梳理常见的失败点。
https://geovisora.com/zh/blog/structured-data-formats-json-ld-microdata-html-ai