Schema.org 与 RAG:结构化数据如何改变 LLM 检索
· Visora
Schema.org 与 RAG:结构化数据如何改变 LLM 检索
检索增强生成(RAG)驱动大多数消费级 AI 搜索。流程概念简单:嵌入查询、检索 top-k 片段、生成带引用的回答。商户可见性在检索阶段生死攸关。
非结构化 PDP 为何表现差
导航、促销条、评论组件稀释片段。固定 512 token 窗口可能抓到「今日包邮」却漏掉功率规格。JSON-LD 位于可预测脚本块——许多爬虫将其与可见 HTML 一并索引为高置信结构化证据。
按商户引用影响排序的 Schema 类型
1. Product + Offer(priceValidUntil、availability、shippingDetails) 2. 自然语言问答的 FAQPage 3. 安装/尺码/保养的 HowTo 4. 真实采集时的 AggregateRating 5. 类目上下文的 BreadcrumbList(PLP 用 ItemList)
损害信任的反模式
标记与可见价格/库存矛盾。虚假评论。类目页用 Product。主题+应用多个冲突 Product 节点。
HTML–JSON 一致清单
- 价格与货币一致。
- availability 反映加购按钮状态。
- name、description 与 H1、导语对齐。
- FAQ 答案与手风琴文本一致或语义等价。
FAQ
Google 是否要求 Schema 才有 AI 引用?无 universal 规则,但结构化事实改善解析 JSON-LD 的系统的检索。
Microdata 够吗?JSON-LD 更易验证,模板破坏更少。
能否从 metafield 自动生成 Schema?可以——Shopify metafield 转 Liquid 是常见模式;在 /audit 中验证输出。
Lewis 等(2020)表明检索质量上限决定生成质量。对商户即结构化事实质量是杠杆——Visora /audit 在无 ML 运维负担下对有效性、完整度、HTML–JSON 一致性打分。
https://geovisora.com/zh/blog/structured-data-rag-retrieval