公开评估规范
状态:可供测试的公开评估草案;尚未完成独立验证,也不是已完成的正式规范。 依据:VGO Framework 公开定义冻结基线 V1.0(2026-09-20)。 用途:让不使用 Omseek 的评估者,凭同一份证据对单个用户意图场景中的可见度作出可解释、可复核的判断。本文不规定行业通用评分公式,不声称本规范已被第三方采纳。
1. 范围与边界
VGO 从真实用户与高价值意图出发,观察企业的有效资产、有效 SEO、有效 GEO 与有效可见,关心被发现、理解、引用、比较、推荐、选择的连续过程。V1 首先覆盖企业自有资产、搜索入口与生成式 AI 入口。其他入口可沿用记录格式,但不应被表述为已验证适用。
本规范评估的是一条明确的用户意图场景中的可见证据,而非企业总体价值、市场份额或销售贡献。搜索排名、AI 提及或引用都只是观察值;实际用户选择和商业结果需要额外的第一方证据。原则表达“对的人 × 对的意图 × 对的入口 × 对的出现”不是数值乘法,不用它计算总分。
公开部分:评价单位、证据要求、判断规则、分歧处理、案例与版本记录。保留在实现方内部:高价值意图自动发现、跨场景优先级、VHI 等指标的实际权重 / 归一化 / 置信度算法、机会排序、自动执行策略和商业数据处理。任何实现方都可以按本公开规范报告案例,不得据此声称自己的私有分数等于 VGO 通用认证。
2. 评估单位:一条场景记录
每条记录须预先固定以下字段,观察后不可为了得到好看的结果而改写意图或筛选样本:
| 字段 | 必填内容 |
|---|---|
| 用户与问题 | 目标用户类型、需求触发、具体问题、决策阶段;不得把自造的低价值问题冒充真实需求 |
| 意图依据 | 客户访谈、客服 / 销售记录、站内搜索、公开问答等来源及日期;标明来源局限。缺少依据时标为“待验证意图” |
| 企业与主张 | 被评估实体、产品 / 服务、应核实的事实、相关第一方资产及更新日期 |
| 入口与查询 | 搜索引擎或 AI 服务、地区 / 语言、设备或界面、原始查询 / 提示词及采集时间;AI 记录会话条件和可见的模型标识 |
| 对照范围 | 同一场景下纳入的竞品或其他选项及纳入理由;不得只抽取有利的竞品 |
| 观察结果 | 原始结果快照、链接、时间戳、可见位置、出现的原文片段及引用来源 |
| 后续证据 | 如有:来源点击、有效访问、咨询、销售质量等记录与口径;不可从截图推断转化 |
| 复核信息 | 评估者、日期、版本、判定及理由;敏感数据可脱敏,但应保留可复核的来源或访问办法 |
“高价值”在此只允许作为场景选择理由,须说明与目标用户、决策阶段和企业实际供给的关联,并注明证据是已观察、合理假设还是未知。本规范不提供自动判定高价值意图的算法,也不把“出现过一次”提升为“高价值场景已覆盖”。
3. 最低判定规则
逐项记录 符合 / 不符合 / 证据不足 / 不适用,不得用一个好结果抵消事实错误。每项均写明支持和反证。下表中的“符合”只对本条场景、本次观察有效。
| 维度 | 符合的最低条件 | 常见不符合或证据不足 |
|---|---|---|
| 人与意图相关 | 查询能合理代表已说明的用户问题,实体供给与需求相关 | 只凭营销方造出的 prompt、用户需求未说明、供给根本不相关 |
| 自有资产可核验 | 企业可控制的公开资产有相关且可核对的事实、更新时间或有效维护线索 | 无相关页面、页面无法访问、关键事实缺失或过期;有页面不等于“有效资产” |
| 被发现 | 指定入口的可见结果确实出现该实体或相关资产,并保留原始证据 | 用品牌词结果代替非品牌场景,或把历史结果当成本次结果 |
| 被正确理解 | 可见结果对实体、产品、适用范围、价格 / 限制等与场景有关的关键事实没有实质性歪曲 | 把同名公司混淆、把不提供的服务归给企业、引用过期价格;无法核实则证据不足 |
| 提及与引用 | 区分名称出现、内容被引用、可点击来源与来源可靠性,并逐项保留证据 | 有提及却写成“被引用”,引用无法追溯或来源错误 |
| 比较与推荐 | 若发生比较 / 推荐,评价其是否与用户需求及已核实事实相符;没有推荐时记“不适用” | 把广告、无依据的优先推荐或只出现一次解释为用户已选择 |
| 完整性风险 | 检查实体混淆、错误 / 过期事实、疑似投毒或来源冲突,并记下冲突证据 | 存在未经澄清的重大冲突,却仍判为“可信有效” |
| 结果关联 | 只有具备可追溯的下游行为与一致口径,才报告观察到的业务结果 | 用曝光、排名、提及替代点击、咨询、成交或增量贡献 |
单场景结论仅用以下四种表达,不另设新指数:
有证据支持的有效可见:人 / 意图相关,有本次可见证据,关键事实正确,无未处理的重大完整性风险;仅限所观察入口与场景。可以同时注明结果关联仍未知。可见但有效性未成立:确实出现,但场景不相关、关键事实错误、重大完整性风险未解决,或把不合理推荐作为优势。未观察到可见:按预先记录的查询和采集条件未出现;这不能证明所有用户都看不到。证据不足:缺少完整查询条件、快照、场景依据或事实核验材料;不得强行给正负结论。
若同一场景有多次观察,逐次报告,再描述波动;禁止只展示最佳截图。不同入口的结果分别判定,不把搜索观察直接解释为 AI 可见度。
4. 采样与复核协议
- 先登记场景,再采样。 记录用户问题及来源、入选 / 排除条件、入口、地域、语言、查询或提示词、采集窗口和预期观察次数。品牌词、非品牌词、比较型、核实型问题应依研究问题分别呈现;没有事实依据的测试提示词可用于功能演示,但不能支持“高价值覆盖”主张。
- 保存原始证据。 页面 URL、快照及采集时间;搜索记录可见排序 / 广告标记;AI 记录完整提示词、答复、可见引用、模型 / 产品标识、日期和会话条件。遇到登录、个性化或随机性限制时如实说明。原始材料无法公开时可提供脱敏版、哈希或受控复核方式,并标明独立复核的限制。
- 独立双人判读。 两名评估者各自填写第 3 节各项判定及证据,不先商议。记录初始一致项和分歧项;分歧须依据原始证据或新增可核验证据处理,不能由 Omseek 的私有分数裁决。持续分歧则并列发布,不伪装成一致意见。
- 报告分母与缺失。 公布预先登记场景数、实际采样数、各入口观察次数、缺失 / 排除理由,以及四种单场景结论的数量。若只展示案例,显著标注“非总体估计”。不得把几条演示案例当作客户效果或框架有效性验证。
- 变更后再观察。 有优化动作时记录动作、日期、受影响资产与未变项目;使用尽量相同的场景和条件复测,并披露同期其他变化。前后差异只表示观察关联;需要因果结论时另行设计对照或更强证据。
可复核性成功条件:第三方在得到同样证据和规则后,可以独立得出相同结论或准确指出规则存在的歧义。若出现系统性分歧,应修订定义并保留旧版结果,不允许事后调口径抹去反例。
5. 演示案例(全部虚构,不是实际调查或产品效果)
案例 A:被提及,但事实错误
预先场景:某小企业负责人询问“上海本地支持 10 人视频会议实时双向翻译的服务怎么选”。假设供应商甲官网明确写“仅支持 2 人”;某 AI 答复却将其列为“支持 10 人”,并链接到一年前的第三方页面。原始记录应附问句、完整答复、引用链接和官网现行规格。
判定:名称出现=是;引用=有,但来源陈旧;正确理解=不符合;完整性风险=重大事实冲突;单场景结论=可见但有效性未成立。即使出现频次增加,也不能据此称“有效 GEO 提升”。
案例 B:搜索有排名,用户意图不符
预先场景:采购经理寻找“支持企业数据留存与审计的实时翻译会议系统”。假设供应商乙在“免费翻译软件下载”排第 2,但其产品页没有数据留存与审计说明;在预先登记的采购问题中未观察到乙。应分别保留两个查询结果,而不是只报排名最好的一个。
判定:免费工具查询的搜索出现=是;与采购场景相关性=不符合或证据不足;采购问题中的可见=未观察到。不得用无关查询的排名证明“有效 SEO”。
案例 C:相关且事实正确,但转化未知
预先场景:一位多语言团队负责人询问“10 人跨语言会议,是否可按参会分钟计费”。假设供应商丙官网有明确计费说明,AI 在完整答复中准确描述并给出可访问的第一方来源;未取得点击或咨询数据。
判定:意图相关、资产可核验、被发现、正确理解和可追溯引用均=符合,无已知重大冲突;单场景可标为有证据支持的有效可见,同时必须注明“只针对这次观察;结果关联未知;不能声称带来成交”。
案例 D:记录不全
只有一张“AI 推荐我司第一”的裁剪截图,缺少提示词、模型、时间及完整答复。判定=证据不足;不能把裁剪图纳入有效可见的分子。补齐材料后按原场景重评,保留此前状态。
6. 可复制的单场景记录模板
record_id: ""
protocol_version: "VGO-public-evaluation-draft-0.1"
pre_registered_at: ""
audience_and_need: ""
intent_evidence: "source/date/limits or unverified"
decision_stage: ""
entity_and_claims: ""
owned_asset_urls_and_dates: []
surface: "search | generative_ai"
service_region_language_device: ""
query_or_full_prompt: ""
collection_timestamp_and_conditions: ""
observations: [] # raw result URLs, snapshots, full response, citations, ad labels
fact_checks_and_counterevidence: []
downstream_evidence_or_unknown: "unknown"
assessments: # each: 符合/不符合/证据不足/不适用 + evidence
audience_intent: ""
owned_asset: ""
discovered: ""
correctly_understood: ""
mentioned_and_cited: ""
comparison_recommendation: ""
integrity_risk: ""
outcome_link: ""
scenario_conclusion: ""
reviewer_a_and_rationale: ""
reviewer_b_and_rationale: ""
disagreements_and_resolution: ""
publication_limits: ""
7. 结果发布方式与框架治理
公开案例至少附协议版本、采样期、分母、四类结论数量、缺失及利益关系说明。区分“方法论发起方自行评估”“实施方评估”“独立第三方复核”。不得因为任何人提交外部意见就称其认可 VGO。公开问题可通过 GitHub Issue 或联系页提交。安全问题请使用联系页中的安全渠道。
仓库文件名为 EVALUATION-PROTOCOL.md,并由 examples/README.md 说明案例的虚构或真实来源。修订前,维护者应核对 METRICS.md、GOVERNANCE.md 与 INTEGRITY-AND-DEFENSE.md 有无冲突。规范修订需记录:争议案例、旧判定、新判定、修订理由、发布日期;历史记录保留原协议版本。任何商业关联与评估者利益冲突需披露。
8. 待验证事项与首次实测验收
当前仍未证实:场景选择能否代表真实高价值意图、不同评估者的一致性、不同入口 / 语言的可迁移性,以及“有效可见”与业务结果的关系。VHI、EVR、VCR、OVR 的私有计算不是本规范的验证对象,也不得从这组案例倒推出统一公式。VCI 不进入 V1 正式 KPI。
首次真实试点应事前登记不少于三类意图场景,纳入成功、失败和证据不足的结果;邀请至少两位独立判读者;按第 4 节保留原始证据、分歧和全部样本。验收关注“评估者能否复核、分歧是否可解释、反例是否改变规则”,不设事后追逐的命中率目标。完成前,只能称本文件为可供测试的公开评估草案。
与冻结基线的关系:本文件只细化公开判定与验证方法,不更改 VGO 定义,不新增一级理论层或总指数,不公布 Omseek 的专有发现、评分与执行机制。
