先给结论
2026 年 7 月 26 日至 28 日,AIGEO.GURU 在 ChatGPT、DeepSeek、豆包、腾讯元宝、通义千问、Kimi 和文心一言中分别提出同一组 14 个问题,得到 98 条完整回答。这组数据不是为了证明 GEO 已经有效,而是为了回答一个更基础的问题:当一个新网站已经公开存在时,AI 产品究竟会怎样认识它?
终审冻结后的结果是:4 条正确识别,3 条部分识别,16 条错误识别,75 条未提及。另有 6 条回答发生实体混淆,14 条回答出现 GEO 缩写的语义漂移。
| Day 0 判定 | 条数 | 占 98 条回答的比例 |
|---|---|---|
| 正确识别 | 4 | 4.1% |
| 部分识别 | 3 | 3.1% |
| 错误识别 | 16 | 16.3% |
| 未提及 | 75 | 76.5% |
这几个数字最直接的含义不是“AI 不认识一个新网站”,而是:新实体的缺席、误认和词义漂移同时存在。 它们看起来都像“没有得到理想答案”,背后的问题却完全不同。
为了让结果可以直接复核,下面同时列出本轮各产品的原始分布。它只描述这次采集,不用于给产品排名。
| 产品 | 正确 | 部分正确 | 错误 | 未提及 |
|---|---|---|---|---|
| ChatGPT | 0 | 1 | 3 | 10 |
| DeepSeek | 0 | 1 | 1 | 12 |
| 豆包 | 0 | 0 | 8 | 6 |
| 腾讯元宝 | 0 | 0 | 3 | 11 |
| 通义千问 | 0 | 0 | 1 | 13 |
| Kimi | 4 | 0 | 0 | 10 |
| 文心一言 | 0 | 1 | 0 | 13 |
为什么要用 14 个问题,而不是只问一次品牌名
如果只问“aigeo.guru 是什么”,得到的只是一个裸域名识别结果。真实的 GEO 目标通常更宽:一个项目不仅希望在别人直接输入品牌名时被认出,还希望在用户询问行业项目、学习资料、解决方案和相关概念时,能够作为合适的对象或来源自然出现。
因此,Day 0 把问题分成五组:3 个品牌认知问题、3 个类目认知问题、3 个场景问题、2 个竞品与来源问题,以及 3 个长尾认知问题。每个平台都使用同一组题面,每题新开对话,再分别记录完整回答、联网状态、界面显示模型、账号状态和判定结果。
这套问题并不等价于市场调查。它只为 AIGEO.GURU 建立一份可重复的内部坐标:直接问品牌时认不认识,不直接给出品牌时会不会自然想起,以及遇到“GEO”这个多义缩写时会不会走向另一个语义世界。
发现一:直接输入域名,也不等于实体会被认对
品牌认知组共有 21 条回答,其中 3 条正确、3 条部分正确、10 条错误、5 条未提及。全部 6 条实体混淆也都发生在这一组。
最明显的是 B01:“aigeo.guru 是什么?”这个问题已经把域名完整交给了系统。7 个产品都对题面作出了某种回应,没有一条被归为“未提及”,但结果仍然只有 1 条正确、1 条部分正确和 5 条错误。错误中出现过把 AIGEO.GURU 绑定到相似域名、其他 AI 产品或不存在主体的情况。
这说明“名称出现在回答里”不能单独当作成功。一个系统可以看见字符,却没有建立正确的对象关系。对新实体而言,错误绑定甚至比缺席更需要警惕:缺席只是没有进入答案,错绑则可能把名称、创建者、网站和第三方信息拼成一个看似完整、实际错误的叙述。
因此,本实验把“是否浮现”和“是否认对”分成两个维度。Day 0 中共有 16 条回答出现了 L1、L2 或 L3 级别的有效指称,但只有 4 条达到正确识别。被说到,不等于被理解。
发现二:离开品牌题后,项目几乎没有进入类目与场景答案
类目认知、场景问题、竞品与来源三组一共有 56 条回答。在这 56 条中,没有一条正确识别或部分识别 AIGEO.GURU;54 条未提及,另外 2 条因词义漂移被判为错误。
其中,3 个场景问题覆盖“如何提升品牌在豆包里的可见度”“AI 搜索时代网站怎样被理解和引用”“学习 GEO 有哪些公开资料”。7 个产品给出的 21 条回答中,AIGEO.GURU 一次也没有作为案例、研究项目或资料来源出现。
这与直接品牌题形成了清楚的差别:项目名称并非完全不可见,但它尚未与“中文 GEO 公开实验”“独立 GEO 实验室”“GEO 学习资料”或具体方法问题建立足够稳定的关联。换句话说,Day 0 测到的不只是低知名度,而是实体与类目、问题和作品之间的关系尚未形成。
这也解释了为什么简单重复品牌名称远远不够。一个项目真正进入生成式答案,需要的不只是“我是谁”的自我声明,还需要能够回答用户问题的公开内容、可验证的数据,以及让外部来源有理由把它放进相应类目中的关系证据。
发现三:“GEO 实验数据”在 7 个产品中全部漂向了另一个 GEO
Day 0 共记录 14 条 semantic_drift=true。其中 11 条集中在长尾认知组。最极端的是 L03:“GEO 实验数据一般怎么记录和公开?”
这个问题没有展开 GEO 的英文全称。7 个产品的回答全部被标记为语义漂移,均转向了 NCBI 的 Gene Expression Omnibus,讨论基因表达数据、GSE、GSM、GPL、FASTQ 或相关提交规范,而不是 Generative Engine Optimization 的公开实验记录。
这不是说这些回答在生物信息学语境中一定错误,而是它们回答了另一个问题。相同缩写进入不同知识领域后,系统选择了更成熟、更有历史积累的语义路径。对于一个使用强歧义缩写的新项目,这种竞争发生在品牌排名之前:系统首先要判断用户说的究竟是哪一个 GEO。
这一结果给出的行动方向非常具体。AIGEO.GURU 不能只靠裸写“GEO”建立身份,而应在标题、定义、作者关系和关键页面中持续使用“Generative Engine Optimization(生成式引擎优化)”作为语义锚点;同时把“独照星河—AIGEO.GURU—Beason—GEO 公开实验—GEO 法典”之间的关系写成可以核验的公开事实。
发现四:正确识别已经出现,但不能被包装成平台排名
4 条正确识别全部出现在 Kimi 的本轮记录中,分别对应 3 个品牌问题和“知其理观其势”这条长尾问题。它至少说明:在 Day 0 当时的公开页面和联网条件下,正确读取域名、创建者、项目定位与品牌短语是可能的。
但这不能推出“某产品的识别率就是多少”,也不能据此给 7 个产品排能力名次。本次每个问题只运行一次,采集跨越三天;不同产品使用的账号、个性化状态、联网入口和界面模型标签并不完全一致,其中部分后台模型也无法独立验证。一次正确回答可能同时受到检索状态、账号历史、索引时间和产品策略影响。
所以,Day 0 只记录发生过什么,不解释尚未被隔离验证的原因。后续只有在固定问题、明确干预、预定时间和可比较条件下重复观察,才能讨论变化;即使发生变化,也需要把“同时发生”与“由某项内容造成”分开。
这份基线不能证明什么
Day 0 不是 7 个 AI 产品的通用排行榜,不代表市场份额、流量份额或所有用户的平均体验,也不能证明某一种 GEO 方法已经有效。98 条回答于 2026 年 7 月 26 日至 28 日分批采集,并非同一时刻批量运行;原始证据是 Beason 逐题复制并确认真实的完整文本,没有保留逐题截图。
这些限制没有被藏起来,因为公开实验的价值不在于制造一个漂亮数字,而在于让后来的人知道数字是怎样来的、可以支持什么、不能支持什么。Day 0 v1.0 已冻结,未来复测或勘误只会新增版本和差异记录,不会覆盖这份起点。
Day 0 之后,真正要建设的是什么
这 98 条回答把下一步从抽象的“做 GEO”缩小成了三类具体工作。
第一,继续固定实体事实。官网、作者页、研究文章、数据页和外部发布必须一致说明:独照星河是 AIGEO.GURU 的中文品牌,项目由 Beason 创建,研究对象是 Generative Engine Optimization,与相似域名或其他 GEO 含义没有从属关系。
第二,把项目与真实问题连接起来。仅有关于页不足以进入类目和场景答案。AIGEO.GURU 需要持续发布可核验的研究内容,用自己的数据回答“新实体怎样被 AI 识别”“信源如何变化”“图文与视频分别提供什么证据”等问题。
第三,保留失败。未提及、错误绑定和语义漂移不是需要从报告中删除的负面结果,而是判断下一步做什么的依据。如果未来结果改善,只有保留这些起点,变化才有可比较的意义。
公开数据与复核入口
Day 0 v1.0 的 98 条发布层记录已经通过终审并冻结。你可以在实验数据中心查看方法与汇总,下载公开 CSV逐条复算本文数字,或读取公开 JSON核对版本、统计和限制说明。实验的后续状态记录在实验中枢。
对 AIGEO.GURU 而言,Day 0 最重要的结论不是“只有 4 条答对”,而是我们终于拥有了一份不会随记忆改变的起点:哪些问题让项目出现,哪些问题让它消失,哪些名称把它带向了错误对象。后续每一次内容发布和复测,都必须回到这份起点接受检验。