Trellner Research 在 2026 年 9 月 2 日发布的调查报告里有一组具体数字:380 个软件品类里,AI 搜索给出的 7,534 条引用中,59.8% 指向流量排名 10 万名之外的网站,23.4% 甚至不在全球流量前 100 万之列。给 AI 答案当「证据」的网页,大部分来自你从没听过的站点。
报告还追溯到三个内容农场:WifiTalents、WorldMetrics、Gitnux,三者之间存在明显关联。三家合计发布过 215,128 个「best 某品类 software」购买指南页面,其中两家的首页 HTML 标题直接写着「Facts & Grounding Page」。
「Grounding」(接地检索)是 AI 行业术语,指模型回答前先检索外部文档来约束答案。采购软件的人不会用这个词。这类页面从标题到 meta 描述都在照顾另一个读者群:采购软件的人搜不搜得到无所谓,AI 检索得到就行。

一、实验怎么做的:760 次调用,每个品类只问一遍
先讲方法,这份报告能证明什么、不能证明什么,都取决于它。
Trellner 在 9 月 2 日选了 380 个购买意图明确的品类,从「CRM software」到「museum collection management software」(博物馆藏品管理软件),逐个投给 OpenRouter 上的 perplexity/sonar 和 perplexity/sonar-pro 两个联网模型,每个品类每个模型各问一次,共 760 次调用。提示词要求按 JSON 返回排名前五的产品和官网域名。品类清单在跑任何查询之前就定下来了,中途没有改过。
760 次调用全部返回了可解析的答案,合计产生 3,800 个推荐位、1,807 个不同产品、7,534 条引用,覆盖 2,055 个域名。研究者随后用 Tranco 全球流量排名(9 月 1 日日榜)和 Wayback Machine 网页存档逐个核对被引域名,还把模型给出的 1,502 个厂商官网挨个访问了一遍,确认网站还在不在。
选 Perplexity 有个技术原因:这两档模型会随答案报告自己检索过的 URL,引用可审计。Gemini 没有入选,因为在 OpenRouter 上调用它走的是 OpenRouter 自家的联网搜索插件,测出来的引用属于插件,而非 Google 的检索层。
二、引用都落在了哪里
分模型的数字几乎一致,结果比较稳定:
| 模型 | 引用数 | 流量前100万名之外 | 10万名之外 |
|---|---|---|---|
| perplexity/sonar | 3,767 | 23.4% | 59.8% |
| perplexity/sonar-pro | 3,767 | 23.5% | 59.9% |
| 合计 | 7,534 | 23.4% | 59.8% |
几个值得单独看的数据点:
- 头部集中度低:被引最多的 10 个域名合计只占 17.3% 的引用。给 AI 喂答案的并不是某几家知名站点,问题集中在长尾。
- 长尾里大部分是「影子站点」:2,055 个被引域名中有 751 个(36.5%)完全不在流量前 100 万名内。
- 这些长尾站点普遍很新:被引但排名在百万外的域名,首次被网页存档收录的时间中位数是 2020 年;被引且排名靠前的域名,这个中位数是 2011 年。16.6% 的未排名被引域名是 2025 年之后才首次被存档的,对照组只有 1.6%。
引用量前十的域名:
| 域名 | 引用次数 | 占比 | Tranco 排名 |
|---|---|---|---|
| g2.com | 291 | 3.86% | 4,027 |
| reddit.com | 261 | 3.46% | 105 |
| guideflow.com | 194 | 2.57% | 177,039 |
| gartner.com | 158 | 2.10% | 1,766 |
| zapier.com | 82 | 1.09% | 2,919 |
| wifitalents.com | 71 | 0.94% | 105,281 |
| capterra.com | 68 | 0.90% | 6,387 |
| linkedin.com | 67 | 0.89% | 18 |
| worldmetrics.org | 60 | 0.80% | 104,737 |
| gitnux.org | 50 | 0.66% | 42,759 |
作为参照:Wikipedia 在 7,534 条引用里出现了 3 次。
三、第三大引用源是一家厂商的营销博客
排第三的 guideflow.com 不是评测站,也不是目录站或媒体。它卖交互式产品演示(interactive product demo),和报告问的 380 个品类没有竞争关系,它的博客却在 96 个品类(约四分之一)里被引用了 194 次,超过 Gartner,排到总榜第三。
每一次引用对应一个不同的 URL:96 篇博客文章,一个品类写一篇,其中 6 篇还是爱沙尼亚语区的副本。它的 sitemap 里列了 3,351 个博客 URL,其中 2,176 篇是不同文章。「3D 渲染软件」「IVR 软件」「RFID 软件」「建筑事务所软件」,这些分属完全不同领域的品类,引用列表里都有它的文章。
报告的措辞很克制:guideflow 的内容营销本身没有任何欺骗性,成千上万家公司都在做同样的事。问题出在检索层怎么消化它。一家厂商写给市场的清单文,在「该买什么软件」这个问题上成了第三大的证据来源。
还有个细节:guideflow 的 robots.txt 第一条规则就是欢迎 OAI-SearchBot(OpenAI 的搜索爬虫)全站抓取。检索型 AI 能给内容站带来流量,从业者已经用行动投了票。这条 robots.txt 规则实测于 2026 年 9 月 3 日。
四、一个模板,三个品牌,215,128 个页面
WifiTalents(71 次引用,27 个品类)、WorldMetrics(60 次,22 个品类)、Gitnux(50 次,23 个品类),合计 181 次引用、2.4% 的份额,出现在 41 个品类里。报告认为三家是同一拨人做的,证据如下:
- 注册时间集中:三家域名全部通过 NameCheap 注册,时间在 2023 年 12 月到 2024 年 5 月之间,没有一个更早存在。
- 基础设施相同:三家把 DNS 指向同一对 Cloudflare 域名服务器(
pam.ns.cloudflare.com和sean.ns.cloudflare.com)。这是同一 Cloudflare 账号的有力间接证据,还不能证明所有权。 - 模板逐项吻合:同一套页面模板和导航(Services、Market Data、Software Advice、Editorial Process、Company)。每家各有一个恰好六篇文章的博客,这 18 篇文章全部在写彼此,外加第四个品牌 zipdo.co。zipdo.co 用同一对域名服务器,首页顶着同一个「Facts & Grounding Page」标题。
- 规模:三家 sitemap 分别列出 103,578、107,083、105,541 个 URL,其中 70,731、71,684、72,713 个是
best/某品类-software/形式的购买指南,合计 215,128 个生成页面。世界上并不存在 215,128 个软件品类。 - 自我描述:9 月 2 日抓取时,worldmetrics.org 和 gitnux.org 的首页 HTML 标题是「品牌名 — Facts & Grounding Page」,meta 描述除品牌名外逐字相同:「关于 Gitnux 的已验证事实:一家独立市场研究公司,发布行业统计、定制研究与软件最佳清单。公司、法律、方法论与合规细节,一份机器可读记录。」
- 变现照常:worldmetrics.org 在这套生成的清单上面挂着明码标价的服务:定制市场研究 5,000 欧元起,现成报告 499 欧元起,选型咨询 2,500 欧元起。

五、同一个问题,三份互相矛盾的「权威答案」
报告取了三家的「项目估算软件」(project estimation software)品类页做对照。每页都用 JSON-LD 结构化数据声明排名,机器可以直接读取。前五名如下:
| 站点 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| worldmetrics.org | Float | Scoro | Teamwork.com | Procore | Wrike |
| wifitalents.com | Float | Scoro | Teamwork.com | Buildertrend | Apropo |
| gitnux.org | Saviom | Mosaic | Buildertrend | Float | Teamwork.com |
Gitnux 排第一的 Saviom,在 WorldMetrics 的前五名里根本没出现。同一套模板,对同一个问题给出三份对不上的排名。
页面的包装做得很细:每页署名三位编辑,WorldMetrics 挂 Kathryn Blake、Alexander Schmidt、Victoria Marsh,Gitnux 挂 Diana Reeves、Helena Kowalczyk、Olivia Thornton,WifiTalents 挂 Ryan Gallagher、Isabella Rossi、Natasha Ivanova。同一份推荐榜,配了九位互不重合的「专家」。Gitnux 还给自己的结果贴上「AI-verified · Expert reviewed」标签。三家的署名栏里都残留着没渲染出来的模板变量,两家显示「Within the next 26 days」,一家显示「Within the next 40 days」。
六、推荐出去的链接,一部分已经失效
1,502 个模型给出的厂商官网,绝大多数没问题。研究者每个网址访问两次(直连一次、轮换代理一次),任意一次能打开就算存活,避免把屏蔽数据中心 IP 的正常公司误判成死站。
即便如此,仍有 17 个域名(1.1%)已经消失或打不开,其中 10 个连 DNS 解析记录都没有。模型把 graphiql.com 当成 GraphiQL 的官网(这个项目没有官网),把 todo.com 当成 Microsoft To Do 的官网,把 aquasecurity.io 当成 Trivy 的官网。另有 92 个域名(6.1%)重定向到别家,多数是正常的收购和改名。
剩下两个案例问题更大:
- 问「研究数据管理平台」,两档模型都推荐 Dryad。sonar-pro 给了真正的仓库
datadryad.org;sonar 给了dryad.co,这个域名重定向到一个标题为「BIGSLOT288 | Portal Game Online」的印尼在线赌博门户。 - 问「数据质量工具」,两档模型都推荐 Monte Carlo(数据可观测性厂商)。sonar 给了正确的
montecarlodata.com;sonar-pro 给了montecarlo.com,打开是摩纳哥蒙特卡洛海滨浴场集团(Monte-Carlo Société des Bains de Mer)的网站,一家赌场酒店公司。
七、第二天的回访:2026 年 9 月 3 日
报告发布第二天,我挨个访问了三个品牌的站点,结果各不相同:
- worldmetrics.org 返回 HTTP 503,响应体只有一行「no available server」,直连和走代理结果一样。写着「Facts & Grounding Page」的首页,当时对人和爬虫都不提供服务。
- gitnux.org 返回 Cloudflare 拦截页(「Attention Required!」),普通浏览器访问会先撞上人机验证。
- wifitalents.com 还能正常打开。首页标题「Original data, independently audited」(原创数据,独立审计),正文自称独立市场研究公司,每项统计发布前都经过人工编辑终审。首页下方是媒体引用墙:Washington Post、WSJ、USA Today、Los Angeles Times、New York Times、Bloomberg、Reuters 的标识,配文「Cited by hundreds of publications」,再往下是三个大数字:3,000+ 篇引用 WifiTalents 的文章、500+ 家出版物、100+ 个国家。
Hacker News 的讨论串里,有评论者贴出 Semrush 的估算:wifitalents.com 的自然搜索流量在 7 月 15 日前后见顶(约 1.8 万次访问/月),worldmetrics.org 在 7 月 27 日前后见顶(约 8 千次/月),之后都在回落。三个站点在 Perplexity 索引里的引用还在,人类访问量却先跌下去了。
八、报告自己承认的局限
报告在「What this does not show」一节把限制列得很全,能下多大的结论,取决于这几条:
- 两个模型不是两次独立测量。sonar 和 sonar-pro 在 380 个品类中的 289 个返回了逐字节相同的引用列表,URL 集合的 Jaccard 重合度 0.898,第一名也一致(290/380)。它们共享同一个检索层,正确的读法是「同一个搜索栈采样两次」。
- 只测了 Perplexity。ChatGPT、Gemini、Copilot、Google AI Mode 的检索配比可能完全不同,这份报告说明不了它们的情况。
- 380 个品类是研究者自己拟的清单,偏重垂直细分品类,长尾来源的比例因此会高于大众高频查询。
- 所有抓取走数据中心代理和具名研究 UA,这些站点返回给研究者的内容,未必等于返回给检索爬虫的内容。
- 单日快照。一次提示词措辞,一次采样,检索索引随时在变。早期试点显示,把「best」换成「most popular」会明显改变产品入围名单,但引用构成变化不大,这个变量本次没有测。
- Tranco 排名只衡量流行度,不衡量质量,排名低本身不是指控。对具体站点的每项判断,依据的都是站点自己的页面,全部链接和存档随数据集公开。
- 报告没有证明这些来源改变了答案。研究者没有测「移除这些来源之后推荐会不会不同」,guideflow 和三个品牌推荐的产品可能完全合理。这项测量始终只针对证据的构成。
对三个品牌的共同控制权,报告也只写了「基于共享基础设施和相同模板的推断」。运营者是谁,三家从头到尾没有一处署名,报告也不知道。
九、成本结构变了
传统 Google SEO 的排序信号(外链、用户行为、域名年龄)积累慢,垃圾站把排名做起来要按月算。AI 搜索的检索层不一样:它偏爱结构化数据(JSON-LD 声明的排名可以直接读),偏爱标题和查询的字面匹配,对新域名也没有历史权重惩罚。215,128 个页面用同一套模板几个月铺完,然后一天之内被检索层当成「市场研究」。过去垃圾站要解决的是「怎么排在结果前面」,现在只要进入检索窗口就够,成本结构完全变了。
旧 SEO 产业的服务商也在转向。搜狗微信搜索里以「AI搜索」「GEO」「AEO」为关键词的文章,2026 年以来持续增多,标题从「别再死磕SEO」到「抢占AI搜索询盘新风口」,教程在教独立站卖家怎么让内容被 AI 引用。在 Perplexity 的检索层里,一个页面被引用的门槛和被人类认可的门槛,已经明显分开了。
十、不同角色能做什么
如果你在做产品或内容:这份报告的数据集已经公开(CC BY 4.0,含全部引用、Tranco 与 Wayback 查证、厂商存活检查和生成每张表的脚本)。做 AI 搜索优化(GEO)之前,先确认自己不会成为报告里 guideflow 的翻版。厂商博客进入检索层之后,读者和竞争对手都能审计你的品类覆盖范围。
如果你采购软件时用 AI 搜索:报告正文给了几条可以照做的检查步骤。AI 给出的每个推荐,官网域名要自己点一遍(1.1% 的推荐链接已经失效,个别指向赌博站);名不见经传的产品被推荐时,看一眼引用来源是不是又一个「Facts & Grounding Page」。九位不重合的「编辑」、26 天后到期的模板变量、三份互相矛盾的 JSON-LD 排名,这些痕迹在浏览器里各花十秒就能看出来。
如果你在做检索或 RAG 系统:sonar 与 sonar-pro 共享检索层这件事,本身就值得写进设计文档。评估联网搜索的答案质量时,要把同一底座的两档模型当作一次测量。报告验证过一种成本不高的防线:对引用来源做域名层过滤,看流量排名、域名年龄、来源和查询主题是否独立。guideflow 的案例还说明,现有检索层完全没有过滤「来源是否与查询同属一个领域」,厂商博客和独立评测被一视同仁。
十一、还有一个没验证的问题
报告最后承认:没人知道剔除这些来源之后,AI 的推荐会不会变好。guideflow 的清单文和三个品牌的名录页,推荐的产品可能并不差。人类靠十几年 Google 使用经验养成的「来源即权威」直觉,检索层暂时不认:Perplexity 引用 g2.com 291 次和引用 gitnux.org 50 次,用的是同一种引用格式,在回答页面上长得一模一样。
215,128 个页面,六篇一组的博客,九位找不到真人的编辑,一对共享的域名服务器,这一整套东西没有一处是为人准备的。这项实验值得更多检索团队复现,数据集已经公开。
来源:
- Trellner Research: Three sites made 215,128 "best software" pages for AI. Perplexity cites them(2026-09-02,数据集 CC BY 4.0)
- Hacker News 讨论串
- worldmetrics.org / gitnux.org / wifitalents.com / guideflow.com 的直接回访与截图(2026-09-03,本文实测)