AI Agent都在推荐什么工具?6742次提问测出的真相
先问个扎心的问题:你上一次认真逛”工具导航站”选工具,是什么时候?
我猜很久了。现在的流程基本变成了——打开Claude Code或者Codex,直接问一句”这个项目用什么数据库””测试框架选哪个”,AI啪一下给出答案,你还觉得挺靠谱。
但你想过没有:它凭什么推荐这个,不推荐那个?
这事以前大家只是模糊感觉”AI推荐谁很重要”,没人拿出数据。直到Latent Space干了一件狠事:烧掉几十亿token,做了个叫Frontier AEO Tracker的项目,把这个问题变成了可以审计的数据集。今天带大家把核心结论扒一遍。
一、这是个什么实验
先解释个新词:AEO = Answer Engine Optimization(答案引擎优化)。以前做SEO是争取在谷歌搜索结果里排前面,现在要做AEO——争取在AI Agent回答”该用什么工具”时,被它点名。
实验规模(2026年9月的V5快照):
| 维度 | 数据 |
|---|---|
| Prompt框架 | 6种问法 |
| 模型-CLI配置 | 7套 |
| 工具品类 | 161类 |
| 计划提问数 | 6,762次 |
| 通过验证的回答 | 6,742次 |
7套配置里有大伙熟悉的面孔:GPT-5.6 Sol和GPT-6 Astra(走Codex)、Claude Opus 5和Fable 5.1(走Claude Code)、Grok 4.6(走Cursor)、Muse Spark 1.3、SWE-1.7(走Devin)。注意:Gemini、GLM、DeepSeek因为报错和限流没能进榜——这是采集约束,不是能力结论,看榜时别被带节奏。
评分规则也透明:首选/并列首选60分,直接替代25分,被提及15分;场景性反推荐扣25分,广泛性反推荐扣60分。每个问答对都公开可查。
二、谁在霸榜:5个100%全票王
最炸裂的发现是这个——有5款工具,被所有7套模型配置一致推荐为首选,净AEO得分100%:
| 工具 | 品类 | 净AEO得分 |
|---|---|---|
| PostgreSQL | 数据库 | 100% |
| Supabase | 集成后端 | 100% |
| Sentry | 可观测性 | 100% |
| Vitest | 测试框架 | 100% |
| Slack | 团队聊天 | 100% |
紧随其后的是一批”接近垄断”的选手:Confluence 96.6%、Zapier和Pipedrive 96.2%、Render 90.5%、PostHog 89.6%、Linear 85.8%、Stripe和Neon 84.7%。这些产品在Agent嘴里几乎没有对手。
其他赛道的座次也很有信息量:
| 赛道 | 第一名 | 第二名 | 第三名 |
|---|---|---|---|
| 编程Agent | Claude Code 56.9% | Codex 43.8% | Cursor 38.4% |
| AI应用搭建 | Lovable 73.7% | Replit 66.5% | Bolt.new 24.3% |
| AI搜索 | Tavily 67.7% | Exa 54.6% | Brave 52.4% |
| AI记忆 | Mem0 71.7% | — | — |
| SEO工具 | Semrush 79.1% | Ahrefs 61.5% | — |
最有节目效果的是最后一行:SEO工具类目里,Semrush压过Ahrefs一头。SEO老兵们,在AEO这个新战场上也要抢座次,多少有点黑色幽默。
三、模型有私心,而且不装
数据里有个藏不住的现象:自荐偏差。Fable和Opus爱推Claude Code,Sol和Astra爱推Codex,Grok爱Cursor,Muse爱自家Muse Code——每家模型都在给自家生态导流,这很难说是巧合。
有意思的是例外:GPT系的模型多次推荐竞品Claude,作者专门表扬这是”值得称赞的无偏见”。你品品——当”不偏心”变成需要专门表扬的稀罕事,这本身就说明了问题。将来AEO咨询行业大概率会分化出一支”反偏差优化”业务,我先把话放这。
还有更值得投了AEO的创业公司注意的:代际翻转。同一个实验室,Sol升级到Astra、Opus升级到Fable之后,产品推荐出现了”非常关键的翻转”。你去年针对老模型做的优化,新模型上来可能直接清零。每次大模型换代,都是一次重新洗牌。
四、最意外的发现:模型越自信,赢家通吃越狠
这是整份数据里我认为最值钱的发现。对比两代模型的搜索行为:
| 模型换代 | 搜索来源中位数 | 变化 |
|---|---|---|
| Sol → Astra | 9个 → 5个 | -44% |
| Opus → Fable | 11个 → 15个 | +36% |
GPT-6 Astra不只搜得少,被轻度改写问题后推荐结果几乎不变——更”高效”,也更”固执”。
这意味着什么?当模型的选择随机性下降,被推荐产品的赢家通吃效应就越强。以前模型多看几个来源,第5名好歹能混个”陪跑”;现在Astra只看5个来源就拍板,没进短名单的产品,连露脸的机会都没有了。
SEO时代谷歌给你十条蓝链接,排第8名还有流量;Agent时代它只报1个首选加2个备选。100%和0%的差距,不是排名差距,是有无之分。
五、161类里只有28个”霸主”,剩下的全是窗口
别被上面的100%吓到,反过来看更有意思:161个品类里,只有28类存在全模型一致的首选。也就是说,剩下130多个品类还处在势均力敌的混战状态——没有谁锁定胜局。
这就是2026版的”SEO黄金时代”窗口。当年在谷歌算法早期卡住位置的站点吃到了十年红利,现在AEO的早期窗口就摆在130多个类目面前。谁先成为这些品类里模型认可的”标准答案”,谁就锁定了下一代的分发入口。
六、给工具站和开发者的3条实操建议
重点来了。文章里有个对我们这种AI工具站性命攸关的判断:模型推荐强依赖可抓取的结构化markdown内容和权威信源。Ora和Vercel实测过的AEO手段(比如markdown content-negotiation)被证实真实有效;反过来,内容抓取失败会让模型直接放弃读你的站点。翻译一下:导航站的传统价值(收录全、更新快)会被”模型直答”截流,但”被Agent引用”是新长出来的位置——Tracker数据里”top cited sources(高频引用来源)”这一层,就是测评站的新座位。
基于此给3条能落地的建议:
官网和测评内容提供干净的markdown版本,部署llms.txt,关键页面别用纯JS渲染挡爬虫。每篇评测给出清晰的对比表格和明确的”首选/替代”结论。抓取失败等于直接出局,这一步做不好后面全白搭。
模型的推荐依赖权威信源,谁的内容结构清晰、评分规则透明、数据可复核,谁就更可能成为Agent回答时的引用来源。与其堆关键词,不如把每一篇测评都做成”模型愿意引用”的格式——标注测试方法、给出评分依据、保持更新日期。
优先在130多个还没有”全票霸主”的品类里建立存在感,这些赛道还没人锁定胜局。同时每次主流模型换代(比如Sol→Astra这种)后重新复查自己的AEO效果——代际翻转是真实存在的,老模型的推荐结果不能当成新模型的保证。
写在最后
这份Tracker本质上是对”模型即分销渠道“的第一次严肃测量。它真正吓人的地方不是PostgreSQL拿了100%,而是它揭示的趋势:AI的回答正在取代传统的”逛和比”,而模型的口味会随着换代越来越稳定、越来越固执。
对做产品的人,这是个残酷的信号——没进短名单,就出局。对做内容的人,这反而是十年一遇的窗口——Agent需要可引用的信源,而绝大多数网站还没开始准备。
窗口就在那130多个品类里。动作快点的,已经开始抢了。
· 完 ·
发表回复