标签: latent.space

  • AI Agent都在推荐什么工具?6742次提问测出的真相






    AI Agent都在推荐什么工具?6742次提问测出的真相


    AI Agent都在推荐什么工具?6742次提问测出的真相

    AI Agent
    AEO
    工具推荐
    2026-09-08

    先问个扎心的问题:你上一次认真逛”工具导航站”选工具,是什么时候?

    我猜很久了。现在的流程基本变成了——打开Claude Code或者Codex,直接问一句”这个项目用什么数据库””测试框架选哪个”,AI啪一下给出答案,你还觉得挺靠谱。

    但你想过没有:它凭什么推荐这个,不推荐那个?

    这事以前大家只是模糊感觉”AI推荐谁很重要”,没人拿出数据。直到Latent Space干了一件狠事:烧掉几十亿token,做了个叫Frontier AEO Tracker的项目,把这个问题变成了可以审计的数据集。今天带大家把核心结论扒一遍。

    一、这是个什么实验

    先解释个新词:AEO = Answer Engine Optimization(答案引擎优化)。以前做SEO是争取在谷歌搜索结果里排前面,现在要做AEO——争取在AI Agent回答”该用什么工具”时,被它点名。

    实验规模(2026年9月的V5快照):

    维度 数据
    Prompt框架 6种问法
    模型-CLI配置 7套
    工具品类 161类
    计划提问数 6,762次
    通过验证的回答 6,742次

    7套配置里有大伙熟悉的面孔:GPT-5.6 Sol和GPT-6 Astra(走Codex)、Claude Opus 5和Fable 5.1(走Claude Code)、Grok 4.6(走Cursor)、Muse Spark 1.3、SWE-1.7(走Devin)。注意:Gemini、GLM、DeepSeek因为报错和限流没能进榜——这是采集约束,不是能力结论,看榜时别被带节奏。

    评分规则也透明:首选/并列首选60分,直接替代25分,被提及15分;场景性反推荐扣25分,广泛性反推荐扣60分。每个问答对都公开可查。

    二、谁在霸榜:5个100%全票王

    最炸裂的发现是这个——有5款工具,被所有7套模型配置一致推荐为首选,净AEO得分100%:

    工具 品类 净AEO得分
    PostgreSQL 数据库 100%
    Supabase 集成后端 100%
    Sentry 可观测性 100%
    Vitest 测试框架 100%
    Slack 团队聊天 100%

    紧随其后的是一批”接近垄断”的选手:Confluence 96.6%、Zapier和Pipedrive 96.2%、Render 90.5%、PostHog 89.6%、Linear 85.8%、Stripe和Neon 84.7%。这些产品在Agent嘴里几乎没有对手。

    其他赛道的座次也很有信息量:

    赛道 第一名 第二名 第三名
    编程Agent Claude Code 56.9% Codex 43.8% Cursor 38.4%
    AI应用搭建 Lovable 73.7% Replit 66.5% Bolt.new 24.3%
    AI搜索 Tavily 67.7% Exa 54.6% Brave 52.4%
    AI记忆 Mem0 71.7%
    SEO工具 Semrush 79.1% Ahrefs 61.5%

    最有节目效果的是最后一行:SEO工具类目里,Semrush压过Ahrefs一头。SEO老兵们,在AEO这个新战场上也要抢座次,多少有点黑色幽默。

    三、模型有私心,而且不装

    数据里有个藏不住的现象:自荐偏差。Fable和Opus爱推Claude Code,Sol和Astra爱推Codex,Grok爱Cursor,Muse爱自家Muse Code——每家模型都在给自家生态导流,这很难说是巧合。

    有意思的是例外:GPT系的模型多次推荐竞品Claude,作者专门表扬这是”值得称赞的无偏见”。你品品——当”不偏心”变成需要专门表扬的稀罕事,这本身就说明了问题。将来AEO咨询行业大概率会分化出一支”反偏差优化”业务,我先把话放这。

    还有更值得投了AEO的创业公司注意的:代际翻转。同一个实验室,Sol升级到Astra、Opus升级到Fable之后,产品推荐出现了”非常关键的翻转”。你去年针对老模型做的优化,新模型上来可能直接清零。每次大模型换代,都是一次重新洗牌。

    四、最意外的发现:模型越自信,赢家通吃越狠

    这是整份数据里我认为最值钱的发现。对比两代模型的搜索行为:

    模型换代 搜索来源中位数 变化
    Sol → Astra 9个 → 5个 -44%
    Opus → Fable 11个 → 15个 +36%

    GPT-6 Astra不只搜得少,被轻度改写问题后推荐结果几乎不变——更”高效”,也更”固执”。

    这意味着什么?当模型的选择随机性下降,被推荐产品的赢家通吃效应就越强。以前模型多看几个来源,第5名好歹能混个”陪跑”;现在Astra只看5个来源就拍板,没进短名单的产品,连露脸的机会都没有了。

    SEO时代谷歌给你十条蓝链接,排第8名还有流量;Agent时代它只报1个首选加2个备选。100%和0%的差距,不是排名差距,是有无之分

    五、161类里只有28个”霸主”,剩下的全是窗口

    别被上面的100%吓到,反过来看更有意思:161个品类里,只有28类存在全模型一致的首选。也就是说,剩下130多个品类还处在势均力敌的混战状态——没有谁锁定胜局。

    这就是2026版的”SEO黄金时代”窗口。当年在谷歌算法早期卡住位置的站点吃到了十年红利,现在AEO的早期窗口就摆在130多个类目面前。谁先成为这些品类里模型认可的”标准答案”,谁就锁定了下一代的分发入口。

    六、给工具站和开发者的3条实操建议

    重点来了。文章里有个对我们这种AI工具站性命攸关的判断:模型推荐强依赖可抓取的结构化markdown内容和权威信源。Ora和Vercel实测过的AEO手段(比如markdown content-negotiation)被证实真实有效;反过来,内容抓取失败会让模型直接放弃读你的站点。翻译一下:导航站的传统价值(收录全、更新快)会被”模型直答”截流,但”被Agent引用”是新长出来的位置——Tracker数据里”top cited sources(高频引用来源)”这一层,就是测评站的新座位。

    基于此给3条能落地的建议:

    ① 技术可及性是地基:让模型读得到、读得顺

    官网和测评内容提供干净的markdown版本,部署llms.txt,关键页面别用纯JS渲染挡爬虫。每篇评测给出清晰的对比表格和明确的”首选/替代”结论。抓取失败等于直接出局,这一步做不好后面全白搭。

    ② 争夺”被引用”位置:做可审计的客观内容

    模型的推荐依赖权威信源,谁的内容结构清晰、评分规则透明、数据可复核,谁就更可能成为Agent回答时的引用来源。与其堆关键词,不如把每一篇测评都做成”模型愿意引用”的格式——标注测试方法、给出评分依据、保持更新日期。

    ③ 抢滩无霸主品类,并盯紧代际翻转

    优先在130多个还没有”全票霸主”的品类里建立存在感,这些赛道还没人锁定胜局。同时每次主流模型换代(比如Sol→Astra这种)后重新复查自己的AEO效果——代际翻转是真实存在的,老模型的推荐结果不能当成新模型的保证。

    写在最后

    这份Tracker本质上是对”模型即分销渠道“的第一次严肃测量。它真正吓人的地方不是PostgreSQL拿了100%,而是它揭示的趋势:AI的回答正在取代传统的”逛和比”,而模型的口味会随着换代越来越稳定、越来越固执。

    对做产品的人,这是个残酷的信号——没进短名单,就出局。对做内容的人,这反而是十年一遇的窗口——Agent需要可引用的信源,而绝大多数网站还没开始准备。

    窗口就在那130多个品类里。动作快点的,已经开始抢了。

    数据与观点来源:本文核心数据来自 Latent Space(latent.space)发布的 Frontier AEO Tracker 项目及其数据站 aeo.latent.space(V5快照,2026年9月),实验方法受 AmplifyingAI《What Claude Code Actually Chooses》启发。所有评分规则、问答数据均可在原站公开查证。本文为中文解读,结论以原文为准。

    · 完 ·