Tow Center 独立测评 8 款 AI 搜索工具,1600 次查询显示所有产品错误率均超 60%;Perplexity 免费版以 37% 错误率居首,但付费 Pro 版反而更常给出「自信的错误答案」。
最大规模的独立 AI 搜索引用准确率研究显示:即便领先者的错误率也超过了三分之一的回答。将这类工具用于工作场景,必须同时配备一套验证流程——单靠任何一方的准确率都不够用。
1600 次查询、八款工具、每款 200 次测试。这是 Tow Center for Digital Journalism 的测试方法论——也是目前公开发表过的规模最大的独立引用准确率测评。八款产品的综合结果:错误回答占比超过 60%。最差的是 Grok-3,错误率 94%。最佳是免费版 Perplexity,37%。赢家都还有三分之一的错误引用——这是系统级的风险,任何想把 AI 搜索作为主要事实核查工具的人都无法回避。
数据随后开始与直觉相悖。按理说付费版应该比免费版更准——否则每个月 $20 是在买什么。但同一项研究中,Perplexity Pro 的出错率反而高于 free 版:付费模型更少拒绝回答,更频繁地给出自信但错误的答案,而非诚实地说"不知道"。研究人员将此描述为"自信与准确之间的权衡"——产品花钱买来的自信,反而在应该放弃回答的地方积累更多错误。
研究合著者 Claudia Jażwińska 的表述很直接:"Collectively, they provided incorrect answers to more than 60 percent of queries"——八款测试聊天机器人合计在超过 60% 的查询中给出了错误回答,Nieman Lab 报道。这是反驳"AI 搜索比聊天更准"这一理念的最有力论据:具体产品之间的差距(37% 对 94%)远大于搜索类与聊天类之间的差异。准确率取决于具体实现;仅凭它是搜索引擎还是聊天机器人,几乎无法预测其表现。
技术机制确实存在影响,只是它运行的位置通常不在人们寻找的地方。在 Claude 的网络工具中,引用始终开启,并包含 cited_text——从搜索页面中逐字摘录最多 150 个字符,严格绑定到具体 URL,详见 Anthropic 官方文档。这不保证回答的事实准确性,但保证了引用在技术上不可能脱离真实文本片段——模型必须引用它真正找到的内容,而非对自身知识的重新表述。
同时,Claude 默认情况下选择性地进行网络搜索——用于新闻、价格、统计以及可能已发生变化的人物和机构信息,而对既定事实直接回答,无需联网。架构上这是聊天加可选搜索:网络由模型判断何时接入。Perplexity 的设计正好相反——搜索是任何回答前的强制第一步。架构差异确实存在,只是目前还没有在同等的受控测试中独立测量过 Claude——Tow Center 的研究根本没有纳入它,测试的仅是 2025 年 3 月版本的 ChatGPT Search 和 Perplexity。

Perplexity CEO 兼联合创始人 Aravind Srinivas 公开将引用称为产品的"货币":"Citations are our currency",他在 2024 年接受 Fast Company 采访时回应剽窃指控时如是说。同一次采访中,他承认内容聚合功能存在"粗糙之处"(rough edges)——这一承认的具体背景由 Forbes 记录在案:调查发现一个案例,Perplexity 引用了一篇 AI 生成的内容,其中几乎逐字重复了 Forbes 关于前 Google CEO Eric Schmidt 报道中的表述。这只是 2024 年中期的一个有文档记录的单例,发生在公司宣布修复之前;无法评估其系统性的发生频率,但也不应过早将低质量来源的引用问题一笔勾销。
独立评论者 Binis 在 Medium 上发布的评测中,用 13 个学术查询对两款工具进行了一周测试,结果 ChatGPT 13 次查询中出现了 3 次虚构引用,而 Perplexity 同一样本中为零。他的结论比数字更诚实:"Always verify every source independently — even with Perplexity"。13 次查询来自同一个人——不是对照研究,直接将这个数字与 Tow Center 的 37% 进行比较是不合理的。但方向与大规模测试一致:Perplexity 在虚构引用频率上稳定优于 ChatGPT,只是小规模测试中差距的戏剧性远大于对照测试。
还存在另一种标准构建的排名——以回答对人类的友好程度为依据。独立众包平台 LMArena Search Arena 收集了 2025 年 3 月 18 日至 4 月 13 日期间的 7000 条用户投票,结果 Perplexity Sonar-Reasoning-Pro-High(1136 分)与 Gemini-2.5-Pro-Grounding(1142 分)统计持平,OpenAI 网络搜索模型明显领先;前四名被 Perplexity 占据。Perplexity 本人在博客中将此作为主导地位的证明,同时引用自家基准 SimpleQA 的 F-score 0.858 对比基础模型的 0.773——这是厂商在自己选择的测试上生成的数字,与其当作营销材料附数字,不如诚实看待。重要的是理解方法论的差异:Arena 测量的是哪个回答更受人类喜爱,而非引用是否与来源相符。这是不同的标准,在营销材料中容易被粘合成一个结论。
两款工具的分歧还体现在素材来源上。GEO 公司 Averi 引用 Profound 的数据指出:在 6.8 亿次分析的引用中,只有 11% 的域名同时出现在 ChatGPT 和 Perplexity 的引用中。ChatGPT 在 47.9% 的顶级引用中依赖 Wikipedia,Perplexity 在 46.7% 上依赖 Reddit。这是供应商服务的 AI 可见性营销刊物,天然有强调差异的商业动机,数据来自第三方供应商——应谨慎参考。但两款工具系统性地从互联网不同层面获取内容这一事实,解释了他们对同一查询的回答为何早在来源索引层面就已分歧,更别提模型"智能"层面的差异了。
所有这些的实践结论:决策的成本已不在钱上。Perplexity Pro 和 ChatGPT Plus 价格相同——每月 $20(或每年 $200),独立价格追踪机构 Finout(Perplexity)和 CometAPI(ChatGPT)均确认了这一点——两个数字均通过第三方来源收集,因为官方定价页面在检查时返回了访问错误,下决定前仍然值得核实一下。在价格持平的情况下,按预算选择 Perplexity 或 ChatGPT 没有意义——选择标准应该是任务类型。
如果你在开发并希望将同一测试查询通过多个具有网络访问权限的模型运行,而不想同时打开三个标签页并分别登录,更实用的方式是通过统一的 OpenAI 兼容 API 访问——在那里切换模型只需在请求中改个名字,无需为每个供应商协议重写客户端;provod.ai 就是这样实现的。而如果犹豫的真正原因是不想同时承担两个 $20 的固定订阅,而两款工具在引用错误率上其实相当,一个合理的替代方案是使用按量付费的工作空间,以卢布控制支出,而不是两个"以防万一"的并行订阅。

包括测试冠军在内的任何工具,都不适合作为未经核实的引用来源。工作时协议如下:
从回答中提取 3–5 条直接引用——不是转述,而是带引号的片段或带链接的内容。
手动打开每个页面,不信赖界面中的预览。
核对:论断确实存在于页面中——无论是逐字还是按原意,不许自行发挥。
单独标注那些引用的是转述原始来源但未注明原始来源的材料——这是间接引用,不是原始事实。
如果五项检查中至少一项失败,整个回答视为草稿,而非已完成的 facts。
在最佳工具错误率 37%、总体超过 60% 的情况下,这五分钟仍是防止以自己名义发布他人幻觉的最低防护。