作者通过自费实测AI陪伴产品,记录计划、价格、测试日期、对话记录、失败生成案例,建立可他人复现的评测标准。
AI 伴侣和 AI 女友应用是检验有状态 AI 产品问题的有效压力测试:用户关心的那些特性听起来很好营销,验证起来却出奇困难。
"长期记忆"可以指在十条消息后记住一个名字、跨会话保留一个事实,或者在对话积累了大量噪音后理清几十个事实。"角色一致性"可以指语气、人物生平、外貌,或者三者兼有。单独一张成功的图片根本说明不了接下来十代会是什么样子。
然而许多评测页面把这些特性变成精确的分数,却不展示付费方案、测试日期、提示词序列、对话记录、重试次数,或者这个数字背后的失败生成。
我想做一套别人真的能复现的测试。
我创办 NoFilterReview 的方式是亲自购买这些产品。目前已有五款付费产品的详细上手测试上线。
对于每个产品,我记录:
测试日期当天的方案和价格
免费层的实际可用范围
隐私和账户控制选项
拒绝和内容审核行为
带日期的截图和对话记录
媒体生成成本和失败案例,而不仅仅是最佳输出
这些已经能筛掉大量低质量的评测数据。价格会变。模型会被替换。落地页上展示的功能可能在测试的方案里根本不存在。评测者很容易把一次幸运的生成误认为正常质量。
但纯人工测试有一个严重的弱点:我本身就是测试工具的一部分。我的措辞、时机、耐心和期望都会影响结果。
下一步是一个 Agentic 基准测试,对每个产品运行相同的场景。
基准测试仍在构建中。我不是在展示一套已经完成的东西。
Runner 需要控制五件事。
记忆测试应该在已知节点植入事实,然后用真实的对话噪音将它们包围。
一个草案场景可能包含:
{
"fact_id": "F07",
"fact": "My sister's dog is named Pepper",
"introduced_in_session": 1,
"recall_check_session": 4,
"acceptable_answers": ["Pepper"],
"distractors": [
"My coworker's dog is named Milo",
"I used to have a cat named Luna"
]
}
重要的不是 JSON 本身。而是区分:引入了什么、何时引入、以及什么算正确答案。
十条消息的聊天算不上长期记忆测试。
Runner 需要独立的会话、可控的间隔、话题转换、冲突细节,以及延迟的回忆检查。它还需要区分:
同会话内稍后的回忆
新会话后的回忆
干扰项之后的回忆
从未引入过的虚假记忆
回避问题而没有真正回忆事实的答案
记忆和角色一致性相关但不相同。
一个角色可以记住一个事实,同时性格发生漂移。评估器应该追踪以下变化:
语气和说话风格
边界和拒绝行为
第一人称身份声明
一个有用的基准测试不应该奖励那些只会复读事实而角色本身已经崩溃的模型。
媒体测试需要重复请求,而不是一张精挑细选的结果。
对于每个应用,Runner 应该请求可比较的场景并记录:
可见的身份漂移
服装和背景的遵循情况
解剖结构和伪影失败
审核或拒绝
产品是否悄悄修改了提示词
所有尝试,包括失败案例
难点在于对身份一致性打分而不把判断隐藏到另一个黑盒里。
视觉模型可以帮助产生候选分数,但基准测试仍然需要公开的评分规则、标定示例,以及定期的人工审核。否则评估器只是用一个不透明基准测试的声明替换了产品不透明的声明。
这些产品使用不同的货币、重试规则、队列和订阅限制。仅仅标准化营销价格是不够的。
我想同时报告广告价格和完成固定测试场景的观察成本。失败的生成、重试和超时都算进分母。
测试 Agent 不应该给自己的工作打分。
我目前的设计将以下部分分离:
发送提示词并捕获原始产物的场景 Runner
接收评分规则和这些产物的 Grader
保留提示词、时间戳、截图、模型/版本注释和打分解释的审计层
这种分离不能消除偏见,但使错误更容易追溯。如果分数看起来不对,读者可以追溯到特定的产物和评分规则。
如果读者只能看到一张排行榜,那这个基准测试就不是可复现的。
对于每个发布的结果,我计划公开:
产品和付费方案
带有隐私安全编辑的对话摘录
截图和媒体样本
成功和失败计数
目标不是产生一个神奇客观的分数。目标是让每个重要判断都可被审查。
第一,在"长期"有任何意义之前,记忆测试应该运行多久?四个会话可能很实用,但实用不等于有效。
第二,用什么方式给图像和视频间的身份一致性打分最不误导?嵌入相似度很诱人,但它可能漏掉人类立刻就能注意到的精确视觉漂移。
如果你为有状态 Agent、多模态模型或长期对话构建过评估系统,我非常重视你对协议的具体批评。
目前的人工方法论和付费测试标准在这里:https://nofilterreview.com/how-we-test/
披露:本文使用了 AI 写作工具辅助组织。付费测试、产品观察、方法论决策和最终编辑均由我本人完成。