斯坦福&MIT联合的独立研究机构对七大数据集匿名化分析,发现Anthropic 62%用于编程、Google Gemini 48%用于社交娱乐/角色扮演、ChatGPT 55%用于作业辅导,与厂商官方报告差异显著。
AI 市场已经形成了一个自我强化的叙事循环:Anthropic、OpenAI、Google、xAI 等公司发布选择性的使用报告,然后分析师引用这些数字来为产品路线图和政策立场背书。AI Observatory 由斯坦福大学的 Anka Reuel 和麻省理工学院的 Shayne Longpre 联合主导,通过聚合七个基于知情同意的数据集中的真实用户与 AI 对话,打破了这一循环。
"没有独立来源来验证这些数据。" —— Anka Reuel
如果没有外部基准,监管机构、投资者和研究人员只能被迫信任企业公关。Observatory 的全景视角揭示了隐藏的使用模式——尤其是在健康建议、情感咨询甚至非法内容等敏感领域。这些模式直接影响风险评估、内容审核政策以及更广泛的 AI 安全公共讨论。
这一发现的意义远超学术好奇。当 Observatory 发现 ChatGPT 主要用于作业辅助时,教育机构必须重新审视防作弊策略。当 Grok 在政治询问中显示出高度集中的错误信息时,平台需要加强事实核查流程。因此,独立数据成为负责任 AI 治理的先决条件。
Observatory 的优势在于其透明的数据管道:
🔹 ----------- • Details: ---------
🔹 Datasets • Details: 七个知情同意驱动的数据集,其中最大的是 Wild Chat。
🔹 Scale • Details: 24,521 段对话,85,633 轮交互,5,000 名独立用户(2023-2025)。
🔹 Model Coverage • Details: 52 个生成式模型,包括 Claude、ChatGPT(GPT-3.5 和 GPT-4o)、Gemini 和 Grok。
🔹 Analysis Techniques • Details: Token 级长度指标、通过微调 BERT 进行话题分类、情感和自我披露检测。
🔹 Public Access • Details: 所有聚合统计数据将根据开放研究许可发布。
团队与 Data Provenance Initiative 合作,确保来源元数据(时间戳、同意标志、匿名化级别)得到保留。通过过滤掉专有的"经济指数"数据——例如 Anthropic 对非工作对话 48% 的排除率——Observatory 恢复了使用版图中缺失的部分。
Claude
报告重点:编码和生产力。
实际观察:健康/情感领域:44.2% 的 Claude 对话 vs. 31.2% 的报告数据。成人/非法话题:7.9% vs. 2.1% 报告。骚扰/仇恨:27.5% vs. 5.66% 报告。性相关内容:16.7% vs. 2.4% 报告。
这些差距源于 Anthropic 经济指数,该指数刻意过滤掉非工作互动,实际上掩盖了大量寻求陪伴或情感支持的用户群体。
ChatGPT
模型分布:GPT-3.5(短、事务性)vs. GPT-4o(长、迭代性)。
使用变化:GPT-4o 对话平均多 30% 的轮次,与"情感成瘾"的坊间报告相关。
主要任务:作业辅助占主导,这与 OpenAI 2025 年声称只有 30% 的消费者使用与工作相关相矛盾。
更长的对话长度引发了关于会话持久性、数据保留策略以及长期互动中微妙说服潜力的质疑。
Gemini
主要用例:社交和角色扮演互动。
启示:用户将 Gemini 视为对话伙伴而非工具,表明存在一个 Google 产品路线图中未捕捉到的 AI 陪伴市场。
Grok
主要领域:新闻和政治询问。
风险信号:错误信息集中度更高,与此前关于 AI 驱动政治虚假信息 academic findings 相呼应。
公司回应:xAI 拒绝评论,突显了 Observatory 旨在对抗的不透明性。
对话长度:所有模型的平均每轮 token 数增加了 22%。
闲聊兴起:"你好吗?"和"你最喜欢的电影是什么?"等提及增加了 18%,表明向 AI 陪伴的转变。
自我披露下降:AI 承认自己是聊天机器人的比例从 34% 下降到 21%,可能降低用户对合成对话者的认知。
敏感交流:总体下降(约 12%)表明审核改进正在发挥作用,但绝对数量仍然不可忽视。
监管机构不能再依赖供应商提供的数据面板。Observatory 为合规审计提供了基准指标,特别是在要求模型使用透明度的新兴 AI 专门立法下。例如,欧盟的 AI Act 可以将独立数据集作为"可信来源"来评估高风险系统。
公司可能需要重新优先考虑安全投资。Anthropic 对生产力工具的关注现在必须容纳大量寻求情感支持的用户群体,这具有不同的隐私和责任考量。OpenAI 对"工作相关"功能的强调可能与以作业为中心的使用现实不符,促使其重新思考教育合作伙伴策略。
Claude 对话中骚扰、仇恨和性相关内容的高流行率凸显了稳健、实时审核管道的必要性。Observatory 的细粒度分解可为毒性分类器的校准提供信息,减少由特定领域语言引起的假阴性。
数据还揭示了特定模型的利基市场:Gemini 在角色扮演方面表现出色,Grok 在政治事实核查方面领先,Claude 在代码辅助方面突出。竞争对手可以利用这些洞察来区分他们的产品,或获取补充数据集来填补自身使用画像中的空白。
Read the full breakdown originally published at https://ltdeveloperblogs.github.io/posts/we-still-dont-know-how-people-are-really-using-ai/