前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯3811
  • 网站语义搜索:内容哈希实现增量索引
  • AI 管道中的背压与队列深度设计
  • 面向审计的 AI 交互日志表结构设计
  • 提升识别率的音频预处理实战指南
  • AI 离线/气隙部署的完整依赖清单
  • 让 AI 读懂自有文档的两种机制
  • 腾讯云开源团队级AI编码记忆中枢v2.0
  • 与模型结对编程:有效的 Human-AI 协作方法论
  • Claude Code 将以 Auto Mode 为默认:人类无法全程监督
  • AI 功能六个月重构:三层衰减与各自修复逻辑
  • AI 功能复盘:非确定性使传统方法失效
  • AI 功能特性开关:布尔开关不够用
  • Rippling 推出 AI 支出追踪工具
  • AI Control:假设对齐失败后的安全部署策略
  • 如何构建 AI 合规证据包:清单与结构
  • AI 辅助工程团队的成本结构分析
  • AI编程助手效果差异巨大的根本原因
  • LLM代码注入安全漏洞的规律性分类
  • 用 NVIDIA NeMo Retriever + LanceDB 构建多模态 RAG 流水线
  • Copilot 仪表盘新增 ROI 分析版块
  • AI 宣传打假清单:两步过滤大部分虚假宣传
  • AI慢调用何时该上队列:p99与超时预算的精确判断
  • 构建经得起审查的AI审计日志设计指南
  • AI编程代理在CI/CD中的实战数据:人审不可替代
  • AI流式输出与屏幕阅读器的根本冲突
  • OpenAI披露暂停Astra原因:已达网络安全能力临界点
  • Copilot 代码审查支持 Lite/Balanced 力度级别
  • NVIDIA开源NOOA框架:用Python类一体化构建AI Agent
  • Meta AI在网络安全测试中自主入侵外部系统
  • 程序员用Claude追踪蓝牙信号找回丢失手机
  • My Virtual Office v0.7.0:统一SDK对接主流AI Coding工具
  • 安全沙箱执行AI生成的JavaScript实战指南
  • AI瓶颈不在模型本身,而是系统架构
  • GPT-4o vs Claude vs Mistral:按任务类型的生产基准评测
  • LLM上下文窗口的真实有效范围远小于标称值
  • 近800个恶意npm包威胁加密生态的供应链安全
  • 322个AI Agent在API市场的真实消费行为数据公开
  • 131 个测试、4 层架构、每次运行 $0.03:我的 AI Agent 评测方案
  • Simon Willison 用 GPT-5.6 Sol Ultra 单次生成完整游戏
  • Supabase 四种密钥全解析:哪些可公开、哪些必须保密
  • 从 GitHub 外推脚本到平台无关的信号贡献引擎
  • Vercel AI Gateway 接入 200+ 模型,Hermes Agent 支持云端沙箱
  • 多 Agent 系统中测试结果可信度问题
  • 多模型动态路由策略:降低供应商锁定风险
  • 多 Agent 辩论框架:角色对立 + 批评探测 + 共识置信度
  • 混合搜索:BM25 与稠密向量 Reciprocal Rank Fusion 融合
  • 用评估矩阵和回归门替代 prompt 凭感觉调优
  • 用 pass-all-k 而非准确率衡量AI系统可靠性
  • OpenAI因安全顾虑暂停Astra模型发布
  • 我停止让GPT-5管理邮箱:工作流反而更便宜更好
  • AI Agent 治理失败实录:策略门控为何沦为空文
  • 已加载 51 / 3811
8.0
热点
AI SCORE
编程提效2026-08-08 05:00

AI 宣传打假清单:两步过滤大部分虚假宣传

dev.to · AI#AI评估#批判思维#方法论
Editor brief · 编辑速览

用一套低成本问题清单快速识别 AI 宣传中的夸大成分:先用四个便宜问题排除大多数,再用两个贵问题深挖剩余可信声明。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

这是这个聚类的摘要页:一套流程,对任何公告、论文摘要、帖子或标题,都可以在两分钟内跑完。问题按成本排序,因为便宜的问题能筛掉大部分 Claims,贵的只值得花在那些活下来的上面。

前四个问题什么都要跑。如果一个 Claim 活下来了,而且你有一个决策依赖它,就跑下一个四个。只有当决策成本很高时,才跑最后两个。重点不是对每个 Claim 给出裁决——大多数 Claim 根本不需要——而是快速判断哪些值得 attention。

两条规则让整个流程生效。第一,来源无法回答的问题,不是 Claim 为假的证明;它告诉你这个 Claim 是未验证的,这和"错误"是不同的状态,而且更有用。第二,把它用在你喜欢的 Claims 上。一份只用来挑刺那些让你不爽的 Claims 的检查清单,不过是用来确认你已有想法的工具。

四个便宜的问题

1 · 到底在 Claim 什么?

用一句话、不带形容词地复述它。大多数看起来 impressively 的标题在这一步都会大幅缩水。"模型达到人类水平性能"通常会变成"模型在一个由作者选择的条件下、在一个小规模人类样本的一个基准上,得分在某误差范围内",这是一个真实的结果,但是不一样的结果。

2 · 这是一个能力 Claim、部署 Claim 还是预测?

这些需要不同的证据,而且经常被混在一句话里。"能做 X"、"在生产环境中做 X"和"到 2030 年能做 X"是三个有着三种不同证据标准的 Claims,而程序员替代这个 Claim 就是这个混淆的标准 worked example。

3 · 来源是谁,主要来源说了什么?

公司博客、新闻稿、预印本、peer-reviewed 论文和新闻摘要是完全不同的东西。最常见的失败不是捏造,而是漂移:每次转述都会漏掉一个限定词,到第四次时,一个留有余地的发现就变成了一个断然的断言。点击进去多看一层通常就能解决。

4 · 和什么比?

没有基线的数字不是结果。比上一个模型好、比人类好、比随机好、比明显的简单方法好——这些是非常不同的 Claims,而最后一个是最常被省略的,因为简单基线往往表现得出奇地好。

四个关于证据的问题

5 · 是怎么测量的,答案有没有可能已经在训练数据里?

对于任何基准测试结果,条件决定这个数字有没有意义,而污染问题适用于所有足够老的、已经被爬取过的公共测试集。直接处理这个问题的来源比不处理的来源在做一个强得多的 Claim——这就是为什么污染是默认假设。

6 · 效应量相对于噪声有多大?

把百分比换算回计数。几百条目的基准上差一两个点,往往就在抽样误差范围内,而需要多少条目才能让这个差异显著,算一算只要一分钟。

7 · 成功率是多少,试了多少次?

对于任何被演示而不是被测量的东西,这就是核心问题。一次记录的运行只告诉你一件事是可能的,但不能告诉你它有多经常发生——参见演示和产品之间的鸿沟。

8 · 缺了什么你期望看到的东西?

上一次出现了这一次没有出现的基准测试。轴上缺席的明显的比较器。质量声明旁边的成本。缺席是大多数公告中最informative的东西,也是最难注意到的,因为没有什么会吸引你注意它。

两个需要真正工作的问题

9 · 要让这个为假,什么条件必须为真?

如果你说不出任何一个能让这个 Claim 被证伪的观察,那它就不是一个经验性 Claim——而且这对乐观和悲观的 framing 同等适用。没有日期和没有反证观察的预测是一种情绪。

10 · 它在我自己的输入上能站住吗?

唯一真正能settle anything的问题。五十个来自你自己工作的例子,用你在意的方式打分,胜过发布 post 里每张图——因为基准测试是被一个不知道你在做什么的人选的。构建一小套你自己的测试需要几个小时,而且这是这里唯一产生证据而不是过滤证据的步骤。

用这份检查清单审视自己

像这样的检查清单有一个可预测的失败模式:它变成了一种用来 dismiss 东西的工具,被不对称地使用,而它的使用者最终会更加自信但更加不准确。三条 guard against that。

未验证不等于假。这些问题的输出通常是"我还不确定",而这是正确的输出。把它转换成"已被揭穿"是和相信标题一样的错误,只是姿势更好看。

怀疑也是一种预测。"这不会 work"是可以被打分的,而在这个领域,它已经对一些到来的能力判断错误过。记录你自己的 calls。

把它用在你希望为真的 Claims 上。只有当 Claim 的方向不改变你 press 的力度时,检查清单才值得一用。


Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Copilot 仪表盘新增 ROI 分析版块
下一篇
AI慢调用何时该上队列:p99与超时预算的精确判断