人脸比对分数并非直接概率,实际判定取决于特征距离、阈值以及ROC曲线上的运行点。图像质量和使用场景会显著改变误接受率与误拒绝率,因此不能用固定分数直接给出身份结论。
为什么你的置信度分数一直在骗你
对于构建计算机视觉应用的开发者来说,“94% 匹配”是一种危险的抽象。在人脸比对和生物识别领域,我们处理的并不是简单的概率,而是高维特征向量之间的欧氏距离。如果你正在构建或接入人脸分析 API,那么能否理解原始相似度分数与“判定结果”之间的差异,将决定你做出来的是一个真正可用的工具,还是一个潜在的责任隐患。
从技术上讲,匹配分数完全取决于匹配阈值——也就是受试者工作特征(ROC)曲线上的工作点。作为开发者,我们经常在后端设置这些阈值,以平衡错误接受率(FAR)和错误拒绝率(FRR)。然而,NIST 最新的行业数据表明,这些阈值并非一成不变。同一种算法在处理清晰的高分辨率嫌犯照片与模糊、来自真实环境的监控画面时,产生的误报数量可能相差 100 倍。
从本质上看,大多数人脸比对技术——包括 CaraComp 背后的引擎——都依赖欧氏距离分析。我们将人脸关键点映射到一个向量空间中。所谓“匹配”,只不过是衡量这个空间中两个点彼此有多接近。
当调查人员看到 0.94 的分数时,往往会把它理解为确定性。但作为工程师,我们知道,这个分数取决于训练集,以及匹配之前执行的质量评估(QA)算法。
如果输入图像存在光线不足、姿态偏转角度过大或运动模糊等问题,提取出来的特征就会变得“嘈杂”。低质量图像上的高置信度分数,通常更可能意味着向量空间中发生了“碰撞”,而不是真正的生物学匹配。
这就是我们优先采用 1:1 人脸比对,而不是 1:N 大规模扫描的原因。通过这种方式,可以进行更可控的欧氏距离分析:甚至在数学计算开始之前,就先仔细检查“探针”图像所处的环境和质量。
我们在计算机视觉领域面临的最大技术难题之一,是不同人口群体之间错误率存在差异。这不仅是一个社会问题,也是一个数据科学问题。
如果训练集中的某些人口群体占比过高,那么代表性不足群体在向量空间中的“簇”就会更加紧密,彼此之间也更难区分。这会导致这些群体中的不同个体获得更高的“匹配”分数。
对开发者来说,这意味着我们的 API 不应该只返回一个浮点数,还应该返回相关元数据:图像质量分数、使用的阈值,最好还要包含是否建议进行人工复核。
要构建可靠的调查技术,我们必须摆脱“黑盒”模型。在 CaraComp,我们专注于让企业级欧氏距离分析不再受限于每年 2,000 美元的高昂价格,同时强调人在回路(HITL)架构的重要性。
我们提供比对工具和可供法庭使用的报告,但最终确认必须始终由人工完成:由人对数学分析提供的线索进行手动核验。
对于独立调查人员和小型公司来说,这项技术能够提供与联邦机构同等级别的分析能力,但要正确实施它,必须具备开发者思维:把 AI 当作高速过滤器,而不是最终裁决者。
你目前是如何处理计算机视觉流水线中的误报率(FPR)的?你会向最终用户公开原始置信度阈值,还是将其抽象成简化的“匹配/不匹配”标签?
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。