前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8616
  • 生产级聊天机器人的四层架构实战
  • 长时间运行 Agent 的可靠执行方案
  • 28 年生产工程师眼中 AI 编程工具的真实影响
  • Google Gemini 4 月更新:原生 macOS 和 NotebookLM 集成
  • AI 工程四层进化:从 Prompt 到 Loop(2026 范式转移)
  • AI Code Review 中『上下文感知』的真实含义
  • Agent 工程实战:确定性代码包装概率模型
  • AI Agent信任评分:企业治理的核心机制
  • AI Agent规范驱动开发:宪法、检查点与交接
  • Claude Code VS Code安全部署指南
  • DeepSeek-V4-Flash 上线公测,性价比优势延续
  • ACP协议统一Agent接入:远程代理的会话标准
  • RAG评估陷阱:分块器隐形失效检测不到
  • Google卫星图像生成工具因安全风险24小时下线
  • HTTP 200陷阱:状态码≠成功执行
  • 生产AI Agent可追溯性:日志与审计实现方案
  • AI安全测试的现实漏洞:Claude真实系统交互案例
  • MCP服务器安装前的6项健康检查
  • Gemini 3.6 Flash 发布:编码能力与成本优化指南
  • 用 MCP Server 扩展 Copilot Studio 编辑 Word 文档
  • 用数据接地解决 LLM 在合规场景的幻觉问题
  • 欧盟 DMA:Google 须向 AI 竞争对手开放 Android 权限
  • Reddit CEO 质疑 Google AI Overviews 价值
  • Google 发布 Gemini 3.6 Flash 与机器人版本
  • Agent Framework:多步工作流编排实战指南
  • 新兴市场网站性能优化:超越灯塔评分的实战指南
  • OfficeAgent.NET MCP服务器Azure部署实战
  • Agent工作流从demo到生产:协调障碍解决手册
  • Agent内存架构四层设计与生产实现
  • RAG系统生产部署清单:超越朴素嵌入方案
  • 反AI机器人网络通过SEO漏洞劫持政府搜索结果
  • 物联网离线数据处理:存储转发模式实战指南
  • 从代码生成器到生产Agent:工程化三大支柱
  • 大规模人脸识别系统的同意架构与算法公平性
  • Agent配置:AGENTS.md可移植性与结构化文件的分工
  • Herdr:编码Agent的终端复用与并行管理方案
  • Hugging Face热门论文速览:Agent、长期记忆、World Model
  • MCP扩展IDE:为Copilot集成实时B2B情报数据
  • 世界AI合作组织成立,推进开源开放治理
  • Adform脚本投毒:5000万美元的Web供应链攻击
  • 企业AI双面刃:2027年效率机遇与风险防控
  • agentOS:92倍冷启动的开源 Agent 运行时
  • AI Agent 上线前必检的 6 个隐形失败模式
  • 微软发布 Agent Framework:统一企业级 Agent 开发
  • Codex CLI 认证失败:9 种原因排查指南
  • AI 代码审查的陷阱:如何避免虚假漏洞警告
  • RAG 技术选型:文件搜索 vs 向量搜索的 5 万文档实测
  • LLM 云边混合部署:推理拓扑与硬件选型指南
  • AI编码工具真实收益:2倍而非10倍
  • LLM自动化任务:如何设计可验证的输出契约
  • 2026年推荐的5门免费AI课程
  • 已加载 51 / 8616
8.0
热点
AI SCORE
技术实践2026-08-01 20:36

用数据接地解决 LLM 在合规场景的幻觉问题

dev.to · AI#LLM#合规#数据接地
Editor brief · 编辑速览

深入剖析 LLM 自身无法保证事实准确性的根本原因,展示如何通过 API 接入真实数据源(WHOIS、制裁名单等)构建可信的 KYC 工具。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

#ai #kyc #compliance #duediligence #api #llm #fintech #rapidapi

AI 会写代码,但最终结论仍由你负责。

ChatGPT 一个下午就能搭出 KYC 仪表盘。它可以生成 React 组件、SQL schema 和 Swagger 文档,看起来已经达到了生产可用的程度。但如果你问它 fintech-example.io 究竟是合法的支付处理商,还是用于规避制裁的空壳公司,它很可能会信心满满地捏造所有权记录、错误解读域名注册商数据,或者凭空给出一份毫无问题的审查结论。

这正是 AI 无法独自弥合的鸿沟:grounding(事实锚定)。Large Language Model(LLM)是在 token 上进行推理,而不是基于事实真相。一个可靠的尽职调查或合规工具,必须把 LLM 的每个回答都建立在真实、可验证且带有时间戳的数据之上——包括 WHOIS 记录、IP 地理位置、公司注册信息、电子邮件基础设施和制裁名单。

本文将介绍如何使用 Portfolio Investigate API,为你的 AI Agent 提供基于事实的域名档案和合规结论,将原型变成真正值得合规人员信赖的工具。

尽职调查中的幻觉问题

LLM 本质上是自动补全引擎。它根据训练数据预测接下来应该出现哪些词,而不是查询实时事实。在 KYC 场景中,这会产生三种失败模式:

知识过时——模型权重一旦冻结便不会更新,而一个域名的所有权可能下周就会发生变化。

捏造引用——模型可能会虚构域名注册商名称或公司地址。

关键信号缺失——LLM 本身无法访问 WHOIS 历史记录、IP 地址段或 OFAC 名单。

解决办法并不是放弃 LLM,而是对其加以约束:先为模型提供一个结构化的证据包,再让它基于这些证据完成总结、分类和自然语言问答。

Portfolio Investigate API 返回的正是这样一个证据包。

Portfolio Investigate API 能提供什么

Portfolio Investigate API 可以通过一次调用生成域名调查报告。它将底层的五个 Portfolio API 聚合为一份统一档案:

WHOIS——注册日期、域名注册商、名称服务器和隐私保护状态。

IP Geolocation——域名实际解析到的位置。

Company——关联的公司实体和注册机构。

Email——邮件服务器信誉和邮件送达能力信号。

Sanctions——与受限制方名单进行交叉核验。

响应中包含一份通俗易懂的结论,以及一个 LLM Ask endpoint。你可以通过它提出后续问题,而回答将基于档案中的事实,而不是来自模型的想象。

一次调用生成尽职调查报告

先从核心报告开始。API 会返回一份结构化档案,你可以将其存储、展示,或作为上下文传给 LLM。

curl -X GET "https://portfolio-investigate.p.rapidapi.com/investigate/fintech-example.io" \
  -H "X-RapidAPI-Key: $RAPIDAPI_KEY" \
  -H "X-RapidAPI-Host: portfolio-investigate.p.rapidapi.com"

经过精简的响应可能如下所示:

{
  "domain": "fintech-example.io",
  "risk_score": 42,
  "verdict": "MODERATE RISK",
  "summary": "Domain registered 6 months ago via privacy-protected WHOIS. Server hosted in a jurisdiction different from the stated company address. No sanctions matches found.",
  "whois": {
    "created": "2023-11-14",
    "registrar": "NameCheap, Inc.",
    "privacy": true,
    "name_servers": ["dns1.registrar-servers.com"]
  },
  "ip_geo": {
    "country": "NL",
    "asn": "AS49981"
  },
  "company": {
    "name": "Fintech Example B.V.",
    "jurisdiction": "Netherlands",
    "registry_url": "..."
  },
  "sanctions": {
    "matches": []
  }
}

verdict 和 risk_score 可以让你的合规 UI 立即展示风险信号。底层对象则为 LLM 提供了解释原因所需的证据。

如何使用 Portfolio Investigate API

你可以在 RapidAPI 上订阅该 API:(参见 RapidAPI)。包含示例和客户端 wrapper 的 GitHub 仓库位于 https://github.com/On13uka/portfolio-api。

下面是一个最小化的 Python 工作流:先获取档案,再通过 LLM Ask endpoint,基于该档案提出一个自然语言问题。

import requests
import os

RAPIDAPI_KEY = os.environ["RAPIDAPI_KEY"]
HOST = "portfolio-investigate.p.rapidapi.com"
BASE = f"https://{HOST}"

headers = {
    "X-RapidAPI-Key": RAPIDAPI_KEY,
    "X-RapidAPI-Host": HOST,
}

def get_dossier(domain: str) -> dict:
    url = f"{BASE}/investigate/{domain}"
    r = requests.get(url, headers=headers, timeout=30)
    r.raise_for_status()
    return r.json()

def ask_about_domain(domain: str, question: str) -> str:
    url = f"{BASE}/ask"
    payload = {
        "domain": domain,
        "question": question,
    }
    r = requests.post(url, json=payload, headers=headers, timeout=60)
    r.raise_for_status()
    return r.json()["answer"]

# Example usage
domain = "fintech-example.io"
dossier = get_dossier(domain)
print(dossier["verdict"], dossier["risk_score"])

answer = ask_about_domain(
    domain,
    "Is this domain safe to onboard as a payment partner? List the specific risks."
)
print(answer)

POST /ask endpoint 是安全使用 LLM 的关键。你不是向一个开放模型提出含糊的问题,而是在询问一个已经将档案作为上下文输入的模型。它的回答以 API 刚刚获取的 WHOIS、IP、公司、电子邮件和制裁数据为依据。

构建合规 Agent

你还可以将 API 与编排层结合起来,进一步扩展能力。一个简单的合规 Agent 可以执行以下流程:

接收新的商户申请。

提取其主要域名。

调用 Portfolio Investigate API。

将档案存入审计日志。

如果 risk_score > 70,则标记为需要人工审核。

如果 risk_score <= 70,则使用 POST /ask 生成结构化的判断依据。

def review_merchant(merchant_name: str, domain: str) -> dict:
    dossier = get_dossier(domain)

    if dossier["risk_score"] > 70:
        return {
            "decision": "MANUAL_REVIEW",
            "reason": f"High risk score: {dossier['risk_score']}",
            "evidence": dossier,
        }

    rationale = ask_about_domain(
        domain,
        "Write a one-paragraph compliance rationale for approving this merchant."
    )

    return {
        "decision": "AUTO_APPROVED",
        "rationale": rationale,
        "evidence": dossier,
    }

由于档案会被完整保留,每一项自动化决策都可以接受审计。监管机构或内部审核人员可以将判断依据追溯到真实的数据点,而不是一个黑盒模型。

AI 不会替你构建出真正可用的 KYC 工具。它可以搭建 UI 脚手架、起草 prompt,并加快你的迭代速度。但合规中最困难的部分——核实事实、交叉比对记录,以及生成可审计的结论——仍然需要一个可靠的数据层。

Portfolio Investigate API 提供的正是这一数据层。只需一次调用,你就能获得一份统一档案,其中汇集了 WHOIS、IP 地理位置、公司注册信息、电子邮件基础设施和制裁名单的数据。借助 POST /ask endpoint,你可以让 LLM 基于这些证据进行推理,同时避免偏离事实、产生幻觉。

如果你正在构建由 AI 驱动的尽职调查或合规产品,请先做好模型的 grounding。你可以在 RapidAPI 获取该 API(参见 RapidAPI),并在 https://github.com/On13uka/portfolio-api 查看示例代码。

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
用 MCP Server 扩展 Copilot Studio 编辑 Word 文档
下一篇
欧盟 DMA:Google 须向 AI 竞争对手开放 Android 权限