前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库AI 开发面试题第 2 页
面试知识索引 · 分类、标签与搜索

AI 开发面试题,262 道完整答案

AI 开发面试题第 2 页,显示第 51–100 题,共找到 262 道完整解析,可继续按分类、标签与关键词缩小范围。

262筛选结果
52技术分类
178检索标签
6索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

清除全部筛选
题库检索
技术分类52 个
全部分类5000AI 开发262AI Agent511浏览器301JavaScript285React281CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
AI 开发 标签25 个
向量检索59向量与嵌入47RAG41知识库数据37AI 评测36模型与应用评测36RAG 检索31微调与数据31大模型基础29Prompt28提示与上下文设计27多模态应用24安全11离线应用11测试9
查看其余 10 个标签
性能优化5可观测性4构建工具4缓存4工具调用3Agent 记忆2容器化1数据库事务1流处理1路由1
当前页02 / 6

正在显示第 51–100 题

AI 开发50
第 2 页

本页面试问题

按稳定语义路径排序

  1. 0051
    AI 开发模型与应用评测

    越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗?

    围绕“越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须主张分开报告攻击成功率、误伤率和功能保持率,避免安全加固被平均指标抵消。

    核心关键词越狱鲁棒性 对抗评测 准确率 离线边界
    #模型与应用评测#AI 评测#离线应用
  2. 0052
    AI 开发模型与应用评测

    Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因?

    围绕“Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须包括计划、工具参数、返回观察、重试与终止状态,并区分最终成败与过程合规。

    核心关键词Agent评测 工具调用 轨迹记录 失败诊断
    #模型与应用评测#工具调用#AI 评测
  3. 0053
    AI 开发模型与应用评测

    上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚?

    围绕“上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须把低 kappa 归因到类别定义、边界样本或标注者训练,并说明是否继续放量标注。

    核心关键词标注指南 Cohen kappa Fleiss kappa 标注一致性
    #模型与应用评测#AI 评测
  4. 0054
    AI 开发模型与应用评测

    摘要生成离线评测为什么不能只凭 BLEU 或 ROUGE 判定上线?

    本题解析 BLEU/ROUGE 在摘要评测中的本质局限,说明其对同义改写、事实错误和流畅性的盲区,并给出与人工侧写互补的最小设计。

    核心关键词BLEU ROUGE 生成评测 人工相关性 局限性
    #模型与应用评测#AI 评测#离线应用
  5. 0055
    AI 开发模型与应用评测

    风控概率输出部署前为什么既要看区分度也要看 Brier 分数和校准曲线?

    本问题讨论风险概率输出为何不能只看排序指标;区分度与校准是两个维度。通过Brier分数和校准曲线发现概率绝对值系统偏移,对定价和限额的影响;并给出具体工程场景和边界条件。

    核心关键词概率校准 Brier分数 reliability曲线 风控模型评估
    #模型与应用评测#AI 评测
  6. 0056
    AI 开发模型与应用评测

    怎样把混淆矩阵转换成可比较不同模型的期望误分类成本?

    本题解释混淆矩阵如何通过乘以误分类成本转换为期望成本,并考虑类别先验变化进行重加权,用于模型比较,强调成本不对称性和先验调整。

    核心关键词混淆矩阵 期望成本 误分类代价 模型评估
    #模型与应用评测#AI 评测
  7. 0057
    AI 开发模型与应用评测

    团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检?

    围绕“团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按变更风险路由到不同评测层级,并说明全量集抽样刷新与人工抽检比例。

    核心关键词评测预算 CI分层 smoke test 人工抽检
    #模型与应用评测#AI 评测#路由
  8. 0058
    AI 开发模型与应用评测

    招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释?

    围绕“招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明群体通过率平等与合格组召回平等通常不可兼得,并落到受保护属性、基准率和决策后果。

    核心关键词公平性 demographic parity equal opportunity 评测解释
    #模型与应用评测#AI 评测
  9. 0059
    AI 开发模型与应用评测

    特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏?

    围绕“特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用特征可得时间、快照表和因果链审查特征,并区分合法滞后特征与结算后字段。

    核心关键词特征泄漏 未来信息 标签泄漏 point-in-time
    #模型与应用评测#AI 评测
  10. 0060
    AI 开发模型与应用评测

    为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本?

    围绕“为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释反复看同一套样例导致的评测过拟合,并给出可见/隐藏集合的更新纪律。

    核心关键词金标集 隐藏测试集 过拟合防护 prompt迭代
    #模型与应用评测#Prompt#AI 评测
  11. 0061
    AI 开发模型与应用评测

    开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分?

    围绕“开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须拆分支持证据充足性、答案可验证性和 abstention 成本,避免高拒答率拿高分。

    核心关键词事实性评测 幻觉 拒答计分 开放问答
    #模型与应用评测#AI 评测
  12. 0062
    AI 开发模型与应用评测

    类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1?

    围绕“类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明少数类是否会被样本量多数类淹没,并说明宏/微平均各自对应的业务损失。

    核心关键词类别不均衡 宏平均F1 微平均F1 评测指标
    #模型与应用评测#AI 评测
  13. 0063
    AI 开发模型与应用评测

    排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用?

    围绕“排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同次展示混合两模型可降低用户方差,但受位置展示和不可混合约束限制。

    核心关键词interleaving 排序实验 在线评估 敏感性对比
    #模型与应用评测#AI 评测
  14. 0064
    AI 开发模型与应用评测

    多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率?

    围绕“多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别高资源语言占比拉高总分,并给低资源语言最低可接受门槛。

    核心关键词多语言评测 低资源偏差 语言分层 公平性
    #模型与应用评测#AI 评测
  15. 0065
    AI 开发模型与应用评测

    每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制?

    围绕“每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明重复窥视使名义 p 值失效,并采用预设 horizon、alpha spending 或始终有效区间。

    核心关键词多重比较 序贯检验 假阳性 控制策略
    #模型与应用评测#AI 评测
  16. 0066
    AI 开发模型与应用评测

    模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优?

    围绕“模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须由可接受业务退化定 delta,并报告单侧置信区间是否越界。

    核心关键词非劣效实验 等效性检验 margin 设定
    #模型与应用评测#AI 评测
  17. 0067
    AI 开发模型与应用评测

    离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本?

    围绕“离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较来源、意图、长度、语言、难度切片与线上日志,并说明重加权是否改变主结论。

    核心关键词离线评测集 代表性 流量分布 覆盖偏差
    #模型与应用评测#AI 评测#离线应用
  18. 0068
    AI 开发模型与应用评测

    离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位?

    围绕“离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须依次查样本分布、judge 与真实效用差异、延迟成本、交互入口变化和护栏退化。

    核心关键词离线在线不一致 指标错位 诊断流程
    #模型与应用评测#AI 评测#离线应用
  19. 0069
    AI 开发模型与应用评测

    多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率?

    围绕“多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明传递性、对手强度不同和置信区间对排名稳定性的影响。

    核心关键词成对偏好 Bradley-Terry Elo 模型排行 评测聚合
    #模型与应用评测#AI 评测
  20. 0070
    AI 开发模型与应用评测

    罕见事件检测为什么优先看 PR-AUC 而不是 ROC-AUC?

    本题说明ROC在极度不平衡下因负例基数过大导致FPR失真,用具体欺诈场景对比两种曲线差异,并指出PR-AUC的局限:依赖正例患病率,不可跨数据集比较,适合在离线选型时优先参考。

    核心关键词PR-AUC ROC-AUC 罕见事件 评测指标对比
    #模型与应用评测#AI 评测#离线应用
  21. 0071
    AI 开发模型与应用评测

    在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值?

    围绕“在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出以期望损失最小化定阈值的方法,并区分阈值优化与模型排序能力。

    核心关键词精确率 召回率 成本敏感 分类阈值 欺诈检测
    #模型与应用评测#AI 评测
  22. 0072
    AI 开发模型与应用评测

    程序化弱监督标签进入训练前需要估计哪些噪声参数?

    围绕“程序化弱监督标签进入训练前需要估计哪些噪声参数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须估计各标注源的覆盖率、准确率、相关性和极性冲突,并决定是否只用于训练不用于测试。

    核心关键词弱监督 程序化标注 标签噪声 评测参数估计
    #模型与应用评测#AI 评测#测试
  23. 0073
    AI 开发模型与应用评测

    同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性?

    围绕“同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用语义保持改写集报告均值、最差组和方差,而不是只报单 prompt 分数。

    核心关键词prompt敏感性 扰动鲁棒性 语义保持改写 评测
    #模型与应用评测#Prompt#AI 评测
  24. 0074
    AI 开发模型与应用评测

    RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率?

    围绕“RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须定位失败在检索召回、引用支撑还是生成推理三段之一,并说明端到端分数不可单独诊断。

    核心关键词RAG评测 context precision faithfulness 答案正确率
    #模型与应用评测#RAG#AI 评测
  25. 0075
    AI 开发模型与应用评测

    用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机?

    围绕“用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明处理泄漏和网络干扰会污染对照组,并用聚类稳健方差或更高层随机化。

    核心关键词随机化单位 用户级实验 集群随机 干扰偏差
    #模型与应用评测#AI 评测
  26. 0076
    AI 开发模型与应用评测

    回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型?

    围绕“回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须依据误差平方惩罚、绝对误差解释性和接近零爆炸边界选择,并说明是否改用 sMAPE/分位数损失。

    核心关键词MAE RMSE MAPE 回归评测 异常值 零值场景
    #模型与应用评测#AI 评测
  27. 0077
    AI 开发模型与应用评测

    搜索召回评测中 MRR、Recall@k 和 nDCG@k 分别适合什么目标边界?

    本题考查搜索召回评测中 MRR、Recall@k、nDCG@k 的目标边界。核心结论:MRR 是只取首个正解的倒排名,Recall@k 是覆盖度而非排序质量,nDCG@k 是多级相关性下的位置衰减分数。k 截断决定应用场景。

    核心关键词MRR Recall@k nDCG@k 检索排序 评测指标边界
    #模型与应用评测#AI 评测
  28. 0078
    AI 开发模型与应用评测

    安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率?

    围绕“安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须构造对抗集与良性近边界集并分别报告,避免只提高拒绝率显得更安全。

    核心关键词安全评测 过度拒答 over-refusal 有害请求拦截
    #模型与应用评测#AI 评测
  29. 0079
    AI 开发模型与应用评测

    实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么?

    围绕“实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须先检查随机化、埋点丢失、机器人过滤和资格后筛选,再谈指标结论。

    核心关键词样本比例失衡 SRM 分流偏差 诊断
    #模型与应用评测#AI 评测
  30. 0080
    AI 开发模型与应用评测

    BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量?

    围绕“BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别语义接近但事实相反、数字错误、漏关键约束等失败边界。

    核心关键词BERTScore 语义相似度 生成评测 高估事实性
    #模型与应用评测#AI 评测#向量检索
  31. 0081
    AI 开发模型与应用评测

    整体指标提升但关键行业切片变差时应怎样设计分层评测报告?

    围绕“整体指标提升但关键行业切片变差时应怎样设计分层评测报告”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须预先冻结切片维度并报告每片样本量、指标和置信区间,避免整体平均掩盖退化。

    核心关键词分层评测 数据切片 关键群体 回归诊断
    #模型与应用评测#AI 评测
  32. 0082
    AI 开发模型与应用评测

    需求预测或舆情分类做离线评估为什么不能随机切分时间样本?

    围绕“需求预测或舆情分类做离线评估为什么不能随机切分时间样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明未来特征、季节漂移和重复实体穿越切分点的风险,并给出滚动原点验证边界。

    核心关键词时间切分 数据泄漏 随机切分 离线评估
    #模型与应用评测#AI 评测#离线应用
  33. 0083
    AI 开发模型与应用评测

    大模型评测发现分数异常高时如何排查训练集与测试集污染?

    围绕“大模型评测发现分数异常高时如何排查训练集与测试集污染”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出 n-gram/嵌入近邻、答案串泄露和时间戳交叉的排查路径,并区分逐字重复与模板同构。

    核心关键词训练测试污染 数据泄漏 基准污染 去重
    #模型与应用评测#AI 评测#测试
  34. 0084
    AI 开发大模型基础

    为什么大语言模型做多步算术和长数字运算容易出错?

    围绕“为什么大语言模型做多步算术和长数字运算容易出错”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从 token 化破坏数字结构与无计算执行能力解释错误成因,给出工具外置方案。

    核心关键词LLM 算术能力弱 原因 为何出错
    #大模型基础
  35. 0085
    AI 开发大模型基础

    束搜索(beam search)和随机采样在文本生成上各适合什么场景?

    围绕“束搜索(beam search)和随机采样在文本生成上各适合什么场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要比较高置信度搜索的重复倾向与采样的多样性收益。

    核心关键词束搜索 与 随机采样 文本生成区别
    #大模型基础
  36. 0086
    AI 开发大模型基础

    让大模型先推理再作答(思维链)为什么能提升复杂题准确率,代价是什么?

    围绕“让大模型先推理再作答(思维链)为什么能提升复杂题准确率,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明中间推理步骤对多步任务的收益与 token 成本、错误传播风险。

    核心关键词思维链 权衡 生成质量与成本
    #大模型基础
  37. 0087
    AI 开发大模型基础

    为什么大模型用自信的语气陈述错误内容,语气能否作为可信度信号?

    围绕“为什么大模型用自信的语气陈述错误内容,语气能否作为可信度信号”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成流畅性与事实正确性解耦的原因及对产品设计的影响。

    核心关键词LLM 自信但错误 语气可信度
    #大模型基础
  38. 0088
    AI 开发大模型基础

    把全部资料塞进上下文和按需检索注入,面对大知识库应如何取舍?

    围绕“把全部资料塞进上下文和按需检索注入,面对大知识库应如何取舍”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从成本、延迟、召回准确率对比两种信息供给策略的适用规模。

    核心关键词长上下文 塞入资料 与 检索增强 取舍
    #大模型基础#RAG#安全
  39. 0089
    AI 开发大模型基础

    什么是大模型的上下文窗口,它如何限制一次请求能处理的内容?

    回答重点:上下文窗口同时约束输入与输出 token 总额,超过会产生 400 错误或停止生成;通过具体多轮对话场景说明历史、提示词和输出如何竞争有限空间,并解释溢出与精度衰减的边界。

    核心关键词LLM context window 上下文窗口 限制
    #大模型基础#Prompt
  40. 0090
    AI 开发大模型基础

    用大模型做文本分类时,如何保证输出只落在预定义标签集合内?

    围绕“用大模型做文本分类时,如何保证输出只落在预定义标签集合内”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要比较提示枚举、工具调用与受限采样在标签封闭性上的保障强度。

    核心关键词文本分类 枚举输出 约束解码
    #大模型基础#工具调用
  41. 0091
    AI 开发大模型基础

    少样本提示(few-shot)为什么能在不更新权重的情况下改变模型行为?

    围绕“少样本提示(few-shot)为什么能在不更新权重的情况下改变模型行为”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖解释示例作为条件分布引导的机制与示例选择的敏感性。

    核心关键词少样本学习 上下文学习 无需更新权重
    #大模型基础
  42. 0092
    AI 开发大模型基础

    什么是大模型幻觉,事实性幻觉和指令遵循失败是一回事吗?

    围绕“什么是大模型幻觉,事实性幻觉和指令遵循失败是一回事吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖区分与训练数据冲突的事实错误和无中生有,界定幻觉与通用错误的边界。

    核心关键词LLM hallucination 幻觉 类型
    #大模型基础
  43. 0093
    AI 开发大模型基础

    如何通过多次采样或自我一致性检查来发现大模型的幻觉输出?

    围绕“如何通过多次采样或自我一致性检查来发现大模型的幻觉输出”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明输出不一致作为不确定性信号的用法与局限。

    核心关键词幻觉检测 self-consistency 多次采样
    #大模型基础
  44. 0094
    AI 开发大模型基础

    大模型输出的 JSON 解析失败时,工程上有哪些修复与容错策略?

    围绕“大模型输出的 JSON 解析失败时,工程上有哪些修复与容错策略”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖列举截断补全、错误反馈重试、schema 重生成等策略的适用条件。

    核心关键词JSON 解析失败 工程修复 重试策略
    #大模型基础
  45. 0095
    AI 开发大模型基础

    大模型的知识截止日期对回答时效性问题意味着什么?

    围绕“大模型的知识截止日期对回答时效性问题意味着什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明模型对截止后事件无记忆的含义及工程上补充时效信息的方式。

    核心关键词知识截止 时效性 问答边界
    #大模型基础#Agent 记忆
  46. 0096
    AI 开发大模型基础

    大模型输出的 logits 是什么,如何从中解读模型对每个 token 的置信程度?

    logits 是对词表各 token 的未归一化得分,通过 softmax 转为概率,logprob 即其自然对数。本文从机制说明如何阅读单个 token logprob 并用于低置信度拦截,指出概率高不等于正确,不同模型与 temperature 下不可直接比较。

    核心关键词LLM logits logprobs 置信度
    #大模型基础
  47. 0097
    AI 开发大模型基础

    为什么大模型在长上下文中间位置的信息容易被忽略(lost in the middle)?

    本文解释lost in the middle现象的机制,即位置偏置导致中间信息召回下降,并通过一个RAG场景展示对策:将关键证据前置或后置,同时给出边界如超长多跳和指令冲突时的局限。

    核心关键词长上下文 中间信息丢失 lost in the middle
    #大模型基础#RAG#Prompt
  48. 0098
    AI 开发大模型基础

    max_tokens 参数控制的是什么,设置过小会导致什么问题?

    本题解释 max_tokens 参数如何控制输出长度,指出当输出达到上限时会被强制截断,stop_reason 返回 max_tokens 而非自然终止。通过具体场景说明截断导致 JSON 解析失败,并给出识别和处理方法,帮助开发者避免因参数过小引发应用错误。

    核心关键词max_tokens 最大输出长度 截断
    #大模型基础
  49. 0099
    AI 开发大模型基础

    为什么默认的大模型 API 调用不能访问实时网页、文件或执行动作?

    围绕“为什么默认的大模型 API 调用不能访问实时网页、文件或执行动作”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖澄清纯文本补全接口的无工具、无状态本质,区分模型能力与外挂系统能力。

    核心关键词LLM 能力边界 无法联网 无状态
    #大模型基础
  50. 0100
    AI 开发大模型基础

    为什么说大语言模型的本质是下一个 token 预测,概率是如何计算的?

    本题解释自回归生成中“下一个 token 预测”的机制:输入序列经 Transformer 后得到隐状态,经线性层产生 logits,再由 softmax 归一化为每个 token 的条件概率。结合具体解码场景说明如何选择 token,并指出采样策略、温度等都会改变最终输出但不改变基础概率的生成逻辑。

    核心关键词next token prediction 生成概率 softmax
    #大模型基础
上一页
1234…6
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致