前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库AI 工程 · 推理与成本面试题
面试知识索引 · 分类、标签与搜索

AI 工程 · 推理与成本面试题,37 道完整答案

AI 工程 · 推理与成本面试题第 1 页,显示第 1–37 题,共找到 37 道完整解析,可继续按分类、标签与关键词缩小范围。

37筛选结果
52技术分类
178检索标签
1索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

清除全部筛选
题库检索
技术分类52 个
全部分类5000AI 工程37AI Agent511浏览器301JavaScript285React281AI 开发262CSS240Node.js217TypeScript206Vue180前端工程化138
查看全部 52 个分类
React Native135操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
AI 工程 标签9 个
全部标签推理与成本37缓存7Prompt3并发编程3路由2Agent 记忆1安全1流处理1离线应用1
当前页01 / 1

正在显示第 1–37 题

AI 工程37
第 1 页

本页面试问题

按稳定语义路径排序

  1. 0001
    AI 工程推理与成本

    按月调用量增长时,API 计费与自建 GPU 推理的成本交叉点如何计算,需要考虑哪些隐性成本?

    围绕“按月调用量增长时,API 计费与自建 GPU 推理的成本交叉点如何计算,需要考虑哪些隐性成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出含利用率、运维与闲置成本的盈亏平衡计算框架。

    核心关键词API vs self-hosted LLM break-even cost analysis
    #推理与成本
  2. 0002
    AI 工程推理与成本

    LLM 推理服务中动态批处理(continuous batching)如何同时改善吞吐与延迟,什么时候反而会伤害尾延迟?

    围绕“LLM 推理服务中动态批处理(continuous batching)如何同时改善吞吐与延迟,什么时候反而会伤害尾延”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确批大小、调度粒度与 P99 延迟之间的取舍判断。

    核心关键词连续批处理优化吞吐与延迟的边界条件
    #推理与成本
  3. 0003
    AI 工程推理与成本

    上线 prompt caching 后应监控哪些指标来确认缓存真的在省钱,命中率下降如何归因?

    围绕“上线 prompt caching 后应监控哪些指标来确认缓存真的在省钱,命中率下降如何归因”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出缓存成本收益监控口径与命中率下降的归因路径。

    核心关键词prompt cache hit rate monitoring attribution
    #推理与成本#Prompt#缓存
  4. 0004
    AI 工程推理与成本

    分块 prefill(chunked prefill)如何缓解长输入请求阻塞整个批次的问题,代价是什么?

    围绕“分块 prefill(chunked prefill)如何缓解长输入请求阻塞整个批次的问题,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确长 prefill 阻塞 decode 的机制与分块调度的吞吐代价。

    核心关键词分块 prefill 缓解阻塞的代价
    #推理与成本
  5. 0005
    AI 工程推理与成本

    按量伸缩的推理服务中模型冷启动造成分钟级延迟,有哪些预热与保活策略?

    围绕“按量伸缩的推理服务中模型冷启动造成分钟级延迟,有哪些预热与保活策略”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较预热、最小副本与懒加载的成本延迟权衡。

    核心关键词model cold start latency warmup keep-alive
    #推理与成本
  6. 0006
    AI 工程推理与成本

    单副本并发上限应如何由目标 SLO 反推,而不是靠压测随意取一个数?

    围绕“单副本并发上限应如何由目标 SLO 反推,而不是靠压测随意取一个数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用延迟预算与单请求服务时间反推并发上限。

    核心关键词单副本并发上限由 SLO 反推方法
    #推理与成本#并发编程
  7. 0007
    AI 工程推理与成本

    请求超出模型上下文窗口时,截断历史、摘要压缩与直接拒绝三种策略如何选择?

    围绕“请求超出模型上下文窗口时,截断历史、摘要压缩与直接拒绝三种策略如何选择”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按任务类型判断三种溢出策略的信息损失代价。

    核心关键词context window overflow truncation summarization policy
    #推理与成本
  8. 0008
    AI 工程推理与成本

    推理服务运行中偶发 OOM,如何从长请求、批调度与显存碎片三个方向定位?

    围绕“推理服务运行中偶发 OOM,如何从长请求、批调度与显存碎片三个方向定位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出区分输入长度触发与碎片触发的诊断方法。

    核心关键词inference OOM diagnosis long request fragmentation
    #推理与成本
  9. 0009
    AI 工程推理与成本

    GPU 利用率长期低于 30% 的推理服务,如何从批大小、CPU 预处理和网络 IO 定位瓶颈?

    围绕“GPU 利用率长期低于 30% 的推理服务,如何从批大小、CPU 预处理和网络 IO 定位瓶颈”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出利用率低的诊断树并区分计算瓶颈与喂数瓶颈。

    核心关键词GPU 利用率低的瓶颈定位方法
    #推理与成本
  10. 0010
    AI 工程推理与成本

    主力模型不可用或超时时,LLM 服务的降级链(备用模型、截断上下文、模板应答)应如何分层设计?

    围绕“主力模型不可用或超时时,LLM 服务的降级链(备用模型、截断上下文、模板应答)应如何分层设计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确降级层级顺序与每级质量损失的可接受性判断。

    核心关键词LLM 降级链分层设计与切换逻辑
    #推理与成本
  11. 0011
    AI 工程推理与成本

    LLM 推理用 INT8 权重量化替代 FP16 时,显存、延迟和输出质量各会发生什么变化?

    围绕“LLM 推理用 INT8 权重量化替代 FP16 时,显存、延迟和输出质量各会发生什么变化”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 INT8 权重量化的三维权衡与适用场景。

    核心关键词INT8 weight quantization LLM latency quality
    #推理与成本
  12. 0012
    AI 工程推理与成本

    如何根据模型参数量、层数、上下文长度和并发数估算 KV cache 显存占用并决定最大并发?

    本文给出KV cache显存估算公式与最大并发推导,以7B模型为例展示具体计算,并讨论GQA、分页注意力和动态长度对容量的影响。

    核心关键词KV cache 显存估算与最大并发确定
    #推理与成本#缓存#并发编程
  13. 0013
    AI 工程推理与成本

    多请求共享系统提示词时,前缀 KV cache 复用为什么要求前缀严格一致,改动一个 token 会怎样?

    围绕“多请求共享系统提示词时,前缀 KV cache 复用为什么要求前缀严格一致,改动一个 token 会怎样”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明前缀一致性的边界条件及复用收益。

    核心关键词prefix KV cache reuse exact match
    #推理与成本#Prompt#缓存
  14. 0014
    AI 工程推理与成本

    限制 max_tokens 对成本、延迟和截断风险分别有什么影响,如何设定合理上限?

    围绕“限制 max_tokens 对成本、延迟和截断风险分别有什么影响,如何设定合理上限”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确输出上限的成本与截断权衡及设定方法。

    核心关键词max_tokens 上限对成本与截断的影响
    #推理与成本
  15. 0015
    AI 工程推理与成本

    设计 LLM 路由层把请求分发到大小不同的模型时,路由信号与兜底策略应如何设计?

    围绕“设计 LLM 路由层把请求分发到大小不同的模型时,路由信号与兜底策略应如何设计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确分类路由的误判代价与回退链路设计。

    核心关键词LLM model routing cost quality fallback
    #推理与成本#路由
  16. 0016
    AI 工程推理与成本

    单底座多 LoRA 部署时,适配器数量与热适配器缓存如何影响单卡可承载的租户数?

    围绕“单底座多 LoRA 部署时,适配器数量与热适配器缓存如何影响单卡可承载的租户数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确热适配器换入换出对吞吐的影响与租户容量估算。

    核心关键词multi-LoRA serving adapter cache capacity
    #推理与成本#缓存
  17. 0017
    AI 工程推理与成本

    离线任务使用批量 API(batch API)相比实时调用能省多少,代价是什么?

    围绕“离线任务使用批量 API(batch API)相比实时调用能省多少,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确批量接口的折扣与延迟代价及适用任务类型。

    核心关键词batch API offline cost savings latency tradeoff
    #推理与成本#离线应用
  18. 0018
    AI 工程推理与成本

    什么类型的 LLM 应用成本由输出 token 主导,这类应用的降本手段与输入主导型有何不同?

    围绕“什么类型的 LLM 应用成本由输出 token 主导,这类应用的降本手段与输入主导型有何不同”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明成本构成由输出主导的场景特征并给出针对性手段。

    核心关键词输出主导型应用的降本策略
    #推理与成本
  19. 0019
    AI 工程推理与成本

    LLM 服务 P99 延迟突高但平均值正常,应按什么顺序排查调度、批处理和输出长度因素?

    围绕“LLM 服务 P99 延迟突高但平均值正常,应按什么顺序排查调度、批处理和输出长度因素”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出尾延迟的排查顺序与定位方法。

    核心关键词P99 尾延迟突高排查顺序
    #推理与成本
  20. 0020
    AI 工程推理与成本

    分页注意力(PagedAttention)解决了 KV cache 的什么显存浪费问题,对容量规划意味着什么?

    围绕“分页注意力(PagedAttention)解决了 KV cache 的什么显存浪费问题,对容量规划意味着什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确显存碎片浪费的机制与分页后的并发提升含义。

    核心关键词PagedAttention KV cache memory fragmentation
    #推理与成本#Agent 记忆#缓存
  21. 0021
    AI 工程推理与成本

    LLM 推理的 prefill 与 decode 两个阶段在计算特征上有何差异,为什么需要分开做容量规划?

    本题说明LLM推理prefill与decode分别属于计算密集还是显存带宽密集,通过7B模型的具体负载案例展示分离部署的收益条件与失败边界,帮助容量规划做合理决策。

    核心关键词prefill decode disaggregation inference
    #推理与成本
  22. 0022
    AI 工程推理与成本

    压缩提示词降低输入成本时,哪些压缩手段对输出质量影响最小、如何验证?

    围绕“压缩提示词降低输入成本时,哪些压缩手段对输出质量影响最小、如何验证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较静态精简、动态裁剪与摘要注入的质量代价及回归验证方法。

    核心关键词提示词压缩对质量影响最小的方法
    #推理与成本#Prompt#安全
  23. 0023
    AI 工程推理与成本

    为什么量化后的模型有时吞吐提升不明显,瓶颈可能在哪里?

    围绕“为什么量化后的模型有时吞吐提升不明显,瓶颈可能在哪里”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须诊断反量化开销、kernel 支持与内存带宽瓶颈。

    核心关键词量化后吞吐提升不明显的原因分析
    #推理与成本
  24. 0024
    AI 工程推理与成本

    遇到 API 429 限流时,重试、排队与降级到更小模型各自的适用条件是什么?

    围绕“遇到 API 429 限流时,重试、排队与降级到更小模型各自的适用条件是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明重试预算与降级触发时机。

    核心关键词API 429 限流时重试与降级策略选择
    #推理与成本
  25. 0025
    AI 工程推理与成本

    已知业务峰值 QPS、平均输入输出长度和模型单卡吞吐,如何推导所需 GPU 数量与冗余水位?

    围绕“已知业务峰值 QPS、平均输入输出长度和模型单卡吞吐,如何推导所需 GPU 数量与冗余水位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出从业务指标到卡数的完整推导与冗余系数选择。

    核心关键词GPU capacity planning QPS tokens per second
    #推理与成本
  26. 0026
    AI 工程推理与成本

    用大模型做请求路由分类器本身引入的延迟和成本如何控制在可接受范围?

    本文讨论用大模型做请求路由分类器时的延迟与成本控制策略,包括模型选型、结果缓存、降级路径与监控指标。

    核心关键词路由模型延迟与成本控制策略
    #推理与成本#路由#缓存
  27. 0027
    AI 工程推理与成本

    面向 LLM 应用做语义缓存时,相似度阈值、嵌入模型与失效策略应如何选择?

    介绍语义缓存中相似度阈值、嵌入模型与失效策略的选择方法:解释阈值高低对命中率和错误命中风险的影响,给出嵌入模型选择与验证手段,以及按数据特性设计失效策略的具体原则。

    核心关键词语义缓存相似度阈值与失效策略选择
    #推理与成本#缓存
  28. 0028
    AI 工程推理与成本

    用竞价实例跑 LLM 推理服务能省多少成本,被回收时对在途请求和服务 SLO 如何处理?

    围绕“用竞价实例跑 LLM 推理服务能省多少成本,被回收时对在途请求和服务 SLO 如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明竞价实例的成本收益与中断兜底设计。

    核心关键词竞价实例服务中断应对策略
    #推理与成本
  29. 0029
    AI 工程推理与成本

    合理使用 stop sequences 如何直接降低输出 token 成本,设置不当会带来什么质量问题?

    围绕“合理使用 stop sequences 如何直接降低输出 token 成本,设置不当会带来什么质量问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确停止序列的降本机制与误截断风险。

    核心关键词stop sequences output cost truncation risk
    #推理与成本
  30. 0030
    AI 工程推理与成本

    流式输出如何改变用户感知延迟,什么场景下流式反而无意义?

    围绕“流式输出如何改变用户感知延迟,什么场景下流式反而无意义”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明流式对感知延迟的改善条件及失效场景(如结构化输出需整体校验)。

    核心关键词流式输出对感知延迟的影响场景
    #推理与成本#流处理
  31. 0031
    AI 工程推理与成本

    约束解码生成结构化输出时,JSON schema 约束对解码延迟和输出长度成本有何影响?

    围绕“约束解码生成结构化输出时,JSON schema 约束对解码延迟和输出长度成本有何影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明约束解码的额外开销来源及强制短输出的降本效果。

    核心关键词constrained decoding structured output latency overhead
    #推理与成本
  32. 0032
    AI 工程推理与成本

    单模型张量并行从 1 卡扩到 8 卡,为什么吞吐不随卡数线性增长?

    围绕“单模型张量并行从 1 卡扩到 8 卡,为什么吞吐不随卡数线性增长”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释通信开销与并行效率的递减规律。

    核心关键词tensor parallelism scaling communication overhead
    #推理与成本
  33. 0033
    AI 工程推理与成本

    为什么增大批大小到一定程度后吞吐不再线性增长,拐点由什么决定?

    围绕“为什么增大批大小到一定程度后吞吐不再线性增长,拐点由什么决定”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释算术强度与显存带宽决定的吞吐拐点。

    核心关键词批大小与吞吐关系的饱和点分析
    #推理与成本
  34. 0034
    AI 工程推理与成本

    LLM 应用中客户端、网关、推理三层超时如何分层设置才能避免重试风暴?

    围绕“LLM 应用中客户端、网关、推理三层超时如何分层设置才能避免重试风暴”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确外层超时大于内层、重试次数递减的预算分配原则。

    核心关键词timeout budget layered retry storm LLM
    #推理与成本
  35. 0035
    AI 工程推理与成本

    如何建立按输入/输出 token 分开计价的 LLM 应用成本模型,并预测功能上线后的月度账单?

    围绕“如何建立按输入/输出 token 分开计价的 LLM 应用成本模型,并预测功能上线后的月度账单”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出区分输入输出单价的成本公式与流量假设敏感性分析。

    核心关键词LLM token cost model monthly bill estimation
    #推理与成本
  36. 0036
    AI 工程推理与成本

    容量报表中 token/s 与 request/s 两个吞吐指标背离时,说明什么、该信哪个?

    围绕“容量报表中 token/s 与 request/s 两个吞吐指标背离时,说明什么、该信哪个”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明输出长度变化导致两指标背离的含义及容量决策应采用的口径。

    核心关键词token throughput vs request throughput divergence
    #推理与成本
  37. 0037
    AI 工程推理与成本

    TTFT(首 token 延迟)与 TPOT(逐 token 延迟)分别受哪些因素影响,优化手段为何不同?

    围绕“TTFT(首 token 延迟)与 TPOT(逐 token 延迟)分别受哪些因素影响,优化手段为何不同”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须分别定位两个指标的主导因素并给出不同优化路径。

    核心关键词TTFT 与 TPOT 延迟影响因素对比
    #推理与成本
上一页
1
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致