分块 prefill(chunked prefill)如何缓解长输入请求阻塞整个批次的问题,代价是什么?
围绕“分块 prefill(chunked prefill)如何缓解长输入请求阻塞整个批次的问题,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确长 prefill 阻塞 decode 的机制与分块调度的吞吐代价。
程序员面试题库第 14 页,收录第 651–700 题,共 5000 道完整解析,覆盖前端、JavaScript、React、Vue、Node.js、AI Agent、网络、数据库与系统设计。
按稳定语义路径排序
围绕“分块 prefill(chunked prefill)如何缓解长输入请求阻塞整个批次的问题,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确长 prefill 阻塞 decode 的机制与分块调度的吞吐代价。
围绕“按量伸缩的推理服务中模型冷启动造成分钟级延迟,有哪些预热与保活策略”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较预热、最小副本与懒加载的成本延迟权衡。
围绕“单副本并发上限应如何由目标 SLO 反推,而不是靠压测随意取一个数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用延迟预算与单请求服务时间反推并发上限。
围绕“请求超出模型上下文窗口时,截断历史、摘要压缩与直接拒绝三种策略如何选择”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按任务类型判断三种溢出策略的信息损失代价。
围绕“推理服务运行中偶发 OOM,如何从长请求、批调度与显存碎片三个方向定位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出区分输入长度触发与碎片触发的诊断方法。
围绕“GPU 利用率长期低于 30% 的推理服务,如何从批大小、CPU 预处理和网络 IO 定位瓶颈”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出利用率低的诊断树并区分计算瓶颈与喂数瓶颈。
围绕“主力模型不可用或超时时,LLM 服务的降级链(备用模型、截断上下文、模板应答)应如何分层设计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确降级层级顺序与每级质量损失的可接受性判断。
围绕“LLM 推理用 INT8 权重量化替代 FP16 时,显存、延迟和输出质量各会发生什么变化”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 INT8 权重量化的三维权衡与适用场景。
本文给出KV cache显存估算公式与最大并发推导,以7B模型为例展示具体计算,并讨论GQA、分页注意力和动态长度对容量的影响。
围绕“多请求共享系统提示词时,前缀 KV cache 复用为什么要求前缀严格一致,改动一个 token 会怎样”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明前缀一致性的边界条件及复用收益。
围绕“限制 max_tokens 对成本、延迟和截断风险分别有什么影响,如何设定合理上限”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确输出上限的成本与截断权衡及设定方法。
围绕“设计 LLM 路由层把请求分发到大小不同的模型时,路由信号与兜底策略应如何设计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确分类路由的误判代价与回退链路设计。
围绕“单底座多 LoRA 部署时,适配器数量与热适配器缓存如何影响单卡可承载的租户数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确热适配器换入换出对吞吐的影响与租户容量估算。
围绕“离线任务使用批量 API(batch API)相比实时调用能省多少,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确批量接口的折扣与延迟代价及适用任务类型。
围绕“什么类型的 LLM 应用成本由输出 token 主导,这类应用的降本手段与输入主导型有何不同”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明成本构成由输出主导的场景特征并给出针对性手段。
围绕“LLM 服务 P99 延迟突高但平均值正常,应按什么顺序排查调度、批处理和输出长度因素”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出尾延迟的排查顺序与定位方法。
围绕“分页注意力(PagedAttention)解决了 KV cache 的什么显存浪费问题,对容量规划意味着什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确显存碎片浪费的机制与分页后的并发提升含义。
本题说明LLM推理prefill与decode分别属于计算密集还是显存带宽密集,通过7B模型的具体负载案例展示分离部署的收益条件与失败边界,帮助容量规划做合理决策。
围绕“压缩提示词降低输入成本时,哪些压缩手段对输出质量影响最小、如何验证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较静态精简、动态裁剪与摘要注入的质量代价及回归验证方法。
围绕“为什么量化后的模型有时吞吐提升不明显,瓶颈可能在哪里”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须诊断反量化开销、kernel 支持与内存带宽瓶颈。
围绕“遇到 API 429 限流时,重试、排队与降级到更小模型各自的适用条件是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明重试预算与降级触发时机。
围绕“已知业务峰值 QPS、平均输入输出长度和模型单卡吞吐,如何推导所需 GPU 数量与冗余水位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出从业务指标到卡数的完整推导与冗余系数选择。
本文讨论用大模型做请求路由分类器时的延迟与成本控制策略,包括模型选型、结果缓存、降级路径与监控指标。
介绍语义缓存中相似度阈值、嵌入模型与失效策略的选择方法:解释阈值高低对命中率和错误命中风险的影响,给出嵌入模型选择与验证手段,以及按数据特性设计失效策略的具体原则。
围绕“用竞价实例跑 LLM 推理服务能省多少成本,被回收时对在途请求和服务 SLO 如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明竞价实例的成本收益与中断兜底设计。
围绕“合理使用 stop sequences 如何直接降低输出 token 成本,设置不当会带来什么质量问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确停止序列的降本机制与误截断风险。
围绕“流式输出如何改变用户感知延迟,什么场景下流式反而无意义”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明流式对感知延迟的改善条件及失效场景(如结构化输出需整体校验)。
围绕“约束解码生成结构化输出时,JSON schema 约束对解码延迟和输出长度成本有何影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明约束解码的额外开销来源及强制短输出的降本效果。
围绕“单模型张量并行从 1 卡扩到 8 卡,为什么吞吐不随卡数线性增长”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释通信开销与并行效率的递减规律。
围绕“为什么增大批大小到一定程度后吞吐不再线性增长,拐点由什么决定”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释算术强度与显存带宽决定的吞吐拐点。
围绕“LLM 应用中客户端、网关、推理三层超时如何分层设置才能避免重试风暴”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确外层超时大于内层、重试次数递减的预算分配原则。
围绕“如何建立按输入/输出 token 分开计价的 LLM 应用成本模型,并预测功能上线后的月度账单”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出区分输入输出单价的成本公式与流量假设敏感性分析。
围绕“容量报表中 token/s 与 request/s 两个吞吐指标背离时,说明什么、该信哪个”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明输出长度变化导致两指标背离的含义及容量决策应采用的口径。
围绕“TTFT(首 token 延迟)与 TPOT(逐 token 延迟)分别受哪些因素影响,优化手段为何不同”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须分别定位两个指标的主导因素并给出不同优化路径。
围绕“线上如何做提示词版本的 A/B 对比并保证结论可信”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确分流一致性、指标定义与样本量问题。
围绕“何时应该在提示词中要求模型逐步推理(chain-of-thought)”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出适用与不适用的任务类型判断。
围绕“设计分类任务的提示词时,标签集合应如何呈现以减少误判”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确标签互斥性说明与示例覆盖边界类别的要求。
本文解释清晰指令为何提升模型遵循度:明确指令缩小意图空间、降低歧义,而暗示放大误解风险。通过场景比较委婉与直接表述的差异,指出适用范围与失效条件,给出可量化操作标准。
本题讨论上下文窗口接近上限时的裁剪策略,明确优先级:旧轮次、冗余示例、低相关文档先删,保留系统指令与近期关键信息。结合具体token场景给出判断依据,并指出追忆早期线索时必须保底的边界。
围绕“如何为一个对话应用规划输入输出的 token 预算”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出输入、输出、系统提示与历史四部分的预算分配方法。
围绕“模型输出不符合预期时,如何系统性地定位是提示词问题还是模型能力问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出分离变量(指令、示例、上下文、采样参数)的诊断顺序。
围绕“为提示词优化设计评估集时,样例应如何选取”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确覆盖典型、边界与对抗样例的比例原则。
本文解释少样本提示中示例选择的三大原则,并通过一个新闻分类场景说明具体操作和失败边界,帮助读者掌握可复用的示例选取方法。
这道题考察系统提示词与用户指令冲突时的优先级。正确结论是系统提示词通常优先,因为它是开发者设定的安全边界,但并非绝对安全。答案解释机制、一个客服场景的决策过程,以及容易失效的边界情况,并给出设计系统提示的建议。
本文解释在长上下文提示中为何建议将文档置于查询之前:分析注意力分布与查询位置的影响,给出工程场景与边界条件,并指出何时可例外以及相关成本。
围绕“切换 Claude 模型版本时,提示词需要做哪些兼容性检查”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确行为差异回归评估与参数默认值变化检查清单。
围绕“多份文档内容互相矛盾时,提示词应如何指导模型处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确冲突显式声明与来源优先级指令的设计。
围绕“多语言场景下提示词语言与输入语言不一致时会出现什么问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确指令语言对输出语言的影响及显式指定输出语言的做法。
围绕“为什么“不要输出 X”式的负面指令常常失效,应如何改写”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确以正面行为替代负面禁令的改写原则。
围绕“如何可靠地控制模型输出的长度”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分 max_tokens 硬限制与提示词指令软约束的适用场景。