从 50+ 国内外信源筛出真正值得读的 AI 编程、办公提效与工程实践。每天评分、翻译、提炼,让信息差变成生产力。
Anthropic 公开的系统提示词从 358 词扩至 3235 词,作者拆解其中工程化设计供 AI 产品团队借鉴。
论文发现:改变prompt中的语言风格(使用模糊词、标签疑问句、集体代称)比改用户姓名产生更大、更一致的输出差异。使用"礼貌克制"语气时模型回答更短、更简单。
提出将 AI 请求分解为预设决策点的菜单式结构,而非让 AI 盲目猜测或逐个追问。总结七种真实决策形态,帮助快速获得符合预期的输出。
新版模型发布后工作流反而退化,根因是自定义技能指令基于旧模型行为编写;审核清理后可恢复甚至超越原有表现。
Hacker News讨论Anthropic平台的系统提示词官方文档,含50条评论109个投票;文档覆盖Claude的system prompts机制和使用指南。
Anthropic偏好XML标签、OpenAI偏好markdown分隔符源于各自后训练数据分布,而非解析器需求;XML标签对token消耗不容忽视,40+标签的prompt需计算实际成本差异。
Prompt中「像输出」的部分(示例、语气示范、源文档引用)必须用目标语言本地书写,「像指令」的部分(任务描述、约束、输出schema、角色声明)可保留模型最熟悉的语言;因为模型是基于全量token做延续,非特权通道。
对比通用Prompt与高质量Prompt的差距,提出「背景+问题+输出目标」的结构化Prompt模式,强调具体场景和技术细节。
动态 Few-Shot 选择本质是排序问题,抽象为 query+示例库→有序 ID 列表的函数。预计算向量、返回 ID 而非对象,可实现零模型调用的单元测试。
解释上下文窗口的本质:每次调用都是将完整对话历史重新输入,窗口满时旧内容被截断而非「遗忘」,并讨论了窗口大小选择与上下文管理的工程实践。
阐述从LLM demo到生产环境的核心差距——结构化输出。提出JSON强制约束、逐步从Prompt到函数调用方案的演进路径。
用labeled测试集验证prompt效果,每个pipeline携带输入/期望对,最大文本pipeline含3900个案例;用模型做裁判时通过交换AB顺序消除位置偏差,约11%判决不通过交换验证。
建议用积累的真实失败用例(回归集)验证新模型,而非轻信基准测试排名。发布说明不了解你的代码库和错误日志,榜单高分不代表在实际业务场景下不翻车。
低资源语言缺乏英文那样丰富的隐式先验,Prompt 必须补足结构、语域和术语。通过 Wikipedia 词条量、网络爬虫占比、Token 化效率四个代理指标评估语言资源丰富度。
模型对多语言指令的歧义消解方式与预期不符,但输出格式正确、延迟正常,无异常信号可追踪,只能靠人工审核或专项检测发现。建议对多语言输出增加针对性验证用例。
将传统软件的metamorphic testing方法应用于LLM测试,通过验证输出间的数学/逻辑关系而非绝对正确性来解决oracle问题。
Netlify 测试者用相同 prompt 对比 11 个 AI 模型输出,发现生成质量、风格和准确性存在巨大差异,无绝对最优模型。
分析AI幻觉产生根源(统计猜测、过度优化),给出安全实践:提供源文档 grounding、降低temperature、人类审查环。
建议先用免费模型建立个人 benchmark(5 个真实任务),对免费模型失败的任务再路由到付费前沿模型,避免为简单问题付出不必要的高昂推理成本。
揭示「保留最近 12 轮」背后是 window−系统提示−工具 schema−检索文档−输出预留−推理预留的完整方程,迁移时容易被忽略。
数据每日自动更新 · 最后同步 2026-08-17 04:18 · 内容由 AI 整理解读,观点仅供参考