前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8611
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • AI产品定价数学:固定费率如何悄悄亏损
  • ZCode事件:AI编程工具静默上传全部Git历史
  • Anthropic自评:R&D自动化率26%,但完全自主为0
  • 阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型
  • OWASP CRS 规则引擎:给 LLM 和 MCP 加上 WAF
  • 智谱 MaaS 上线数据不留存机制,可申请开通
  • 如何界定可完成的AI工程范围
  • Cursor中直接查询技术文档的MCP方案
  • AI Agent的过度自信陷阱
  • Cursor与.NET周报:七个实战规则
  • Qwen-Image-2.1开源:7B参数兼顾生图与编辑
  • 阿里开源 Qwen-Image-2.1:7B 参数兼顾透明图生成与多图编辑
  • 免费模型Trace不能支持的五个评估主张
  • AI重构前的副作用冻结术:先录 Ledger 再动格式
  • Agent能改Oracle则Green Build不足为信:独立检查三原则
  • AI编程导致代码质量下降?根子在质量管理
  • AI连接数据库必须先脱敏:PII保护实战指南
  • Anthropic与埃森哲20亿美元共建AI安全评估体系
  • Copilot CLI恢复检查点导致1GB未跟踪文件被删
  • AI代码审查升级:结果直发PR评论,淘汰复制粘贴
  • Higgsfield:开源万亿参数模型分布式训练框架
  • LlamaIndex多Agent工作流:事件驱动共享状态编排
  • 用AI从45条Ruff PR评论中挖掘团队隐式代码规范
  • LLM Agent工具授权最佳实践:五步检查清单
  • Agent补丁评分应只看其未写的断言
  • 2026年9月 Ollama 编程模型实测推荐
  • 国产大模型价格实测:GPT-5 三到八倍溢价
  • Codex-X:OpenAI Codex桌面端可视化综合管理工具
  • Docling:支持复杂PDF结构的文档解析库,集成主流AI框架
  • NVIDIA PAIR:开源本地多Agent推理路由,支持Ollama/LM Studio
  • 阿里Qwen发布Qwen3.8-LiveTranslate:60语言实时翻译,延迟仅2.3秒
  • Supermemory:AI记忆与上下文引擎开源实现
  • OpenSpec:AI编程时代的规格驱动开发框架
  • MCP Agent工具集成测试实战指南
  • Claude Code 在 Zed 中的 ACP 协议传输机制实测
  • Mubayyin:基于结构化知识库做 AI 发布决策的智能体
  • 阶跃发布 Step 5 Preview:开源模型前三,单任务成本仅 Claude Opus 5 的 1/8
  • 已加载 41 / 8611
8.0
热点
AI SCORE
编程提效2026-09-20 22:23

如何界定可完成的AI工程范围

dev.to · AI#AI工程#项目规划#最佳实践
Editor brief · 编辑速览

AI项目范围界定方法:明确输入输出用户行为、选择单一任务类型、设定可测试指标。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

很多 AI 项目创意听起来很宏大,但往往难以落地。问题通常不在模型,而在范围界定。

一份优秀的学生项目需要具备:明确的输入、可衡量的输出、真实可用的数据集,以及一个核心技术问题。本文介绍一种实用的方法,把一个宽泛的想法转化为一个可以落地、测试和讲解的项目。

1. 从决策出发,而不是技术出发

"用深度学习构建一个 AI 系统"不是项目目标。它只说了一种技术,没有说明系统应该做什么决策。

给定输入 X,预测或分类输出 Y,使得用户 Z 可以采取行动 A。

例如:

给定小型电机的振动和温度读数,预测电机是正常运行还是出现早期故障,以便实验室技术人员安排检修。

这个陈述立即明确了输入、输出、用户和实际价值。

2. 选择一个主要任务

大多数未完成的项目试图同时解决多个任务。选择一个:

  • 分类:正常 vs. 故障设备
  • 回归:剩余使用寿命(小时)
  • 异常检测:传感器异常行为
  • 预测:次日能源需求
  • 计算机视觉:识别表面缺陷
  • NLP:按问题类型对维护笔记分类

额外的功能可以作为延伸目标,不应该在第一个可工作版本中作为必需项。

3. 选模型之前先审计数据

在写训练代码之前,先回答这些问题:

  • 数据从哪里来?
  • 每条记录是否包含目标所需的字段?
  • 标签是否可用且可靠?
  • 每个类别有多少样本?
  • 数据能否合法合规地使用?
  • 数据集是否小到可以用现有硬件处理?
  • 同一机器、人或时间段的记录是否会泄露到训练集和测试集?

数据泄露在工程数据集中尤其常见。随机行划分可能导致同一机器的几乎相同读数同时出现在两个集合中。基于分组或时间的划分通常更符合实际。

4. 先构建基线

不要从最复杂的神经网络开始。

对于传感器分类项目,有用的基线可能包括:

  • 基于工程阈值的规则
  • 简单模型(如随机森林)

基线让你有东西可以对比。如果一个复杂模型只提升了 0.5% 的准确率但需要十倍的计算量,那么更简单的模型可能是更好的工程方案。

一个最小的 Python 基线代码:

from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import classification_report
from sklearn.model_selection import GroupShuffleSplit

X = data[["temperature", "rms_vibration", "current"]]
y = data["fault_label"]
groups = data["machine_id"]

splitter = GroupShuffleSplit(test_size=0.2, n_splits=1, random_state=42)
train_idx, test_idx = next(splitter.split(X, y, groups=groups))

model = RandomForestClassifier(
    n_estimators=200,
    class_weight="balanced",
    random_state=42,
)

model.fit(X.iloc[train_idx], y.iloc[train_idx])
predictions = model.predict(X.iloc[test_idx])

print(classification_report(y.iloc[test_idx], predictions))

重要的选择不是树的数量,而是分组感知的划分方式,因为它能测试模型在从未见过的机器上的表现。

5. 选择与失败成本匹配的指标

准确率并不总是够用的。

假设只有 5% 的电机读数代表故障。一个总是预测"正常"的模型可以达到 95% 的准确率,但完全检测不出任何故障。

根据项目风险选择指标:

  • 当误报代价高昂时,精确率(Precision) 很重要
  • 当漏掉真实故障很危险时,召回率(Recall) 很重要
  • 当两种错误类型都很重要时,使用 F1 分数
  • 对于可理解的回归误差,平均绝对误差(MAE) 效果很好
  • 混淆矩阵 可以显示模型混淆了哪些类别

在训练前写下成功条件。例如:

第一个版本应在训练集外机器上保持故障类召回率至少 80%,同时精确率高于 70%。

现在评估有了明确的含义。

6. 定义最小可行演示

一个完整的 AI 工程项目的演示部分需要包含:

  • 有文档的数据集和数据字典
  • 可复现的预处理流程
  • 一个可工作的输入到输出演示
  • 局限性和失败案例
  • 包含设置和运行步骤的 README

演示可以是一个小的 Streamlit 界面、一个 FastAPI 端点,或者一个接受 CSV 文件的脚本。选择最轻量的接口来证明系统可以工作。

7. 用证据规划里程碑

一个现实的八周计划可能是:

第 1 周:问题与数据可行性

  • 撰写决策陈述,确定用户,确认数据访问,定义目标变量
  • 检查缺失值、标签平衡、采样频率、泄露风险和伦理约束
  • 创建划分策略,训练简单模型,保存初始指标

第 4-5 周:改进

  • 特征工程,测试一到两个模型家族,跟踪实验
  • 运行最终测试,检查错误,整理局限性

第 7 周:演示

  • 将预处理和推理连接到一个最小界面

第 8 周:文档

  • 完成 README、架构图、结果表、设置指南和演示

每个里程碑都应该产出证据。"做了模型相关工作"很模糊。"在保留的机器组上对比了随机森林和梯度提升"是可以验证的。

8. 用削减清单控制范围

在开发之前,创建三份列表:

必须有(Must have)

  • 证明主要目标的最小系统

可以有(Could have)

  • 基线工作后可添加的有用改进

最好有(Nice to have)

  • Dashboard 美化、移动端部署、实时流、多模型、云基础设施或额外传感器

当时间受限,首先从"最好有"中删除内容。不要削弱核心评估。

9. 诚实记录局限性

一个可信的项目会解释它可能在哪些地方失败。

  • 数据集仅包含实验室条件
  • 某些故障类别样本很少
  • 不同机器的传感器校准存在差异
  • 模型尚未在实时操作中测试
  • 输出支持检修,但不能替代合格的工程师

局限性不会让项目显得薄弱。它们表明开发者理解原型和生产系统之间的边界。

一个实用的项目范围界定清单

在确定一个想法之前,确保你能对以下大多数问题回答"是":

  • 用户和决策是否清晰?
  • 主要任务能否用一句话描述?
  • 是否有合法可用的数据集?
  • 是否有合适的基线?
  • 评估划分是否合理?
  • 选择的指标是否反映错误成本?
  • 能否用现有时间和硬件构建可工作的演示?
  • 其他人能否复现结果?
  • 局限性是否已记录?

更多起点方向,可以探索这些 AI 和机器学习项目创意,然后用上述范围界定方法把一个想法缩小到可测试的第一个版本。

一个具有可信评估的小项目,比一个永远达不到可复现结果的大项目更有价值。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
智谱 MaaS 上线数据不留存机制,可申请开通
下一篇
Cursor中直接查询技术文档的MCP方案