作者通过AI辅助实现合同制造商匹配流程自动化,迭代五次后效率提升一倍以上,记录了每个版本的耗时和改进点。
6 月 11 日,我写了一个程序,为一个在印度上市的保健品品牌寻找合同制造商。文件夹创建于上午 11:35。到 13:55 时,里面已经有一份打完分、附带报告的文件。两个半小时,大部分时间花在和评分权重较劲。
三天后我需要的是营销代理商而不是工厂,于是照搬了框架,重新指向。13:47 到 15:56。
6 月 23 日我需要包装和品牌设计工作室。那个文件夹 10:48 时还不存在,11:56 时已经有一份打完分的报告在其中。68 分钟。
后来又做了一个以美元计价的远程工作。又一个是寻找可能购买我工作室服务的公司,8 月 14 日完成。
本质上,它们是同一个程序。读简报、搜索、打开实际页面而不信搜索摘要、给每个候选对象打分、写每条分数的理由、标记看起来空洞的行。
有人用略带质疑的语气问我,为什么要把自己的大量工作自动化。问题背后隐含的假设是:这是为了快,而追求快是件肤浅的事。
速度确实存在,但它是最无趣的部分。
机器保留文件。我不保留。
上周我对第五条流水线做了一个验证轮次——那个寻找我自己潜在客户的。它回溯了已经筛选过的条目,真正打开每家公司查看。
它和自己产生了分歧。在它通过的 58 家公司中,有 21 家被它自己否决了。36%。
我公布了这个数字,有几个人把它解读为反对构建这个东西的理由。
和手工版本对比一下。8 月初我手工写了六封推广邮件。一次一家公司,真正做调研,对每家企业都有具体观察,一周内花了数小时。六封全部发出并被阅读。零回复。
现在告诉我那六封的错误率是多少。
没有错误率。没有文件。没有一栏记录过去的我对每家公司写了什么看法和原因,所以没有东西可以对照结果来检验。我有的只是一种"我很用心"的记忆,而"感觉用心"不是任何证据。
这整句话的偏见就在这里。我宁愿运行一个可测量地错误 36% 的流程,也不愿意一个不可测量的、错误量无人知晓的错误。
可测量的错误是周二下午的工作。评分模型把"团队页面上没有列出营销人员"读成了"不存在营销人员",这是不同的断言,一旦写进文件你就能看到并修复它。不可测量的错误不是 bug。它会成为一种性格。它在那里待了好几年,被称为"判断力"。
人类的工作不产生收据,除非你强制它,而几乎没人强制它。自动化一个任务是让我的推理可以被检验、被移交给他人、被公开证明错误的最低成本方式。
68 分钟改变了哪些想法可以存在
偏见的第二部分更无聊,但可能更重要。
第一条流水线花了两个半小时。第三条花了 68 分钟。这个巨大的缩减改变了哪些想法被允许存在。
当一个小系统需要一周的晚间时间,你只构建那些你已经很有信心的,这意味着你只构建你本来就相信的东西。当它只需要一小时,你构建那个愚蠢的。6 月,我在凌晨一点做了一个东西:拍一张连衣裙的照片,在印度各大商店里找相似的,因为女朋友提了一句,而那只需要 34 分钟。它在运行。它真的有用。它永远不会通过商业案例的审批。
凭一时冲动构建的东西,大约有三分之一比精心挑选的那些表现更好,而我不认为那是运气。精挑细选过滤出那些容易提前论证的想法,而这类东西的价值很少在论证所在的地方。
偏见的错在哪里
我想对失败坦诚,因为没有这一点的版本就只是营销。
我从错误的阶段发了邮件。我看了还未经过丰富处理或验证的发现结果,觉得行看起来对,就发了十封邮件。两封因为发送域名才九天大而硬退回。你没法撤销。系统在那里没有错。我对一个还在运行的系统失去了耐心,这是自动化制造而非解决的一种特定失败模式。
还有第二件事,那是真正的边界。14 个潜在客户中有两个死在流水线看不到的层面:一个创始人戴着"开放找工作"的横幅,一个正确的决策人有五个连接但从未发过任何帖子。都无法从公司数据发现。再多的流水线也够不到。
所以我现在遵循的规则:自动化收集,永远不要自动化结论。
这五条流水线都在发送前停止。最能 catch 真正问题的步骤——每分钟比上游任何步骤都多——是我打开一个人的资料看上 30 秒。随着周围一切越来越便宜,那一步变得越来越贵,应该如此,因为它才是真正的工作。
不光鲜的版本
我偏爱自动化不是因为它很酷。我构建的大多数东西就是几百行代码,读页面、写 CSV,加一列写明原因。
我偏爱自动化是因为它把我的观点变成了 artifact。脑子里的观点无法被审计、无法移交给他人、也无法被公开证明是错的。同样的观点写成评分函数,到午饭时就能做到这三点。
36% 的错误率并在改进,胜过未知数量的错误和一种良好的感觉。就这样。这就是全部论点。