AI 眼镜编码体验:新硬件的真实表现
作者实际体验了 AI 眼镜进行编码开发,分享这项新硬件在工程实践中的真实效果和局限,帮助开发者了解新工具的可用性。
作者实际体验了 AI 眼镜进行编码开发,分享这项新硬件在工程实践中的真实效果和局限,帮助开发者了解新工具的可用性。
我最近收到了一对 AI 眼镜作为礼物。这不是我会自己购买的东西。但既然我现在拥有一对,我就把这看作一个有趣的机会,来评估这些眼镜是否能改善我作为开发者的日常生活。
我首先尝试的是使用集成的 AI 来让它解释我屏幕上的代码。结果是……令人失望的。我尝试了不同的场景:
解释一个简单的 HTML 文件
调试特定的一行代码
提供上下文感知的解释
它无法可靠地识别我在看什么。它缺乏对视觉内容的精确理解。
我开始思考一个更好的管道:
从眼镜摄像头捕捉画面
应用 OCR 提取可见的文本
将图像 + 提取的上下文输入一个能力强的视觉模型
将结果发送给一个 LLM
通过眼镜以音频形式返回解释
理论上,这可以把眼镜变成一个实时编程助手。但这似乎工作量太大、复杂且昂贵。而且比直接在编辑器内提示一个助手的效果还要差。
这时我意识到了什么。
也许 AI 眼镜之所以有用,不是因为它们能帮你更好地编程。也许它们之所以有用,是因为它们能帮你更好地理解自己。
所以我尝试了不同的东西。
如果我用眼镜捕捉我的生活呢?我把它们称为 life commits。就像 Git commits 捕捉代码的演进,life commits 捕捉你一天的演进。
用眼镜快速拍照是非常无缝的,不像手机那样需要从口袋里掏出来,会产生摩擦。
每个小时,应用都会提示你捕捉一个时刻。
捕捉到的图像会自动使用 Apple 的 Vision 框架进行分类:
VNClassifyImageRequest()
这允许对以下环境进行分类:
然后,我给每个时刻关联一个情感评分。
这可以通过两种方式完成:
使用以下方式检测的手势:
VNDetectHumanHandPoseRequest()
或者通过应用手动设置。
随着时间的推移,这会创建一个时间线,包含:
你在哪里花费时间
你所处的环境
这些环境与你的情感状态如何关联
这些洞察和模式随着时间推移可能很有趣,可以用来改善你的日常生活和改善你的情感状态。
这是我构建的流程演示:
这是测试这个想法的工作原型:https://github.com/JulienAvezou/ai-glasses
我惊讶地发现自己喜欢通过眼镜听音乐。虽然它不能替代舒适的耳机,但听清音乐而不需要在耳朵上或头上戴东西还是很不错的。
提示 AI 在编码时提供简单的解释也不错,因为直接进行对话很方便,无论是在办公桌前还是走动时。
快速拍照或视频的便利性也很好。
但目前,AI 眼镜仍然感觉像是早期硬件。
不是无用。但也不是必不可少。
它们并不从根本上改变我编程的方式。
但它们确实改变了我捕捉和反思生活的方式。
这可能是它们真正的潜力。
那么你怎么看呢?小工具还是有用工具?
我很好奇是否有人在积极使用 AI 眼镜。
你如何在日常生活中融入它们呢?(锻炼、编码等)
有些评论可能仅对已登录的访客可见。登录以查看所有评论。
如需采取进一步行动,你可以考虑屏蔽该用户和/或举报滥用行为。