整理 17 个实用项目案例,展示如何在应用中快速集成 AI 功能,覆盖常见业务场景。
提示词工程和 AI 正蓬勃发展,几乎每个创业团队都在集成 AI,让用户使用起来更加轻松。
今天,我们将介绍 17 个项目,帮助使用 AI 进行开发的开发者最大限度地提高生产力。
你会看到与提示词工程、代码编辑器、AI 智能体等相关的工具,以及更多令人兴奋的内容。
这份清单会让你大吃一惊。
Latitude 是一个开源提示词工程平台,可借助 AI 构建、评估和优化提示词。你可以使用它们的 SDK 或 API,在平台中创建并迭代提示词。
最棒的是,每次运行提示词时,它都会自动记录完整的上下文、输出,以及与评估和调试相关的其他元数据。
仪表盘如下所示。
✅ 支持参数、代码片段、逻辑等高级功能。
✅ 提供提示词版本控制、协作式提示词管理器,甚至还支持批量或实时评估。
一个基本的用户流程可以是:
-→ 创建一个新项目。
-→ 使用编辑器编写你的第一个提示词。
-→ 在演练场中使用不同输入测试提示词,并查看模型的响应。
-→ 部署之前,你可以上传数据集并运行批量评估,以衡量提示词在各种场景下的表现。观看此视频,了解评估功能如何分析提示词的运行结果。
-→ 你可以将提示词部署为端点,以便轻松集成到应用程序中。
-→ 使用 Logs 部分检查提示词长期以来的表现。
-→ 优化提示词,并邀请团队成员加入你的 Latitude 工作区进行协作。
观看这个简短演示,了解更多信息。
你可以阅读文档,了解提示词、日志和评估等相关概念。
你可以按照这份快速入门指南,使用云版本或进行自托管。
他们在 GitHub 上拥有 536 个 Star,并且发展得非常快。
LiveKit Agents 是一个端到端框架,让开发者能够构建智能的多模态语音助手(AI 智能体),通过语音、视频和数据通道与用户互动。
让我用简单的话解释一下。
Agents 框架允许你构建能够实时看、听和说话的 AI 驱动型服务端程序。你的 AI 智能体通过 LiveKit 会话连接最终用户设备。在会话期间,AI 智能体可以处理从用户设备流式传输的文本、音频、图像或视频,并让 AI 模型生成这些模态的任意组合作为输出,再将其流式传回给用户。
✅ 它们支持大量 SDK,包括 Swift、Android、Flutter、Rust、Unity、Node、Go、PHP、React 等。
你可以使用 pip 开始安装。
pip install livekit-agents
它们还提供了大量插件,可以轻松处理流式输入或生成输出。例如,其中有将文本转换为语音,或使用热门 LLM 进行推理的插件。下面是一个插件示例:
pip install livekit-plugins-openai
如果你使用 React,它们还提供用于基于 LiveKit 进行开发的开源 React 组件和示例。
你可以阅读文档,并查看所有可用插件的列表。如果想亲自试用,可以前往 cloud.livekit.io。
如果你正在寻找附带代码的示例应用,请查看以下内容:
⚡ 使用 STT、LLM 和 TTS 流水线构建的基础语音 AI 智能体
⚡ 使用 Cerebras 托管的 Llama 3.1 构建的超高速语音 AI 智能体
在我见过的 1000 多个开源项目中,这是最令人兴奋的项目之一。
它们在 GitHub 上拥有 3.2k 个 Star,并且发展势头强劲。
为 LiveKit Agents 点个 Star ⭐️
Julep 是一个用于创建 AI 智能体的平台,这些智能体可以记住过去的交互并执行复杂任务。
假设你想构建一个不只是回答简单问题的 AI 智能体。它需要处理复杂任务、记住过去的交互,甚至可能还要使用其他工具或 API。这正是 Julep 的用武之地。
你可以使用它创建包含决策、循环、并行处理等众多能力的多步骤任务。
✅ 它会自动重试失败的步骤、重新发送消息,并从整体上保证任务顺畅运行。
✅ 你可以使用 Julep 的文档存储构建一个能够检索和使用自有数据的系统。
你可以通过 npm 或 pip 开始使用。
npm install @julep/sdk
or
pip install julep
我还推荐阅读一个快速示例:示例 AI 智能体会选择一个主题,生成 100 个相关的搜索查询,同时执行这些搜索,总结搜索结果,并将摘要分享到 Discord。当然,还附有完整代码 :)
观看这个简短演示并查看更多示例应用,以便深入了解。
你可以阅读详细文档,其中包含 Python 快速入门指南、Nodejs 快速入门指南、教程和操作指南。
你可能会说它与 Langchain 很相似,但两者的理念略有不同。例如,LangChain 非常适合创建提示词序列和管理与 AI 模型的交互。它拥有庞大的生态系统和大量预构建集成,让你可以更轻松地快速运行项目。
另一方面,Julep 更侧重于构建能够记忆信息的持久化 AI 智能体。如果你需要直接在 AI 智能体的处理流程中执行包含多个步骤、决策过程,并集成各种工具或 API 的复杂任务,它的优势便会显现出来。阅读详细对比了解更多信息。
Julep 在 GitHub 上拥有 1.3k 个 Star,并且发展势头强劲。
Open WebUI 是一个出色且易于使用的自托管聊天用户界面,专为完全离线运行而设计。
它可以帮助你以前所未有的速度构建功能。
你可以使用 pip 快速安装。请查看完整安装指南。
# install Open WebUI
pip install open-webui
# run Open WebUI
open-webui serve
让我们看看其中一些出色的功能。
✅ 你可以自定义 OpenAI API URL,将其连接到 LMStudio、GroqCloud、Mistral、OpenRouter 等服务。
✅ 借助国际化(i18n)支持,你可以使用自己偏好的语言。
✅ 它还提供免手持语音和视频通话功能,带来更多灵活性。
✅ 它们的官方网站清晰展示了大量由社区提供的模型、提示词、工具和函数信息。
✅ 你可以将文档直接加载到聊天中,也可以把文件添加到文档库,并在查询前使用 # 命令访问它们。
✅ 你可以使用 SearXNG、Google PSE、Brave Search、serpstack、serper、Serply、DuckDuckGo、TavilySearch 和 SearchApi 等服务执行 Web 搜索,并将结果直接注入聊天体验中。
此外,我也建议观看这个演示教程来了解更多信息。
你可以阅读文档,其中包含入门指南、FAQ(推荐阅读)和教程。
它使用 Svelte、Python 和 TypeScript 构建。
它们在 GitHub 上拥有 41.6k 个 Star,这足以说明其受欢迎程度。
Quivr 是你的第二大脑,它利用生成式 AI 的能力充当你的个人助理。你可以把它想象成由 AI 能力大幅强化的 Obsidian。
这是一个帮助你创建 AI 助手的平台,这些助手被称为 Brain。它们针对专门的场景而设计,例如,一些助手可以连接特定数据源,让用户直接与数据交互。
另一些则作为特定使用场景的专用工具,由 RAG 技术驱动。这些工具会处理特定输入,并生成摘要、翻译等实用输出。
观看 Quivr 的简短演示!
其中一些出色功能包括:
✅ 你可以根据想要交互的数据源,选择要使用的 Brain 类型。
✅ 它们还提供了一项强大的功能,让你可以与他人分享自己的 Brain。你可以通过电子邮件将 Brain 分享给其他人,并为他们分配特定权限。
✅ Quivr 可以离线运行,因此你能够随时随地访问自己的数据。
✅ 你可以访问并继续之前与 Brain 进行的对话。
✅ 不过,我最喜欢的功能是你可以安装一个 Slack 机器人。查看这个演示,了解它能做什么。非常酷!
总之,你可以阅读相关内容,了解 Quivr 能实现的所有精彩功能。
你可以查看安装指南和 60 秒安装视频。其他信息请参阅文档。
它们还提供了有关如何使用 Vercel、Porter、AWS 和 Digital Ocean 部署 Quivr 的指南。
它在 GitHub 上拥有 36.3k+ 个 Star,并已发布 300 多个版本。
Dify 是一个用于构建 AI 应用的开源平台。
其直观的界面整合了 AI 工作流、RAG 管道、AI 智能体能力、模型管理、可观测性特性等,让你能够快速从原型阶段进入生产环境。
他们结合了 Backend-as-a-Service 和 LLMOps 来改进生成式 AI 解决方案的开发。你可以使用云端或自托管部署(参考文档)。
你甚至可以在视觉画布上构建和测试强大的 AI 工作流。
让我们看看一些很棒的功能:
✅ Dify 为 AI 智能体提供了 50+ 个内置工具,如 Google Search、DALL·E、Stable Diffusion 和 WolframAlpha。
✅ 你可以随时监控和分析应用日志及性能。
✅ 你可以使用 RAG 管道从 PDF、PPT 和其他常见文档格式中提取文本。
✅ 有大量的集成选项可供选择,来自数十个推理提供商和自托管解决方案,涵盖 GPT、Mistral、Llama3 和任何 OpenAI API 兼容的模型。支持的模型提供商完整列表可以在这里找到。
✅ 你可以只需点击几下就创建 AI 智能体,让它们独立使用企业定义的工具和数据来解决复杂任务。
你可以阅读文档。
两个我最喜欢的印象深刻的使用案例:
⚡ 构建 Notion AI 助手
⚡ 用 Dify 创建 MidJourney Prompt 机器人
Dify 在 GitHub 上有 47.7k 个 stars,拥有众多贡献者。
GitHub Copilot 和 ChatGPT 等 AI 辅助编码工具生成的代码往往不够可靠,通常开箱即用时无法正常工作,你会发现错误、边界情况,甚至对不存在的 API 的引用。
这可能会导致一个令人沮丧的循环:尝试生成的代码、发现问题、回到 AI 寻求修复、然后重复。
用于调试的时间可能会抵消使用 AI 工具最初节省的总时间。
Micro Agent 使用 AI 来缓解不可靠的代码生成问题。
给它一个提示,它会生成一个测试,然后迭代代码直到所有测试用例都通过。
你可以使用以下命令安装它。
npm install -g @builder.io/micro-agent
# Next, set your OpenAI API key when prompted or manually using this.
micro-agent config set OPENAI_KEY=<your token>
# Then you can run to start a new coding task
micro-agent
Micro Agent 会提示你描述所需的函数、生成测试,然后用你偏好的语言开始编写代码来通过测试。一旦所有测试都通过,你就会有一个完全可用的、有测试支持的函数可以直接使用。
让我们探索一些最令人惊叹的使用案例:
⚡ 30 秒演示 Micro Agent 为一个 TypeScript 函数生成测试和代码,该函数将字符串数组中的变位词分组在一起。
⚡ 使用 Micro Agent 生成一个简单的 HTML 到 AST 解析器(通过两次迭代实现)。
⚡ 单元测试匹配。
⚡ 视觉匹配(实验性)。
⚡ 与 Figma 集成。
Micro Agent 还可以与 Visual Copilot 集成,直接连接到 Figma,以确保设计到代码转换的最高保真度!
Visual Copilot 直接连接到 Figma,协助进行像素完美的转换、精确的设计 token 映射,以及在生成输出中精确使用你的组件。
然后,Micro Agent 可以获取 Visual Copilot 的输出并对代码进行最终调整,以确保它通过 TSC、lint、测试,并完全匹配你的设计,包括最终的微调。太棒了,对吧 :)
你可以阅读文档和官方博客,团队在那里讨论了关于 Micro Agent 的所有内容。
它是开源的,在 GitHub 上有 2.8k 个 stars。
这个概念与 Cursor 非常相似,其中 Cline 是一个自主编码智能体,能够创建/编辑文件、执行命令等,每一步都需要你的许可。
它是一个 VSCode 扩展,你可以在应用商店中找到它。它有 84k+ 次安装。
Cline 基于 Claude 3.5 Sonnet 的智能体编码能力工作。
✅ Cline 支持 OpenRouter、Anthropic、OpenAI、Google Gemini、AWS Bedrock、Azure 和 GCP Vertex 等 API 提供商。你还可以配置任何 OpenAI 兼容的 API 或通过 Ollama 使用本地模型。
✅ 你可以使用四个不同的命令来添加上下文。
@url:粘贴一个 URL,扩展将获取并转换为 markdown,当你想给 Cline 最新的文档时很有用
@url:粘贴一个 URL,扩展将获取并转换为 markdown,当你想给 Cline 最新的文档时很有用
@problems:添加工作区错误和警告("问题"面板)供 Cline 修复。
@problems:添加工作区错误和警告("问题"面板)供 Cline 修复。
✅ 它使用无头浏览器来检查任何网站(如 localhost),允许它捕获截图和控制台日志。这使它能够自主修复可视化错误和运行时问题,无需你手动指导和复制粘贴错误日志。
✅ 你甚至可以在终端中运行命令来做令人惊叹的事情。
你可以阅读文档。
Cline 在 GitHub 上有 7k 个 stars。
使用 GPT Crawler,你可以爬取任何网站以生成知识文件,从一个或多个 URL 创建你自己的自定义 GPT。
目标是让文档网站具有交互性,使用户能够更简便地通过聊天界面找到他们寻找的答案。
观看这个快速演示!
你需要配置爬虫然后简单地运行它。爬取完成后,你会得到一个新的 output.json 文件,其中包含所有爬取页面的标题、URL 和提取的文本。
现在你可以通过创建新的 GPT 将其直接上传到 ChatGPT。上传后,这个 GPT 助手将拥有来自这些文档的所有信息,并能够回答关于它们的无限问题。
它是 ChatGPT 中的官方助手。
你可以阅读文档了解如何开始。你可以在官方博客上找到所有说明。
如果你想知道 Mitosis 如何编译这些组件,请观看这个快速教程。
他们在 GitHub 上有 18.6k 个 stars。
Composio 是构建复杂 AI 自动化软件所需的唯一工具。它允许 AI 模型访问第三方工具和应用程序以自动化与它们的交互。
例如,你可以通过 Composio 将 GitHub 与 GPT 模型连接,并自动化 PR 审查、问题解决、测试用例编写等。
你可以通过使用 90+ 个工具和集成选项(如 GitHub、Jira、Slack 和 Gmail)来自动化复杂的现实工作流。
你还可以通过将应用的 OpenAPI 规范添加到 Composio,来自动化发送电子邮件、模拟点击、下单等操作及更多其他功能。
这是你可以使用它的方式。
# install it
pip install composio-core
# Add a GitHub integration
composio add github
这是你如何使用 GitHub 集成来为仓库加星。
from openai import OpenAI
from composio_openai import ComposioToolSet, App
openai_client = OpenAI(api_key="******OPENAIKEY******")
# Initialise the Composio Tool Set
composio_toolset = ComposioToolSet(api_key="**\\*\\***COMPOSIO_API_KEY**\\*\\***")
## Step 4
# Get GitHub tools that are pre-configured
actions = composio_toolset.get_actions(actions=[Action.GITHUB_ACTIVITY_STAR_REPO_FOR_AUTHENTICATED_USER])
## Step 5
my_task = "Star a repo ComposioHQ/composio on GitHub"
# Create a chat completion request to decide on the action
response = openai_client.chat.completions.create(
model="gpt-4-turbo",
tools=actions, # Passing actions we fetched earlier.
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": my_task}
]
)
你可以阅读文档和示例。
Composio 在 GitHub 上有 9k 个 stars。
Langflow 旨在在现实场景中简化 AI 开发。它基于 Python,对任何模型、API 或数据库都不可知。
它就像一个动态图,其中每个节点都是一个可执行单元。你可以观看演示。
✅ 你可以通过使用花括号 {} 来使用动态输入。
✅ 你可以通过轻松从电子表格中微调 LLM 来发挥它们的全部潜力。
✅ 你可以超越表面并编写你自己的组件。
✅ 更高级别的组件自然来自 AI 构建块。存储并共享你的创作。
集成选项非常丰富,所以你可以构建几乎任何东西。他们还提供可组合的构建块,这些块类似于预构建的组件,可以以许多方式组合来创建 AI 应用。
你可以阅读文档,其中包含快速入门指南和游乐场,你可以在那里直接进行原型化,进行调整并观察模型的不同结果。
Langflow 在 GitHub 上有 31.2k 个 stars。
OpenLLM 让开发者可以通过单一命令将任何开源 LLM 作为 OpenAI 兼容的 API 端点运行。
⚡ 支持 llama3、qwen2、gemma 以及许多量化版本(完整列表)。⚡ OpenAI 兼容的 API 和包括类似 ChatGPT 的 UI。⚡ 使用最先进推理后端加速 LLM 解码。⚡ 为企业级云部署做好准备(Kubernetes、Docker 和 BentoCloud)。
使用以下命令入门。
pip install openllm # 或 pip3 install openllm
openllm hello
OpenLLM 为 LLM 服务器在 /chat 端点提供聊天用户界面(UI)。你可以访问 http://localhost:3000/chat 的聊天 UI,并开始与模型进行不同的对话。
如我之前所说,OpenLLM 通过 BentoML(统一模型服务框架)和 BentoCloud(企业 AI 团队的 AI 推理平台)支持 LLM 云部署。
如果你不了解,BentoCloud 提供了为 LLM 推理优化的完全托管基础设施,具有自动扩展、模型编排、可观测性,这只是说它允许你在云中运行任何 AI 模型的一个花哨方式。
你可以阅读有关支持的模型以及如何启动 LLM 服务器的信息。
探索文档,你也可以使用 openllm run 在 CLI 中与模型进行对话,并指定模型版本 - openllm run llama3:8b。
如果你喜欢探索演练,请观看 Matthew 的这个演示!
他们在 GitHub 上有 9.9k 个 star,几乎达到了 10k 的标记 :)
GPT-engineer 让你用自然语言指定软件,然后坐下来,看着 AI 编写和执行代码,你可以要求 AI 实现改进。
可以说这是一个不需要学位的工程师 😅
这是一个用于自动生成 Web 应用程序的商业项目。它为连接到 git 控制的代码库的非技术用户提供了一个 UI。
我知道这感觉有点令人困惑,所以请观看下面的演示来了解你可以如何使用 GPT Engineer。
你可以使用此命令安装稳定版本开始使用。
python -m pip install gpt-engineer
默认情况下,gpt-engineer 期望通过提示文件进行文本输入。它还可以接受对视觉能力强的模型的图像输入。这对于添加 UX 或架构图作为 GPT Engineer 的额外上下文很有用。阅读所有很棒的功能。
如果你想要一个完整的演练,请观看 David 的这个很棒的演示!
我建议查看路线图以了解总体愿景。
他们在 GitHub 上有 52.2k 个 star,处于 v0.3 版本。
如你所知,PearAI 和 Zed 等许多项目在 Cursor 推出后出现,但大多数只是 VSCode 的 fork,并没有真正改进生态系统。
如果你想切换,我会推荐 Cursor(不是开源)、Continue(类似于 Cursor)和 Void,它是 Cursor 的开源替代品。
我之所以介绍 Void 是因为它由 YCombinator 支持,所以他们足够可信。他们还没有发布它,但你可以轻松获得早期访问权来尝试。
它具有与 Cursor 非常相似的 AI 语法特性。
✅ 你可以使用 AI 进行智能搜索。
✅ 你可以查看和编辑底层提示。
✅ 有上下文感知、第三方集成、微调生成,你甚至可以在本地托管 Ollama,永远不会用完 API 额度。
如我之前所说,Void 是 VS Code 的 fork,所以你可以只需点击一下就将所有主题、按键绑定和设置转移过来。
我之前介绍过 Continue,所以这次跳过了它,但在 Void 完全发布之前,我肯定会更倾向于使用 Cursor。
Void 在 GitHub 上有 7.5k 个 star,仍处于早期版本。
Unsloth 使微调 Llama-3、Mistral、Phi-3 和 Gemma 等大型语言模型快 2 倍,使用 70% 更少的内存,且精度无下降!
✅ 什么是微调?
如果我们想让一个语言模型学习一项新技能、一种新语言、一些新编程语言,或只是想让语言模型学会如何遵循和回答指令,就像 ChatGPT 的工作方式一样,我们会进行微调!
微调是通过一个称为反向传播的过程来更新语言模型的实际"大脑"的过程。但是,微调可能会变得非常缓慢和非常耗资源。
Unsloth 可以在本地或通过 Google Colab 等其他 GPU 服务安装。大多数人通过 Google Colab 界面使用 Unsloth,它提供免费 GPU 来训练。
一些突出的特点:
✅ 开源版本训练快 5 倍,Pro 版本声称快 30 倍。
✅ 不使用近似方法,精度损失为 0%。
✅ 无需更改硬件,在 Windows via WSL 和 Linux 上工作。
你可以在网站上阅读安装说明和性能基准表。
你可以直接在 Hugging Face 上阅读文档和所有上传的模型。
他们还提供了关于"如何微调 Llama-3 和导出到 Ollama"的详细指南。
Unsloth 在 GitHub 上有 16.8k+ 个 star。
Khoj 是开源的 AI copilot 搜索。轻松获得答案,无需筛选在线结果或自己的笔记。
Khoj 可以理解你的 Word、PDF、org-mode、markdown、plaintext 文件、GitHub 项目,甚至 Notion 页面。
它可作为桌面应用、Emacs 包、Obsidian 插件、Web 应用和 Whatsapp AI。Obsidian 配合 Khoj 可能是最强大的组合!
你可以使用以下命令在几分钟内在本地开始使用 Khoj。
$ pip install khoj-assistant
$ khoj
一些令人兴奋的功能:
✅ 你可以共享你的笔记和文档来扩展你的数字大脑。
✅ 你的 AI 智能体可以访问互联网,允许你纳入实时信息。
✅ 你将在你的文档上获得快速、准确的语义搜索。
✅ 你的智能体可以创建深度个人化的图像并理解你的语音。
例如,说:"根据我的兴趣为我创建一张我的梦想房子的图片"。它会画出来!
阅读所有功能,包括可共享的聊天、在线聊天、文件摘要,以及各个类别的完整详情。
你可以阅读文档和...