在NVIDIA边缘设备部署Ollama本地LLM的性能评测;针对想在资源受限环境运行AI的开发者。
前言:第一部分相关文章
这个特殊的"兔子洞"源于我之前在 DEV 上与另一位成员的一次对话,我们讨论了基准测试和测试的相关问题。由此衍生出许多疑问:
最好的基准测试方法是什么?
什么样的数字算是好数字?
什么信息真正重要?
事实是,这在很大程度上取决于你在做什么,以及什么对你最重要。对我来说,为了我的小型测试生成应用,目的很明确:用 AI 在本地创建一个简单应用,完全免费,能够从现有文本生成闪卡和测验,用于学习复习。我得承认,迄今为止我花在挖掘有趣工具上的时间远多于实际复习的时间。
在这段旅途中——我做了太多东西,都不知道该从哪里开始讲起。但我会尽量专注于测试这个话题。基本上,我想找出哪个模型能在我的 Nano 上运行得最好,并且不让它崩溃——我确实在某个时刻弄崩溃过。这是个题外话,我稍后再说,但我把与 Claude 的那段对话保存在 techdocs 里了,如果想看点有趣的东西可以去看(techdocs → 点击左边的 jetson nano)。问题是我的 Nano 内存不足以运行测试。为此我创建了一个交换文件来应应急,毕竟我容易惹麻烦。
安全措施就位后,我从一个网页快速创建了一个关于 OSI 模型的测验,用作对比结果的参考。感谢 Vinicius Pereira 在我们讨论中的建议!然后我对各个模型分别运行了这项测试,并尝试了不同的"量化"水平(这算动词吗?)来揭示这个概念的奥秘。
高层结论是——如果一个模型高度量化,你会损失精度。这是硬道理。
我费力做完所有这些才意识到,唉,这只针对一个特定的使用场景。要在多个不同的使用场景上映射性能特征会是一项繁重的工作。我很好奇,如果你有 Nano,你用 Ollama 做过什么?(不是说我需要另一个理由来囤积数据 XD)
无论如何,如果你不想离开本页面,这里是一份表格总结:
上面有些空白的单元格是因为这些模型超出了 Nano GPU 的能力,运行测试没有意义,因为它们本身就无法因为硬件限制而正常工作。
这些数字基于 10 个问题的测试集,所以这就是为什么数字看起来如此精确。显然这只是一个简单的高层测试,但我想完整地走完整个流程。经过这些实践,我认识到这个兔子洞有多深多广——我这里只是刚刚触及表面。不过从我的测验生成使用场景的简单测试来看,qwen2.5:3b-instruct 表现最出色。等我把应用重新整理好,从 llama3.2:3b-instruct 切换到 qwen 时,我就能尽情使用它了~这是改天的事了。
我相信很多读者都看过其他地方发布的基准数据。我很想请各位给这份数据做个同行评审,告诉我我的方向是否大致正确,或者数据是否有什么奇怪的地方。我感觉自己正在陷入一个测试的深坑。我知道其他人做过这些工作,也有很多现成的数据可查,但这样做对理解这些技术本身有什么实际帮助吗?
部分评论可能仅对已登录用户可见。请登录以查看所有评论。
如需进一步操作,你可以屏蔽此用户和/或举报滥用行为。