神经符号搜索模型Ontology 1性能碾压谷歌和亚马逊
Onton发布Ontology 1,精准度超Google Shopping 16%、Amazon 34%,用1%的索引量达成。对搜索和推荐系统架构师有直接参考价值。
Onton发布Ontology 1,精准度超Google Shopping 16%、Amazon 34%,用1%的索引量达成。对搜索和推荐系统架构师有直接参考价值。
Artificial Intelligence
Vision Language Model
Onton 是一家位于旧金山的搜索和发现公司,已发布 Ontology 1,这是一个用于复杂、对话式、多模态产品搜索的神经符号模型。在由三个独立LLM评审评分的90个查询基准测试中,Ontology 1 达到了0.630的平均precision@10,而 Google Shopping 为0.543,Amazon 为0.469。在这个过程中,它仅需索引其目录的大约1%。
不,不是以可下载的权重形式。Ontology 1 已在 Onton.com 上向终端用户上线,Onton 表示合作伙伴访问权根据具体情况授予那些在 agentic web 上进行构建的团队。模型本身没有公开 API、定价层或开放检查点。当今的采用形式更像是一种合作伙伴关系,而非 pip install。
中端市场和企业零售商、市场平台,以及 agentic-commerce 平台,这些平台的相关性栈在长查询和需求密集型查询上已经落后。小目录获益较少,因为 Ontology 1 针对的故障模式随目录规模和列表噪声而扩大。
目前仅限于家居装饰和家具,因为这是 Onton 索引的唯一垂直行业。Onton 声称该方法可推广到电子商务之外,且 Ontology 搜索非产品数据基本上无需重新配置。
对话式和多模态网站搜索、情绪板驱动的发现、否定型过滤、列表和评论信任评分,以及购物 agent 的基础层。
传统电商假设意图映射到类别和属性:尺寸、价格、材质、品牌。没有"宠物友好"的过滤器,也没有适合你房间的家具过滤器。Onton 主张这个目录界面在近30年里几乎没有改变。
Ontology 1 走了不同的路线。对于"宠物友好的转角沙发",它不信任卖家标签,后者可能不存在或不准确。它从更可能是客观的属性推理——纤维、织法、构造——并标记产品数据矛盾的声明。它还权衡信息来源,因为一些列表会游戏化算法,有些评论是付费的。
该模型构建一个明确的、可检查的世界模型,而不是将模式吸收到权重中。当它没有"宠物友好"的说明时,它将其视为一个缺口并解决答案:清洁性和耐用性,然后聚酯面料作为指标。学习被重新用于后续查询,如"宠物友好的椅子"或"可清洁的蓝色沙发",循环持续运行。
Onton 随附代码和数据发布了 Subtext-Decor-90。三个多模态评审——Claude Opus 4.8、Gemini 3.1 Pro 和 GPT-5.5,为 Onton、Amazon 和 Google Shopping 在90个文本查询中各自返回的前10个可见结果卡片评分。P@10 在评审间平均化,95% 置信区间来自10,000次引导重采样。
结果:Onton 0.630 [0.571, 0.688],Google Shopping 0.543 [0.490, 0.596],Amazon 0.469 [0.417, 0.521]。Onton 赢得52个查询,Google 19个,Amazon 16个。这些数字加起来是87,因为 Ontology 在三个查询中返回的结果少于10个,空位被评分为无关。如果排除这些空位,Onton 得分为0.665,Google 为0.549,Amazon 为0.459。
三个评审间的 Krippendorff's alpha 为0.465,所以绝对 P@10 值存在噪声并且评审相关。所有三个评审仍将搜索引擎排列在相同顺序。
图像和多模态查询被排除在90之外,因为 Amazon Lens 不支持多模态查询,Google Lens 不专门返回产品。Onton 报告了针对 Google 的单独10个查询图像和多模态比较。
失败案例聚集在 Amazon 的类别元数据主导的功能规格查询上:"3点钟阅读时不会唤醒伴侣的灯"(Onton 0.4,Amazon 0.9)和"可以放在异常深的窗台上的东西"(Onton 0.07,Amazon 0.67)。Onton 将此归因于目录广度和其单垂直、非赞助索引,并期望自学习循环来缩小差距。
Ontology 1 的知识图谱运行在 Ograph 上,这是一个自定义图数据库。Onton 报告一个 Ograph 核心相对于在14个核心上运行的 SuiteSparse:GraphBLAS,大约100倍的吞吐量(每核),GPU 构建比 CPU 变体快43倍,早期运行接触1000倍,随着实现不断优化。
下面的嵌入在四个面板中演示了相同的材料:Subtext-Decor-90 的真实查询及逐查询评分、逐步绘制的宠物友好推理图、自学习循环,以及带有置信区间和替代评分视图的基准测试图表。
Ontology 1 在 Subtext-Decor-90 上得分 P@10 0.630,超过 Google Shopping(0.543)和 Amazon(0.469)。
它在仅索引竞争对手目录的约1%的情况下,赢得了90个查询中的52个。
该架构是神经符号的:一个可检查的知识图谱,将模糊的谓词分解为可检查的属性。
评审可靠性较低(Krippendorff's alpha 0.465),但所有三个评审对搜索引擎的排列相同。
可用性是产品优先——在 Onton.com 上线,合作伙伴访问根据具体情况确定,无开放权重或公开 API。
查阅技术细节和基准测试。同时,欢迎在 Twitter 上关注我们,别忘了加入我们的15万+ML SubReddit 并订阅我们的新闻通讯。等等!你在 Telegram 上吗?现在你也可以在 Telegram 上加入我们。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?联系我们
Michal Sutter 是一位数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。凭借统计分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的见解。