实战案例展示Claude Code在HN、ArXiv等海量数据源上的查询能力,证明其在大规模信息检索中的潜力。
搜索引擎接受几个词并返回十个排序的链接。但 agent 实际提出的问题很少是"十个链接"。更多是:提及这个化合物但不提及那个专利的每个页面,按域分组,仅限三月以来。这是一个查询,不是搜索,而 agent 一直在通过运行多次搜索并抓取结果来近似它。
Scry 将公共网络数据保持为可查询的源原生关系:每个源一个 schema,保持该源自己的标识符和来源信息。你的 agent 通过 HTTPS 针对它们编写 SQL。查询返回所有匹配的行,而不是排序的选择。
你的 agent 读取实时 schema(/v1/scry/schema),选择一个启用的源原生关系和列出的向量助手,然后为短语匹配、时间窗口、连接或向量组合编写有界 SQL。结果行保持源原生标识符和关系提供的来源字段。
研究 agent 检查数百个源而不是只浏览五个。监视查询,观察网络上任何你能写下来的条件。从野生网络中提取结构化数据集,无需构建爬虫。
哪些公开的 X 账户称赞了一个模型发布但批评了下一个,哪些源行支持了这个信号?
Hacker News 上关于 Sam Altman 和 SBF 的内疚、正义和荣誉的讨论如何随时间变化?
哪些 Reddit 社区最先使用了一个技术短语,哪些评论推动了它的传播?
哪些公开的 Mastodon 帖子使用了相同的术语,哪些用户发布了它们?
哪些学术论文文本提取足够干净以供下游嵌入使用,确切使用了什么分块和模型规范?
Agent 可以通过反馈端点发送源请求或产品反馈。
覆盖范围因源而异。某些语料库实时上线或增量到达;其他的是批量导入或固定快照。下表描述了今天提供的内容;/v1/scry/schema 是当前查询覆盖范围和关系新鲜度的权威,而 /v1/stats 报告语料库计数。
Scry 是公益基础设施:搜索公开证据,每个结果都可追溯到其源。
Scry 处于 alpha 阶段:语料库、索引和接口变化快速。通过下面的表单或 /feedback 端点报告缺失的源、缺失的索引或痛点。
签名使用从额度中扣除,有每日和每月支出控制。拥塞定价让紧急工作在系统负载下购买优先级。定价问题:[email protected]。
— = 尚未测量。徽章和实时计数:/v1/stats。
发送存档、API、提要或数据集。Scry 摄取、索引和嵌入它,然后将其公开为 SQL、搜索和向量。一次性导入、定期刷新和数据集许可按项目定价。
用其确切的源和嵌入规范读取当前的学术论文分块嵌入。
embeddings.academic_paper_chunks
用实时欧几里得范数助手测量一个向量。
scry_vector_norm(embedding)
将向量的每个元素按选定的标量缩放。
scry_scale_vector(embedding, 0.6)
移除一个向量沿另一个向量方向的分量。
scry_debias_vector(embedding, topic)
从一个极点减去另一个极点的方向构建单位向量。
scry_contrast_axis(positive, negative)
用实时余弦相似度助手比较两个向量。
scry_cosine_similarity(left, right)
export SCRY_API_KEY=your_key
curl https://api.scry.io/v1/scry/query \
-H "Authorization: Bearer $SCRY_API_KEY" \
-H "Content-Type: text/plain" \
-d "SELECT hn_id, title, original_author, original_timestamp, uri
FROM hackernews.items
WHERE title != ''
ORDER BY hn_id DESC
LIMIT 20"
"机制可解释性"如何在 Hacker News 上随时间流动,哪些作者和线程推动了它?
-- 1) Confirm the source-native shape with the live schema's bounded sample.
SELECT hn_id, title, original_author, original_timestamp, uri
FROM hackernews.items
WHERE title != ''
ORDER BY hn_id DESC
LIMIT 20;
-- 2) Trace the phrase through Hacker News by month, authors, and source rows.
WITH mentions AS (
SELECT hn_id, title, original_author, original_timestamp, uri
FROM hackernews.items
WHERE is_deleted = false
AND original_timestamp IS NOT NULL
AND hasToken(search_text_lc, 'mechanistic')
AND hasToken(search_text_lc, 'interpretability')
AND positionCaseInsensitive(
search_text_lc,
'mechanistic interpretability'
) > 0
ORDER BY original_timestamp ASC, hn_id ASC
LIMIT 5000
)
SELECT toStartOfMonth(original_timestamp) AS month,
count() AS mentions,
uniq(original_author) AS authors,
argMin(tuple(hn_id, original_author, title, uri), original_timestamp) AS first_mention
FROM mentions
GROUP BY month
ORDER BY month ASC
LIMIT 120;