作者用 RSS、关键词预筛、AI 评分和定时任务搭建约300行的资讯管线,每天自动筛选并汇总内容。先用低成本规则去噪,再调用模型,可减少费用和人工浏览时间。
过去,我每天早晨的开场都一模一样:打开十个标签页,浏览三份 newsletter、两页 Hacker News,同时越来越担心自己错过了什么重要内容。后来,我搭建了一套替我完成阅读的 pipeline——每天早晨因此节省了大约 30 分钟。
信息过载的问题并不在于内容太多,而在于噪声太多、信号太少。手动查看十个信息源,意味着你要为所有内容支付注意力成本,其中也包括那 90% 你根本不关心的信息。
这套 pipeline 大约由 300 行 Python 代码组成,通过 cron 定时运行,每天的成本只有几分钱。它分为三个阶段:
我只订阅真正重要的 feed——再也不用打开一堆浏览器标签页。一个简单的 feedparser 循环会从每个信息源拉取新内容,并将其放入队列。
import feedparser
def collect(feeds: list[str], since: datetime) -> list[dict]:
items = []
for url in feeds:
feed = feedparser.parse(url)
for entry in feed.entries[:20]:
ts = entry.get("published_parsed")
if ts and datetime(*ts[:6]) > since:
items.append({"title": entry.title, "link": entry.link, "source": url})
return items
在产生任何 AI 成本之前,先用低成本的关键词预过滤器剔除明显的噪声。如果某条内容与你的兴趣不匹配,它就永远不会进入 LLM。
KEYWORDS = {"python", "automation", "ai", "productivity", "open source"}
def prefilter(items: list[dict]) -> list[dict]:
return [i for i in items if any(k in i["title"].lower() for k in KEYWORDS)]
这一步将我的输入从大约 60 条减少到了约 15 条。也就是说,在进入成本较高的环节之前,就已经降低了 75% 的成本。
通过筛选的内容会由 LLM 根据我的兴趣进行评分。每条内容还会得到一句话的相关性说明——这样,我无需阅读全部内容,也能信任排序结果。
def score(item: dict) -> float:
prompt = f"Score 0-10 relevance for a developer focused on AI automation: {item['title']}"
# returns a number; items below 6 are dropped
return call_llm(prompt)
输入:来自 12 个信息源的 60 条内容
预过滤后:15 条内容
LLM 重新排序后:5 条内容进入晨间摘要
节省时间:每天大约 30 分钟
关键洞察是:先过滤,再排序。低成本规则可以剔除 75% 的噪声,让 LLM 只把 token 花在那些可能真正重要的内容上。
如果你每天会查看五个以上的新闻源,答案是肯定的。整套流程可以写在一个脚本里,运行在免费的 cron 服务层级上,而 LLM 的成本每周最多只需要几美分。
想要完整模板吗?它是开放的——在下方留言,我会分享 repo。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。