Last30Days-Skill:一个跨 50+ 平台的实时信号聚合引擎及其技术架构分析
在 AI 领域,信息的半衰期正在以天甚至小时为单位缩短。传统的搜索工具聚合的是编辑精选的内容,而 Last30Days-skill 做的是另一件事——它聚合的是"人"的声音。
一、定位与核心哲学
Last30Days-skill 是一个开源 AI Agent Skill,设计目标是跨 Reddit、X、YouTube、HN、Polymarket、GitHub 等 15+ 平台并行搜索最近 30 天的内容,按真实用户参与度评分后合成结构化摘要。
其核心理念可以用项目官方的一句话概括:"Google aggregates editors. /last30days searches people." —— 它不是又一个更强的搜索引擎,而是一个将十几个孤立平台通过 Agent 桥接在一起的工具。
这个定位背后有一个明确的动机。开发者在 README 中写道:"I built it to keep up in AI. Everything changes every day and the Reddit and X nerds are always on top of it first." 在 AI 领域,真正的第一手信号往往来自社区而非传统媒体;Last30Days 的存在就是为了捕捉这些稍纵即逝的信号。
二、架构与零配置策略
2.1 分层数据源设计
Last30Days 采用了一种"零配置基础源 + 向导解锁扩展"的分层架构。Reddit、HN、Polymarket、GitHub 等平台开箱即用,无需 API key;首次运行后,30 秒的向导可解锁 X、YouTube、TikTok、arXiv、Techmeme 等更多平台。
这一设计在技术上有两层考量:
第一层是 Keyless RSS + Shreddit Scraping 恢复 Reddit 免费路径。 众所周知,Reddit 在 2023 年底关闭了免费 RSS API,迫使大量工具转向付费端点或放弃支持。Last30Days 通过 Shreddit 库模拟登录并恢复免费抓取路径,这是一种务实的工程选择——在平台政策收紧时,维持可用性的成本远比追求"纯净"的 API 调用方式更低。
第二层是 ScrapeCreators API 作为付费兜底。 当 Keyless 路径因反爬升级而失效时,ScrapeCreators API 提供 10,000 次免费调用额度作为降级方案。这一架构的核心问题是:当某个平台临时封锁 cookie 时,系统的降级策略是什么?从现有资料来看,降级似乎是逐级发生的——Keyless → ScrapeCreators → 跳过该平台。但这一过程对终端用户的可见性如何,以及何时触发告警,文档中并未充分说明。
2.2 多模式查询引擎
Last30Days 支持多种查询模式和输出格式:
- 人物/公司/技术对比查询:跨平台整合同一实体的信息
- 趋势发现模式(--discover):自动识别新兴话题
- JSON 结构化输出(--emit=json):供程序化消费
- HTML Brief:人类可读的简报格式
- Atom 订阅源:持续追踪机制
- SQLite Watchlist:本地数据库级持久化追踪
这种多模式设计使得 Last30Days 既能服务于人类研究者的阅读需求,也能嵌入自动化工作流——例如作为 CI/CD 中的竞争情报检查点,或作为研究辅助的定时简报生成器。
三、信号评分体系:从"编辑精选"到"真实参与"
3.1 参与度的多维量化
Last30Days 区别于传统搜索引擎的核心在于其评分体系:它不依赖编辑推荐或 SEO 排名,而是综合各平台的真实用户参与度信号。
项目方给出的量化表述是:"A Reddit thread with 1,500 upvotes is a stronger signal than a blog post nobody read." 这一判断背后是一种朴素但有力的假设——群体参与的密度与内容价值正相关。
具体来说,评分体系包含以下维度:
| 平台 | 信号类型 | 权重逻辑 |
|------|----------|----------|
| Reddit | Upvotes + 热门评论点赞数 | 群体共识强度 |
| X | Likes + Retweets | 传播广度 |
| YouTube | 观看数 + 转录关键句提取 | 深度内容信号 |
| Polymarket | 真金白银押注的赔率 | 经济激励下的真实判断 |
| GitHub | 提交速度 + PR 合并率 | 开发者活动强度 |
3.2 Polymarket 赔率的特殊性
Polymarket 的纳入是 Last30Days 最具辨识度的设计之一。项目方强调:"Polymarket odds backed by $66K in volume are harder to argue with than a pundit's guess." 这种将市场赔率纳入信号评估的做法,本质上是将"金钱投票"作为一种去噪机制——在信息过载的环境中,真金白银的押注比文字评论更难伪造。
然而,这一设计也引发了若干值得深挖的问题:
首先,Polymarket 赔率与社交平台情绪的交叉验证逻辑如何构建? 当 X 上的情绪与 Polymarket 的赔率方向不一致时,系统如何权衡?是否存在一个明确的风向标优先级?文档中没有给出算法层面的说明。
其次,市场操纵风险如何评估? Polymarket 虽然有一定交易量,但相比成熟的金融衍生品市场,其流动性仍然有限。小额资金即可在特定市场上制造显著的价格影响,这是否会导致信号失真?系统是否内置了异常交易模式的检测机制?
四、跨平台聚类与去重
4.1 同一事件的跨叙事聚合
Last30Days 的另一个关键技术能力是跨平台内容自动合并去重。同一事件在不同平台的报道会被聚类合并——例如 X 上宣布音乐节、Reddit 讨论票价、TikTok 传播 = 一个集群而非三条独立结果。
这一功能的实现依赖于事件级的语义聚类,而非简单的标题去重。其潜在的技术路径可能包括:
1. 实体识别与时间窗口匹配:首先识别事件涉及的核心实体(人物、组织、产品)和时间戳
2. 语义相似度计算:利用 Embedding 模型计算不同平台内容的语义重叠度
3. 叙事框架聚类:将相似语义内容按叙事角度进一步分组
4.2 争议视角的保留问题
这里存在一个值得警惕的技术伦理问题:跨源聚类算法如何处理同一事件的不同叙事框架?会不会无意中抹平争议视角?
以一个假设场景为例:某项 AI 政策出台后,X 上有支持者 praising its benefits,Reddit 上有反对者 criticizing its implications,而 Polymarket 上出现了方向相反的预测赔率。如果聚类算法简单地将其合并为一个"政策讨论"集群,那么争议本身的结构就被消解了——系统呈现的是"有一个讨论",而非"讨论中存在对立"。
这要求聚类算法在"去重"和"保留多样性"之间找到精细的平衡点。目前的文档中未见对此问题的讨论,这是一个值得作者回应的技术盲区。
五、深度内容提取能力
5.1 多模态内容解析
Last30Days 在不同平台上的内容提取深度存在显著差异,这反映了各平台数据结构和技术可达性的不均衡:
- YouTube:通过 yt-dlp 提取完整转录,并进一步提炼 5 个关键句。这是一个有价值的筛选层——原始转录往往冗长且重复,关键句提取直接将视频内容转化为可快速消费的文本信号。
- Reddit:热门评论带点赞数展示,保留了社区评选的层次结构。
- TikTok:caption 纳入分析,尽管视频内容本身无法直接转录,但文本描述仍提供了话题线索。
- GitHub:提交速度和 PR 合并率纳入分析,将代码活动量化为可比较的信号。
5.2 浏览器 Cookie 提取机制
Last30Days 的一个重要技术细节是:浏览器 cookies 从本地 Chromium 系列浏览器提取。这意味着用户已登录的平台(如 X、Reddit)可以直接使用其会话凭据进行抓取,而无需额外配置 API key。
这一设计带来了一个隐私层面的张力:虽然项目强调"隐私优先本地运行"——MIT 许可,无追踪无 analytics,研究数据存储在本地 ~/Documents/Last30Days/,API keys 存储于 OS keychain——但浏览器 cookie 的本质是用户的身份凭证。将这些凭证用于自动化抓取,是否违反了目标平台的服务条款?这是一个法律灰区,也是用户需要自行评估的风险。
六、社区驱动与长期演进
6.1 贡献规模
从 v3.3(2025年5月)到 v3.11.1(2026年7月),Last30Days 经历了 175 个合并 PR,其中 122 个来自 52 位社区贡献者。这一贡献密度在开源 AI 工具中属于较高水平,表明项目已形成稳定的社区生态。
改进领域涵盖:
- arXiv/Techmeme 自动安装
- Reddit keyless 路径恢复
- X pipeline 重写
- 安全加固
6.2 维护成本与挑战
然而,50+ 平台的适配维护成本是一个持续的压力源。每个平台都可能随时改变其反爬策略、API 政策或前端结构,这意味着 Last30Days 需要持续投入工程资源来维持可用性。
社区贡献模式能否支撑长期演进?从现有数据来看,52 位贡献者在 14 个月内完成了 122 个 PR,平均每月约 9 个 PR 来自社区。这一速率足以支撑迭代,但面对平台政策的突发变化时,响应速度可能不足。此外,核心维护者的角色缺失(文档中未提及专职维护者)意味着项目的可持续性高度依赖个别贡献者的持续投入。
ScrapeCreators API 的 10K 免费调用额度对重度用户的实际影响也不容忽视。对于一个每天运行多次查询的研究者而言,免费额度可能在数周内耗尽,之后的成本结构如何,文档同样未予说明。
七、兼容性与生态集成
Last30Days 通过 /plugin marketplace 或 npx skills add 安装,兼容 Claude Code、Codex、Cursor、Copilot、Gemini CLI、OpenClaw 等 50+ AI agent 平台。Codex 的原生插件化支持 renderer-aware citations,这意味着不同的渲染器可以根据自身能力选择合适的引用展示方式。
这种广泛的兼容性既是优势也是负担:优势在于用户几乎可以在任何主流 AI 编码环境中使用它;负担在于适配和维护的成本随平台数量线性增长。
八、小结
Last30Days-skill 代表了 AI 时代信息聚合工具的一个明确转向:从"编辑精选"到"真实参与",从"单一搜索引擎"到"跨平台 Agent 桥接"。其信号评分体系将 Polymarket 赔率、Reddit upvotes、GitHub 活跃度等多元信号纳入统一框架,为研究者提供了一个在传统搜索引擎中难以获得的"人群信号层"。
然而,这一工具也面临若干未解的技术与伦理问题:跨源聚类的争议视角保留、Polymarket 信号的可操纵性、浏览器 cookie 提取的法律边界、50+ 平台的长期维护可持续性。对于重度用户而言,免费 API 额度的消耗速度也是一个需要纳入考量的实际因素。
正如项目方所言,"That's the unlock. Not one better search engine. A dozen disconnected platforms, bridged by an agent." Last30Days 的真正价值不在于它找到了更好的答案,而在于它搭建了一座桥梁——让分散在十几个平台上的"人声"得以汇聚、比较、交叉验证。在信息爆炸的时代,这种能力本身就是一种基础设施。
更多推荐




所有评论(0)