读完本文,你会搞懂为什么读书和投资在信息获取层面是同一件事,以及一个 AI Agent 技能从构思到发布的全过程。
━━━ ━━━ ━━━
引子
你有没有这种感觉:
想找本技术书——打开豆瓣→复制书名→去安娜档案搜索→找到下载链接→再回来对比格式。五个网站,十分钟,一本书还没到手。
想知道最近央行发了什么新规——打开央行官网→翻公告列表→再去外管局→再去工信部。每个网站设计风格不同,翻了一小时,脑袋快炸了。
我每天就活在这种信息焦虑里。于是决定——造两个 AI Agent 技能,让机器替我做这些脏活。
一个叫 find-ebooks(搜好书),一个叫 regulation-monitor(监管动态追踪)。
技能一:find-ebooks / 搜好书
这个技能的使命很简单:你给一个关键词,它帮你搜遍全网找书。
底层对接的是 安娜档案(Anna\'s Archive)——目前最全的电子书元数据库。但光有安娜档案不够,我要的是「一站式」:
- 书名、作者、出版年份、语言、格式、文件大小——全部一次拉出来
- 多个 slow_download 服务器随机选取,避免单点限流
- Amazon 商品页、Google Books、微信读书——有就给你
- 还有 6 个中文平台:豆瓣读书、掌阅 iReader、天猫图书、当当网、京东图书、机械工业出版社
每个平台用不同的搜索策略。豆瓣有评分页面,当当有商品链接,天猫反爬严格就只能给搜索页——都有对应的图标标记(✅ 表示直达商品页,🔍 表示搜索页需手动选择)。
技术上的挑战主要是反爬。安娜档案用 Cloudflare,得靠 cloudscraper 绕过去。中文平台各自有自己的 HTML 结构,正则匹配的逻辑写了三十多行。每个请求之间还要间隔 0.5 秒,不然直接给你 ban。
技能二:regulation-monitor / 监管动态追踪
这个技能的初衷更直接:我不想每天刷五个政府网站。
现在覆盖五家机构:
| 机构 | 数据源类型 | 更新频率 |
|---|---|---|
| 国家金融监管总局(NFRA) | API(需 Cloudflare 绕过) | 实时 |
| 证监会(CSRC) | 静态 HTML | 2021--至今 |
| 央行(PBOC) | 静态 HTML | 实时 |
| 国家外汇管理局(SAFE) | 静态 HTML | 实时 |
| 工业和信息化部(MIIT) | CMS API JSON | 实时 |
每家网站的技术栈都不一样:
- NFRA 有 WAF 防护,得用 cloudscraper + 带 Referer 的 API 请求
- CSRC 和 PBOC 是传统 HTML 列表页,BeautifulSoup 一把梭
- SAFE 有三四个栏目(公告信息、政策法规、外汇新闻),每个结构微调
- MIIT 用的是 CMS API,返回 JSON 里嵌 HTML,得剖开两层才能拿到数据
我统一做了一个 is_nav() 过滤函数,把「首页」「网站地图」「无障碍」「上海专员办」这些导航噪音全部去掉,只保留真正的公告和政策。
技术栈总结
两个技能的技术栈很相似:
Python → cloudscraper / requests → HTML/JSON 解析 → 结构化输出 ↓ Markdown 报告 / JSON / 终端表格
所有敏感配置(代理、API Key)通过环境变量或命令行参数传入,绝不硬编码。
这也是作为 SkillHub 标准技能的要求——发布到公开注册中心的技能,代码里不能有任何个人信息。
注册中心:SkillHub 与 ClawHub
技能写好了,放哪?
目前 AI Agent 技能有两个主流注册中心:
| 注册中心 | 地址 | 适用 CLI |
|---|---|---|
| SkillHub | skillhub.club |
skillhub install |
| ClawHub | clawhub.ai |
clawhub install |
发布流程一模一样:
# SkillHub
skillhub push skillhub publish
# ClawHub
clawhub publish ./ --slug find-ebooks --version 1.1.0
发布完成后,用户只要一行命令就能安装:
# Codex / Claude / Cursor 等
skillhub install find-ebooks --agent codex
# OpenClaw
clawhub install find-ebooks
当然,前提是你要先注册并获取 API Token。登录方式两个 CLI 都支持 ——token 参数,别走浏览器流程——那个已经废了。
踩过的坑也不少:
- SkillHub 安装不了自己的技能?原来 slug 格式有讲究
- ClawHub 发布说「SKILL.md required」?路径得用绝对路径
- 发布了搜索不到?要等 moderation 审核
都记在技能仓库的 README 里了,后来者不用再踩一遍。
信息蒸馏:读书和投资的底层逻辑
写这两个技能的过程中,我突然意识到一件事——读书和投资,本质是同一件事。
读书,是从人类几千年的知识海洋里,找到对你最有价值的那些书,然后吸收精华。投资,是从每天海量的政策公告和市场数据里,找到影响你决策的那几条,然后做出判断。
两者的核心流程完全一样:
信息获取 → 清洗过滤 → 结构化整理 → 决策输出
我做的这两个 AI Agent,本质上就是两个「信息蒸馏器」:
- find-ebooks蒸馏的是人类知识的精华(电子书)
- regulation-monitor蒸馏的是权威信息的精华(监管政策)
它们不是在创造新东西,而是在帮人节省时间——把从 100 个网站找信息的时间,压缩到一句话。
下一步
这两个技能只是开始。接下来计划:
- 加更多数据源——比如知网、专利数据库
- 技能发布到 SkillHub 的公共市场,让更多人直接用
- 写一个「信息蒸馏」系列的下一篇:如何用 AI Agent 做个人知识管理
━━━ ━━━ ━━━
你在信息获取上遇到过什么痛点?留言说说,也许下一个技能就为你的需求而造。
如果你觉得这两个技能有用,欢迎关注 LeisureLinux,下周我们聊聊如何用 AI Agent 搭建个人情报系统。
━━━ ━━━ ━━━
*附:技能仓库地址 github.com/LeisureLinux/Skills,直接 fork 或 clawhub install 即可使用。*