← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

我做了两个 AI 技能,一个帮你搜书,一个替你盯监管

AI/Agent 阅读原文(微信)↗

读完本文,你会搞懂为什么读书和投资在信息获取层面是同一件事,以及一个 AI Agent 技能从构思到发布的全过程。

━━━ ━━━ ━━━

引子

你有没有这种感觉:

想找本技术书——打开豆瓣→复制书名→去安娜档案搜索→找到下载链接→再回来对比格式。五个网站,十分钟,一本书还没到手。

想知道最近央行发了什么新规——打开央行官网→翻公告列表→再去外管局→再去工信部。每个网站设计风格不同,翻了一小时,脑袋快炸了。

我每天就活在这种信息焦虑里。于是决定——造两个 AI Agent 技能,让机器替我做这些脏活。

一个叫 find-ebooks(搜好书),一个叫 regulation-monitor(监管动态追踪)。

技能一:find-ebooks / 搜好书

这个技能的使命很简单:你给一个关键词,它帮你搜遍全网找书。

底层对接的是 安娜档案(Anna\'s Archive)——目前最全的电子书元数据库。但光有安娜档案不够,我要的是「一站式」:

  • 书名、作者、出版年份、语言、格式、文件大小——全部一次拉出来
  • 多个 slow_download 服务器随机选取,避免单点限流
  • Amazon 商品页、Google Books、微信读书——有就给你
  • 还有 6 个中文平台:豆瓣读书、掌阅 iReader、天猫图书、当当网、京东图书、机械工业出版社

每个平台用不同的搜索策略。豆瓣有评分页面,当当有商品链接,天猫反爬严格就只能给搜索页——都有对应的图标标记(✅ 表示直达商品页,🔍 表示搜索页需手动选择)。

技术上的挑战主要是反爬。安娜档案用 Cloudflare,得靠 cloudscraper 绕过去。中文平台各自有自己的 HTML 结构,正则匹配的逻辑写了三十多行。每个请求之间还要间隔 0.5 秒,不然直接给你 ban。

技能二:regulation-monitor / 监管动态追踪

这个技能的初衷更直接:我不想每天刷五个政府网站。

现在覆盖五家机构:

机构 数据源类型 更新频率
国家金融监管总局(NFRA) API(需 Cloudflare 绕过) 实时
证监会(CSRC) 静态 HTML 2021--至今
央行(PBOC) 静态 HTML 实时
国家外汇管理局(SAFE) 静态 HTML 实时
工业和信息化部(MIIT) CMS API JSON 实时

每家网站的技术栈都不一样:

  • NFRA 有 WAF 防护,得用 cloudscraper + 带 Referer 的 API 请求
  • CSRC 和 PBOC 是传统 HTML 列表页,BeautifulSoup 一把梭
  • SAFE 有三四个栏目(公告信息、政策法规、外汇新闻),每个结构微调
  • MIIT 用的是 CMS API,返回 JSON 里嵌 HTML,得剖开两层才能拿到数据

我统一做了一个 is_nav() 过滤函数,把「首页」「网站地图」「无障碍」「上海专员办」这些导航噪音全部去掉,只保留真正的公告和政策。

技术栈总结

两个技能的技术栈很相似:

Python → cloudscraper / requests → HTML/JSON 解析 → 结构化输出 ↓ Markdown 报告 / JSON / 终端表格

所有敏感配置(代理、API Key)通过环境变量或命令行参数传入,绝不硬编码。

这也是作为 SkillHub 标准技能的要求——发布到公开注册中心的技能,代码里不能有任何个人信息。

注册中心:SkillHub 与 ClawHub

技能写好了,放哪?

目前 AI Agent 技能有两个主流注册中心:

注册中心 地址 适用 CLI
SkillHub skillhub.club skillhub install
ClawHub clawhub.ai clawhub install

发布流程一模一样:

# SkillHub

skillhub push skillhub publish

# ClawHub

clawhub publish ./ --slug find-ebooks --version 1.1.0

发布完成后,用户只要一行命令就能安装:

# Codex / Claude / Cursor 等

skillhub install find-ebooks --agent codex

# OpenClaw

clawhub install find-ebooks

当然,前提是你要先注册并获取 API Token。登录方式两个 CLI 都支持 ——token 参数,别走浏览器流程——那个已经废了。

踩过的坑也不少:

  • SkillHub 安装不了自己的技能?原来 slug 格式有讲究
  • ClawHub 发布说「SKILL.md required」?路径得用绝对路径
  • 发布了搜索不到?要等 moderation 审核

都记在技能仓库的 README 里了,后来者不用再踩一遍。

信息蒸馏:读书和投资的底层逻辑

写这两个技能的过程中,我突然意识到一件事——读书和投资,本质是同一件事

读书,是从人类几千年的知识海洋里,找到对你最有价值的那些书,然后吸收精华。投资,是从每天海量的政策公告和市场数据里,找到影响你决策的那几条,然后做出判断。

两者的核心流程完全一样:

信息获取 → 清洗过滤 → 结构化整理 → 决策输出

我做的这两个 AI Agent,本质上就是两个「信息蒸馏器」:

  • find-ebooks蒸馏的是人类知识的精华(电子书)
  • regulation-monitor蒸馏的是权威信息的精华(监管政策)

它们不是在创造新东西,而是在帮人节省时间——把从 100 个网站找信息的时间,压缩到一句话。

下一步

这两个技能只是开始。接下来计划:

  1. 加更多数据源——比如知网、专利数据库
  2. 技能发布到 SkillHub 的公共市场,让更多人直接用
  3. 写一个「信息蒸馏」系列的下一篇:如何用 AI Agent 做个人知识管理

━━━ ━━━ ━━━

你在信息获取上遇到过什么痛点?留言说说,也许下一个技能就为你的需求而造。

如果你觉得这两个技能有用,欢迎关注 LeisureLinux,下周我们聊聊如何用 AI Agent 搭建个人情报系统。

━━━ ━━━ ━━━

*附:技能仓库地址 github.com/LeisureLinux/Skills,直接 fork 或 clawhub install 即可使用。*

你昨晚没看 `/wp-json/batch/v1`?WordPress 已经替你急了

OpenClaw 2026.7.1 预发行版全栈解读:从 GPT-5.6 默认到 Crash-loop 安全模式

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)