一套个人资讯信息萃取系统,具体怎么搭

浏览我的晨早播报博客:https://www.zhouqiang.com/brief-intro/

查看:花了 2 周,用 AI 手搓了一个超实用的资讯信息萃取系统

先交代一个可能让人意外的事实:这套每天自动给我端上情报简报的系统,没有一行代码是我自己写的,我都是用腾讯的 workbuddy 帮忙,让 AI 编程帮我实现的。

上篇说了它每天给我端上什么。这篇拆开讲,它是怎么搭的——难在哪、翻过什么车、哪一步最值钱。

一、先看全景:系统就三块

先把理论摆出来,其实特别朴素:不管你想做日报、周报还是播客,一套资讯萃取系统就三个模块——

进料:把散落在各个平台的内容定时抓回来;

加工:让 AI 读一遍、挑一遍、改写一遍;

出餐:排版成你能看的页面、能听的音频,准点送到你面前。

跟开餐馆一个结构:采购、后厨、前厅。哪一环出问题了,整桌菜都不对味。

对应到我的系统,实际长这样:每天早上六点,一个定时任务把公众号、社交平台上我关注的博主、还有几个行业媒体的热榜全部抓回来;AI 把这一百多条内容分进四个栏位,逐条打分,合格的改写成摘要;最后渲染成一页早报,再把高分条目单独写成播客稿、合成音频,六点零几分推到我企业微信上。

三大模块全景:进料、加工、出餐

三大模块全景:进料、加工、出餐

▲ 三大模块全景:进料、加工、出餐

三块里,最容易被低估的是加工。抓内容是体力活,排版是手艺活,”挑什么、扔什么”才是判断活。这块立不住,前面抓得再多、后面排得再漂亮,都是在精致的容器里堆垃圾。

下面按顺序拆。每块讲我用的方法,也讲我翻过的车。

二、三大模块的实现方法

进料:先管住”从哪来”

第一件事,信源是人,不是平台。

我的信源清单不是按”我玩哪些平台”列的,是按”我每天真的在看哪些人”列的:公众号里真会点开的号,社交平台上真会蹲更新的博主,再补几个行业媒体的热榜兜底。拢共几十个号。

这里有个方向问题。问”还有什么好内容可以抓”,清单会越拉越长,最后又回到刷不完的时间线;从”我本来在看什么”倒推,才收得住。

第二件事,把所有格式统一成一种。

每个平台的内容格式都不一样,逐个适配要命。有个开源工具叫 RSSHub,能把很多平台的更新变成同一种叫 RSS 的老格式,抓取就顺了。最难啃的是微信:我试过直接从微信里抓,折腾一番证明此路不通,最后老老实实走的镜像源。

信源清单怎么核对、我在这上面翻过什么车,上篇写过,不重复。只补一条:这份清单是活的,谁不更新了、谁是新发现的,定期过一遍。

加工:规矩比模型重要

内容抓回来,一天一百多条,AI 的活分三步:分类、打分、改写。

打分漏斗:一百多条进来,二十条出餐

打分漏斗:一百多条进来,二十条出餐

▲ 打分漏斗:一百多条进来,二十条出餐

分类简单。我按自己的口味设了四个栏位:AI 动态、人文认知、投资方法、财经动态。AI 动态最多十条,人文常常只有两三条。栏位给多大,看的就是口味。

打分是整套系统的灵魂,也最能看出”规矩比模型重要”。

第一版我让 AI 直接打 0 到 10 分。翻车翻得结结实实:同一条内容重跑一次,分数能差出两三挡,两成到一半的条目,连”进不进日报”这个最简单的判断都会翻转。更要命的是它不敢给低分——一条汽车公司破产重整的新闻,跟 AI 半毛钱关系没有,它给了 5.5 分。

后来我才想明白:让模型在连续的分数上做精细区分,它做不到,就只好中庸,什么都是”还行”。它不是不会打分,是替你打了个平安分。

改成档位制才稳。先让它回答几个必答题:有实质吗?合不合这个栏位?踩没踩红线?答完机械地映射到档位,和稀泥的退路就没了。再配一条:5 分起步,有加分项往上加,有硬伤往下减。

但这些还都是术。真正的核心是那份规矩清单,它是我跟 AI 吵架吵出来的:它选错一条,我讲一条为什么错;改完标准,拿新内容再试,不行再吵。清单上具体写了什么、那条最关键的分界线长什么样,上篇原样公布过,不重复。这份清单后来就长在了打分规则里,AI 每天照着执行。这是整个系统里最值钱的一个文件。

最后还有一道闸门:每个栏位有上限,分数不够就挤不进去。哪栏挤哪栏空,不凑数。有位投资大师的一组语录,每条才 5.5 分,早报里收了,播客因为容量有限没装下——这套打分不认人,名头再大也不加成。

同一天的真实早报:AI 动态满员 7 条,人文与认知只有 1 条——栏位头上的条数是系统自己标的

同一天的真实早报:AI 动态满员 7 条,人文与认知只有 1 条——栏位头上的条数是系统自己标的

▲ 同一天的真实早报:AI 动态满员 7 条,人文与认知只有 1 条——栏位头上的条数是系统自己标的

出餐:眼睛和耳朵各一份

早报页没什么玄乎的:四个栏位,每条是 AI 改写的小标题加两三句摘要,带分数和原文链接,顶部嵌一条播客音频。真正花功夫的是播客。

播客:耳朵比眼睛金贵

第一,稿子得单独写,不能拿早报直接念。每条先分配预算:最重要的 200 到 250 字,一般条目 130 到 170 字,5.5 分以下的直接不进音频。**耳朵比眼睛金贵,一句废话都嫌多。**全稿还有口语规矩:句子要短,直接称呼”你”,板块之间的转场写成主持人的话,禁止”下面进入 XX 板块”这种目录腔。

别信 AI 说”写好了”,让机器验收

第二,**别信 AI 自己说”写好了”,让机器来验收。**出过两次事故。一次,AI 把一位博主的内容张冠李戴到别的平台——原始链接明明白白,它就是写错了。还有一次更绝:播客片头是句固定的话,”笔记本”三个字,电子嗓念成了”笔记、本晨早”。这种错 AI 自己查自己查不出来。我最后写了个校验脚本,成稿后机器过七道检查:出处对不对、有没有内部术语、转场违不违规、该播的条目一条没少、字数在不在预算里……七道全过,才允许配音上线。

播客成稿前的七道校验,机器逐项过,全过才允许配音

播客成稿前的七道校验,机器逐项过,全过才允许配音

▲ 播客成稿前的七道校验,机器逐项过,全过才允许配音

最后一块:发布与告警

配音用的是免费的电子嗓,微软的晓晓。也有讲究:默认语速实测只有每分钟 280 字,听着发闷,调快 15% 才回到正常播客的密度。播出来十二分钟左右,通勤正好听完。

发布是全自动的:每天六点定时跑,跑完推到微信,音频传到博客。这里有个容易漏的细节:告警。程序挂了还能修,最怕挂了没人知道。我的判据不看程序退出码,看产物:六点半早报页面没更新、微信没收到推送,就是出事了。以结果论英雄。

三、每个人都能搭一套自己的

现在每天早上六点零几分,微信弹出那条推送,我在开车上班的路上点开音频,十几分钟听完,刚好到公司——第一天跑通的时候,我盯着手机听完了一整期,有点不敢信:这就是那个我跟 workbuddy 边聊边开发边修改、翻了几次车才搓出来的东西。

写到这你会发现,这套系统里没有一样东西算高技术:抓内容用开源工具,打分是让 AI 按清单办事,播客是稿子加免费配音。真正花掉我两个星期的,是把”什么值得看”这个我自己都说不清的判断,一点点讲给 AI 听,写成清单,再用机器校验兜住它每一次自作主张。

这件事每个会用 AI 对话的人都做得到。你不需要会写代码,写代码的活,AI 全包了。你真正要花的,是跟它吵那几十架的时间,把脑子里的口味,变成白纸黑字的规矩。

别贪大。不用一上来就四个栏位加播客,从一个最疼的地方开始:是刷不完的时间线,还是收藏夹里吃灰的文章?就从那里下手,做一个只进一栏、每天十条的小系统。跑顺了,再添耳朵,再开新栏。

工具会一直换,模型会一直便宜。那份清单不会过时——它写的,是你自己每天想看什么。

浏览我的晨早播报博客:https://www.zhouqiang.com/brief-intro/

查看:花了 2 周,用 AI 手搓了一个超实用的资讯信息萃取系统

本文系作者 @周强 原创发布在 周强笔记本,未经许可,禁止转载。
有帮助?
周强笔记本
周强· 本文作者
新媒体老兵
数字化营销和AI应用实战者。文中的系统均在实际业务中运行,欢迎交流。
关于我

发表评论

这个站点使用 Akismet 来减少垃圾评论。了解你的评论数据如何被处理。