折腾了半个月,我搭了套自动跑内容的AI流水线,把踩坑记一下

最近号越开越多,一个人根本喂不饱那么多内容位,就想着能不能让机器自己产。试下来大概是这么个思路:用Python的transformers库对接Hugging Face上的预训练模型来出文本,然后拿GitHub Actions定时跑脚本,跑完发封邮件通知我。

中间接了个Google Trends的接口,看看最近大家搜什么,让机器出的东西别太离题。数据这块我用matplotlib画了个简单的图看趋势。

最有用的其实是最后加的那个质量打分模块,用连贯性和相关性两个维度卡一遍,不然纯生成的东西读起来一股塑料味,直接发出去要挨骂的。现在还在调,产出勉强能用,但离能完全放手还差得远。

定时跑那块GitHub Actions确实好使,免费用额度够用

质量打分这步是关键,不然生成的东西没眼看

Trends接口有次给我返空,你遇到过没

预训练模型直接出的文章还是能闻出来味儿

邮件通知这个细节不错,省得我一直盯着

我也在搞类似的,卡在评估模块这一步一直调不好