这是什么:一个交给 AI 助手的技能包
如果你的电脑里有一个 AI 助手——WorkBuddy、Claude,或者你自己搭的 agent——它现在大概已经会写文档、做 PPT、帮你查资料。这篇文章介绍的东西,让它再多会一件事:替你运营一个视频号,从找选题到发成片,再到第二天把数据抓回来告诉你哪里要改。
它的形态是一个压缩包。解压之后没有界面、没有 App、没有要注册的网页——里面是一套写给 agent 看的作业指引(SKILL.md)和一套脚本。你要做的第一件事是把文件夹丢给你的助手,然后说一句:「读这个包的 SKILL.md,按里面的流程跑。」剩下的命令都由它来执行。
三个「不是」:它不是代运营——账号、密钥、数据全程在你自己电脑里;它不是 SaaS——没有按条计费,没有后台;它也不是无人值守的印钞机——每一条真正发出去的片子,都经过你的确认。
为什么做成给 agent 用的形态?因为我们自己就是这么用的:我们同时运营 3 个视频号(科技、足球、茶),这条产线每天真实在跑。把「怎么跑」写成一份 agent 能照着执行的说明,比把它做成一个软件更诚实——软件会过时,流程不会。
它替你做的 8 件事
整条链拆成 8 个阶段,每个阶段都能单独重跑。哪些要花钱、花多少,表里直接标出来:
| # | 阶段 | 它做什么 | 花钱吗 |
|---|---|---|---|
| 1 | 抓信源 | 从 163 个公开通道抓当天内容,取正文 | ¥0,免登录免密钥 |
| 2 | 选题打分 | 按你的账号定位给候选选题打分排序(DeepSeek) | ¥0.002/次 |
| 3 | 写口播稿 | 按选题写成稿,含一次自动返工(DeepSeek) | ¥0.010/条 |
| 4 | 配音 + 字幕 | 云端语音合成(edge-tts),句级时间戳 | ¥0 |
| 5 | 生成画面 | MiniMax H3(768P),6 秒 × 2 片循环 | ¥6.00,走你自己的 Key |
| 6 | 合成成片 | 本机合成、字幕烧录,纯 CPU | ¥0 |
| 7 | 发布 | 浏览器自动化,默认干跑,确认才真发 | ¥0 |
| 8 | 数据回流 | 读你自己的后台数据,输出「问题→动作」 | ¥0 |
一个容易忽略的细节:配音排在生成画面之前。不是随意的顺序——音轨长度是确定的,画面要服从音轨;反过来做,配音一改画面就得全部重做。这条顺序是我们踩过坑之后改的。
表里的模型是默认档,不是写死的。三家厂商都写在配置文件里,改一行就换:画面引擎 engine.provider 可选 minimax(海螺 H3 / Hailuo)或 seedance(豆包 Seedance,火山引擎);配音 tts.provider 可选 edge(免费云端、无需 Key)或 minimax(付费,与画面同厂同 Key);文字模型由 LLM_BASE_URL 与 LLM_FLASH_MODEL 指定,任何 OpenAI 兼容接口都能接,不限于我们默认用的 DeepSeek。换厂商只改配置,脚本一行不动。
换引擎不是换个名字,换的是单价和画风——下一节的账单会把几档的差价一起列出来。另外交代一条边界:跑在本机显卡上的开源视频模型、以及本地部署的语音合成,我们只预留了接口、当前尚未实现,所以不会把它们写成可用选项。
用起来什么感觉:一条命令,三条前置
前置条件只有三条:一台普通电脑(Windows 或 macOS 都行)、能上网、你自己的账号(模型服务和视频平台的)。不需要显卡——画面生成走云端 API,你本机的 GPU 占用是 0。
第一次跑的完整过程是这样的:
- 把包交给助手,它先做一次环境自检(15 项),把「你已经有什么、还缺什么」列成清单给你——缺的东西每一项都附了对应平台的安装命令;
- 扫码登录视频号。登录发生在你自己电脑的浏览器里,凭据不出本机;
- 跑一次零成本全链演练:8 个阶段全部走一遍,但不真发、不渲染,大约 27 秒、花 0 块钱——先确认整条链在你机器上通不通,再谈花钱;
- 确认没问题,才让它跑第一条真实成片。
「先演练再花钱」不是话术,是这套包的设计原则:能复算的绝不重跑,能干跑的绝不真发。改一次口播稿返工只要几分钱,重渲一版画面要 6 块——所以所有修改都尽量留在纸面上解决。
一条成片多少钱:怎么算出来的
先把样本说清楚:一条真实发布过的茶号成片,34.37 秒竖屏(1080×1920),整条链合计 约 ¥6.01。整条链只有两笔钱——位置、模型、单价、用量、公式全在下面这张表里,你可以自己乘一遍:
| 花钱的地方 | 用什么 | 单价 | 用量 | 怎么算出来的 |
|---|---|---|---|---|
| 生成画面 (第 5 段) | MiniMax H3 (海螺 H3,768P 档) | ¥0.50 / 秒 官方中国站按秒计价 | 6 秒 × 2 片 = 12 秒 | 0.50 × 6 = ¥3.00 / 片 3.00 × 2 片 = ¥6.00 |
| 选题打分 (第 2 段) | DeepSeek V4.1-Flash | 输入 ¥1.07 / 百万 token 输出 ¥4.26 / 百万 token (低峰时段) | 1 次调用 提示词 1014 字符 | 约 ¥0.002 |
| 写口播稿 (第 3 段) | DeepSeek V4.1-Flash | 同上 | 3 次调用,8308 字符 (含 1 次返工) | 约 ¥0.010 |
| 其余六段:抓信源 / 配音 / 合成 / 发布 / 数据回流 | ¥0 | |||
| 合计 | ≈¥6.01(6.00 + 0.002 + 0.010) | |||
一句话读这张表:¥6.00 ÷ ¥6.01 ≈ 99.8% 的钱花在画面上——写稿相关的两笔加起来 ¥0.012,其余六段是 0。三个口径必须一起看,少一个数字就会被误读:
- 「2 片」是循环策略,不是用量单位。6 秒素材循环 3 轮撑满 34 秒。同一条片子若全程不重复、拆满 6 片,就是 ¥18——3 倍差。所以「6 块」的前提是采用循环策略,这是我们的选择,不是一个固定价格。
- 分辨率档位决定单价。同样是 H3:768P 档 ¥0.50/秒(本表用的就是它);换 2K 档 ¥0.80/秒 → 单条 ¥9.60(贵 60%);换 H3-Max 480P ¥0.33/秒 → ¥3.96。
- 画面 API 的费用走你自己的 Key,我们不代收、不转售、不做充值——一旦我们来收这笔钱,这个工具就从「你的产线」变成「我们的代运营」,性质就变了。
单价会变,所以交代出处:模型名与各档单价来自 MiniMax 中国站官方定价与 DeepSeek 官方定价,2026-10 核对;其中 ¥0.50/秒 这一档我们用真实账单逐个任务对过账(每次生成在本地台账留一条记录,含时长、分辨率、实际花费)。完整的三杠杆对比与更细的账单,见 《日更 3 个视频号两个月:真正卡住我们的不是创意,是产线》。
它明确不做的四件事
介绍一个工具,说清它「不做什么」比罗列功能更重要。四条边界:
| 不做的事 | 为什么 | 对你意味着 |
|---|---|---|
| 不碰你的账号密码 | 登录态在你本机浏览器里,上传、发布都在你眼前发生 | 账号安全不依赖任何人的承诺 |
| 不默认真发 | 发布是整条链里唯一不可撤销的动作,默认干跑,加确认参数才真发;另有内容指纹幂等、连续失败熔断两道护栏 | 不会半夜替你发出一条你没看过的片子 |
| 不做多号并发 | 当前一个浏览器实例对应一个账号,切号需要重启实例 | 想跑 3 个号就像我们一样按顺序跑,不是同时跑 |
| 不保证每片爆款 | 它保证「今天有片发、数据回得来」,但不保证每一条都爆 | 数据回流帮你看趋势、提假设,不编结论 |
怎么拿到、怎么开始
技能包在我们的开放能力页免费下载。拿到之后的三步:
- 解压到任意目录;
- 把这个文件夹交给你的 AI 助手,说「读 SKILL.md,按流程走」——环境自检、缺什么装什么、扫码登录,它都会带着你做;
- 先跑零成本演练,通了再花第一笔 6 块钱。
如果你不熟命令行,也不需要担心:所有命令都应该由你的助手来执行,你只做两件事——扫码,和告诉它你想做一个什么号的账号。这也是我们把它做成技能包而不是软件的原因:交付物的读者本来就是 agent,不是人。
微信内识别二维码分享此文