大家好,我是程序员晚枫。
最近Kimi K3实在是太火了,让我这种不关注大模型的榜单的人,都不得不注意到它。
前两天我用它做了个PPT:WorkBuddy+Kimi K3做PPT,真挺好看的
既然PPT都能做,那肯定也能做视频,因为视频就是一页页的图片拼出来的。
周末我又拿出来上个月因为太丑放弃了的1分钟生成视频的skill,用K3做了一个视频,效果出来的那一刻,我自己还挺满意的。

做法说出来你可能不信,就三步:
先用其他大模型写好口播稿,让 Kimi K3 生成 Hyperframes 的 HTML 视频模板;再用 AI 逐段配音,把每段配音实际读了多久,填回时间轴里;最后本地跑一句 hyperframes render,几分钟出 MP4。
全程没碰剪映、没装插件、没学新软件。而且它不调用视频大模型,视频是拿代码"画"出来的,Token 花得特别少。
从头到尾就两个工具:Kimi K3 + Hyperframes。
成片什么样?转场丝滑、配色高级、节奏踩得准。发到朋友圈、发到短视频平台,都合适。
为什么用K3+Hyperframes
Kimi K3:月之暗面的新旗舰
Kimi K3 是月之暗面(Moonshot AI)在 2026 年 7 月发布的旗舰模型。
它最大的卖点是 WebDev 能力全球第一:在 arena.ai 的 Code Arena WebDev 排行榜上拿了 1678 分,把 Claude Fable 5(1634)和 GPT-5.6(1630)都压在了身后。

WebDev 第一是什么概念?说白了,凡是"能在浏览器里跑出来的东西",它写得最好——网页、可视化、动画,都算。
巧了,Hyperframes 的视频,本质上就是一个在浏览器里跑的 HTML 页面。这事儿正好撞在 Kimi K3 的枪口上。
Hyperframes:把 HTML 变视频
Hyperframes 是由 heygen-com 在 GitHub 开源的工具框架,核心理念很简单:
"用 HTML 写一个页面,就能渲染成 MP4 视频。"
所以用它来生成视频还有一个最大的好处,就是非常节约 Token。因为大家知道生成视频的大模型非常贵,我们等于是走了一个取巧的方法,用代码去生成视频。
你不用学 PR、不用学 AE、不用学剪映,只要有一个 HTML 页面:页面长什么样,视频就长什么样;动画用 GSAP 写;写完一行 render 命令,直接输出 1080P 的 MP4。

对会用AI写代码的人来说,这大概是门槛最低的视频方案——毕竟用AI这件事,我们天天都在干。
跟传统视频创作方式对比
| 维度 | PR/AE/剪映 | Kimi K3 + Hyperframes |
|---|---|---|
| 学习成本 | 高(要学软件操作) | 低(会调skill 就行) |
| 制作速度 | 1-3 小时/视频 | 10分钟/视频(含配音和质检) |
| 画面和人声同步 | 手动逐段对齐,改一处全要挪 | 实测时长注入时间轴,自动严格同步 |
| 设计感 | 取决于你的操作水平 | 取决于你的 prompt 描述 |
| 可复用性 | 低(每个项目从零开始) | 高(模板+口播稿可复用,换稿就是新视频) |
| 协作 | 文件大、难分享 | 纯文本+HTML,可版本管理 |
我的视频工作流(5 步)
网上很多教程是「一句 prompt 直接出片」,我实测下来,那样出的视频画面和节奏全靠运气。
下面这套视频工作流的skill,是我做了很多条视频之后固定下来的: https://github.com/CoderWanFeng/wanfeng-skills/tree/main/skills/knowledge-short-video,核心就一句话:
一个视频 = 一份视觉模板 + 一份口播稿,时间轴由配音的实测时长驱动。
第 1 步:写口播稿
先把主题用一句话讲清(比如「一杯咖啡的温度」),然后写一篇连续的口播稿——先别管分段和画面。
字数怎么定?按 4 字/秒 估:60–90 秒的短视频,大概 240–360 字。
第 2 步:把口播稿拆成分镜
把稿子按视觉节奏拆成一段一段。我的标准是每段不超过 30 个字,读出来 3–8 秒,超了就再拆。
还有两个容易被忽略的小细节:标点要写全(,。!?),因为标点直接决定配音的停顿,半角逗号中文会读得很怪;拆完先自己通读一遍,确认文字没问题再往下走。
第 3 步:让 Kimi K3 生成视觉模板
打开 Kimi K3,把分好段的口播稿贴进去,prompt 这样写:
1 | 请用 Hyperframes 框架,帮我做一个竖屏 9:16 的口播短视频模板。 |
这段 prompt 里最重要的,是让画面跟着口播稿分段走,而不是放任 AI 自由发挥一个"30 秒的整体"。段数对上了,后面画面和配音才能一段一段地对齐。
第 4 步:配音,把实测时长注入时间轴
这是整个工作流最核心的一步,也是大多数教程都不讲的:
每个 scene 显示多久,不是拍脑袋写的,是配音读了多久决定的。
具体做法是:先用 TTS 把口播稿逐段配音,一段一个音频文件——想省钱就用 macOS 自带的 say 命令,正式出片就换 MiniMax 这类 TTS API;然后用 ffprobe 量一下每段音频到底读了多长;最后把这些实测时长填回 HTML 模板里对应 scene 的时间轴上,再把整段配音挂进去。
这么折腾一圈,换来的是画面切换和人声严格同步。朋友圈里那句"节奏踩得准",其实全是这一步的功劳。
第 5 步:渲染 + 质检
环境很简单,装好 Node.js(nodejs.org)和 Hyperframes 就行。这些安装AI都会帮你干。
渲染时记得用已经装好的 hyperframes 命令:
1 | # 先出草稿快速预览 |
两个实测经验送给你:一是别用 npx hyperframes 渲染,它会联网装最新版,然后卡在一个交互确认上,看起来像死机了一样,这个坑我结结实实踩过;二是长视频是逐帧渲染的,通常要几分钟,只要进度条在动就不是卡死,去倒杯咖啡就好。

渲染完也别急着发。我的习惯是从成片里等间隔截 12 帧图出来过一遍眼:有没有黑屏、文字截断、排版溢出。就 10 秒钟的事,能避免发出去才发现翻车。
几个让效果加倍的实战技巧
下面这些,都是我拿多次熬夜和几亿Token换来的经验:
技巧 1:在 prompt 里强调「设计感」
别只说"做个产品介绍",而是说:
"参考 Apple 官网的设计风格,简约高级,留白充分"
同样一份口播稿,加不加这句话,出来的东西完全是两个档次。
技巧 2:明确指定动画库和素材源
不要让 AI 自由发挥,告诉它用哪些工具:
"用 GSAP 写动画,素材用 Unsplash 高清图,配色 #000 + #fff + #e63946"
不然它有时候会给你挑一些老旧的库,渲染的时候莫名其妙报错,查半天查不出来。
技巧 3:画面上的字,用观众的话说
字幕、角标这些画面文字,用观众能听懂的生活词。「钩子」「场景」「痛点」这类创作黑话,是写给你自己看的,别让它们出现在画面上。
技巧 4:先定文字,再合成音频
口播稿一定要先通读确认,再去批量配音。因为文字哪怕只改一个字,音频、时长、时间轴就全要重来一遍。把"确认文字"和"合成音频"当成两个独立环节,能省掉绝大部分返工。
技巧 5:两个容易翻车的坑
一个是配音片段时间重叠:如果你手动调过时间轴,相邻两段的结束和开始时间只能紧挨着,一旦重叠,画面直接全黑,而且你很难想到是这个原因。
另一个是BGM 盖人声:背景音乐音量别超过 0.25,不然观众根本听不清你在说什么。
说实话,做完这个视频之后,你也会发现:
AI 时代的视频创作,可能根本不是从剪映开始的。
剪映、PR、AE 这些工具,会越来越像"传统相机"——专业,但门槛高。而 Kimi K3 + Hyperframes 这种组合,更像手机:简单,但人人能用。
最重要的不是工具,是你会不会描述你想要什么。skill 写得越好,视频效果越惊艳。
视频创作这件事,正在从"专业技能"变成"基础表达能力"——就像十年前大家觉得"写作"是文人的事,现在写朋友圈、写小红书、写公众号,人人都在写。
下一个十年,做视频也会变成这样。
💬 来评论区聊聊
你最想用这个组合做什么视频?
评论区告诉我,我下篇专门出教程。
相关阅读
- 普通人做 AI 短剧:用这 6 个工具,从写剧本到成片
- Hyperframes 模板与样式完全指南:让你的视频更有设计感
- Kimi K3 WebDev 排名第一,用 Anthropic PPTX Skill 做惊艳 PPT
- Codex 视频插件全景:用 AI 编辑器搞定一切
我是晚枫。
科技不高冷,AI很好用。
关注我,带你一起玩AI!



