OpenShorts 智能16:9转手机 9:16 尺寸,智能提取高光镜头,AI 口播/UGC 营销短视频生成

OpenShortsmutonby/openshorts)是一个开源、可自部署的 AI 短视频全流程生成与自动化平台(基于 MIT 开源协议)。

它的核心定位是作为商业 SaaS 工具(如 Opus Clip、Klap、Submagic、Vidyo.ai)的开源替代品。它不仅能自动将横屏长视频裁剪为竖屏短视频,还整合了 AI 演员/UGC 营销视频生成以及 YouTube 运营辅助系统,旨在提供无水印、无使用限制、零订阅费的短视频矩阵解决方案。

以下是对该项目的全面深度解析:

1. 软件架构与底层开发生态

  • 协议与许可证MIT 开源协议(代码完全开源,自部署无水印、无流量限额、无商业限制)。

  • 核心编程语言与技术栈

    • 后端框架:Python(FastAPI)、Async 任务队列、FFmpeg 视音频处理管线。

    • AI 模型与推理:Faster-Whisper(语音识别)、Google Gemini(大模型文本/高光分析与 FFmpeg 视效生成)、YOLOv8 / MediaPipe(人脸检测与主体追踪)。

    • 集成与 API:原生集成 MCP(Model Context Protocol) 服务器接口,便于 Claude、ChatGPT 或 n8n 等 AI Agent 自动化驱动。

  • 架构模式:采用前端仪表盘 + 后端 Agent Server/处理管线 + Docker 容器化引擎解耦设计。

 

图片[1]-OpenShorts 智能16:9转手机 9:16 尺寸,智能提取高光镜头,AI 口播/UGC 营销短视频生成-共赢源码

2. 三大核心功能模块 (3-in-1 Platform)

OpenShorts 并非单一的裁剪工具,而是包含了三个相互独立的AI视频生产系统:

① AI 智能长转短(Clip Generator)

  • AI 爆款高光检测:利用 Google Gemini 模型对 Whisper 生成的逐字转写字幕进行语义分析,在一集播客/演讲/直播中智能提取出 3~15 个具备高传播潜力的 15~60 秒高光片段。

  • 智能 9:16 画面重构:基于人脸/主体追踪,自动平滑移动视窗。

    • 特色分屏:当画面中有双人/多人对话时,AI 会自动采取上下分屏(Stacked Layout)拼接画面,并将动态字幕精准叠加在分屏缝隙处,避免遮挡人脸。

  • Hook 动态标题与视效:自动生成前 3 秒吸睛标题,并使用 Gemini 动态生成 FFmpeg 滤镜调整调色与转场。

  • 多语言 AI 语音克隆与翻译:对接 ElevenLabs API,支持将视频一键翻译并克隆声音导出为 30+ 种语言的音轨,同时生成同步字幕。

② AI 口播/UGC 营销短视频生成(AI Shorts)

  • AI 虚拟演员:只需输入产品描述或网页 URL,即可生成带 AI 形象口播、动态 B-roll 配图、字幕的营销短视频。

  • 生成成本低:相比制作实拍,提供低成本模式(约 $0.65/视频)和高质量模式(约 $2/视频),支持上传个人照自定义数字人形象。

③ YouTube Studio 运营工具包

  • AI 封面生成器:支持结合人物人脸自动合成具备爆款样式的缩略图。

  • 标题与文案生成:基于 Gemini 提供 10 个高点击率标题建议(支持对话式微调),并提取 Whisper 转写自动生成带时间轴章节(Timestamps)的描述文案。

  • 多平台一键发布:直接对接 API 部署一键同步投递至 TikTok、Instagram Reels 和 YouTube Shorts。

3. 部署方式与系统环境要求

官方提供两种使用形态:Self-Hosted(本地/私有云自部署)Cloud(云端付费服务)。对于 GitHub 自部署用户,具体指标如下:

硬件要求规格:

  • CPU 运行(最低门槛)

    • 配置:4 核 CPU + 8GB RAM。

    • 性能:处理一段 8 分钟的长视频需 5 ~ 8 分钟

  • GPU 渲染(推荐生产环境)

    • 配置:NVIDIA RTX 3060 / 4060(显存 ≥ 6GB-8GB)+ 16GB RAM。

    • 性能:在 CUDA / NVENC 硬件加速下,处理一段 8 分钟的长视频仅需 约 50 秒

图片[2]-OpenShorts 智能16:9转手机 9:16 尺寸,智能提取高光镜头,AI 口播/UGC 营销短视频生成-共赢源码

部署依赖:

  • 容器化支持:项目提供开箱即用的 docker-compose.yml,一键部署 FastAPI 后端与前端 UI。

  • API 密钥依赖(用户自备 – 绝大多数有免费额度)

    • Google Gemini API(必需,用于分析高光、生成视觉效果,每日免费 1,500 次调用,个人使用基本零成本)。

    • ElevenLabs API(可选,用于 AI 克隆配音)。

    • Upload-Post API(可选,用于多平台一键发布)。

4. 适用场景与人群

  1. 内容创作者与自媒体矩阵:将播客(Podcast)、访谈、网课、游戏直播自动化裁剪出数十条 9:16 短视频,批量投递至 TikTok、Reels、Shorts。

  2. 电商与跨境营销团队:利用 AI Shorts 功能快速生成批量带有 AI 演员口播的商品 UGC 演示视频。

  3. AI Agent 开发者 / 自动化极客:利用项目内置的 MCP Server 或 API 结合 n8n、Dify 等工具搭建“无人值守”的自动切片和发布流水线。

 

下载地址

Github仓库:https://github.com/mutonby/openshorts

维度 OpenShorts 表现
功能丰富度 ⭐⭐⭐⭐⭐(剪裁、字幕、AI演员、发布全流程涵盖)
上手门槛 ⭐⭐⭐⭐☆(提供完整 Docker 镜像,只需填写 Gemini Key)
画幅处理效果 ⭐⭐⭐⭐⭐(支持双人分屏与 YOLOv8 动态主体追踪,非机械居中)
开源性价比 ⭐⭐⭐⭐⭐(MIT 协议,自部署终身免费且没有任何水印)
© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容