软件简介
VideoCaptioner 是一款轻量化高效视频字幕自动生成编辑工具,依托智能语音识别技术,可快速为各类视频自动转录生成字幕,支持字幕精准校对、格式调整、批量处理与多格式导出,操作简单易上手,无需专业剪辑基础,适合自媒体创作者、短视频运营、办公剪辑人员使用,能够大幅节省视频加字幕的时间成本,兼顾本地离线识别与高效字幕排版需求。

软件信息
| 项目 | 详情 |
|---|---|
| 软件名称 | VideoCaptioner |
| 软件类型 | 视频智能字幕生成编辑工具 |
| 软件版本 | 最新正式版 |
| 软件大小 | 约 80MB |
| 发行时间 | 持续更新发布 |
| 支持语言 | 简体中文、繁体中文、英语、日语、韩语、多国主流外语 |
| 版本说明 | 免费基础版 + 专业付费版双模式,支持本地离线语音识别, 无强制水印限制,适配全品类短视频、长视频素材,支持 Windows 主流系统运行,兼顾日常个人使用与小型团队 批量字幕制作需求 |
主要功能
- 智能语音转字幕:精准识别视频内人声,自动一键生成同步字幕,支持方言、日常口语精准识别,识别准确率高。
- 多格式视频兼容:支持 MP4、MOV、AVI、MKV、FLV 等几乎所有主流视频格式导入识别处理。
- 字幕精细化编辑:自由调整字幕时长、起止时间、文字内容,支持拆分、合并、删除字幕条目。
- 字幕样式自定义:可修改字幕字体、字号、颜色、描边、位置、透明度,打造专属视频字幕风格。
- 双语字幕制作:支持一键翻译生成双语对照字幕,满足跨境视频、外语视频制作需求。
- 批量处理功能:支持多视频批量导入批量生成字幕,大幅提升批量剪辑工作效率。
- 多格式字幕导出:可导出 SRT、ASS、LRC 等通用字幕文件,也可直接将字幕压制嵌入视频内。
- 离线识别运行:内置识别模型,无需全程联网,本地即可完成语音转文字,保护视频素材隐私。
- 字幕对齐校准:内置一键字幕对齐功能,快速修正人声与字幕不同步问题。

配置要求
- Windows: Windows 10/11 (64位)
- macOS: macOS 10.15 或更高版本
- Linux: Ubuntu 20.04+ / Debian 11+ / Fedora 35+
- Python: Python 3.10 或更高版本(源码运行时需要)
- 内存: 建议 4GB 以上(使用本地 Whisper 需要 8GB+)
更新内容
- 升级核心语音识别模型,提升嘈杂环境下人声识别精准度,减少错别字出现概率。
- 优化长视频识别速度,缩短大时长视频字幕生成耗时。
- 新增更多字体库与字幕排版模板,一键套用短视频热门字幕样式。
- 完善多语种翻译引擎,优化小语种字幕翻译准确度。
- 修复部分特殊格式视频导入失败、音画识别错位等问题。
- 精简软件后台进程,降低运行内存占用,低配电脑也可稳定运行。
- 优化字幕压制功能,提升内嵌字幕视频导出清晰度,无损压缩画质。
- 新增字幕一键查重、批量删减空白字幕实用小工具。
- 优化界面布局,简化操作步骤,新手可快速上手使用。
安装方式
Windows 用户(推荐使用打包版本)
软件较为轻量,打包大小不足 60M,已集成所有必要环境,下载后可直接运行。
macOS / Linux 用户
使用自动安装脚本(推荐)
# 1. 克隆项目
git clone https://github.com/WEIFENG2333/VideoCaptioner.git
cd VideoCaptioner
# 2. 运行安装脚本
chmod +x run.sh
./run.sh
脚本会自动:
- 检测 Python 环境
- 创建虚拟环境并安装依赖
- 检测系统工具(ffmpeg、aria2)
- 启动应用程序







