Overview
产品概述
Capabilities
核心能力
语音识别与字幕生成
基于 FunASR 的 Paraformer-Large 等模型进行语音识别,并集成时间戳预测;支持多段自由裁剪,自动返回完整视频 SRT 字幕和目标片段 SRT 字幕。
说话人分离与热词定制剪辑
集成 CAM++ 说话人识别模型,可按说话人 ID 裁剪片段;支持 SeACo-Paraformer 热词定制,可在识别过程中指定实体词、人名等以增强识别效果。
大语言模型智能剪辑
可接入 qwen、GPT 等大语言模型,将视频 SRT 字幕与默认提示词结合,通过 AI Clip 自动提取裁剪时间戳。
Use Cases
适用场景
-
01
基于文本片段的快速剪辑
在识别结果中自由选择文本片段,点击剪辑按钮即可获得与所选片段对应的视频片段。
-
02
按说话人提取片段
利用说话人分离能力,以自动识别的说话人 ID(如 spk0)为裁剪目标,快速提取某个或某几个说话人的片段。
-
03
大模型辅助视频精简
将视频字幕交给大语言模型分析,并基于模型输出结果自动生成所需视频片段的裁剪时间戳,适用于快速制作高光或摘要片段。
-
04
多语言视频内容处理
支持对中文、英文、日文等多种语言的音频/视频文件进行识别和裁剪,并可识别 7 个中文方言群与 26 个区域口音。
Integrations
集成能力
FunASR
基于 FunASR 的 Paraformer-Large 等模型执行语音识别,可集成预测时间戳。
SeACo-Paraformer
提供热词定制能力,用于在 ASR 过程中增强指定实体词、人名等内容的识别效果。
CAM++
说话人识别模型,支持自动识别说话人 ID 并按说话人裁剪。
Qwen / GPT 系列大语言模型
用于 LLM 智能剪辑,结合字幕与提示词生成裁剪时间戳。
Gradio
通过 Gradio 提供交互界面,支持本地使用或部署到服务器后通过浏览器访问。