FunClip 页面截图
产品页面 点击查看大图

FunClip

FunClip 是一款基于 FunASR 的本地部署开源视频剪辑工具,支持视频/音频转写、字幕生成、说话人分离以及大语言模型辅助的智能剪辑,并提供本地 Gradio 交互界面。

视频剪辑语音识别大语言模型
平台
本地部署(Gradio)、浏览器/Web
语言
多语言
价格
FunClip 为完全开源项目,采用 MIT 许可证,可免费用于本地部署。
01

Overview

产品概述

FunClip 是一个完全开源、本地部署的自动化视频剪辑工具。它利用阿里通义语音实验室开源的 FunASR Paraformer 系列模型对视频进行语音识别,并集成时间戳预测;用户可在识别结果中自由选择文本片段或说话人,一键获取对应视频片段。工具还支持 SeACo-Paraformer 热词定制和 CAM++ 说话人识别,并结合 Gradio 提供本地交互界面,也可部署到服务器通过浏览器访问。FunClip 支持多段自由裁剪,并自动返回完整视频 SRT 字幕和目标片段 SRT 字幕;同时可接入 qwen、GPT 等大语言模型实现智能剪辑。
02

Capabilities

核心能力

01

语音识别与字幕生成

基于 FunASR 的 Paraformer-Large 等模型进行语音识别,并集成时间戳预测;支持多段自由裁剪,自动返回完整视频 SRT 字幕和目标片段 SRT 字幕。

02

说话人分离与热词定制剪辑

集成 CAM++ 说话人识别模型,可按说话人 ID 裁剪片段;支持 SeACo-Paraformer 热词定制,可在识别过程中指定实体词、人名等以增强识别效果。

03

大语言模型智能剪辑

可接入 qwen、GPT 等大语言模型,将视频 SRT 字幕与默认提示词结合,通过 AI Clip 自动提取裁剪时间戳。

03

Use Cases

适用场景

  1. 01

    基于文本片段的快速剪辑

    在识别结果中自由选择文本片段,点击剪辑按钮即可获得与所选片段对应的视频片段。

  2. 02

    按说话人提取片段

    利用说话人分离能力,以自动识别的说话人 ID(如 spk0)为裁剪目标,快速提取某个或某几个说话人的片段。

  3. 03

    大模型辅助视频精简

    将视频字幕交给大语言模型分析,并基于模型输出结果自动生成所需视频片段的裁剪时间戳,适用于快速制作高光或摘要片段。

  4. 04

    多语言视频内容处理

    支持对中文、英文、日文等多种语言的音频/视频文件进行识别和裁剪,并可识别 7 个中文方言群与 26 个区域口音。

04

Integrations

集成能力

01

FunASR

基于 FunASR 的 Paraformer-Large 等模型执行语音识别,可集成预测时间戳。

02

SeACo-Paraformer

提供热词定制能力,用于在 ASR 过程中增强指定实体词、人名等内容的识别效果。

03

CAM++

说话人识别模型,支持自动识别说话人 ID 并按说话人裁剪。

04

Qwen / GPT 系列大语言模型

用于 LLM 智能剪辑,结合字幕与提示词生成裁剪时间戳。

05

Gradio

通过 Gradio 提供交互界面,支持本地使用或部署到服务器后通过浏览器访问。