Skip to content

Repository files navigation

Video Content Pickup

一个强大的Chrome扩展,支持从网页视频中提取字幕和语音内容,提供多种语音识别方案。

🚀 主要功能

📺 视频内容提取

  • 智能字幕解析 - 自动检测并提取视频字幕
  • 多平台支持 - 支持YouTube、Bilibili等主流视频网站
  • 时间轴定位 - 点击字幕可跳转到对应视频时间点
  • 网页覆盖显示 - 在视频页面直接显示提取的内容

🎙️ 多种语音识别

  • Web语音识别 - 浏览器原生API,快速便捷
  • 本地Whisper - 高精度AI模型,离线处理,保护隐私
  • 阿里云ASR - 商用级识别服务,专业准确(需配置)

🛠️ 实用工具

  • 内容翻译 - 支持多语言翻译
  • 多格式导出 - 原文稿、翻译文本、混合输出
  • 历史缓存 - 自动保存提取结果
  • 一键复制/下载 - 便捷的内容输出

📦 安装使用

安装扩展

  1. 下载项目源码到本地
  2. 打开Chrome扩展管理页面(chrome://extensions/
  3. 开启"开发者模式"
  4. 点击"加载已解压的扩展程序",选择项目文件夹
  5. 扩展安装完成,可在工具栏看到图标

基础使用

  1. 访问包含视频的网页(如YouTube、Bilibili)
  2. 点击扩展图标打开控制面板
  3. 点击"提取文稿"获取视频字幕
  4. 如无字幕,选择语音识别方案:
    • Web语音识别:直接使用,适合快速测试
    • 本地Whisper:需要本地模型部署
    • 阿里云ASR:需要配置API凭据

高级配置

本地Whisper设置

# 1. 安装依赖
pip install transformers torch

# 2. 启动模型服务器
python whisper_model_server.py

# 3. 下载模型文件到 C:/Models/whisper-medium

阿里云ASR配置

  1. 登录阿里云控制台
  2. 开通智能语音交互服务
  3. 获取AccessKey ID、Secret和AppKey
  4. 在扩展中选择"阿里云ASR" > "配置阿里云"填入凭据

🏗️ 项目结构

├── manifest.json          # 扩展配置文件
├── popup.html/js/css      # 用户界面
├── content.js             # 核心内容脚本
├── background.js          # 后台服务
├── libs/                  # 第三方库
├── icons/                 # 图标资源
├── whisper_model_server.py # 本地Whisper服务器
└── 本地Whisper部署指南.md    # 部署文档

🔧 核心技术

统一语音识别架构

项目采用统一的服务管理架构,支持多种语音识别方案的无缝切换:

// 服务类型定义
const SPEECH_SERVICE_TYPES = {
  WEB_SPEECH: 'web_speech',      // 浏览器原生
  LOCAL_WHISPER: 'local_whisper', // 本地AI模型
  ALIYUN_ASR: 'aliyun_asr'       // 阿里云服务
};

// 统一调用接口
await startUnifiedSpeechRecognition(serviceType, config, options);

智能字幕提取

  • 多源解析:支持WebVTT、TTML、SRT等格式
  • 站点适配:针对YouTube、Bilibili等网站的专门优化
  • 实时解析:动态获取字幕轨道和时间轴信息

用户界面设计

  • 响应式布局:适配不同屏幕尺寸
  • 动态UI:根据选择的服务自动显示相关配置项
  • 状态反馈:实时显示处理进度和结果

📊 功能对比

功能 Web语音识别 本地Whisper 阿里云ASR
部署难度 ⭐ 无需配置 ⭐⭐⭐ 需要部署 ⭐⭐ 需要凭据
识别精度 ⭐⭐ 一般 ⭐⭐⭐⭐ 很高 ⭐⭐⭐⭐⭐ 极高
隐私保护 ⭐⭐ 上传云端 ⭐⭐⭐⭐⭐ 完全本地 ⭐⭐ 上传云端
使用成本 🆓 免费 🆓 免费 💰 按量计费
网络要求 📶 需要网络 🔌 离线可用 📶 需要网络
多语言 ⭐⭐⭐ 较好 ⭐⭐⭐⭐ 很好 ⭐⭐⭐⭐⭐ 极好

🤝 贡献指南

欢迎提交Issue和Pull Request!

开发环境

  1. Clone项目:git clone <repository-url>
  2. 按照安装说明加载到Chrome
  3. 修改代码后重新加载扩展测试

扩展新服务

基于统一架构,可以轻松添加新的语音识别服务:

  1. SPEECH_SERVICE_TYPES中添加新类型
  2. 实现对应的服务类(参考AliyunASRService
  3. 在统一管理器中添加处理逻辑
  4. 更新UI配置界面

📝 更新日志

v0.4.0 (当前版本)

  • ✨ 新增统一语音识别架构
  • ✨ 新增阿里云ASR支持
  • ✨ 重构用户界面
  • 🐛 修复多个稳定性问题
  • 📝 完善文档和指南

v0.3.0

  • ✨ 新增本地Whisper AI支持
  • ✨ 新增本地模型部署
  • 🐛 修复Chrome扩展CSP问题

v0.2.0

  • ✨ 新增Web Speech API语音识别
  • ✨ 新增网页覆盖层显示
  • ✨ 新增缓存和历史记录

v0.1.0

  • 🎉 首次发布
  • ✨ 基础视频内容提取功能
  • ✨ YouTube、Bilibili字幕解析

📄 许可证

MIT License - 详见 LICENSE 文件

🔗 相关链接


注意: 本项目中的阿里云ASR实现为演示版本,生产使用需要完善API集成逻辑。详见阿里云ASR集成指南

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages