whisper:Speech recognition and transcription
openai/whisper
ToolAI 对 openai/whisper 的客观项目介绍。Robust Speech Recognition via Large-Scale Weak Supervision
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
openai/whisper
ToolAI 对 openai/whisper 的客观项目介绍。Robust Speech Recognition via Large-Scale Weak Supervision
huggingface/transformers
一个面向文本、视觉、音频和多模态领域最先进机器学习模型的模型定义框架,同时支持推理和训练。
hacksider/Deep-Live-Cam
提供实时人脸替换和视频人脸处理功能的视觉工具。
opencv/opencv
面向图像处理、视频分析和计算机视觉应用的开源库。
tesseract-ocr/tesseract
可将图像中的文字识别为可处理文本的开源 OCR 引擎。
hiyouga/LlamaFactory
为多种大语言模型和视觉语言模型提供统一的微调流程。
ultralytics/ultralytics
提供目标检测、分割、姿态估计等视觉模型的训练与推理工具。
ultralytics/yolov5
基于 PyTorch 的目标检测项目,支持模型训练、推理和导出。
deepfakes/faceswap
提供人脸数据处理、模型训练和视频转换流程的开源工具。
ageitgey/face_recognition
为 Python 和命令行提供人脸定位与识别接口。
photoprism/photoprism
可自托管的照片与视频管理系统,用自动标签、人脸分组和元数据检索帮助整理大型个人图库。
naptha/tesseract.js
把 Tesseract OCR 引擎带到浏览器和 Node.js,通过 WebAssembly 识别图像文字,适合网页端轻量文字提取。
第 1 / 3 页 · 28 个项目