DINOv2:用于分类与检索的视觉特征模型
facebookresearch/dinov2
Meta 的自监督视觉模型,提供多种预训练骨干与任务头,可用于图像特征提取、相似图片检索和视觉任务迁移。
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
facebookresearch/dinov2
Meta 的自监督视觉模型,提供多种预训练骨干与任务头,可用于图像特征提取、相似图片检索和视觉任务迁移。
zai-org/GLM-OCR
面向表格、公式和复杂版面的 OCR 项目,提供云端调用、自托管管线、命令行及 Python SDK。
facebookresearch/vggt
Visual Geometry Grounded Transformer 根据场景图片预测相机参数、深度图、点图和点轨迹,适合三维视觉研究与重建流程的前期几何估计。
facebookresearch/segment-anything
Meta 的 SAM 图像分割项目,支持点、框等提示输入,也能自动生成整张图片的候选掩码,适合交互式标注和图像处理流程。
google-ai-edge/mediapipe
面向移动端、浏览器和边缘设备的机器学习组件,提供视觉、文本与音频任务 API、模型及定制工具。
TencentARC/GFPGAN
利用生成式人脸先验修复低质量人像,适合老照片和人脸清晰化实验,可与背景超分辨率工具组合处理整张图片。
JaidedAI/EasyOCR
基于 Python/PyTorch 的多语言 OCR 工具,一次调用返回文字区域、识别文本和置信度,便于集成图片信息提取。
naptha/tesseract.js
把 Tesseract OCR 引擎带到浏览器和 Node.js,通过 WebAssembly 识别图像文字,适合网页端轻量文字提取。
photoprism/photoprism
可自托管的照片与视频管理系统,用自动标签、人脸分组和元数据检索帮助整理大型个人图库。
roboflow/supervision
提供可复用的视觉数据处理、检测结果标注与追踪辅助组件。
ageitgey/face_recognition
为 Python 和命令行提供人脸定位与识别接口。
deepfakes/faceswap
提供人脸数据处理、模型训练和视频转换流程的开源工具。
第 1 / 3 页 · 28 个项目