机器人与边缘 AI

mediapipe

google-ai-edge/mediapipe

面向移动端、浏览器和边缘设备的机器学习组件,提供视觉、文本与音频任务 API、模型及定制工具。

★ 36.9K星级
⑂ 6.2KFork 数
540未解决的问题
C++语言
Apache-2.0许可证
Q90编辑评分

概览

MediaPipe 将模型推理与实际设备输入输出连接起来,适合希望在相机画面、移动应用或网页中加入机器学习能力的开发者。项目包含可直接调用的 Tasks、配套模型、定制工具和可视化评估入口,比单独下载一个模型更接近端上应用开发。 选型关键在于目标平台与任务是否匹配。一个 Python 示例能够运行,并不代表同一能力在网页或手机上有完全相同的 API、模型和性能。项目还保留较早的 Legacy Solutions,新的实现应先核对当前 Tasks 指南,避免复制已停止维护的旧教程。

主要功能

  • 跨平台任务 API
  • 配套预训练模型
  • 视觉文本音频任务
  • Model Maker 定制
  • Studio 可视化评估

要求、安装和快速入门

从官方 Solutions 页面选择具体任务与平台,再按 Android、Web 或 Python setup 指南配置依赖和模型文件。先运行该平台官方样例,确认输入格式和运行模式后再迁移到自己的应用。

用法

以相机视觉为例,先用静态图像验证结果,再切换视频或实时模式;测量端到端延迟和持续运行的资源消耗。测试弱光、遮挡、不同分辨率及设备旋转,并将时间戳和坐标转换纳入验证。

工作原理
设备提供图像、视频、文本或音频输入,任务 API 完成相应预处理、模型执行与结果组织,应用再将检测或分类结果用于交互。Model Maker 用于支持任务的模型定制,Studio 可帮助可视化和评估解决方案。

适用人群与环境
移动、Web、边缘设备和交互应用开发者。 目标平台 SDK、适配模型文件、任务所需设备输入。

具体使用场景
• 相机中的视觉识别和交互。
• 端侧文本或音频分类。
• 移动及浏览器上的轻量模型功能验证。

局限与选型边界
不同任务在平台和模式上的支持范围不同,需逐项确认。端上运行也受设备算力、模型大小和持续功耗影响。Legacy Solutions 的状态与新 Tasks 不同,不能把旧接口的支持情况直接外推。

关联项目与选型分析
opencv/opencv:互补:OpenCV 可处理图像预处理和显示,MediaPipe 提供具体模型任务接口,需自行连接数据格式。

lutzroeder/netron:互补:可检查支持格式的模型结构和输入输出信息,帮助排查端侧模型接入。

资料说明
基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

模型兼容性与使用场景

模型文件需符合所选 Tasks 的输入输出和元数据要求,支持范围依平台与任务而异。

许可证与风险说明

仓库当前页面标注 Apache-2.0;完整条件请查看仓库 LICENSE,模型权重与数据集另查各自说明。

Editorial source review 2026-09-09T05:00:00.950Z. README and live repository page verified; current stars/forks from GitHub HTML. Last-push metadata retained from 2026-09-05 discovery snapshot. No runtime benchmark. Integration proposals are editorial analysis.

发布与维护

资料核对:2026-09-09。统计取自本次仓库页面;功能依据 README 与官方资料整理。版本变化请查看来源区的 Releases。 基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

cosmos

NVIDIA/cosmos

★ 11.2KJupyter Notebook