# 计算机视觉
14 个相关产品 · 中文解读 · 按热度排序
supervision
为开发者提供可复用的计算机视觉工具,自动构建模型、训练与部署流程,降低 CV 开发门槛
chandra
专精于复杂表格、表单与手写体识别的OCR模型,保留完整版面布局,适用于高精度文档数字化场景
YOLO Trainer
YOLO Trainer 是一款本地运行的桌面应用,专为计算机视觉开发者提供图像与视频的物体检测模型训练、数据准备与测试功能,解决 AI 模型训练依赖云端、隐私与成本高的问题,适合
Robbyant/lingbot-map
基于流数据的前馈3D基础模型,可实时重建场景,适用于机器人导航、AR/VR和自动驾驶等实时环境感知场景。
DreamX-World, Alibaba's new realtime world model
DreamX-World 是阿里巴巴推出的实时世界模型,能基于视觉输入动态生成和理解三维环境,用于机器人、AR/VR 等场景。
roboflow/supervision
一个用于构建可复用计算机视觉工具的 Python 库,帮助开发者快速实现目标检测、图像分割等任务,提升 CV 开发效率。
RepStandard
基于计算机视觉的实时健身动作计数应用,通过摄像头自动识别并统计用户训练次数。
NVlabs/FoundationPose
CVPR 2024 突破性项目,统一建模与追踪新物体的 6D 姿态估计模型,支持零样本泛化,适用于机器人与 AR/VR。
Run SAM only when your tracker is uncertain – #1 on SportsMOT
Run SAM 只在追踪器不确定时才触发,是一种智能优化策略,用于提升 SportsMOT 等视觉追踪任务的效率与准确性,适合计算机视觉与多目标追踪研究者
colmap/colmap
COLMAP 是一个强大的三维重建工具,支持从多视角图像中自动恢复场景结构与纹理,广泛应用于摄影测量、AR/VR 和计算机视觉研究。
google-ai-edge/mediapipe
谷歌推出的跨平台机器学习框架,支持实时与流媒体媒体处理,适用于摄像头、AR/VR、语音等场景。
Neverclick – Keyboard-driven mouse control using local computer vision
基于本地计算机视觉的键盘驱动鼠标控制工具,无需鼠标即可完成精准操作,提升无障碍与效率体验
realsenseai/librealsense
Intel RealSense SDK 是用于开发深度感知应用的 C++ 开发工具包,支持 3D 摄像头硬件,适用于机器人、AR/VR 和计算机视觉项目。
Square net turn a wild elephant into a flat grid – ML ready
将野生大象图像转换为可被机器学习模型直接使用的二维网格表示,用于计算机视觉任务中的数据预处理与特征提取