# 基准测试
8 个相关产品 · 中文解读 · 按热度排序
SOCBench – an open benchmark for AI on SoC tasks
一个开源基准测试工具,用于评估AI在片上系统(SoC)任务中的性能表现,帮助开发者和研究人员量化AI芯片的效率与能力,主要面向AI芯片与嵌入式AI开发者。
PhysicsThinking
一个AI物理推理能力评测平台,允许开发者通过API接入AI代理,在8个物理场景中测试其模拟现实世界的能力,推动AI具身认知发展
SOCBench – an open benchmark for AI on SoC tasks
面向 AI 在片上系统(SoC)任务上的性能评估开源基准,推动边缘 AI 的标准化测试
PhysicsThinking
面向物理智能的基准测试平台,评估AI模型在理解物理世界规律(如重力、运动)方面的能力,推动AI向具身智能演进。
MillionMiner GPU & AI Benchmark Tool
GPU与AI性能对比工具,直观展示不同显卡在AI任务中的表现,为开发者和硬件采购者提供决策依据
VetoBench – benchmarking AI memory beyond retrieval
一个用于评估AI模型记忆能力的基准测试框架,超越传统检索机制,测试模型在复杂上下文中的长期记忆与推理能力,适用于AI研究与模型优化。
Stickblade Arena – I made two LLMs sword-fight to benchmark them
一个用于对比大语言模型性能的趣味性对抗平台,让两个LLM以‘剑斗’形式比拼推理与生成能力,适合AI研究员和开发者测试模型表现。
Deep Skill Finder – Find agent skills using real execution benchmarks
Deep Skill Finder 是一个基于真实执行基准测试的智能工具,帮助开发者和 AI 研究者评估与选择大模型代理(Agent)的技能,提升 AI 应用的可靠性与性能。