一个用于对比大语言模型性能的趣味性对抗平台,让两个LLM以‘剑斗’形式比拼推理与生成能力,适合AI研究员和开发者测试模型表现。
▲2
为什么值得关注
访问 Hacker News 页面 →
用游戏化方式直观对比LLM能力,创新性地将模型竞争可视化,满足对模型性能评估的趣味性与实用性需求。
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
用游戏化方式直观对比LLM能力,创新性地将模型竞争可视化,满足对模型性能评估的趣味性与实用性需求。