FlashInfer 是专为大语言模型推理优化的高性能内核库,通过低级算子优化显著提升 LLM 服务的吞吐与延迟,适合 AI 工程师和推理服务开发者。
⭐6.0k5/天
为什么值得关注
访问 GitHub 页面 →
在 LLM 服务场景下实现极致性能,填补了高效推理内核的空白,是大模型部署的关键加速利器。
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
在 LLM 服务场景下实现极致性能,填补了高效推理内核的空白,是大模型部署的关键加速利器。