一个用于将大型语言模型(如Gemini)蒸馏为更小、更高效模型的服务,适合开发者在本地或边缘设备上部署轻量级AI模型,支持模型压缩与性能优化。
↑56036/天
为什么值得关注
访问 Reddit 页面 →
在资源受限设备上实现高性能AI推理的新方案,满足对隐私和低延迟的严苛需求。
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
在资源受限设备上实现高性能AI推理的新方案,满足对隐私和低延迟的严苛需求。