~/home / tags / 本地推理

# 本地推理

9 个相关产品 · 中文解读 · 按热度排序
Rapid-MLX
Rapid-MLX 是专为 Apple Silicon 优化的本地 AI 引擎,性能远超 Ollama,支持快速推理与工具调用,可作为 OpenAI 的本地替代方案,适合本地部署
I built a hypervisor and client for inference on consumer compute
一个面向消费级硬件的轻量级虚拟机与推理客户端,可在本地运行大模型推理,降低 AI 推理成本与依赖云端的门槛
Shellular – run Claude Code, Codex, Pi from your phone
在手机上运行 Claude Code、Codex、Pi 等大模型代码生成工具,让移动设备具备本地 AI 编程能力
paddock – Ranks and runs LLMs on your Mac from live GGUF headers
在 Mac 上直接运行和排名 LLM 模型的工具,支持从实时 GGUF 文件头加载模型,无需复杂配置,适合本地 AI 实验与开发者快速验证。
TensorSharp: Open-Source Local LLM Inference Engine
TensorSharp 是一个开源的本地大语言模型推理引擎,支持在设备端高效运行 LLM,适合开发者构建离线 AI 应用
Samosa Chat - Run Qwen3.6-35B-A3B Locally on a 16 GB Mac
Samosa Chat 是一款可在 16GB 内存 Mac 上本地运行 Qwen3.6-35B-A3B 大模型的轻量级聊天应用,专为开发者和 AI 爱好者设计,支持本地推理、低资源
Qwen3.6-35B-A3B on a 16 GB M1 Pro with SSD-streamed MoE
在16GB M1 Pro设备上通过SSD流式加载实现350亿参数的混合专家模型(MoE),让本地运行大语言模型更高效、更可行,适合本地AI开发与研究者
handy-computer/transcribe.cpp
基于ggml的C++语音转文本推理库,支持16+主流模型,适合本地低延迟语音处理场景。
Run GLM-4.5-Air(110B)on a 16GBRAM consumer machine
该项目展示了如何在仅 16GB 内存的消费级机器上运行 1100 亿参数的大模型 GLM-4.5-Air,通过量化与优化技术实现本地大模型推理,适合个人开发者和研究者在低配设备上体
其他标签