# 性能优化
76 个相关产品 · 中文解读 · 按热度排序
LMCache
基于高性能KV缓存层的LLM加速工具,显著提升大模型推理速度,降低部署成本,面向AI应用开发者
evo
evo 将代码库转化为自动研究循环,能自主发现需测量的指标、插入基准测试、并用并行子代理进行树搜索优化,提升代码性能。
Rapid-MLX
Rapid-MLX 是专为 Apple Silicon 优化的本地 AI 引擎,性能远超 Ollama,支持快速推理与工具调用,可作为 OpenAI 的本地替代方案,适合本地部署
Goroviz
Go 语言性能分析工具,自动聚合相似的 goroutine,帮助开发者快速定位程序性能瓶颈,避免在海量堆栈中手动排查
ThreadMine
一个用于快速分析JVM线程转储的工具,能自动检测死锁、线程泄漏、线程池耗尽等性能问题,帮助开发者秒级定位Java应用的运行瓶颈,适合后端开发与运维工程师使用。
I wrote a 1-bit WebGPU runtime to run a 1.7B LLM in the browser
一个仅1比特的WebGPU运行时,能在浏览器中运行17亿参数的大型语言模型,突破前端AI性能极限,适合Web开发者和AI实验者
Alenia Porter
Alenia Porter 是一个高性能通用媒体优化工具,支持图像、视频、音频的自动 GPU 加速处理,基于 Go 和 Nuitka 构建,具备崩溃安全回退机制
Headroom – measure your GPU's true bandwidth ceiling for local AI
Headroom 是一款用于测量本地运行 AI 模型时 GPU 实际带宽上限的工具,帮助开发者优化推理性能,解决本地 AI 推理瓶颈问题,主要面向本地部署 AI 模型的开发者和研究
ContextRot
一个本地CLI工具,用于分析Claude Code和OpenCode等AI编码助手在上下文增长时的性能退化问题,帮助开发者识别模型瓶颈与成本拐点。
Experimental freshness-first caching library for FastAPI
面向FastAPI的实验性新鲜度优先缓存库,按内容更新频率智能缓存,提升API响应效率,面向后端开发与高并发服务场景
TurboQuant for mlx-lm (Apple Silicon)
基于mlx-lm框架的Apple Silicon优化推理加速工具,专为在M系列芯片上运行大模型提供高性能推理支持
DeusData/codebase-memory-mcp
高性能代码智能MCP服务器,能毫秒级索引超150种语言的代码库并构建持久知识图谱,查询快、消耗低,适合大型项目代码理解与智能开发。
Native-Compress
Native-Compress 是一个开源的 React Native 与 Expo 项目 AST 编译器优化工具,通过代码压缩与结构优化提升应用性能与启动速度。
ZeroFS – A log-structured filesystem for S3
ZeroFS 是一个基于 S3 的日志结构文件系统,通过日志结构设计提升写入性能和可靠性,适用于需要高吞吐、低延迟的云原生存储场景。
oven-sh/bun
Bun 是一个超快的 JavaScript 运行时,集成了打包工具、测试运行器和包管理器,专为开发者打造,以极简方式提升全栈开发效率。
rs/zerolog
零内存分配的 JSON 日志库,极致性能,适合对延迟敏感的高吞吐 Go 服务。
PostgreSQL performance and cost across 23 EC2 instance types
对比23种EC2实例类型在PostgreSQL上的性能与成本表现,帮助开发者和运维人员选择性价比最优的云数据库实例
I wrote a 1-bit WebGPU runtime to run a 1.7B LLM in the browser
1-bit WebGPU 运行时项目在浏览器中运行 1.7B 参数的 LLM,仅用极低内存和计算资源实现本地大模型推理,让轻量级 AI 应用在前端落地成为可能。
TurboQuant for mlx-lm (Apple Silicon)
TurboQuant 是针对 mlx-lm 框架在 Apple Silicon 上优化的量化推理工具,显著提升大模型在 Mac 设备上的运行速度与内存效率。
FastFlowLM/FastFlowLM
专为AMD Ryzen AI NPU优化的LLM推理框架,可快速在本地运行大模型,类似Ollama但深度适配AMD硬件。
DataDog/dd-trace-rb
Datadog 为 Ruby 提供的分布式追踪客户端库,用于采集应用性能指标与链路追踪数据,帮助开发者诊断性能瓶颈。
LMCache/LMCache
为大语言模型(LLM)加速的高性能KV缓存层,显著提升推理速度与吞吐量,降低部署成本
Handsum: An LQIP Image File Format
Handsum 是一种用于快速加载图片的低质量预览(LQIP)图像格式,专为网页性能优化设计,通过极小的文件体积实现快速渲染,适合前端开发者提升加载体验
ai-dynamo/nixl
NVIDIA 推出的推理加速库(NIXL),用于高效传输与执行 AI 推理任务,降低延迟并提升 GPU 利用率,专为高性能 AI 服务设计
TensorRT-LLM running natively on Windows (no WSL)
BareMetalRT 允许在 Windows 本地原生运行 TensorRT-LLM,无需 WSL,显著提升大模型推理性能与开发便利性。
onevcat/Kingfisher
Kingfisher 是一个轻量级纯 Swift 图片下载与缓存库,专为 iOS/macOS 应用设计,支持异步加载和内存/磁盘缓存。
A wc rewrite in Rust that makes it over 100 times faster
一个用 Rust 重写的 Web Components(wc)库,性能提升超过 100 倍,为 Web 组件提供极致的运行效率,适合高性能前端框架与组件库开发者。
A 100% branchless, CUDA-native AI guardrail kernel written in C++20
一个用 C++20 编写的 100% 无分支、原生支持 CUDA 的 AI 安全防护内核,专为高性能 AI 推理场景设计,帮助开发者构建更安全、低延迟的 AI 应用。
Hana JIT – LLVM-backed Python JIT with genetic-algorithm superoptimizer
Hana JIT 是一个基于 LLVM 的 Python JIT 编译器,利用遗传算法优化代码生成,旨在提升 Python 程序的运行性能,适合需要高性能计算的开发者和研究者。
Reame – a CPU inference server that gets faster as it runs
Reame 是一个能边运行边变快的 CPU 推理服务器,适合需要低延迟、高效率本地 AI 推理的开发者,通过动态优化提升性能。
Catch your local LLM falling back to CPU
一个用于监控本地大模型运行时是否意外降级到CPU的工具,帮助开发者及时发现性能瓶颈,确保模型在GPU上高效运行。
AurelioB/ClusterTune
一款安卓端CPU频率调优工具,可精细控制设备CPU集群性能,支持保存性能档位并快速切换,适合追求极致性能或续航的用户。
google-ai-edge/LiteRT-LM
谷歌推出的面向边缘设备的高性能大语言模型推理框架,支持低延迟、高吞吐的本地 LLM 部署,适用于手机、IoT 等资源受限设备
Tweaks PC and Games
PC与游戏性能优化工具,帮助玩家解锁硬件极限,提升游戏帧率与系统响应,适合追求极致体验的硬核玩家
CaffeineMC/sodium
Sodium 是 CaffeineMC 开发的高性能渲染引擎,用于替代 Minecraft 原生渲染,显著提升帧率并减少卡顿。
Agustinm28/Optiscaler-Client
OptiScaler的现代化管理客户端,用于优化游戏性能与资源调度,提升游戏运行效率。
Rqshc – A C++/x64 assembly image compressor with its own RQI format
Rqshc 是一个基于 C++ 和 x64 汇编的图像压缩工具,使用自研的 RQI 格式,在极致性能与压缩率之间取得平衡,适合对图像处理效率要求极高的开发者或嵌入式场景。
Pulsys – Pull-through cache for Hugging Face built with io_uring
Pulsys 是基于 io_uring 构建的 Hugging Face 模型缓存系统,通过“拉取穿透”机制加速模型下载,提升大模型部署效率。
GLP-RAM – Chrome extension reducing the browser memory appetite
Chrome浏览器扩展,通过内存优化技术显著降低网页浏览时的内存占用,适合多标签用户与低配设备用户
Llm.c ported to Mojo with Metal kernels, 1.72x faster than PyTorch MPs
将 Llm.c 移植到 Mojo 语言并使用 Metal 加速,性能比 PyTorch MPs 快 1.72 倍,是轻量级大模型推理的新标杆。
siglens/siglens
日志管理性能比Splunk快100倍,成本降低90%,专为高吞吐日志场景优化,适合大规模可观测性系统
Fast NF4 dequantization Triton kernel (1.41x faster than bitsandbytes)
基于 Triton 的 NF4 反量化内核,速度比 bitsandbytes 快 1.41 倍,显著提升 LLM 推理性能。
misa77 - a codec that decodes 2x faster than LZ4 (at better ratios)
一款比LZ4解码快2倍且压缩比更优的编码器,适合需要高性能数据压缩的开发者和系统工程师。
ThreadMine
ThreadMine 是一款针对 JVM 的线程转储分析 SaaS 工具,专为发现 Loom 协程中的线程绑定(pinning)问题而设计,适合 Java 后端工程师和性能调优团队
UOLT – 34 coreutils rewritten in x86_64 assembly, no Libc, no heap
用 x86_64 汇编重写 34 个核心命令行工具(如 ls、cat),不依赖 libc 和堆内存,打造极致轻量、高性能的系统级工具集,适合嵌入式或极简系统开发者。
uplpgsql – PL/pgSQL compiled to native code
将PL/pgSQL编译为原生代码的PostgreSQL扩展,显著提升数据库存储过程的执行性能,适用于对性能敏感的数据库应用。
ikawrakow/ik_llama.cpp
llama.cpp 的增强版,支持最新的高性能量化模型(SOTA quants),可在本地 CPU 上高效运行大语言模型,适合希望在无 GPU 环境下使用 LLM 的开发者。
Cysharp/UniTask
Unity 引擎的高效异步编程库,实现零内存分配的 async/await,显著提升游戏性能与稳定性。
Estratos – stacked memory system for AI assistants
Estratos 是为AI助手设计的分层内存系统,通过优化上下文管理提升大模型交互的连贯性与性能,适合AI应用开发者与研究者。
nodejs/undici
Node.js 原生实现的 HTTP/1.1 客户端,性能优于内置 http 模块,支持流式处理与超时控制
nats-io/nats-server
NATS Server 是高性能消息中间件,专为云原生和边缘计算场景设计,支持低延迟、高吞吐的消息传递,适合微服务通信。
microsoft/onnxruntime
ONNX Runtime 是微软推出的跨平台高性能机器学习推理与训练加速器,支持多种硬件和框架,适合部署 AI 模型到生产环境。
darkroomengineering/lenis
Lenis:高性能、原生流畅的滚动动画库,专为现代Web应用优化,解决传统滚动卡顿问题。
BaseRT
BaseRT 是一个为 Apple M5 优化的开源推理框架,性能远超 llama.cpp 和 MLX,适合开发者在 Mac 上高效运行大模型,亮点是极致的本地推理速度。
Amitry Product Category Slider
专为 WooCommerce 设计的高性能原生产品分类滑动组件,提升电商网站加载速度与用户体验,适用于 WordPress 商店
Palenon Performance
Palenon Performance 专注于高性能汽车零部件,提供经过验证的性能升级方案,适合汽车爱好者与改装玩家。
warmup.rocks
一个专注于提升网站缓存命中率的SEO优化工具,通过智能预热机制解决冷缓存问题,显著改善用户首次访问速度与SEO表现。
UnmangedMemory
UnmangedMemory 是一个为 .NET 开发者打造的高性能无托管内存库,提供对内存的精细控制与零 GC 开销,适用于高频、低延迟场景如游戏引擎或实时系统。
Raytention Updated
Raytention的更新版本,优化了光线追踪渲染性能与视觉效果,适合游戏开发者与3D内容创作者提升作品质感。
Headroom – measure your GPU's true bandwidth ceiling for local AI
Headroom 是一款用于测量本地 GPU 实际带宽上限的工具,帮助 AI 开发者精准评估硬件性能瓶颈,优化模型推理与训练效率。
Fluxnation, the Fastest FLUX.1 Execution Kernel
Fluxnation 是一个专为 FLUX.1 模型设计的超高速执行内核,面向 AI 研发者与推理部署工程师,通过极致优化实现低延迟、高吞吐的模型推理性能。
LLM Context profiler for tracking context usage by tools, agents, MCPs
LLM Context Profiler 是用于监控大模型在工具、代理和MCP中上下文使用情况的分析工具,帮助开发者优化成本与性能。
Lucen a Python compiler that parallelizes for-loops via comment pragmas
Lucen 是一个 Python 编译器,通过注释标记(pragmas)自动并行化 for 循环,适合科学计算与数据处理场景,亮点是无需改写代码即可实现性能提升
NoopJS – A compiler that ships 0 KB JavaScript for static pages
NoopJS 是一个编译器,可为静态页面生成0KB的JavaScript,通过静态分析消除冗余代码,提升加载速度与性能,适合追求极致性能的前端开发者。
Open benchmark for memory layers vs. pasting full chat history
该开源基准测试对比了不同内存层方案与完整聊天历史粘贴的性能差异,帮助开发者优化大模型应用中的上下文管理策略,适合 AI 应用开发者和 LLM 工程师。
raullenchai/Rapid-MLX
专为Apple Silicon优化的本地AI引擎,性能比Ollama快4.2倍,支持工具调用、缓存推理与云路由,可无缝替代OpenAI接口
maximhq/bifrost
企业级AI网关,支持1000+模型、自适应负载均衡、集群模式和安全护栏,性能比LiteLLM快50倍,适合高并发AI服务部署
Speed of Light (PRO)
专为WordPress优化的极速加速插件,通过智能缓存与资源压缩实现网站性能飞跃,无需复杂配置
Avoiding the Memory Wall by computing LLM inference directly inside RAM
通过在内存中直接计算大语言模型推理,突破传统内存墙瓶颈,显著提升推理效率,适用于边缘设备与低延迟场景
SkyRush
一款优化过的竖版2D手机动作游戏,以极简操控和流畅极地熊奔跑体验为核心,主打轻量级沉浸式娱乐
facebook/pyrefly
用 Rust 编写的超快 Python 类型检查器与语言服务器,为 Python 开发者提供低延迟、高准确性的静态类型支持。
deepseek-ai/FlashMLA
C++ 实现的高效多头潜在注意力内核,用于加速大模型推理,特别优化了内存与计算效率,适合高性能 AI 推理场景。
jeandle/jeandle-jdk
Jeandle 是基于 OpenJDK 和 LLVM 的 Java JIT 编译器,通过 LLVM 的强大优化能力,旨在显著提升 Java 应用的运行性能,适合对性能敏感的后端系统
Pixel Lattice Web Tester
网页扫描工具,自动检测网站的 SEO、加载速度与安全漏洞,适合开发者与运营快速诊断
SQLiteWatch – profile SQLite on Linux without code changes
SQLiteWatch 是一个无需修改代码即可在 Linux 上监控和分析 SQLite 性能的工具,适合开发者快速定位数据库瓶颈。
zeux/meshoptimizer
一个用于优化3D网格的C++库,能显著减小网格体积并提升渲染性能,适合游戏和图形开发人员使用,支持多种压缩算法和实时优化。