
oMLX 是一款专为 Apple Silicon Mac 打造的本地大模型推理服务器。
它专门解决 AI 编程智能体在本地运行时的缓存痛点。
日常使用代码助手时,频繁的上下文切换会导致传统的内存缓存失效,迫使模型重新计算庞大的提示词。oMLX 采用独特的分页 SSD KV 缓存架构,将缓存块持久化存储在固态硬盘中。当智能体回溯之前的上下文时,系统能在几毫秒内从硬盘恢复数据,将首代币响应时间从漫长的等待缩短至 5 秒以内。

连续批处理技术让 oMLX 能够高效应对高并发请求。
面对多任务并行处理,它能提升多倍生成速度,告别单任务排队阻塞的困境。这款工具提供原生的 macOS 菜单栏应用,拒绝臃肿的跨平台架构。你可以直接在状态栏启动、监控服务器,并通过直观的网页控制面板管理模型和查看实时数据。它支持同时加载大语言模型、视觉模型以及重排序模型,在内存紧张时会自动进行合理的回收释放。
接口兼容性是这款工具的另一大优势。
oMLX 原生提供与 OpenAI 和 Anthropic 完全一致的 API。它能无缝接入 Claude Code、Cursor 等主流工具,直接作为你的本地后端运行。系统全面支持多种格式的工具调用和 MCP 集成,并自动处理过长的输出结果。你可以直接复用已有的模型目录,无需重复下载庞大的文件,有效节省磁盘空间与配置时间。
传送门
GitHub:https://github.com/jundot/omlx
原创文章,如若转载,请注明出处:https://wefound.cc/p/1737.html