Ollaya 是一个面向“决策模型”的本地运行工具,可以把它理解成这类模型的 Ollama。它不负责生成文章或对话,而是接收一段文本、邮件、工单或 JSON,再回答预先定义好的选择题、是非题和评分题,并返回对应结果与校准后的概率。整个过程只需要一次前向计算,不进行逐 Token 生成,因此更适合分类、路由、审核、意图识别这类需要稳定结构化输出的任务。
例如,把一条客户投诉交给 Ollaya,可以同时判断用户是不是要求退款、事情是否紧急、情绪强度以及流失风险。官方推荐的 winnow:e4b 在 RTX 4090 上回答 5 个问题约需 89 ms,在其 typed-decisions 测试集上的准确率为 0.722;作为对照,TypeSafe 托管的 Jev 为 0.738。规模更小的 laya 延迟可降到约 10 ms,也能在 CPU 上运行。
Ollaya 支持多种开放模型,包括 winnow、laya、decider、kev、NLI、GLiClass 和 Qwen3Guard 等。不同模型各有侧重,有的追求速度,有的支持更多语言,有的适合零样本分类或安全审核。模型权重直接来自原作者的 Hugging Face 仓库,并固定到具体提交、通过 SHA-256 校验;项目本身采用 Apache-2.0 许可证。
它还兼容 TypeSafe 的 /v1/systemone 和 /v1/models API,现有 TypeSafe Python SDK 只需修改服务地址,就可以改用本地模型。除此之外,Ollaya 提供自己的 HTTP API、CLI、桌面应用和 Docker 镜像,并支持通过 MCP 接入 Claude Code、Claude Desktop、Cursor 等智能体工具。
隐私也是它强调的一点。邮件、客服工单和用户消息可以直接在本机处理,默认服务只监听 127.0.0.1,没有按 Token 计费。macOS、Windows 和 Linux 都有对应版本,服务器环境还可以通过 Docker 部署;Linux 和 Windows 可利用 NVIDIA GPU 加速,部分模型在 Apple silicon 上也能使用 Apple GPU。
#Ollaya #Jev #模型
