工具
Switchboard:把 AI 提示按规则路由到本地或付费后端
开源工具 Switchboard 在 Ollama、Codex CLI、Claude Code 之间确定性路由 AI 提…
2026.06.30 · 周二约 5 分钟阅读
Switchboard 是一款本地优先的 AI 提示路由工具,包装现有 CLI(Ollama、Codex CLI、Claude Code),按确定性规则把每条提示分到合适的后端,避免「所有请求都发给最贵付费智能体」的浪费模式。作者在 Show HN 发布,并附带 100 例基准与论文链接。
一、核心数字
在一项 100 例覆盖编程、推理、摘要、私密、事实五类的基准测试中,由本地模型评判、多轮独立运行取均值:
- 「learned」配置质量 4.1/5,付费智能体使用率 38%
- 全付费基线质量 4.6/5,付费使用率 100%,但应答率仅 61%
- 全本地基线质量 3.4/5,付费使用率 0%,应答率 100%
- 「rules」配置质量 3.8/5,付费使用率 27%
- 「hybrid」配置质量 3.9/5,付费使用率 28%
- 全程未观察到 benchmark 泄露
作者声称 Switchboard 可将 62% 的请求挡在付费智能体之外,相比全付费方案在质量上仅下降约 0.5 分,同时保持 100% 应答率。全付费基线覆盖率低的原因是其必须屏蔽每条敏感请求才能保持零泄露。
二、架构与不变量
系统的设计不变量是「确定性策略永远先于、并覆盖学习型组件」。即使本地模型运行时不可用、因此所有学习组件失效,隐私、工具基础事实、强制选择和回退仍照常工作。处理流程为:
- UI / CLI → 会话管理器(跨后端共享历史)→ 能力检测器(regex + 可选学习型工具分发器兜底)
- 隐私底线:关键词 + PII + 密钥格式匹配即终局拦截,学习型敏感度升级器只能增加保护
- 确定性策略层:未知请求默认走本地;强制选择覆盖用户偏好
- 上下文构建 + 脱敏 → 压缩层 → 后端(Ollama / Codex / Claude Code) → 响应清洗 → 仅元数据遥测
三、关键能力
- 路由:在本地 Ollama、Codex CLI、Claude Code 之间分配;可选小型学习型分类器做 recall
- 私有模式:敏感提示绝不进入订阅后端,包含强制回退路径
- 跨后端上下文:用户、助手、工具多轮历史会拼接成一次脱敏后的会话 prompt,跨后端携带
- 确定性格栅化工具:时间日期、安全计算器、单位换算、无密钥行情/新闻,避免模型「猜」
- 上下文压缩:参考 Headroom 的思路,仅压缩近期对话,trusted_facts、长期记忆、当前请求三块不被压缩
- 语义记忆:本地嵌入 + SQLite,跨后端可检索;嵌入不可用时仍可用纯文本搜索
- 可解释与隐私遥测:每条决策都可解释,仅记录元数据,不存 prompt/response 内容
- 自带评测:100 例质量基准、本地 LLM-as-judge、多轮统计 harness
四、上手方式
工具以 PyPI 包发布,安装流程为:
pip install switchboard-local- 准备本地运行时:
ollama pull llama3.2:3b - 自检:
switchboard doctor - 使用:
switchboard ask "..."或switchboard route "..."预览路由决策 - Web UI:
switchboard ui,默认监听http://127.0.0.1:8080/ui
要求 Python 3.11+。Codex / Claude Code 后端可选,不安装时所有请求都会被路由到本地。
五、适用场景与边界
Switchboard 适合希望把付费智能体配额用在刀刃上、同时为敏感提示设置确定性本地底线、并能在多后端之间共享会话上下文的开发者。它本质上是一个开源、轻量的本地编排层,不做模型推理、不代理 API 配额,也不重售任何模型访问。基准数据来自作者自跑的 100 例自有测试,规模与代表性有限;对待「always-premium 覆盖率仅 61%」这一基线差异,也需要注意其测试设定本身带来的偏差。
