前言
目前OpenClaw官方已经出了桌面应用, 再也不用像之前那般苦苦折腾命令行了

CC Switch
以前我们切换模型, 需要手动修改配置文件, 假如有十来个模型, 管理上也是个大问题, CC Switch这个工具的出现就是解决这些痛点的, 它不仅可以自动帮我们修改配置文件切换模型,、可视化管理模型key, 还可以实时监控token额度, 很是方便
最主要的是开源免费, 不用担心隐私泄露


官网: 点击进入
免费模型
关于第三方的模型API, 大家可以自行B站或者抖音搜索, 有一些羊毛可以薅
如果是本地部署的话可以使用qwen2.5模型:
| 模型 | ollama 名称 | 显存需求 | 特点(对你的剧本解析) |
|---|---|---|---|
| Qwen2.5‑3B | qwen2.5:3b |
4‑5G | ⭐优先小模型,原生强中文;输出 yaml 稳定性远好 llama3.2‑3B;适合显卡配置不高机器,做测试原型 |
| Qwen2.5‑7B | qwen2.5:7b |
7‑9G | ⭐⭐⭐最推荐正式生产;中文剧本理解、结构化 yaml 输出能力强,Apache2.0 完全开源,无厂商附加约束 |
| Qwen2.5‑14B | qwen2.5:14b |
12‑14G | 长剧本、多角色大文本解析,效果最好,吃显存 |
Qwen(通义千问开源版),阿里开源,权重 Apache‑2.0 真正开源,没有 Llama 那一套社区协议约束,没有月活上限,个人、商用、二次分发都可以自由使用
可以使用Ollama或者vLLM本地部署, 两种方式对比如下:
| 对比项 | vLLM(当前方案) | Ollama(备选方案) |
|---|---|---|
| 标准 modelscope 模型 | ✅直接加载,无需转换 | ❌必须转为 GGUF 格式 |
| 长文本分镜生成速度 | ⭐⭐⭐⭐⭐(PagedAttention 长上下文加速) | ⭐⭐⭐ |
| 空闲自动释放显存 | 原生无,需要外部脚本 kill 进程 | ✅自带 keep‑alive N 秒自动卸载模型 |
| 环境部署复杂度 | 高(CUDA、vLLM 版本、显存参数) | 极低 |
| 量化方案 | FP16、AWQ、FP8,工业级 | GGUF(Q4_K_M/Q5_K_M) |
| ComfyUI 节点 HTTP 调用 | 支持(OpenAI 接口 http://127.0.0.1:8000/v1) |
ollama 一键拉取模型命令:
1 | # 3B小模型,测试原型,Apache‑2.0真正开源 |
如果使用vLLM部署, 那么推荐国内的modelscope源速度快, 一键下载指令如下:
1 | modelscope download --model qwen/Qwen2.5-7B-Instruct --local_dir /models/Qwen2.5-7B-Instruct |
vLLM部署+启动脚本如下:
1 | #!/usr/bin/env python3 |
ollama一键部署脚本如下:
1 | #!/usr/bin/env python3 |
本文为作者原创 转载时请注明出处 谢谢
