搭配 Ollama 使用
dassi 可以跑在你自己托管的模型上。如果你已经在用 Ollama,把 dassi 指向 http://localhost:11434,它就会用你的本地模型作为推理引擎,而不是 dassi 的托管额度——没有云服务商、没有按 token 计费、页面内容也不会离开你的电脑。
这个设置是真实存在的,只是藏得深:它在 Models 页面一个折叠区域里,位于一长串服务商列表的最底部。本页告诉你具体该点哪里。
关于价格: 用自己的模型意味着你走的是 Developer 套餐——每月 $10,或整年 $36,算下来一天大约 10 美分。key 由你提供,所以你只为扩展本身付费,比任何托管额度档位都便宜。这个选项在连接服务商之前是隐藏的,别先去找它:见下文解锁 Developer 套餐,或到套餐与计费看完整对比。
localhost,不会发给模型厂商。代价是能力。浏览器自动化是一种要求高、跨度长、依赖工具调用的工作负载——在多步任务上,7B 模型会比前沿模型明显不可靠。
你还需要在 Chrome 里安装好 dassi。
1. 打开 dassi 的设置
Section titled “1. 打开 dassi 的设置”侧栏工具栏上没有齿轮图标。设置藏在 ⋮ 菜单后面。

- 点击 dassi 侧栏右上角的 ⋮。
- 点击 Settings。dassi 会在新标签页打开设置页。
2. 进入 Models,展开 API keys
Section titled “2. 进入 Models,展开 API keys”这是最容易漏掉的一步——API keys 默认是折叠的,点开之前看不到服务商列表。

- 点击左侧导航 Agent 下的 Models。
- 点击 API KEYS 展开该区域,会出现一长串服务商。
3. 找到 Custom endpoint 卡片
Section titled “3. 找到 Custom endpoint 卡片”滚动到服务商列表的最底部,越过 Azure OpenAI。

- Custom (OpenAI-compatible) 卡片——副标题写着「Azure, LiteLLM, Ollama …」。要的是这一张,不是它正上方的 Azure OpenAI。
- 点击 Add endpoint 打开表单。
4. 填写表单
Section titled “4. 填写表单”会出现三个字段。只有第一个需要填:

- Base URL — 填
http://localhost:11434。要带协议:只写localhost:11434会被判为无效 URL。dassi 会把 URL 规范成以/v1结尾,所以http://localhost:11434和http://localhost:11434/v1等价。 - Model ID — 留空。 dassi 会从你的服务器读取模型列表,让你在聊天里选。(如果想固定一个,填
ollama list里的准确标签,如qwen3:8b。gpt-4o只是占位文字。) - API Key — 留空。 Ollama 不需要鉴权,自定义端点的 key 是可选的。忽略
sk-...占位文字。 - 点击 Save。
Chrome 会请求访问 http://localhost 的权限——允许它。然后 dassi 调用 http://localhost:11434/v1/models 验证连接,卡片显示已验证。
5. 选模型,跑一个任务
Section titled “5. 选模型,跑一个任务”打开聊天窗口底部的模型选择器。你拉取过且 dassi 支持的每个模型都在里面——切到你想用的那个。
先试个小任务,确认整个链路能跑通:
用三条要点总结本页。
能跑通的话,再上一个真实任务:
找到这个网站的定价页,告诉我最便宜的付费套餐包含什么。
解锁 Developer 套餐
Section titled “解锁 Developer 套餐”用本地模型意味着你不需要托管额度,所以 Starter / Pro / Max 档位不是你要的。Developer(「Dassi for developers」)就是为此设计的:key 由你提供,因为只为扩展付费,所以比任何托管档位都便宜。
在连接服务商之前它是隐藏的。 如果在完成第 4 步之前去找,Plan 页面上根本没有它——这就是为什么很容易错过这个更便宜的选项。
Ollama 端点验证通过后,打开 Settings → Plan。Developer 选项出现在 Starter / Pro / Max 卡片下方,单独放置而不在网格里——它是另一种类型的套餐,不是另一个额度档位。

结账用银行卡。在托管额度购买暂停的地区,旁边还会出现微信支付按钮。
如果你已经订阅了它,或者托管额度套餐在你所在地区不可用,它也会显示出来。
各套餐包含的内容见套餐与计费。
如果模型很慢
Section titled “如果模型很慢”普通硬件上的本地模型可能要等一会儿才出第一个 token,尤其是模型加载后的第一次请求。dassi 默认等待 600 秒,这也是上限。
要查看或修改,点击同一个 Custom endpoint 表单里的 Advanced:

这是 dassi 等待模型开始响应的最长时间。如果撞到了这个上限,要在 Ollama 那边解决——见为 dassi 配置 Ollama。
dassi 也在努力让你的模型少嚼点东西,这在本地硬件上比在任何地方都重要。它让一个任务里重复的部分在多次运行之间逐字节一致,这样 Ollama 可以复用已经处理过的内容而不是从头开始——这个复用默认开启,但只在前缀匹配时生效。它还会为做过的网站给自己写捷径,重复运行时读页面的轮次更少。两者都表现为更少的等待。为什么重复运行更便宜有详细解释。
| 你看到的 | 意味着 |
|---|---|
| 任务开始后提示 “Your local model blocked the request” | OLLAMA_ORIGINS 没设,或者和你的扩展 ID 不匹配。连接检查不需要它也能通过——只有真正的模型调用会失败——所以问题出现在第一个任务,而不是设置时。见允许 dassi 的扩展来源。 |
| “Enter a valid URL, including the scheme” | 你填的是 localhost:11434。改成 http://localhost:11434。 |
| “The endpoint could not be verified” | Ollama 没在运行,或者不在 11434 端口。用 curl http://localhost:11434/v1/models 确认。 |
“Permission to http://localhost was denied” | Chrome 的主机权限提示被关掉了。再点一次 Save 并允许。 |
| 模型没出现在聊天的选择器里 | 它的 ID 不属于支持的系列,或者还没拉取。见选择模型。 |
| dassi 有回复但从不点击 | 模型不支持工具调用。换一个支持的。 |
| 任务在回复前就超时 | 在 Advanced 下调高 Response timeout,最高 600 秒(600 也是默认值)。 |
什么留在本地
Section titled “什么留在本地”连接 Ollama 后,模型调用——提示、页面内容和 dassi 截取的截图——只发往你自己的服务器,不去别处。dassi 仍然会为与推理无关的账号和同步功能与自己的后端通信;完整情况见隐私与安全。
- 为 dassi 配置 Ollama — 服务器这一侧:拉取模型、允许 dassi 的来源、在另一台机器上运行 Ollama
- 模型与服务商 — 所有连接方式,包括托管额度和其他 OpenAI 兼容端点
- 第一个任务 — 连接好之后让 dassi 做什么
- 为什么重复运行更便宜 — dassi 如何减少重复运行的工作量;在本地硬件上体现为速度而不是省钱