DSH Hub
dsh-vision-mix cover

haiziyao/dsh-vision-mix

dsh-vision-mix

UIVision2 GitHub stars· updated 2026-08-16

Vision routing and image generation for DeepSeek Harness through a fixed Mix model.

Install

npx @deepseek-ai/dsh plugin --profile web add dsh-vision-mix

Restart `dsh web` after install. Bundle APIs can change during the developer preview.

README badge

dsh-vision-mix DSH Hub badge
[![DSH Hub](https://dshhub.dev/badge/dsh-vision-mix.svg)](https://dshhub.dev/plugins/dsh-vision-mix)

Paste this into your README. The star count updates with every catalog sync.

From the README

Excerpt from haiziyao/dsh-vision-mix, cleaned of badges and images.

Vision Mix

Vision Mix 是 DeepSeek Harness 的视觉增强插件。它把文本模型、视觉模型和可选的图片生成 API 组合成一个 Mix 模型,让原本不支持图片的 Agent 能识别上传图片、理解网页截图、持续追问图片内容,并生成或编辑图片。

模型的 Base URL、协议和 API Key 仍由 DSH 的“设置 → 模型”统一管理。Vision Mix 只引用已经配置好的 Provider,不复制凭据。

三分钟上手

1. 安装

在 DeepSeek Harness 仓库目录执行:

pnpm dsh plugin --profile web add dsh-vision-mix

启动 Web:

pnpm dsh web

安装后的正常启动不需要 --patch

2. 配置准备使用的模型

打开“设置 → 模型”,配置至少两个模型:

用途要求示例
基础模型能处理文本、推理和工具调用deepseek-chatdeepseek-v4-pro
识图模型中转站实际支持 OpenAI/Anthropic 图片消息gpt-5.6-sol、其他视觉模型

识图和基础模型可以来自同一个 Provider,也可以分别使用不同中转站。

如果还要生成或编辑图片,再配置一个支持 OpenAI-compatible /images/generations/images/edits 的 Provider。它可以使用与识图模型完全不同的 Base URL 和 API Key。

3. 检测并启用模型的图片能力

打开“设置 → Vision Mix”,页面最上方是“基础设置”,下方的“模型图片能力”专门用于检测和声明能力:

  1. 从“待检测模型”选择刚才配置的视觉模型。
  2. 点击“测试并启用 image”。
  3. Vision Mix 会临时授予该模型 image 能力,发送一张红色测试图。
  4. 模型正确识别红色后,Vision Mix 才会保存能力声明;失败会自动回滚。
  5. 回到上方“基础设置”,由你自行在“图片模型”中选择该模型。

测试会产生一次很小的模型调用,但不会出现在聊天会话中。

4. 选择基础模型和可选能力

继续在“设置 → Vision Mix”完成:

  1. 选择基础模型。
  2. 在图片模型列表中选择刚才测试通过的模型。
  3. 根据需要选择意图识别模型,用于判断“再详细一点”等模糊的跨轮图片追问。
  4. 根据需要开启“自动识别 Agent 工具返回的截图或图片”。
  5. 点击“保存路由”。

5. 开始使用

新建对话,在模型选择器中选择 Mix,然后尝试:

上传一张图片:这张图里是什么?
下一轮追问:右下角还有什么?
让 Agent 截图:检查当前网页有没有布局问题。

Mix 是 Vision Mix 注册的固定模型入口,不是一个需要单独填写 API Key 的模型服务。

中转站模型图片能力说明

很多中转站的 /models 只返回模型 id,不会声明模型能否接受图片。DSH 会安全地把这类自定义模型视为纯文本模型;如果直接发送图片,请求会在本地被拒绝,并不会到达中转站。

Vision Mix 提供三种接入方式:

操作是否调用 API结果
测试图片能力临时声明 image,发送红色测试图,结束后始终恢复原配置
强制启用 image直接保存 input: [text, image],适合已经自行验证过的中转站
测试并启用 image正确识别红色才保存能力声明;失败自动回滚,推荐使用

能力操作只修改目标模型的输入能力声明,不会替你更换 Vision Mix 路由。启用成功后,模型会出现在上方“图片模型”列表中。测试和保存会保留模型原有的名称、上下文长度、输出长度及其他高级字段。配置写回原 Provider 的模型 profile,API Key 仍保存在 DSH 凭据系统中。

部署使用只读设置服务时,可以在 settings.yaml 中手工配置:

- id: your-vision-model
  input:
    - text
    - image

DSH Web 模型编辑器会保留这个额外字段。

使用独立的图片生成 API

识图模型与图片生成模型不必来自同一个中转站。例如:

用途Provider模型
基础对话chat-relaydeepseek-chat
图片识别vision-relaygpt-5.6-sol
图片生成与编辑images-relaygpt-image-2

配置步骤:

  1. 在“设置 → 模型”分别创建识图 Provider 和 Images API Provider。
  2. 在“模型图片能力”中测试并启用识图模型的 image 能力。
  3. 在上方“基础设置”中选择识图模型。
  4. 在“图片生成与编辑”选择 Images API Provider。
  5. 点击“测试生图 API”。测试固定使用 low1024×1024、PNG,会产生一次实际生图费用。
  6. 看到测试图预览后点击“保存路由”。

生图测试只在内存中预览并校验结果,不会把测试图片永久写入 attachment 存储。

启用后 Agent 可以调用:

  • vision_mix_image_generate:根据提示词生成新图片。
  • vision_mix_image_edit:使用当前会话 attachment 编辑用户图片或上一张生成图。

生成结果会作为 DSH attachment 直接显示在对话中。后续可以继续要求“把刚才生成的图改成夜景”。

Vision Mix 能做什么

  • 用户上传图片后,先显示原始消息,再调用视觉模型分析。
  • 文本基础模型读取识图结果后继续推理、回复和调用工具。
  • 支持“这张图里还有什么”“再详细一点”等跨轮图片追问。
  • 支持分析 Agent 截图、浏览器截图和读图工具返回的图片。
  • 普通文本不会重新分析上一轮图片。
  • 每一次真实识图调用产生一条独立的会话记录。
  • 图片 attachment 保留稳定 id,可以在当前会话中重新读取像素。
  • 支持 gpt-image-2 图片生成与编辑,并预留其他图片 API 后端接口。
  • 识图、基础对话、意图判断和生图可以分别选择不同 Provider。

路由方式

当前输入处理方式
普通文本直接交给基础模型,不调用图片模型
新上传图片图片模型读取像素,基础模型根据分析结果回答
明确追问最近图片使用当前问题重新读取本会话最近的图片
“再详细一点”等模糊追问配置意图模型后,先判断是否需要重新读取图片
Agent 截图或工具图片分析工具真正返回的图片,再交给下一步 Agent
工具没有返回图片保持原工具结果,不触发识图
生成或编辑图片调用独立 Images API,返回新的会话 attachment

插件只处理当前步骤新进入的图片,不会扫描整段历史并重复调用视觉模型。

界面预览

模型与生图设置

会话级识图记录

安装可选的 dsh-better-sidebar 后,每次识图调用默认折叠显示;展开后可以查看完整提示词、图片预览、attachment id 和解析结果。

会话级生图记录

Related plugins