54xkeee/dsh-youreyes
dsh-youreyes
Eyes for text-only DeepSeek on DeepSeek Harness: model-invokable vision tool + wrapper adapters + general VLM channels (OpenAI-compatible / Gemini / local Ollama)
Install
npx @deepseek-ai/dsh plugin --profile web add dsh-youreyesRestart `dsh web` after install. Bundle APIs can change during the developer preview.
README badge
[](https://dshhub.dev/plugins/dsh-youreyes)Paste this into your README. The star count updates with every catalog sync.
From the README
Excerpt from 54xkeee/dsh-youreyes, cleaned of badges and images.
👁️ dsh-youreyes
给纯文本 DeepSeek 一双眼睛。 在 DeepSeek Harness 里粘贴图片、截图、文件路径——模型就能"看见"并回答与图片相关的问题。DeepSeek 依然是大脑,识图只是眼睛。
一句话:DeepSeek 不会看图?装上它就会了——粘贴、识图、回答,三步完成。
✨ 为什么值得用
| 痛点 | dsh-youreyes 的解法 |
|---|---|
| DeepSeek 纯文本,粘贴图片直接被拒 | 包装适配器声明图片输入,图片自动转文本占位,不再报错 |
| 别的识图插件只认自家 API | 反重力(默认)+ 任意 OpenAI 兼容端点 + Gemini + 本地 Ollama,你的 key 都能用 |
| 配置麻烦、要注册一堆东西 | 本地 Ollama 零配置自动检测;有 Gemini 免费 key 一行配置即可 |
| 模型看到图但"忘了" | 视觉证据记忆:识图结果写入会话,后续轮次可复用,压缩后自动恢复 |
| 同一张图反复花钱识别 | 内容哈希缓存:同图同问进程内只识别一次 |
| 复杂画面识别不准 | auto 档位分流:先标准检查,画面复杂自动升级深度检查 |
| WSL / 被墙环境连不上 API | winCurl 自动降级:fetch 失败自动走 Windows curl 重试 |
🎯 真实效果(2026-08-15 实测,全链路真实调用)
输入:一张橘猫照片 + 这是什么动物?它在做什么?请用中文回答。
输出(Gemini 通道):
这是一只橘色虎斑猫(橘猫)。它正四脚朝天、肚皮朝上地仰卧在黑色床单/毯子上安稳地睡觉,姿态非常放松惬意。
输出(OpenAI 兼容通道 · 通义 qwen3.7-flash):
这是一只橘猫(或者叫橘色虎斑猫)。它正四脚朝天地仰面躺在深色的床单(或毯子)上。它闭着眼睛,看起来睡得很沉或很香;阳光照在它身上形成了明显的光影;四肢完全伸展,呈现出一种非常舒展、毫无防备的姿态。
你粘贴图片 + 提问
→ dsh-youreyes 把图片转成占位符,DeepSeek(大脑)看到
→ DeepSeek 调用 vision 工具 → 通用视觉通道识图
→ 文字证据回填 → DeepSeek 继续回答
🧠 识图引擎——复杂识图到底怎么工作
天真的"看图→描述"循环在密集截图、表格、UI 原型和多图对比面前会崩。dsh-youreyes 把识图做成了结构化、自动升级、带记忆的流水线:
1. 档位自动升级——它知道一遍不够
detail: auto 走两遍策略:
第一遍(standard + 预判)──▶ complexity == "simple" ──▶ 完成
└─▶ complexity == "complex" ──▶ 第二遍(deep)──▶ escalated 结果
视觉模型自己判断画面复杂度。以下情况都会判为 complex 并自动触发深度检查:
- 多主体关系 · 密集小字 · OCR 密集内容
- 表格 / 图表 / 代码 / 界面 · 计数 · 对比 / 找差异
- 专业画面 · 多步空间推理
响应带 escalated 标记,你永远知道是哪一遍回答的。
2. 四种任务模式,一个工具
| 模式 | 干什么 | 典型场景 |
|---|---|---|
glance | 通用理解,围绕你的问题选证据 | 日常提问 |
ocr | 按自然阅读顺序转录文字,保留标题/段落/表格/界面层级 | 截图、文档、报错信息 |
region | 聚焦一个区域——归一化坐标 0.1,0.2,0.8,0.9 或自然语言("右上角") | UI bug、图表细节 |
compare | 逐项列出 ≥2 张图的异同与置信度 | 前后对比、版本对比、A/B |
3. 结构化证据,不是流水账
每次识图都要求视觉模型输出严格 JSON 证据对象:
{
"complexity": "simple|complex",
"base_evidence": {
"summary": "中性概述",
"ocr": "可见文字(没有则为空)",
"layout": ["布局观察"],
"entities": ["实体"],
"relations": ["关系"],
"uncertainty": ["明确的不确定项"]
},
"query_answer": "直接回答用户"
}
观察与推断分离、不确定性显式写出(绝不脑补)、每项列表限长(≤8 项、≤160 字)——上下文始终保持紧凑。
4. 长上下文视觉记忆——模型永远不会"忘"它看过什么
这是让识图跨轮次真正有用的部分:
- 每次结果作为持久化
<dsh-youreyes-evidence>记录写入会话时间线(插件 notice 消息),而不是只返回一次。 - 跨轮复用:同一张图 + 同一个问题直接命中已有记录——识别一次,永远记住。
- 视觉记忆清单:每次请求流自动附带近期证据目录(
attachment=… | mode=… | detail=… | summary),模型可以主动追问——放大区域、重新 OCR、跟新截图对比——你什么都不用重新粘贴。 - compaction 恢复:长会话被 DSH 压缩后,近期视觉记录自动恢复——记忆扛得住摘要。
5. 内容哈希缓存——同样的像素绝不付两次钱
缓存键 = SHA-256(图片字节) + prompt + detail + mode + region + model + channel + prompt版本。进程内 LRU(64 条)保证同一张图用同一种问法每个进程最多识别一次——跨会话也生效。
6. 上游流修复
repairLegacyPlanningStream 会把部分 OpenAI 兼容 DeepSeek 路由误报成 text 的工具前规划重新标记——工具调用流在任何后端上都保持干净。
🚀 快速开始
方式零:反重力 IDE(默认通道,配置后优先)
使用 Antigravity IDE(已启动并登录)时,把它配为默认识图通道——识别走你的 IDE 订阅额度(flash/pro 双档,按模型名自动选择):
- insert:
- id: youreyes
name: dsh-youreyes
config:
antigravityWorkspace: /path/to/workspace
antigravityProjectId: your-project-id
antigravityLsExe: /path/to/language_server.exe
antigravityWindowsHome: /mnt/c/Users/you
antigravityBrainDir: /mnt/c/Users/you/.gemini/antigravity/brain
端口/CSRF 每次调用自动发现,IDE 重启也不用改配置;IDE 不可用时自动降级 Gemini → OpenAI → Ollama。
方式一:本地 Ollama(零配置,最省心)
…


