跳过主要内容

视觉、语音与多模态

视觉、语音与多模态类插件让 DeepSeek-Harness(dsh)里纯文本的 DeepSeek 模型也能"看图""听声""开口"。包含把粘贴的截图交给智谱 GLM、Gemini、豆包或本地 Ollama 做 OCR 与图像描述的 vision 工具和供应商路由、基于浏览器 Web Speech API 或 Whisper 兼容接口的麦克风语音输入、使用 Edge TTS 或自定义音色的朗读回复与全双工语音模式,以及图片、视频、音乐生成工具。

共 312 个插件

T

dsh-vision-worker

try-works/dsh-vision-worker

DeepSeek Harness 视觉插件:为纯文本调用方转接 Cloudflare Workers AI 视觉模型,返回带版本的结构化结果并支持追问。

0上个月视觉、语音与多模态Apache-2.0
F

dsh-dictate

franksong2702/dsh-dictate

面向 Composer 的浏览器 Web Speech 听写:识别无需专用 ASR 服务器、密钥或模型下载,复用会话文本与已配置模型做上下文词汇提示与转写润色。

0上个月视觉、语音与多模态MIT
M

meow-vision

meimiaoji-creator/meow-vision

meow-vision 是 DeepSeek Harness 的视觉插件,解决纯文本模型无视觉、以及 Vue 页面开发中视觉验证不闭环的问题。

0上个月视觉、语音与多模态MIT
Z

dsh-vision-bridge

zzdream67/dsh-vision-bridge

让纯文本模型在 DeepSeek Harness 里也能看图:拦截 llm/stream 瀑布流,把每张图片透明替换为视觉模型给出的描述。

0上个月视觉、语音与多模态MIT
G

glm-vision-plugin

gelomen/glm-vision-plugin

DSH Web 插件:调用智谱 GLM 视觉模型分析图片(analyze_image 工具 + 插件设置卡片)

0上个月视觉、语音与多模态
S

dsh-vision-link

sprainjinyu/dsh-vision-link

轻量、保持路由的 DSH 视觉链路:由配置好的视觉模型看图,而你所选文本模型继续掌控推理与最终回答

0上个月视觉、语音与多模态
R

dsh-omni-vision

renji004/dsh-omni-vision

为纯文本模型装上本地眼睛:eyes_render 在 Web 界面画布上绘制文字/图形/Mermaid,eyes_paste 接收用户粘贴的图片,eyes_ocr 用 Windows 自带 OCR 离线读文字,eyes_analyze 把像素解析成结构化数据,全程无需视觉模型。

02个月前视觉、语音与多模态MIT
I

dsh-tool-accurate-vision

imkingjh999/dsh-tool-accurate-vision

面向模型的 accurate_vision 工具:借视觉模型对图片做精确空间推理,返回归一化到 0–1000 的边界框。

02个月前视觉、语音与多模态MIT
V

dsh-ocr-bridge

vuvanmai936-dot/dsh-ocr-bridge

把图片粘贴进 DSH 聊天,先由免费本地后端(macOS Vision / Tesseract)识别文字,再交给纯文本 DeepSeek 模型回答。

0上个月视觉、语音与多模态
P

dsh-plugin-image-tools

pasumao/dsh-plugin-image-tools

DSH 图片插件:ask_user_choice 图文选择卡、show_images 回复内嵌图片,以及把用户发来的图片存为工作区文件。

0上个月视觉、语音与多模态MIT
H

win11-oneocr

hawkhai/win11-oneocr

DSH 的本地 Windows 11 OneOCR 工具:`oneocr_recognize` 返回 OCR 文本,以及包含行/词多边形、置信度、旋转角度和手写体样式的结构化结果。

0上个月视觉、语音与多模态
H

wechat-ocr

hawkhai/wechat-ocr

DSH 的本地微信 OCR 工具:`wechat_ocr_recognize` 针对本地图片路径返回识别文本和引擎的结构化结果。

0上个月视觉、语音与多模态
Z

dsh-vision

zoahdev/dsh-vision

vision_analyze 工具:把本地图片或 URL 交给 OpenAI 兼容的视觉模型分析并返回文字。

02个月前视觉、语音与多模态MIT
V

dsh-doubao-voice

vorpal-poem/dsh-doubao-voice

DSH 语音输入插件:接入火山引擎流式 ASR(豆包 Seed ASR),识别结果流式回填输入框。

02个月前视觉、语音与多模态MIT
T

dsh-vision-api-localorweb

tipsong/dsh-vision-api-localorweb

02个月前视觉、语音与多模态MIT
J

dsh-autovision

junkrat9527/dsh-autovision

纯文本 dsh 模型的识图插件:粘贴图片自动由你配置的多模态模型转成文字——透明孪生路由、模型可自主调用识图工具、无内置密钥与中转。

02个月前视觉、语音与多模态MIT
L

dsh-mingmu

lab-sku/dsh-mingmu

明眸 VisionBridge:纯文本模型收到图片时自动调用视觉模型识别,把文字喂回主模型,全程无感、可配置。

02个月前视觉、语音与多模态MIT
M

dsh-voice

motongv/dsh-voice

给 DSH 加语音能力的社区插件:输入框语音输入(可配快捷键)+ 回答朗读(微软 Edge 音色),无需 API Key。

02个月前视觉、语音与多模态MIT
T

dsh-vision-ocr

timeflies-qyh/dsh-vision-ocr

DeepSeek Harness OCR 插件:基于 PaddleOCR-json(主)与 RapidOCR-json(备)的离线图片文字识别,无需视觉模型。

02个月前视觉、语音与多模态MIT
S

dsh-media-guard

spyfree/dsh-media-guard

为 DeepSeek Harness(DSH)提供确定性的媒体总量预算与安全的请求投影。

02个月前视觉、语音与多模态MIT
S

dsh-siliconflow-vision

shixiangyu2/dsh-siliconflow-vision

DSH 插件:通过硅基流动(SiliconFlow)视觉模型识别图片,支持本地路径、http(s) URL 与 base64 data URL,含粘贴识别面板。

02个月前视觉、语音与多模态MIT
A

dsh-plugin-multimodal-bridge

avaritiachaos/dsh-plugin-multimodal-bridge

DeepSeek Harness 的动态多模态转文本投影与跨模型视觉桥:可在视觉模型与纯文本模型(DeepSeek)之间无缝热切换。

02个月前视觉、语音与多模态MIT
1

intelligenteyes

1210350468/intelligenteyes

IntelligentEyes——面向 DeepSeek Harness 的通用 agent 视觉网关。

02个月前视觉、语音与多模态MIT
B

vision-translation

bingl-li/vision-translation

vision-translation 的原生 dsh 适配器:调用 Python CLI 把图片转为 <vision-context> 文本给文本模型。

02个月前视觉、语音与多模态MIT