본문으로 건너뛰기

비전, 음성 및 멀티모달

비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.

플러그인 312개 찾음

G

dsh-tts

goodandready/dsh-tts

DeepSeek Harness 웹 UI에서 에이전트 응답을 공급자 폴백 체인(OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak)을 통해 읽어줍니다. 실패하거나 속도 제한된 공급자는 침묵하는 대신 다음 공급자로 넘어갑니다.

26일 전비전, 음성 및 멀티모달MIT
O

DSH-dseyes

okkay712/dsh-dseyes

Web GUI에서 텍스트 전용 DeepSeek를 위한 네이티브 이미지 첨부: 붙여넣기 또는 드롭한 이미지가 세션에 썸네일로 표시되며, 디스패치 전에 호스트가 무료 Zhipu GLM-4V-Flash 비전 API(glm-4v-flash 폴백 체인)로 읽고 설명으로 대체합니다. 따라서 원본은 기록에 보관된 채 DeepSeek가 이미지에 대해 답변합니다.

2지난달비전, 음성 및 멀티모달MIT
W

dsh-wm

waynejin0918/dsh-wm

월드 모델 연구 툴킷: 프레임 검사, 3D/픽셀/잠재 경로 명명, 예측 대 GT 점수화, RSI 스킬 / wm.yaml.

22개월 전비전, 음성 및 멀티모달MIT
I

dsh-tool-visual-primitives

inkshadewoods/dsh-tool-visual-primitives

모드별 프롬프트(caption, UI, 문서, grounding, topology 등)를 통해 대화 이미지를 분석하고, 좌표 프리미티브(박스, 포인트, 참조)와 함께 구조화된 증거를 텍스트로 주입하며, 세션 수준 캐싱을 통해 replay 및 compaction을 거쳐 재사용할 수 있습니다.

23일 전비전, 음성 및 멀티모달MIT
V

dsh-smart-input

v-quest123456/dsh-smart-input

DeepSeek Harness용 스마트 입력 플러그인 — 음성 입력 + 프롬프트 최적화

22개월 전비전, 음성 및 멀티모달MIT
G

dsh-vision-bridge

goodandready/dsh-vision-bridge

이미지를 선택한 비전 모델로 라우팅합니다 — 자동 재작성, 명시적 도구, 또는 하이브리드 방식 — 그래서 텍스트 전용 채팅 모델이 그림이 포함된 턴에서 실패하지 않습니다.

26일 전비전, 음성 및 멀티모달MIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Muxiva가 오케스트레이션하는 DeepSeek Harness용 로컬 우선 양방향 음성

22개월 전비전, 음성 및 멀티모달Apache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

에이전트가 시작하는 음성 통화: `offer_call`이 사람에게 전화를 울리고(接听/拒接/稍后再说), 수락된 통화는 CrispASR + Qwen3-TTS(화자 9명, 중국어 방언 2개)로 로컬에서 합성·재생되며, 거절된 통화는 그 결정을 에이전트에 돌려줍니다.

23일 전비전, 음성 및 멀티모달MIT
M

dsh-fish-tts

mari23333/dsh-fish-tts

Fish Audio API만 사용해 어시스턴트 답변을 음성으로 읽어 줍니다(키는 직접 준비): 메시지별 읽어주기, 자동 읽기 토글, 모델·음성 reference_id·암호화된 API 키·프록시를 설정하는 페이지를 제공합니다.

2그저께비전, 음성 및 멀티모달MIT
X

dsh-vision

xiaoshihou514/dsh-vision

네이티브 시각 능력 확장. Zhipu(무료) 또는 Qwen-VL(로컬)을 사용합니다.

2지난달비전, 음성 및 멀티모달MIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

첨부된 이미지를 구성 가능한 모델(15개 이상의 OpenAI 호환 및 Anthropic 공급업체)을 통해 텍스트로 변환하고, DeepSeek이 계속 답변하는 동안 처리하는 비전 제공업체 경로.

2지난달비전, 음성 및 멀티모달MIT
H

dsh-open-eyes

hyp6666/dsh-open-eyes

첨부 및 로컬 이미지를 설정 가능한 OpenAI Responses, Chat Completions, 또는 Anthropic Messages 엔드포인트를 통해 분석하면서, 이미지 지원 라우트는 네이티브로 유지하는 텍스트 전용 DeepSeek 라우트용 비전 브리지입니다.

227일 전비전, 음성 및 멀티모달MIT
5

dsh-youreyes

54xkeee/dsh-youreyes

텍스트 전용 DeepSeek용 비전 툴킷입니다. 모델 호출형 `vision` 도구, deepseek/opencode-go용 래퍼 어댑터(v4 flash/pro), Antigravity IDE 쿼터(default, flash/pro) / 모든 OpenAI 호환 VLM / Gemini / 로컬 Ollama 채널, 압축 재복원 기능이 있는 증거 메모리, 콘텐츠 해시 캐시, 그리고 이중 언어 클라이언트 패널을 제공합니다.

22개월 전비전, 음성 및 멀티모달MIT
3

dsh-vision (vision-tool)

314857493/dsh-vision

DeepSeek Harness용 모델 호출형 `vision` 도구입니다. 무료 Zhipu GLM vision API 를 직접 호출해 이미지 파일을 설명하고 OCR 하며(glm-4v-flash 폴백 체인 포함), 외부 CLI 는 필요하지 않습니다.

228일 전비전, 음성 및 멀티모달MIT
3

dsh-vision (vision-route)

314857493/dsh-vision

`deepseek-vision` 제공자 라우트를 등록합니다. Web GUI 는 붙여넣은 이미지를 받아 무료 Zhipu GLM vision API 로 텍스트로 변환한 뒤 DeepSeek 어댑터에 전달합니다.

228일 전비전, 음성 및 멀티모달MIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

컴포저에 첨부된 이미지를 텍스트 전용 DeepSeek 모델에 전달하기 전에 OpenAI 호환 비전 모델이 텍스트로 변환

22개월 전비전, 음성 및 멀티모달MIT
J

dsh-live2d-voice

john-walks-slow/dsh-live2d-voice

Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口

14일 전비전, 음성 및 멀티모달MIT
W

dsh-multi-tts

wyr-233/dsh-multi-tts

Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.

122일 전비전, 음성 및 멀티모달
V

dsh-live-voice

victorwads/dsh-live-voice

Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.

118일 전비전, 음성 및 멀티모달GPL-3.0
C

dsh-vision-autoswitch

cultofluna/dsh-vision-autoswitch

DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.

1지난달비전, 음성 및 멀티모달MIT
N

dsh-dictate

navneetset/dsh-dictate

Live speech-to-text dictation into the dsh web composer via OpenRouter STT

127일 전비전, 음성 및 멀티모달MIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119일 전비전, 음성 및 멀티모달MIT
N

dsh-imgdraw

ninjasln-labs/dsh-imgdraw

Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free

128일 전비전, 음성 및 멀티모달MIT
D

dsh-voice-talk

duoduoqian708/dsh-voice-talk

Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.

120일 전비전, 음성 및 멀티모달MIT