비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-tts
goodandready/dsh-tts
DeepSeek Harness 웹 UI에서 에이전트 응답을 공급자 폴백 체인(OpenAI, ElevenLabs, Google, Azure, Groq, Deepgram, OpenRouter, Edge, Piper, eSpeak)을 통해 읽어줍니다. 실패하거나 속도 제한된 공급자는 침묵하는 대신 다음 공급자로 넘어갑니다.
DSH-dseyes
okkay712/dsh-dseyes
Web GUI에서 텍스트 전용 DeepSeek를 위한 네이티브 이미지 첨부: 붙여넣기 또는 드롭한 이미지가 세션에 썸네일로 표시되며, 디스패치 전에 호스트가 무료 Zhipu GLM-4V-Flash 비전 API(glm-4v-flash 폴백 체인)로 읽고 설명으로 대체합니다. 따라서 원본은 기록에 보관된 채 DeepSeek가 이미지에 대해 답변합니다.
dsh-wm
waynejin0918/dsh-wm
월드 모델 연구 툴킷: 프레임 검사, 3D/픽셀/잠재 경로 명명, 예측 대 GT 점수화, RSI 스킬 / wm.yaml.
dsh-tool-visual-primitives
inkshadewoods/dsh-tool-visual-primitives
모드별 프롬프트(caption, UI, 문서, grounding, topology 등)를 통해 대화 이미지를 분석하고, 좌표 프리미티브(박스, 포인트, 참조)와 함께 구조화된 증거를 텍스트로 주입하며, 세션 수준 캐싱을 통해 replay 및 compaction을 거쳐 재사용할 수 있습니다.
dsh-smart-input
v-quest123456/dsh-smart-input
DeepSeek Harness용 스마트 입력 플러그인 — 음성 입력 + 프롬프트 최적화
dsh-vision-bridge
goodandready/dsh-vision-bridge
이미지를 선택한 비전 모델로 라우팅합니다 — 자동 재작성, 명시적 도구, 또는 하이브리드 방식 — 그래서 텍스트 전용 채팅 모델이 그림이 포함된 턴에서 실패하지 않습니다.
muxiva-dsh-voice
piyotahu/muxiva-dsh-voice
Muxiva가 오케스트레이션하는 DeepSeek Harness용 로컬 우선 양방향 음성
dsh-voice-call
pandapolo/dsh-voice-call
에이전트가 시작하는 음성 통화: `offer_call`이 사람에게 전화를 울리고(接听/拒接/稍后再说), 수락된 통화는 CrispASR + Qwen3-TTS(화자 9명, 중국어 방언 2개)로 로컬에서 합성·재생되며, 거절된 통화는 그 결정을 에이전트에 돌려줍니다.
dsh-fish-tts
mari23333/dsh-fish-tts
Fish Audio API만 사용해 어시스턴트 답변을 음성으로 읽어 줍니다(키는 직접 준비): 메시지별 읽어주기, 자동 읽기 토글, 모델·음성 reference_id·암호화된 API 키·프록시를 설정하는 페이지를 제공합니다.
dsh-vision
xiaoshihou514/dsh-vision
네이티브 시각 능력 확장. Zhipu(무료) 또는 Qwen-VL(로컬)을 사용합니다.
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
첨부된 이미지를 구성 가능한 모델(15개 이상의 OpenAI 호환 및 Anthropic 공급업체)을 통해 텍스트로 변환하고, DeepSeek이 계속 답변하는 동안 처리하는 비전 제공업체 경로.
dsh-open-eyes
hyp6666/dsh-open-eyes
첨부 및 로컬 이미지를 설정 가능한 OpenAI Responses, Chat Completions, 또는 Anthropic Messages 엔드포인트를 통해 분석하면서, 이미지 지원 라우트는 네이티브로 유지하는 텍스트 전용 DeepSeek 라우트용 비전 브리지입니다.
dsh-youreyes
54xkeee/dsh-youreyes
텍스트 전용 DeepSeek용 비전 툴킷입니다. 모델 호출형 `vision` 도구, deepseek/opencode-go용 래퍼 어댑터(v4 flash/pro), Antigravity IDE 쿼터(default, flash/pro) / 모든 OpenAI 호환 VLM / Gemini / 로컬 Ollama 채널, 압축 재복원 기능이 있는 증거 메모리, 콘텐츠 해시 캐시, 그리고 이중 언어 클라이언트 패널을 제공합니다.
dsh-vision (vision-tool)
314857493/dsh-vision
DeepSeek Harness용 모델 호출형 `vision` 도구입니다. 무료 Zhipu GLM vision API 를 직접 호출해 이미지 파일을 설명하고 OCR 하며(glm-4v-flash 폴백 체인 포함), 외부 CLI 는 필요하지 않습니다.
dsh-vision (vision-route)
314857493/dsh-vision
`deepseek-vision` 제공자 라우트를 등록합니다. Web GUI 는 붙여넣은 이미지를 받아 무료 Zhipu GLM vision API 로 텍스트로 변환한 뒤 DeepSeek 어댑터에 전달합니다.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
컴포저에 첨부된 이미지를 텍스트 전용 DeepSeek 모델에 전달하기 전에 OpenAI 호환 비전 모델이 텍스트로 변환
dsh-live2d-voice
john-walks-slow/dsh-live2d-voice
Live2D session view with realtime voice: continuous voice input, streaming TTS, subtitle translation, multi-model catalog, standalone entry / Live2D 实时语音会话视图:连续语音输入、流式 TTS、字幕翻译、多模型目录、独立入口
dsh-multi-tts
wyr-233/dsh-multi-tts
Per-reply read-aloud with a multi-provider settings page — MiniMax or any OpenAI-compatible /audio/speech endpoint, with voice, emotion, speed and model selection plus an auto-read toggle.
dsh-live-voice
victorwads/dsh-live-voice
Local-first voice conversations for DSH, with local speech recognition and synthesis and optional external providers.
dsh-vision-autoswitch
cultofluna/dsh-vision-autoswitch
DeepSeek Harness plugin: auto-route image-bearing requests to deepseek-v4-flash-vision-exp, then fall back to the original model.
dsh-dictate
navneetset/dsh-dictate
Live speech-to-text dictation into the dsh web composer via OpenRouter STT
dsh-minimax-asr
moluyao/dsh-minimax-asr
MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选
dsh-imgdraw
ninjasln-labs/dsh-imgdraw
Text-to-image for DeepSeek Harness: a `draw_image` model tool, an input-bar 生图 button with a prompt popup (async generation, 4-grid results, download / keep / delete), an /imgdraw image route, and persisted history. Backends: DashScope wan2.7-image (free
dsh-voice-talk
duoduoqian708/dsh-voice-talk
Voice conversation mode for the DSH Web GUI: tap the mic to start a full-screen call, talk hands-free, and hear each reply read aloud as it streams. Bilingual (Chinese/English) UI, light and dark themes, adjustable speech rate, and switchable voices.