비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-voice-kit
aaaadrop/dsh-voice-kit
DeepSeek Harness 웹 GUI를 위한 음성 입력(Web Speech API) 및 소리내어 읽기(speechSynthesis) — DSH 음성 입력 + 응답 읽어주기 키트
dsh-sight
ericfetch/dsh-sight
DeepSeek Harness 플러그인: 직접 멀티모달 이미지 전송 선언 + 세션별 이미지 삭제(표면 교체) 기능과 설정 페이지 및 작성기 컨트롤을 제공합니다.
dsh-open-file
hyper-dsh-plugins/dsh-open-file
DeepSeek Harness를 위한 워크스페이스에 한정된 임의 파일 업로드, 읽기, OCR 및 렌더링.
dsh-multimodal
yauntyour/dsh-multimodal
파일 유형별 멀티모달 체인: 와일드카드마다 처리 모델을 프리셋으로 지정해 이미지·동영상·오디오 파일을 텍스트 전용 세션 모델에 도달하기 전에 프롬프트 토큰으로 변환합니다. 프리셋별 폴백 체인과 Multimodal 설정 페이지를 제공합니다.
dsh-voice-input
lhenlihai-hub/dsh-voice-input
dsh-vision-bridge
acc1143/dsh-vision-bridge
DSH 이중 모델 라우팅 플러그인: 주 대화는 DeepSeek에 두고, 이미지 작업은 명시적으로 설정한 비전 모델로 자동 분배한 뒤 분석 결과를 DeepSeek에 돌려주어 계속합니다.
dsh-vision
314857493/dsh-vision
DeepSeek Harness 플러그인: 이미지 입력을 선언하는 `deepseek-vision` 라우트로, 무료 Zhipu GLM 비전 모델을 통해 붙여넣은 이미지를 전사한 뒤 DeepSeek 어댑터로 위임합니다.
dsh-image-plugins
alanzhao0128/dsh-image-plugins
DeepSeek Harness용 멀티모달 플러그인으로, 구성 가능한 OpenAI 호환 또는 DashScope 엔드포인트를 통해 이미지를 이해하고 이미지를 생성합니다.
dsh-plugins
zjcdkj/dsh-plugins
DeepSeek Harness 비트리 플러그인: 이미지를 Qwen-VL(DashScope) 경로로 ctx.llm을 통해 라우팅하고 텍스트를 반환하여 텍스트 전용 코딩 모델에 시각을 부여
dsh-open-file
hyp6666/dsh-open-file
DeepSeek Harness용 워크스페이스 바인딩 임의 파일 업로드, 읽기, OCR 및 렌더링
dsh-image-vision
xsoc1/dsh-image-vision
모든 OpenAI 호환 VLM(로컬 Ollama 또는 클라우드)용 view_image 도구를 갖춘 채팅 이미지 첨부 브리지: 붙여넣거나 드롭한 이미지가 텍스트 전용 DeepSeek 모델에 도달하기 전에 view_image 경로 마커가 됩니다.
mimo-vision
wulusai2333/mimo-vision
`describe_image` 도구: opencode Zen API를 통해 이미지를 mimo-v2.5로 보내는 비전 브리지(자격 증명 `OPENCODE_GO_API_KEY`, 무료 라우트 우선 + 유료 폴백)로 텍스트 전용 모델에 설명을 돌려주며, SVG/TIFF/HEIC는 네이티브 패스스루와 ImageMagick 변환을 지원합니다.
dsh-tool-vision
wanshichenguang/dsh-tool-vision
DashScope OpenAI 호환 API(qwen3.7-flash) 기반의 모델용 image_describe(识图) 도구와 붙여넣기 브리지: 텍스트 전용 세션에서 붙여넣은 이미지가 전송 시 파일 경로로 자동 변환되고 트랜스크립트에 다시 렌더링되어 이미지 허용 단계에서 걸리지 않습니다. DASHSCOPE_API_KEY는 BYOK, 엔드포인트/모델/예산 설정 가능, 리다이렉트 방지 HTTP 클라이언트, 모든 agent preset에서 동작.
dsh-vision-subagent
ruby1304/dsh-vision-subagent
모든 DSH 라우트에 비전을: 웹 컴포저에 이미지를 붙여넣으면 의도를 반영해 자동 분석하고, 워크스페이스 이미지 읽기는 Kimi/MiniMax 비전 서브에이전트에 위임하며, 붙여넣은 원본은 편집용으로 실체화합니다.
dsh-auto-vision
normanfxxkingrockwell/dsh-auto-vision
텍스트 전용 DeepSeek Harness 에이전트용 자동 탐색 비전 브리지: 설정된 제공자에서 이미지 지원 모델을 자동으로 찾아 비전 도구로 사진 설명을 평문으로 반환합니다.
dsh-llm-deepseek-vision
nagasakisoyo-ui/dsh-llm-deepseek-vision
비전 증강 DeepSeek 어댑터: 비전 지원 모델이 이미지 입력을 설명하고 텍스트 전용 DeepSeek 모델이 그 설명을 추론합니다.
dsh-eyes
leeminjing/dsh-eyes
텍스트 전용 DeepSeek 모델용 온디맨드 비전: 이미지를 업로드하면 모델이 임의의 OpenAI 호환 비전 엔드포인트(기본 Qwen/DashScope)를 사용하는 view_image 도구를 호출합니다.
dsh-mindseye
kanchengw/dsh-mindseye
DSH의 텍스트 전용 모델용 플러그인 비전: 이미지 이해와 생성, GUI 자동화를 네이티브로 조작하며 계층화된 증거 메모리와 캐시를 갖춥니다.
dsh-tool-vision
gloryxpnv/dsh-tool-vision
텍스트 전용 에이전트를 위한 로컬 우선 구조적 비전: 이미지를 로컬 OpenAI 호환 VLM에 보내고 JSON 증거(요약, 그대로의 OCR, 레이아웃 영역, 엔티티/관계, 색상, 명시적 불확실성)로 돌려받습니다. 환각 방지 폴백과 선택적 붙여넣기/업로드 브리지 포함. 클라우드 비용 없음, 이미지는 기기 밖으로 나가지 않습니다.
dsh-plugin-mm-vision
elohia/dsh-plugin-mm-vision
DSH용 공감각 인코더: 비전 모델이 이미지를 압축된 구조적 공간 텍스트(캔버스/요소/백분율 좌표)로 변환해 `mm_vision` 도구를 통해 텍스트 전용 LLM에 픽셀 수준의 이미지 이해를 제공합니다.
dsh-deepseek-vision
cheng-cheng9669/dsh-deepseek-vision
텍스트 전용 모델을 위해 DeepSeek 웹의 내장 비전 모드를 재사용합니다: deepseek_vision 도구가 로컬 deepseek-vision-cli 브라우저 자동화(수동 로그인 도우미, deep-think 활성, 브라우저 자동 종료)를 구동하고 이미지 설명을 텍스트로 반환합니다.
dsh-vision-fallback
1helloman1/dsh-vision-fallback
채팅 이미지를 고정된 OpenAI 호환 비전 모델로 라우팅하고 사실에 근거한 관찰을 선택된 메인 모델에 반환합니다. 세션 범위 관찰은 리플레이·압축·재시작을 넘어 재사용됩니다.
dsh-voice
zhuiyueya/dsh-voice
DeepSeek Harness(dsh)용 음성 기능 — 텍스트 전용 DeepSeek을 위한 음성-텍스트 입력 + TTS 읽어주기, API 키 불필요
multimodal-bridge
spirit4471/multimodal-bridge
DeepSeek Harness 플러그인 번들: 텍스트 전용 모델을 위한 qwen_vision(Qwen-VL 이미지 이해)과 qwen_generate(Qwen-Image 텍스트-이미지 변환) 도구