본문으로 건너뛰기

비전, 음성 및 멀티모달

비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.

플러그인 312개 찾음

B

dsh-ocr-local

balcoz/dsh-ocr-local

DeepSeek Harness용 로컬 OCR: 이미지를 붙여넣기/첨부하여 PP-OCRv5 + ONNX Runtime으로 텍스트를 추출, 완전 오프라인. TUI (cc-tui) 및 Web 지원.

52개월 전비전, 음성 및 멀티모달
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

텍스트 전용 DSH 세션을 위한 온디맨드 비전: 이미지는 마커로 변환되며, vision_describe 도구가 이미지와 질문만 OpenAI 호환 비전 모델로 전송합니다

52개월 전비전, 음성 및 멀티모달MIT
0

dsh-voice-input

0nt-one/dsh-voice-input

컴포저 도구 행의 마이크 버튼: Web Speech API 음성-텍스트(Chrome/Edge), 언어 전환 및 선택적 자동 전송, 의존성 제로.

52개월 전비전, 음성 및 멀티모달MIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

DSH용 Codex Appshots: 전역 단축키로 최전방 활성 윈도우를 캡처하고 컴포저에 원활하게 마운트하여 에이전트 쿼리에 활용합니다.

55일 전비전, 음성 및 멀티모달MIT
P

dsh-screenshot

paicat1/dsh-screenshot

DSH용 무의존성 화면 캡처: Lightweight — 의존성 0, 바이너리 0; Stage & shoot — 원클릭 풀스크린, 창 레이아웃, 가려진 창의 hover-snap 캡처; Agent self-service — 경로만 전달; 경로는 범용이며, modlens(선택 사항)와 페어링하면 한 번의 호출로 구조화된 증거 확보 가능.

524일 전비전, 음성 및 멀티모달MIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

MiniMax 기반 멀티모달 플러그인: 실시간 음성 통화 모드(스트리밍 대화, 플로팅 도크 UI), 음성 모드 및 마이크 음성 입력, 이미지/비디오/음악/음성 생성 및 시각 검사 도구.

52개월 전비전, 음성 및 멀티모달MIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

로컬 이미지 생성 워크벤치, 구독료 제로: 자체 API로 이미지 생성(모든 OpenAI 호환 인터페이스, 구독료 0), 캔버스 레이아웃 + 이미지 편집/지우개/배경 제거/OCR/벡터 변환, 편집 가능한 PSD/AI 출력 제공, Photoshop/Illustrator 레이어 양방향 브리지

43일 전비전, 음성 및 멀티모달MIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

작은 브라우저 확장이 구동하는 DeepSeek 웹 페이지의 내장 읽어주기 기능을 사용하여 DSH 대화를 소리 내어 읽습니다.

43일 전비전, 음성 및 멀티모달
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

OpenAI 호환 images 엔드포인트를 통해 DeepSeek Harness에서 이미지를 생성하는 도구로, 인라인 웹 UI 갤러리를 제공합니다.

422일 전비전, 음성 및 멀티모달MIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

DeepSeek Harness용 Tripo 3D 스킬입니다. 텍스트 프롬프트나 참조 이미지로부터 tripo-cli를 통해 엔진에 바로 쓸 수 있는 3D 에셋을 생성하며, 텍스처링, 리깅, 리토폴로지, 포맷 변환을 한 번에 처리합니다.

423일 전비전, 음성 및 멀티모달
L

deepseek-vl-support

limccn/deepseek-vl-support

Claude Code, Codex 및 Agent Plugins 클라이언트에서 DeepSeek(텍스트 전용) 모델에 비전 기능을 부여합니다: OpenAI 호환 vision 엔드포인트를 통해 이미지를 설명합니다.

4지난달비전, 음성 및 멀티모달MIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

스크린샷 캡처 도구와 두 개의 선택적 자동 캡처 지점을 추가하여 화면을 이미지 블록으로 대화에 넣습니다. 이미지 지원 모델이 필요합니다.

4지난달비전, 음성 및 멀티모달MIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

비전 모델용 콘텐츠 인식 PDF 읽기 플러그인: 각 페이지를 그림(벡터 및 래스터), 표, 수식 위험 및 이단 레이아웃에 대해 프로파일링한 다음 콘텐츠 인식 하이브리드 추출을 적용하여 그림/표/수식 페이지를 고DPI 영역 크롭으로 렌더링합니다. 페이지 레이아웃 파악을 위한 저해상도 미리보기를 제공하며 지정 영역을 고해상도로 렌더링합니다. 에이전트용 다중 도구로 패키징.

4지난달비전, 음성 및 멀티모달MIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

AI로 DSH 웹 UI에서 HarmonyOS 휴대폰을 제어합니다: 실시간 H.264 화면 미러링, 마우스 터치와 시스템 키, hilog 스트리밍, 그리고 모델이 화면을 읽고 UI 컨트롤을 찾아 탭, 길게 누르기, 키 누르기, 입력을 수행하게 하는 에이전틱 도구를 제공합니다.

4그저께비전, 음성 및 멀티모달MIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

강화된 비전 툴박스: 단일 OpenAI 호환 엔드포인트로 구동되는 14개의 픽셀 레벨 비전 툴(describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot), 깔끔한 [图片: path] 브리지 마커, 콘텐츠 안전 분류 및 속도 제한 자동 재시도.

4지난달비전, 음성 및 멀티모달
D

dsh-image-pathify

dami9527/dsh-image-pathify

텍스트 전용 모델이 채팅에 붙여넣은 이미지를 처리할 수 있게 합니다. 네이티브 비전 경험, 이미지 일괄 보기, 내장된 OpenAI 호환 analyze_image 도구를 제공하며, 비전 지원 모델은 영향을 받지 않습니다.

48일 전비전, 음성 및 멀티모달MIT
S

dsh-voice

stardustlc666/dsh-voice

음성 도구: 무료 edge-tts 뉴럴 음성 합성, OpenAI 호환 ASR 변환, 음성 목록, 음성 일괄 미리보기, 상태 자가 점검.

49시간 전비전, 음성 및 멀티모달MIT
H

dsh-voice

haoku123/dsh-voice

웹 UI용 전이중 음성 모드: 탭하여 토글 또는 누르고 있기(전송 키 또는 `Ctrl`)로 받아쓰기, 실시간 자막, sherpa-onnx를 통한 호스트 측 SenseVoice ASR, 문장별 음성 응답, 발화가 재생 및 실행 중인 턴을 중단(진정한 끼어들기). API 키 불필요.

4지난달비전, 음성 및 멀티모달MIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

웹 UI를 위한 무료 음성 클로즈드 루프: 브라우저 SpeechRecognition 마이크 입력으로 실시간 임시 결과를 표시하고, 읽어주기 스피커 버튼과 어시스턴트 응답 자동 읽기를 제공합니다. 설정 불필요, API 키도 불필요.

42개월 전비전, 음성 및 멀티모달MIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

DeepSeek Harness(DSH)를 위한 통합 이미지 생성 라우터: 모든 OpenAI 호환 엔드포인트에서 이미지 모델을 자동 발견하고, draw_image 및 draw_list_sources 도구를 제공하며, SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen 등을 지원한다.

4지난달비전, 음성 및 멀티모달MIT
N

free-vision-skill

niyongsheng/free-vision-skill

macOS Vision Framework를 통한 완전 로컬 이미지 이해 및 OCR: `ocr_image`(텍스트, 표 레이아웃 + 좌표) 및 `view_image`(장면, 얼굴, QR) — 여러 이미지를 웹 입력 상자에 붙여넣거나 path/URL/base64로 전달 가능. 이미지는 Mac 밖으로 나가지 않습니다.

4지난달비전, 음성 및 멀티모달MIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

텍스트 전용 DeepSeek용 비전 MCP 및 DSH 번들: analyze_image, analyze_clipboard, compare_images 및 vision_status 도구, 비주얼 설정 페이지, 기본적으로 무료 GLM-4.6V-Flash, 결과 캐싱 및 속도 제한 허용 오차; 키는 로그에 남지 않음.

426일 전비전, 음성 및 멀티모달MIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

DeepSeek Harness(DSH)용 DeepEye 비전 플러그인으로, 이미지 설명, OCR, VQA, UI 레이아웃, 클립보드 분석을 지원합니다.

42개월 전비전, 음성 및 멀티모달
H

dsh-her-eyes

huashenglian/dsh-her-eyes

AI가 VLM(멀티모달 모델)을 자동으로 호출해 시각 분석을 수행할 수 있게 해주는 dsh 플러그인입니다.

42개월 전비전, 음성 및 멀티모달MIT