비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-ocr-local
balcoz/dsh-ocr-local
DeepSeek Harness용 로컬 OCR: 이미지를 붙여넣기/첨부하여 PP-OCRv5 + ONNX Runtime으로 텍스트를 추출, 완전 오프라인. TUI (cc-tui) 및 Web 지원.
dsh-vision-bridge
sfyyy/dsh-vision-bridge
텍스트 전용 DSH 세션을 위한 온디맨드 비전: 이미지는 마커로 변환되며, vision_describe 도구가 이미지와 질문만 OpenAI 호환 비전 모델로 전송합니다
dsh-voice-input
0nt-one/dsh-voice-input
컴포저 도구 행의 마이크 버튼: Web Speech API 음성-텍스트(Chrome/Edge), 언어 전환 및 선택적 자동 전송, 의존성 제로.
dsh-plugin-appshot
tauruswood/dsh-plugin-appshot
DSH용 Codex Appshots: 전역 단축키로 최전방 활성 윈도우를 캡처하고 컴포저에 원활하게 마운트하여 에이전트 쿼리에 활용합니다.
dsh-screenshot
paicat1/dsh-screenshot
DSH용 무의존성 화면 캡처: Lightweight — 의존성 0, 바이너리 0; Stage & shoot — 원클릭 풀스크린, 창 레이아웃, 가려진 창의 hover-snap 캡처; Agent self-service — 경로만 전달; 경로는 범용이며, modlens(선택 사항)와 페어링하면 한 번의 호출로 구조화된 증거 확보 가능.
dsh-guide-dog
atropinoltt/dsh-guide-dog
MiniMax 기반 멀티모달 플러그인: 실시간 음성 통화 모드(스트리밍 대화, 플로팅 도크 UI), 음성 모드 및 마이크 음성 입력, 이미지/비디오/음악/음성 생성 및 시각 검사 도구.
canvas-workbench
elangan1997-cmyk/canvas-workbench
로컬 이미지 생성 워크벤치, 구독료 제로: 자체 API로 이미지 생성(모든 OpenAI 호환 인터페이스, 구독료 0), 캔버스 레이아웃 + 이미지 편집/지우개/배경 제거/OCR/벡터 변환, 편집 가능한 PSD/AI 출력 제공, Photoshop/Illustrator 레이어 양방향 브리지
dsh-tts-bridge
yuuyuko-uu/dsh-tts-bridge
작은 브라우저 확장이 구동하는 DeepSeek 웹 페이지의 내장 읽어주기 기능을 사용하여 DSH 대화를 소리 내어 읽습니다.
dsh-cycle-image-gen
chengzzzi44/dsh-cycle-image-gen
OpenAI 호환 images 엔드포인트를 통해 DeepSeek Harness에서 이미지를 생성하는 도구로, 인라인 웹 UI 갤러리를 제공합니다.
tripo3d-plugin-dsh
vast-ai-research/tripo3d-plugin-dsh
DeepSeek Harness용 Tripo 3D 스킬입니다. 텍스트 프롬프트나 참조 이미지로부터 tripo-cli를 통해 엔진에 바로 쓸 수 있는 3D 에셋을 생성하며, 텍스처링, 리깅, 리토폴로지, 포맷 변환을 한 번에 처리합니다.
deepseek-vl-support
limccn/deepseek-vl-support
Claude Code, Codex 및 Agent Plugins 클라이언트에서 DeepSeek(텍스트 전용) 모델에 비전 기능을 부여합니다: OpenAI 호환 vision 엔드포인트를 통해 이미지를 설명합니다.
screenshot-feedback-hook-mcp (dsh-plugin)
lkh081231/screenshot-feedback-hook-mcp
스크린샷 캡처 도구와 두 개의 선택적 자동 캡처 지점을 추가하여 화면을 이미지 블록으로 대화에 넣습니다. 이미지 지원 모델이 필요합니다.
dsh-pdf-reader
angeloszou/dsh-pdf-reader
비전 모델용 콘텐츠 인식 PDF 읽기 플러그인: 각 페이지를 그림(벡터 및 래스터), 표, 수식 위험 및 이단 레이아웃에 대해 프로파일링한 다음 콘텐츠 인식 하이브리드 추출을 적용하여 그림/표/수식 페이지를 고DPI 영역 크롭으로 렌더링합니다. 페이지 레이아웃 파악을 위한 저해상도 미리보기를 제공하며 지정 영역을 고해상도로 렌더링합니다. 에이전트용 다중 도구로 패키징.
dsh-hos-scrcpy
ns-zzj/dsh-hos-scrcpy
AI로 DSH 웹 UI에서 HarmonyOS 휴대폰을 제어합니다: 실시간 H.264 화면 미러링, 마우스 터치와 시스템 키, hilog 스트리밍, 그리고 모델이 화면을 읽고 UI 컨트롤을 찾아 탭, 길게 누르기, 키 누르기, 입력을 수행하게 하는 에이전틱 도구를 제공합니다.
dsh-vision-hub (tool-vision)
xing666173/dsh-vision-hub
강화된 비전 툴박스: 단일 OpenAI 호환 엔드포인트로 구동되는 14개의 픽셀 레벨 비전 툴(describe, ground, detect, crop, pixel-diff, OCR, long-screenshot OCR, vectorize, colors, cutout, screenshot, present, materialize, html-screenshot), 깔끔한 [图片: path] 브리지 마커, 콘텐츠 안전 분류 및 속도 제한 자동 재시도.
dsh-image-pathify
dami9527/dsh-image-pathify
텍스트 전용 모델이 채팅에 붙여넣은 이미지를 처리할 수 있게 합니다. 네이티브 비전 경험, 이미지 일괄 보기, 내장된 OpenAI 호환 analyze_image 도구를 제공하며, 비전 지원 모델은 영향을 받지 않습니다.
dsh-voice
stardustlc666/dsh-voice
음성 도구: 무료 edge-tts 뉴럴 음성 합성, OpenAI 호환 ASR 변환, 음성 목록, 음성 일괄 미리보기, 상태 자가 점검.
dsh-voice
haoku123/dsh-voice
웹 UI용 전이중 음성 모드: 탭하여 토글 또는 누르고 있기(전송 키 또는 `Ctrl`)로 받아쓰기, 실시간 자막, sherpa-onnx를 통한 호스트 측 SenseVoice ASR, 문장별 음성 응답, 발화가 재생 및 실행 중인 턴을 중단(진정한 끼어들기). API 키 불필요.
dsh-chatvoice
fuzzysoul/dsh-chatvoice
웹 UI를 위한 무료 음성 클로즈드 루프: 브라우저 SpeechRecognition 마이크 입력으로 실시간 임시 결과를 표시하고, 읽어주기 스피커 버튼과 어시스턴트 응답 자동 읽기를 제공합니다. 설정 불필요, API 키도 불필요.
dsh-draw-router
xiaozhe7772222/dsh-draw-router
DeepSeek Harness(DSH)를 위한 통합 이미지 생성 라우터: 모든 OpenAI 호환 엔드포인트에서 이미지 모델을 자동 발견하고, draw_image 및 draw_list_sources 도구를 제공하며, SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen 등을 지원한다.
free-vision-skill
niyongsheng/free-vision-skill
macOS Vision Framework를 통한 완전 로컬 이미지 이해 및 OCR: `ocr_image`(텍스트, 표 레이아웃 + 좌표) 및 `view_image`(장면, 얼굴, QR) — 여러 이미지를 웹 입력 상자에 붙여넣거나 path/URL/base64로 전달 가능. 이미지는 Mac 밖으로 나가지 않습니다.
deepseek-vision (dsh-plugin-deepseek-vision)
gou-gee/deepseek-vision
텍스트 전용 DeepSeek용 비전 MCP 및 DSH 번들: analyze_image, analyze_clipboard, compare_images 및 vision_status 도구, 비주얼 설정 페이지, 기본적으로 무료 GLM-4.6V-Flash, 결과 캐싱 및 속도 제한 허용 오차; 키는 로그에 남지 않음.
dsh-plugin-deepeye
favio8/dsh-plugin-deepeye
DeepSeek Harness(DSH)용 DeepEye 비전 플러그인으로, 이미지 설명, OCR, VQA, UI 레이아웃, 클립보드 분석을 지원합니다.
dsh-her-eyes
huashenglian/dsh-her-eyes
AI가 VLM(멀티모달 모델)을 자동으로 호출해 시각 분석을 수행할 수 있게 해주는 dsh 플러그인입니다.