본문으로 건너뛰기

비전, 음성 및 멀티모달

비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.

플러그인 312개 찾음

H

dsh-vision-mix

haiziyao/dsh-vision-mix

텍스트, 비전, 이미지 생성 API를 자동 라우팅이 가능한 하나의 Mix 모델로 결합: 텍스트 전용 요청은 채팅 모델로, 사용자 이미지 및 에이전트 스크린샷은 비전 모델로 이동하며, 후속 요청은 동일한 세션 이미지를 계속 사용하고, 에이전트는 세션 범위 호출 히스토리로 이미지를 생성하거나 편집할 수 있습니다.

324일 전비전, 음성 및 멀티모달MIT
O

dsh-ernie-image

omdsh-dev/dsh-ernie-image

32개월 전비전, 음성 및 멀티모달BSD-3-Clause
Z

openflowframes

zerohackz/openflowframes

32개월 전비전, 음성 및 멀티모달GPL-3.0
O

dsh-paddle-ocr

omdsh-dev/dsh-paddle-ocr

32개월 전비전, 음성 및 멀티모달BSD-3-Clause
H

dsh-plugin-aigc-canvas

huanlinoto/dsh-plugin-aigc-canvas

프로바이더에 종속되지 않는 AIGC HTTP 브리지 + 무한 캔버스 + ffmpeg 후처리를 제공하며, 캔버스 연결/reroll/미디어 편집을 포함한 13개의 도구를 갖추고 있습니다.

32개월 전비전, 음성 및 멀티모달
J

dsh-voice

jesse-njx/dsh-voice

음성으로 입력하고 음성으로 답변 받기: 받아쓰기 음성이 사용자 메시지로 변환(transcribe)되고, 에이전트가 답변을 소리 내어 읽어줌(speak), ~/.dsh/voice 아래 로컬 우선 저장

32개월 전비전, 음성 및 멀티모달MIT
E

dsh-llm-vision-bridge

einskyle/dsh-llm-vision-bridge

네이티브 LLM 제공업체 비전 브리지: 채팅에 붙여넣은 이미지를 비전 모델(pi-ai/llama.cpp를 통한 Qwen3-VL)이 설명하고, 그 텍스트 설명을 텍스트 전용 DeepSeek에 전달해 답변 생성 — 이미지 수신, 라우팅, 압축 모두 하네스 네이티브 메커니즘으로 처리, LRU 설명 캐시와 503 재시도 포함

32개월 전비전, 음성 및 멀티모달MIT
Q

dsh-mic-input

qt-chen/dsh-mic-input

컴포저용 마이크 음성 입력: 브라우저 Web Speech API 실시간 전사, 중복 제거/자동 이어쓰기, 스마트 문장 부호, 언어 및 자동 전송 설정

32개월 전비전, 음성 및 멀티모달MIT
H

dsh-open-eyes

hyper-dsh-plugins/dsh-open-eyes

첨부 및 로컬 이미지를 설정 가능한 OpenAI Responses, Chat Completions 또는 Anthropic Messages 엔드포인트로 분석하는 텍스트 전용 DeepSeek 라우트용 비전 브리지로, 이미지 지원 라우트는 그대로 네이티브로 둡니다.

227일 전비전, 음성 및 멀티모달MIT
C

dsh-gpt-image

cai-mh/dsh-gpt-image

로그인된 웹 ChatGPT 세션을 통해 이미지를 생성하고 로컬 디렉터리로 내려받습니다.

224일 전비전, 음성 및 멀티모달MIT
M

dsh-ui-mockup

mackwan84/dsh-ui-mockup

ui_mockup 도구 Consumer: 검토 단계에서 UI 와이어프레임/하이파이 스케치를 생성하고, 디자인 시안을 디스크에 저장한 뒤 확인을 요청하며, 승인 후 디자인 사양을 잠급니다. 클라이언트 카드, 이미지 라우팅, i18n을 포함합니다.

222일 전비전, 음성 및 멀티모달MIT
B

dsh-voice-call

biliye/dsh-voice-call

DSH 웹 GUI의 음성 통화 도우미: 드래그 가능한 플로팅 통화 볼, 발화마다 일시정지 후 전송하는 브라우저 측 VAD, FunASR HTTP 또는 스트리밍 음성 인식, MiniMax 또는 OpenAI 호환 TTS 응답, 자동 절전이 있는 선택적 웨이크 워드 모드, 그리고 진행·중지·음성 완료 보고가 있는 별도 서브에이전트 세션으로의 작업 파견.

25일 전비전, 음성 및 멀티모달MIT
Y

dsh-tool-lipsync

yu-wenchao/dsh-tool-lipsync

3000개 이상의 음성과 500개 이상의 언어를 지원하는 DSH용 무료 립싱크 비디오 생성 플러그인

228일 전비전, 음성 및 멀티모달MIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

텍스트 전용 DSH 모델용 구성 가능한 이미지 인식: 이미지 메시지는 먼저 OpenAI 호환 비전 모델(Base URL, 모델 ID 및 API 키는 설정 섹션에서 지정)로 전사된 다음, 이미지 입력 지원이 광고되면서 텍스트로 메인 모델에 전달됩니다. API 키 인증 체계는 선택 가능 — OpenAI, Anthropic, Gemini 또는 Azure 스타일 요청 헤더 — 키가 없으면 요청 전송 전에 보고됩니다.

25일 전비전, 음성 및 멀티모달MIT
B

dseyesopen

balue8246-maker/dseyesopen

텍스트 전용 DeepSeek용 비전 브리지: 이미지(단독 또는 텍스트와 혼합)를 보내면 빠르고 작은 비전 모델이 백그라운드에서 이를 설명합니다. 채팅은 이미지를 유지하고 DeepSeek는 텍스트만 봅니다. 순수 플러그인: 제거 시 모든 것이 복원됩니다.

2지난달비전, 음성 및 멀티모달
L

dsh-visibridge

lhbsaa/dsh-visibridge

구조화된 비전 증거(OCR/레이아웃/의미) 외에 "촬영-확인-조정" 디버그 루프용 USB 카메라 캡처 도구를 제공합니다. 백엔드: Ollama, DeepSeek, Xiaomi.

2지난달비전, 음성 및 멀티모달MIT
F

dsh-short-video-studio

fengyungithub/dsh-short-video-studio

deepseek harness 기반의 MiniMax-Design류 AI 영상 제작 워크벤치

2지난달비전, 음성 및 멀티모달Apache-2.0
Z

dsh-watch-video

zeshuochen/dsh-watch-video

자막 우선 비디오 전사로, SRT 내보내기, 취소 가능한 작업 제어, 자막을 사용할 수 없을 때 faster-whisper large-v3 폴백을 제공합니다.

2지난달비전, 음성 및 멀티모달
W

dsh-voice-agent (voice-app)

wayneyu430/dsh-voice-agent

dsh용 대화형 음성 프런트엔드 Agent: ByteDance Duplex로 자연스럽게 말하고, 요청을 백그라운드 작업에 위임하고, 그 비동기 결과를 음성으로 보고받습니다.

2지난달비전, 음성 및 멀티모달
M

dsh-voice-chat

maoyuching/dsh-voice-chat

DSH용 Doubao 스타일 음성 채팅. 작성란의 마이크를 길게 누르면 음성을 텍스트로 변환해 자동 전송하고, AI 응답은 소리 내어 읽어줍니다. 선택적 LLM 축약(긴 응답을 현재 대화 모델을 따르는 짧은 음성 문장으로 요약), TTS 친화적 텍스트 정리, 선택 가능한 Edge TTS 음성, 조절 가능한 무음 자동 중지를 지원하며 설정은 DSH 설정 대화상자에 내장되어 있습니다.

28일 전비전, 음성 및 멀티모달MIT
Y

phone-lens (phone-lens)

yxqfg/phone-lens

스마트폰 카메라를 LAN 또는 USB를 통해 dsh 세션용 라이브 뷰파인더 및 사진 입력으로 전환합니다.

23일 전비전, 음성 및 멀티모달MIT
M

dsh-capture

max-null/dsh-capture

DSH용 듀얼 엔진 화면 캡처. SSiD 데스크톱 셸 안에서는 전역 핫키 또는 트레이로 전체 화면 박스 선택 오버레이(모든 모니터, 디스플레이별 픽셀 단위 프레임)를 열고 그 자리에서 빨간 상자 주석과 WeChat 스타일 도구 모음을 사용합니다. 일반 DSH(브라우저)에서는 작성란의 카메라 버튼이 getDisplayMedia로 디스플레이를 캡처하고, 동일한 단일 단계 박스 선택 + 주석 오버레이를 페이지 안에서 재사용합니다. 잘라낸 이미지는 공식 첨부 처리 경로를 통해 현재 대화 작성란에 들어갑니다.

24일 전비전, 음성 및 멀티모달MIT
Y

phone-lens (lens-mate)

yxqfg/phone-lens

휴대폰 카메라를 LAN 또는 USB를 통해 dsh 세션의 라이브 뷰파인더 및 사진 입력으로 바꿔줍니다.

2지난달비전, 음성 및 멀티모달MIT
E

dsh-labnana

exoticknight/dsh-labnana

DeepSeek Harness용 Labnana 이미지 생성: 텍스트-이미지 / 이미지-이미지 / 정밀 편집과 함께 크레딧 추정, 구독 잔액, 웹 설정 UI 제공.

29일 전비전, 음성 및 멀티모달Apache-2.0