비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-vision-mix
haiziyao/dsh-vision-mix
텍스트, 비전, 이미지 생성 API를 자동 라우팅이 가능한 하나의 Mix 모델로 결합: 텍스트 전용 요청은 채팅 모델로, 사용자 이미지 및 에이전트 스크린샷은 비전 모델로 이동하며, 후속 요청은 동일한 세션 이미지를 계속 사용하고, 에이전트는 세션 범위 호출 히스토리로 이미지를 생성하거나 편집할 수 있습니다.
dsh-ernie-image
omdsh-dev/dsh-ernie-image
openflowframes
zerohackz/openflowframes
dsh-paddle-ocr
omdsh-dev/dsh-paddle-ocr
dsh-plugin-aigc-canvas
huanlinoto/dsh-plugin-aigc-canvas
프로바이더에 종속되지 않는 AIGC HTTP 브리지 + 무한 캔버스 + ffmpeg 후처리를 제공하며, 캔버스 연결/reroll/미디어 편집을 포함한 13개의 도구를 갖추고 있습니다.
dsh-voice
jesse-njx/dsh-voice
음성으로 입력하고 음성으로 답변 받기: 받아쓰기 음성이 사용자 메시지로 변환(transcribe)되고, 에이전트가 답변을 소리 내어 읽어줌(speak), ~/.dsh/voice 아래 로컬 우선 저장
dsh-llm-vision-bridge
einskyle/dsh-llm-vision-bridge
네이티브 LLM 제공업체 비전 브리지: 채팅에 붙여넣은 이미지를 비전 모델(pi-ai/llama.cpp를 통한 Qwen3-VL)이 설명하고, 그 텍스트 설명을 텍스트 전용 DeepSeek에 전달해 답변 생성 — 이미지 수신, 라우팅, 압축 모두 하네스 네이티브 메커니즘으로 처리, LRU 설명 캐시와 503 재시도 포함
dsh-mic-input
qt-chen/dsh-mic-input
컴포저용 마이크 음성 입력: 브라우저 Web Speech API 실시간 전사, 중복 제거/자동 이어쓰기, 스마트 문장 부호, 언어 및 자동 전송 설정
dsh-open-eyes
hyper-dsh-plugins/dsh-open-eyes
첨부 및 로컬 이미지를 설정 가능한 OpenAI Responses, Chat Completions 또는 Anthropic Messages 엔드포인트로 분석하는 텍스트 전용 DeepSeek 라우트용 비전 브리지로, 이미지 지원 라우트는 그대로 네이티브로 둡니다.
dsh-gpt-image
cai-mh/dsh-gpt-image
로그인된 웹 ChatGPT 세션을 통해 이미지를 생성하고 로컬 디렉터리로 내려받습니다.
dsh-ui-mockup
mackwan84/dsh-ui-mockup
ui_mockup 도구 Consumer: 검토 단계에서 UI 와이어프레임/하이파이 스케치를 생성하고, 디자인 시안을 디스크에 저장한 뒤 확인을 요청하며, 승인 후 디자인 사양을 잠급니다. 클라이언트 카드, 이미지 라우팅, i18n을 포함합니다.
dsh-voice-call
biliye/dsh-voice-call
DSH 웹 GUI의 음성 통화 도우미: 드래그 가능한 플로팅 통화 볼, 발화마다 일시정지 후 전송하는 브라우저 측 VAD, FunASR HTTP 또는 스트리밍 음성 인식, MiniMax 또는 OpenAI 호환 TTS 응답, 자동 절전이 있는 선택적 웨이크 워드 모드, 그리고 진행·중지·음성 완료 보고가 있는 별도 서브에이전트 세션으로의 작업 파견.
dsh-tool-lipsync
yu-wenchao/dsh-tool-lipsync
3000개 이상의 음성과 500개 이상의 언어를 지원하는 DSH용 무료 립싱크 비디오 생성 플러그인
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
텍스트 전용 DSH 모델용 구성 가능한 이미지 인식: 이미지 메시지는 먼저 OpenAI 호환 비전 모델(Base URL, 모델 ID 및 API 키는 설정 섹션에서 지정)로 전사된 다음, 이미지 입력 지원이 광고되면서 텍스트로 메인 모델에 전달됩니다. API 키 인증 체계는 선택 가능 — OpenAI, Anthropic, Gemini 또는 Azure 스타일 요청 헤더 — 키가 없으면 요청 전송 전에 보고됩니다.
dseyesopen
balue8246-maker/dseyesopen
텍스트 전용 DeepSeek용 비전 브리지: 이미지(단독 또는 텍스트와 혼합)를 보내면 빠르고 작은 비전 모델이 백그라운드에서 이를 설명합니다. 채팅은 이미지를 유지하고 DeepSeek는 텍스트만 봅니다. 순수 플러그인: 제거 시 모든 것이 복원됩니다.
dsh-visibridge
lhbsaa/dsh-visibridge
구조화된 비전 증거(OCR/레이아웃/의미) 외에 "촬영-확인-조정" 디버그 루프용 USB 카메라 캡처 도구를 제공합니다. 백엔드: Ollama, DeepSeek, Xiaomi.
dsh-short-video-studio
fengyungithub/dsh-short-video-studio
deepseek harness 기반의 MiniMax-Design류 AI 영상 제작 워크벤치
dsh-watch-video
zeshuochen/dsh-watch-video
자막 우선 비디오 전사로, SRT 내보내기, 취소 가능한 작업 제어, 자막을 사용할 수 없을 때 faster-whisper large-v3 폴백을 제공합니다.
dsh-voice-agent (voice-app)
wayneyu430/dsh-voice-agent
dsh용 대화형 음성 프런트엔드 Agent: ByteDance Duplex로 자연스럽게 말하고, 요청을 백그라운드 작업에 위임하고, 그 비동기 결과를 음성으로 보고받습니다.
dsh-voice-chat
maoyuching/dsh-voice-chat
DSH용 Doubao 스타일 음성 채팅. 작성란의 마이크를 길게 누르면 음성을 텍스트로 변환해 자동 전송하고, AI 응답은 소리 내어 읽어줍니다. 선택적 LLM 축약(긴 응답을 현재 대화 모델을 따르는 짧은 음성 문장으로 요약), TTS 친화적 텍스트 정리, 선택 가능한 Edge TTS 음성, 조절 가능한 무음 자동 중지를 지원하며 설정은 DSH 설정 대화상자에 내장되어 있습니다.
phone-lens (phone-lens)
yxqfg/phone-lens
스마트폰 카메라를 LAN 또는 USB를 통해 dsh 세션용 라이브 뷰파인더 및 사진 입력으로 전환합니다.
dsh-capture
max-null/dsh-capture
DSH용 듀얼 엔진 화면 캡처. SSiD 데스크톱 셸 안에서는 전역 핫키 또는 트레이로 전체 화면 박스 선택 오버레이(모든 모니터, 디스플레이별 픽셀 단위 프레임)를 열고 그 자리에서 빨간 상자 주석과 WeChat 스타일 도구 모음을 사용합니다. 일반 DSH(브라우저)에서는 작성란의 카메라 버튼이 getDisplayMedia로 디스플레이를 캡처하고, 동일한 단일 단계 박스 선택 + 주석 오버레이를 페이지 안에서 재사용합니다. 잘라낸 이미지는 공식 첨부 처리 경로를 통해 현재 대화 작성란에 들어갑니다.
phone-lens (lens-mate)
yxqfg/phone-lens
휴대폰 카메라를 LAN 또는 USB를 통해 dsh 세션의 라이브 뷰파인더 및 사진 입력으로 바꿔줍니다.
dsh-labnana
exoticknight/dsh-labnana
DeepSeek Harness용 Labnana 이미지 생성: 텍스트-이미지 / 이미지-이미지 / 정밀 편집과 함께 크레딧 추정, 구독 잔액, 웹 설정 UI 제공.