비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
DeepSeek 브레인 + 자동 이미지 전사: GUI에서 이미지를 첨부하면 기본적으로 공식 deepseek-v4-flash-vision-exp로 전사됩니다(순수 텍스트 V4-Pro 브레인도 이미지를 볼 수 있음). 대안으로 OpenAI 호환 VLM 또는 로컬 Ollama 사용 가능.
dsh-video-lens
dundunhan/dsh-video-lens
텍스트 전용 DeepSeek Harness 에이전트에 비디오 이해 기능 부여: 장면 인식 프레임 샘플링 + VLM + 선택적 ASR 전사를 타임라인 증거로 융합. / 순수 텍스트 모델용 비디오 이해 플러그인(장면 인식 프레임 추출 + VLM + 선택적 음성 전사)
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
텍스트 전용 메인 모델에 설정 가능한 비전 모델을 추가합니다: vision_read_image 도구, 작성 바의 비전 모델 선택기, 텍스트 전용 경로를 위한 이미지-텍스트 자동 변환.
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
플로팅 DSH 패널로 제공되는 AI 이미지·동영상 스튜디오로, 대화를 대체하지 않고 나란히 창작할 수 있습니다: 8가지 화면비에 걸친 1K-4K 텍스트→이미지, 이미지→이미지, 다중 이미지 합성; 첫 프레임 제어가 가능한 4-12초 텍스트→동영상과 이미지→동영상; 대본(.txt/.md/.json)을 가져와 스토리보드 숏으로 나눠 미리보기와 일괄 생성하는 숏드라마 모드; 그리고 프롬프트 전문가 워크스페이스. 런타임 의존성 없음.
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
웹 UI용 음성 AI 여자친구: FunASR 마이크 입력, Qwen3-TTS 음성 응답, 동반 애니메이션 창, 그리고 NapCat을 통한 양방향 QQ 채팅(텍스트/음성/이미지 푸시).
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
DSH Web에 Xiaomi MiMo 텍스트 음성 변환을 추가합니다: 어시스턴트 메시지 읽어 주기, PCM 스트리밍, 프리셋 및 사용자 정의 음성 디자인, 브라우저 음성 폴백, 재생 컨트롤, 선택적 UI 사운드.
dsh-speak
alan2z/dsh-speak
의존성 제로, 이벤트 기반 음성 알림 플러그인: 추가 모델 불필요, 토큰 비용 없음. 시스템 내장 자연 음성으로 음성 출력하며 Windows와 macOS를 모두 지원합니다. 최종 응답 알림, 승인 및 질문 경고, 선택적 이벤트 알림(턴 종료, 명령 완료, 목표 변경, 도구 오류, 할 일 업데이트), 재생 가능한 최종 응답, 이중 언어 비주얼 설정 페이지를 제공합니다.
Gemini-Eyes
consolesun/gemini-eyes
gemini.google.com에 대한 MCP 브리지: 이미지 및 동영상 비전 분석, Imagen 이미지 및 Veo 동영상 생성, API 키 없이 로그인된 브라우저 세션을 이용한 대화 관리.
dsh-draw
perrylink/dsh-draw
세션별 할당량 추적, 엔진 폴백, 자격 증명 안전 설정, 재생성 기능이 있는 결과 카드와 함께 OpenAI Images 및 Zhipu CogView 프리셋을 사용하는 다중 엔진 텍스트-이미지 생성.
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
비전-언어 게이트웨이 프로바이더 경로: 붙여넣은 이미지는 DeepSeek로 전송되기 전에 설정 가능한 VL 모델(기본값 Qwen-VL)이 설명을 생성합니다.
dsh-vision
linenxi-ctrl/dsh-vision
DeepSeek Harness용 외부 비전 플러그인: 고래 버튼 설정 패널, 자동 답변이 포함된 이미지 인식, 에이전트 스크린샷/인식 도구를 제공합니다.
dsh-highres-vision
azwosile/dsh-highres-vision
DeepSeek Harness 네이티브 비전 모델 deepseek-v4-flash-vision-exp를 위해 이미지 허용 한도를 32 MiB / 8192 px / 600장으로 상향하고, 큰 이미지를 타일로 분할한 뒤 호스트의 read_image 도구를 통해 전체 이미지와 800x800 타일을 반환하는 highres_read 도구를 추가합니다.
dsh-voice
goodandready/dsh-voice
Web UI용 음성 입력: 일시 정지에 따라 분할되는 받아쓰기와 음성 메시지를 제공하며, 각각 자체 제공업체 폴백 체인(Deepgram, Groq, HuggingFace, 로컬 whisper.cpp 또는 OpenAI 호환 엔드포인트)을 사용합니다.
dsh-voice
3274375092/dsh-voice
DeepSeek Harness용 음성 입력: 마이크에 말하면 인식된 텍스트가 일반 채팅 메시지로 제출됩니다. 로컬 또는 브라우저 음성 인식 사용.
dsh-free-vision
fuzzysoul/dsh-free-vision
텍스트 전용 모델용 무료 비전 브리지: 무료 티어 제공자(Qwen3-VL-Flash, Doubao, DeepSeek-OCR)를 통한 이미지 이해, OCR, UI 및 디버그 분석, 설정 GUI 포함.
dsh-chat-imagine
corrinehu/dsh-chat-imagine
API 채널 또는 로컬 CLI(mmx / codex / agy)를 통해 DSH 채팅에서 이미지를 자동으로 생성 및 표시하며, 해당 CLI를 사용하여 이미지 인식도 가능합니다.
dsh-tool-vision
scorp1o117/dsh-tool-vision
로컬 이미지 또는 HTTP(S) 이미지 URL을 구성된 OpenAI 호환 vision 엔드포인트로 inspect_image 도구를 통해 보내고, 그 텍스트 응답을 대화로 반환합니다.
dsh-appshots
wongyuye/dsh-appshots
macOS 및 Windows의 DSH Desktop을 위한 Codex 방식의 창 캡처: 두 Command 키(macOS) 또는 두 Ctrl 키(Windows)를 누르거나 카메라 버튼으로 가장 앞의 창을 캡처해 현재 채팅에 첨부하고, VoiceOver 방식의 접근성 트리를 숨은 컨텍스트로 주입합니다.
dsh-vision
54xkeee/dsh-vision
텍스트 전용 DeepSeek을 위한 비전 기능으로, 기본값은 Doubao Web 경유(무료, API 키 불필요 — Windows CDP 브리지를 통해 로그인된 Chrome을 구동), Antigravity IDE 쿼터(flash/pro) 또는 Gemini 폴백을 지원. 자동 디테일 단계 상승, 컴팩션 후 재수화가 가능한 비전 증거 메모리, 콘텐츠 해시 캐시, 이중 언어 클라이언트 패널을 제공합니다.
dsh-duet
yums/dsh-duet
DSH Web용 풀 듀플렉스 중국어 음성 상호작용: 작업을 받아 적고 편집하며, 요청을 제출하고, 세션을 관리하고, DSH 질문에 답하며, 간결한 작업 완료 알림을 듣습니다.
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
텍스트 전용 모델이 이미지를 볼 수 있게 합니다: \[image omitted because this model accepts text only] 같은 자리 표시자와 함께 이미지가 도착하면 모델이 vision_describe 도구를 호출하고, 플러그인이 이미지 참조와 질문을 멀티모달 모델로 전달하며 실패 시 대체 모델로 재시도합니다. 설정 페이지에서 구성하고 공식 설정 API로 유지됩니다.
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
웹 UI용 작성창 마이크: 탭하여 실시간 전사를 모니터링하고 눌러서 말하기 기능을 제공합니다. 모델이 생성하는 동안 스트리밍되는 호스트 Edge TTS 응답 낭독, 낭독 중 에코 일시정지, 탭으로 정지 기능을 갖추고 있습니다.
dsh-ocr-local
grelvan/dsh-ocr-local
텍스트 전용 경로용 로컬 OCR 폴백: 세션 모델이 이미지를 수용할 수 없다고 선언하면 첨부된 이미지가 로컬에 캐시되고 해당 경로가 주입되어 모델이 ocr_image를 호출할 수 있음 — PP-OCRv5 + ONNX Runtime을 CPU에서 실행, API 키 불필요, 이미지가 기기를 떠나지 않음. 모델이 이미지를 볼 수 있을 때는 조용함.
vision-exp-tile
nicholas023/vision-exp-tile
vision-exp 모델용 대용량 이미지 인식: 무손실 800×800 타일 인식(smart/pipeline/full), 전처리 및 손글씨 라우팅을 포함한 로컬 OCR, DirectML/CUDA/OpenVINO 선택적 멀티벤더 GPU(CPU 자동 폴백).