비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
DeepSeek Harness용 호스팅형 무료 비전 사이드카로, 영구적인 세션 증거를 남깁니다.
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
세션 이미지를 구성 가능한 비전 제공자에 연결하고 텍스트 전용 분석 결과를 적격 DeepSeek Harness 모델 경로로 반환합니다.
dsh-omni-workstation
huashenglian/dsh-omni-workstation
DSH용 옴니모달 워크스테이션: 순서가 지정된 다중 카드 VLM 페일오버 체인을 통한 analyze_image, 동일한 이미지 리졸버를 공유하는 6종 비전 툴킷(확대, 색상 샘플링, 픽셀 diff, OCR, 요소 감지, 인라인 표시), OpenAI/DashScope/ComfyUI 프로토콜을 통한 generate_image, /build-video-tool 빌더가 있는 다중 카드 비동기 generate_video, 7개 provider를 통한 speak/clone_voice TTS를 제공하며, 모두 자동 저장 설정 페이지 하나로 구동됩니다.
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
컴포저를 위한 한 손, 키보드 없는 입력: 입력 상자에서 마우스를 길게 누르고 말한 뒤 놓으면 텍스트가 초안에 들어가고, 위로 밀면 반쯤 남은 문장 없이 취소됩니다. 겨냥할 마이크 버튼도, 외울 단축키도 없으며 손이 입력 영역을 떠날 필요가 없습니다. 다른 손이 바쁠 때 유용합니다. 인식은 완전히 오프라인으로 실행됩니다(SenseVoice + sherpa-onnx, API 키 불필요, 오디오는 기기를 떠나지 않음).
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
DeepSeek Harness에서 어시스턴트 응답을 음성으로 읽기: 스트리밍 재생이 가능한 텍스트 음성 변환 제공자.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
dsh 웹용 음성 비서: 웨이크 문구(예: "小鲸")를 말하면 핸즈프리 받아쓰기가 활성화되어 말한 내용이 자동으로 전사되어 채팅 상자에 입력됩니다. 음성 편집 명령(전송, 지우기, 줄 바꿈, 읽기 중지)을 지원하고 비서의 답변을 중국어로 소리 내어 읽습니다. 음성 인식은 sherpa-onnx WASM을 통해 브라우저에서 로컬로 실행되므로 API 키 없이 오프라인에서 작동합니다.
dsh-audiogen
shimingming520/dsh-audiogen
DeepSeek Harness 웹 GUI용 AI 오디오 생성 — 다중 공급자 TTS, 음악, 음향 효과 및 음성 디자인, 사이드바 패널, 모델 비교, 리소스 라이브러리 및 Agent 도구 포함.
dsh-voco
lgquan/dsh-voco
DSH를 위한 핸즈프리 듣기, 푸시 투 토크, 음성 인식, TTS 응답 및 백그라운드 Agent 위임을 갖춘 연속 음성 대화.
dsh-gsv
taoruiliu19/dsh-gsv
DeepSeek Harness용 실시간 로컬 TTS: 음성 프리셋, 자동 읽기, 엔진 설정 어시스턴트, 읽어주기 버튼 및 GSV-TTS-Lite 엔진용 설정 패널.
dsh-ximalaya
jerryqx/dsh-ximalaya
DSH 웹 UI 안에서 Ximalaya 팟캐스트와 오디오북을 청취합니다: 앨범 검색, 페이지 단위 트랙 탐색, 재생 바(이전/재생/다음, 탐색, 볼륨, 속도)를 통한 재생을 제공합니다. QR 로그인 후 "Mine" 페이지에는 좋아요한 트랙(클릭하여 재생), 최신 에피소드 힌트가 있는 구독 앨범, 팔로우한 앵커와 그 공개 앨범이 나열됩니다. 호스트는 Range를 지원하며 오디오 스트림을 중계하고 `ximalaya_play` 도구를 등록해 에이전트가 요청 시 검색하고 재생할 수 있습니다.
phone-eye
boheastill/phone-eye
AI 에이전트가 실제 Android 휴대폰을 보고 조작할 수 있게 합니다: adb를 통해 phone_look(비전 + UI 트리 융합), 탭/스와이프/입력, 스크린샷을 제공하며 모든 MCP 클라이언트에서 사용할 수 있습니다.
dsh-image-vision
xiaoyuink/dsh-image-vision
모든 DSH 모델을 위한 이미지 이해: vision, OCR, grounding, 크롭 도구와 병리조직학, 세포생물학, 해부학, 임상 이미지, 과학 도표용 도메인 프리셋.
Deepseek-Continuity
linxuhao/deepseek-continuity
로컬 이미지, 음성, 음악 및 SFX 생성과 전사. 고정 ID 기능: 캐릭터, 동물, 객체 및 배우 음성을 한 번 정의하면 이후 모든 호출에서 재사용됩니다. 퇴화된 출력(거의 평평한 이미지, 무음 오디오)은 성공으로 반환되지 않고 거부되며, 생성된 줄은 텍스트로 다시 읽을 수 있어 끝을 삼킨 클론이 드러납니다. 엔진은 유휴 시 언로드되며, 이미지 생성과 전사는 로컬 Vulkan 백엔드 대신 OpenAI 호환 API를 가리키도록 설정할 수 있습니다.
dsh-ui-spec
yumimanji/dsh-ui-spec
OCR, 결정론적 기하학, 씬 그래프, 에셋 및 렌더링 비교를 사용하여 UI 스크린샷을 구현 등급 웹 사양으로 변환하는 DeepSeek Harness 플러그인입니다.
deepseekeyes
dttxorg/deepseekeyes
DeepSeek Harness용 감사 가능한 비전 및 크로스 플랫폼 Computer Use 런타임, 출처를 보존하는 증거 포함.
voco-input-sh
nothree-code/voco-input-sh
웹 UI용 음성 입력: 로컬 VocoType 오프라인 음성 인식을 구동하고 인식된 텍스트를 작성창에 자동 삽입하는 마이크 버튼(자동 배포, 중복 제거, 연속 받아쓰기).
dsh-stt-input
baisama-cloud/dsh-stt-input
웹 UI용 음성-텍스트 변환 음성 입력: 컴포저의 마이크 버튼이 브라우저 Web Speech API(제로 설정) 또는 OpenAI 호환 Whisper API(OpenAI / Groq)를 통해 발화를 초안으로 전사하며, 선택 가능한 모델 및 언어가 Settings에 포함됩니다.
visual-review
wang-bool/visual-review
붙여넣거나 업로드한 이미지를 DSH Web 채팅 안에서 인라인으로 렌더링하고, 텍스트 전용 모델에 시각 기능을 제공합니다. 모델이 호출할 수 있는 visual_review 도구는 먼저 OpenAI 호환 멀티모달 API를 사용하고, 실패하면 로컬 Qwen3-VL 워커로 폴백합니다.
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
설정한 모든 OpenAI 호환 vision 엔드포인트를 통해 로컬 이미지를 설명하는 에이전트 호출형 vision 도구입니다. 선택적 다중 모델 교차 검증이 있으며 내장 키는 없습니다.
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
텍스트 전용 DeepSeek 경로에서 이미지 붙여넣기를 알리고, 비전 사이드카로 첨부 파일을 설명하며, 기본 비전 모델은 손대지 않습니다.
dsh-vision-tools
moon09300731/dsh-vision-tools
DeepSeek Harness용 완전한 비전 기능 번들입니다. vision_understand 도구(OpenAI 호환 비전 API, 기본적으로 무료 Zhipu GLM-4V-Flash)와 이미지 인식을 위한 붙여넣기/드래그 앤 드롭/버튼 진입점을 제공합니다.
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
grok2api API 를 통해 dsh 에 이미지와 비디오를 생성하는 기능을 제공합니다.
dsh-image-gen
leemancheung/dsh-image-gen
기본적으로 Codex 구독 OAuth, 또는 명시적 API 키 모드를 사용하는 GPT Image 2 `image_gen`입니다. 개발 중 카드, 최대 3개의 실시간 API partial, 영속적인 첨부 재생 / 라이트박스 / 다운로드, 텍스트 전용 모델 출력, 그리고 범위가 제한된 자격 증명 안전 요청을 제공합니다.