비전, 음성 및 멀티모달
비전, 음성 및 멀티모달 플러그인은 DeepSeek-Harness(dsh)의 텍스트 전용 DeepSeek 모델에 눈, 귀, 그리고 목소리를 부여합니다. 붙여넣은 스크린샷을 Zhipu GLM, Gemini, Doubao 또는 로컬 Ollama로 OCR·설명하는 비전 도구와 제공자 라우트, 브라우저 Web Speech API 또는 Whisper 호환 API를 이용한 마이크 음성 입력, Edge TTS나 커스텀 음성으로 답변을 읽어 주는 TTS, 전이중 음성 모드, 이미지·영상·음악 생성기를 살펴보세요.
플러그인 312개 찾음
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
텍스트 전용 모델을 위한 describe_image 비전 도구: 이미지(로컬 경로, URL, 첨부)를 구성 가능한 OpenAI 호환 비전 엔드포인트로 보내고, 반환된 텍스트만 세션에 들어간다.
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio와 편집 가능한 비디오 템플릿 27종을 DeepSeek Harness의 네이티브 대화 뷰로 제공합니다.
modlens
liustack/modlens
텍스트 전용 모델을 위한 비전 브리지: 이미지를 붙여넣으면 구조화된 JSON 증거(OCR, 레이아웃, 의미 분석)를 반환합니다.
dsh-vision-router
ysr666/dsh-vision-router
텍스트 전용 에이전트를 위한 무료 비전 기능: 키 없이 사용 가능한 내장 비전 체인과 픽셀 도구(Q&A, 그라운딩, 자르기, 픽셀 비교, 색상, OCR, SVG 트레이스, 컷아웃, 스크린샷)를 제공하며, 이미지를 붙여넣기만 하면 됩니다.
dsh-vision-toolkit
anionex/dsh-vision-toolkit
텍스트 전용 모델에 비전 기능 추가: 이미지를 붙여넣으면 모델이 Vision Toolkit 변형으로 전환되어 이미지 Q&A, 다중 이미지 비교, 긴 스크린샷 OCR, 스크린샷 기반 UI 재현, 요소 그라운딩, 픽셀 차이를 지원합니다. 기본적으로 API 키가 필요 없으며, 작성자가 호스팅하는 무료 서비스로 머신당 하루 100장까지 처리 가능합니다. 자체 공급자로 변경하도록 구성할 수 있습니다.
tongflow
tong-io/tongflow
DeepSeek Harness(dsh)용 TongFlow 스튜디오 플러그인: 촬영팀 스타일 프로젝트 모델, 에이전트가 작성하는 TongFlow 워크플로, 결정론적 미디어 생성, 내장 캔버스.
dsh-image-gen
shanliuling/dsh-image-gen
DeepSeek Harness용 네이티브 대화형 이미지 생성: 에이전트에게 이미지 생성을 요청하면, 생성부터 결과의 대화 내 보관까지 자동으로 처리합니다.
watch-skill
oxbshw/watch-skill
기존 DeepSeek Harness 프로필에 설치할 수 있는 DeepWatch의 기능입니다.
dsh-imagegen
dickpy/dsh-imagegen
DSH Web GUI를 위한 AI 이미지 생성: 설정 가능한 OpenAI 호환 엔드포인트(gpt-image-2 / gpt-image-1 / dall-e-3)를 통한 텍스트-이미지 및 이미지-이미지 변환, api_url/api_key 설정 카드와 사이드바 분할 창 생성 스튜디오를 제공합니다.
dsh-comfyui
fandc520/dsh-comfyui
DeepSeek Harness에서 로컬 또는 원격 ComfyUI 서버를 구동: comfyui_run / comfyui_object_info / comfyui_workflow 도구로 이미지와 동영상을 생성·편집하며, 워크플로 라이브러리(그래프 추출: 컴포넌트별/메인 플로우/전체), 해상도 자동 매칭 로드 영역, 라이브 큐, SDXL 및 Wan 2.1 템플릿, 컴패니언 스킬, 동일 출처 미디어 프록시를 갖추고 있습니다.
dsh-omi-voice
polinnizhong/dsh-omi-voice
DeepSeek Harness용 채팅 내 읽어주기: 자연스러운 Doubao TTS 음성(BYOK)으로 AI 응답을 탭하여 읽고, 일시정지하고, 재개합니다. 코드·표·다이어그램은 제외하고 최종 답변만 읽습니다. 로컬 엔진이며 플러그인은 API 키를 저장하지 않습니다.
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬AI 감독: DeepSeek-Harness가 연출하는 MiniMax-H3 영상 생성 플러그인. 🤖프롬프트 그 이상. 🪄캔버스 UI.
dsh-design-qa
sunxin-ai/dsh-design-qa
text-only models를 위한 디자인 충실도 QA: `deepseek_vision` 도구가 어떤 OpenAI 호환 vision route에서든 한 쪽 눈을 빌려와 모델이 구현이 mock과 일치하는지 판단할 수 있게 하며, 그 판단 뒤에 있는 벤치마크(4개 fixture, 23개 주입 결함, raw transcripts)와 그것이 의존하는 질문 규율까지 함께 제공합니다.
picturereader
jing-hy/picturereader
텍스트 전용 모델을 위한 이미지 "읽기": 다운스케일 + 색 심도 축소 + 구조/색상 지문을 텍스트 그리드로 변환하여 대화에 다시 전달함으로써, 모델이 멀티모달 모델처럼 자율적으로 확대, 샘플링, OCR을 수행할 수 있게 합니다. 외부 모델 의존성 없이 완전히 로컬에서 동작하며, 이미지 읽기 방법론 스킬과 선택적 PaddleOCR을 함께 제공합니다.
dsh-voice-scribe
pensivefei/dsh-voice-scribe
웹 UI용 음성 입력: Alt(또는 Alt+Space)를 눌러 받아쓰기 시작/중지, 브라우저 Web Speech(제로 구성) 또는 OpenAI 호환 클라우드 ASR, DSH 구성 LLM을 통한 선택적 다듬기, 설정 UI.
dsh-vision
oil-oil/dsh-vision
DeepSeek Harness에 네이티브에 가까운 이미지 이해 기능을 제공합니다.
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
비전 언어 모델을 통해 텍스트 전용 모델에 이미지 이해 기능을 제공하며, `describe_image` 도구로 노출.
dsh-ears
wiziscool/dsh-ears
DeepSeek Harness(dsh)용 음성 입력 플러그인: 컴포저의 마이크 버튼으로 음성을 초안 텍스트로 변환하며, 다양한 음성 인식 백엔드 선택, dsh 자체 LLM 경로를 통한 선택적 다듬기, 네이티브 설정 페이지를 지원합니다.
dsh-plugin-tts
1624318455/dsh-plugin-tts
무료 Edge TTS 또는 사용자 자신의 RVC 음성 모델로 어시스턴트의 답변을 소리 내어 읽어줍니다: 읽어주기 버튼 + 자동 읽기, 적응형 청크 분할 점진적 재생(끊김 없는 긴 낭독), 레지스트리에서 보이스팩 원클릭 설치, 휴대용 RVC 런타임을 제공합니다.
dsh-media-skills
mjorgin/dsh-media-skills
텍스트 전용 모델을 위한 무료 비전 브리지 및 이미지 생성: 붙여넣은 이미지 읽기, GLM-4V-Flash 및 Gemini 엔진 페일오버, ModLens 스타일 구조화된 증거, 그리고 시드된 무료 비전 모델 경로.
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
AIGC 캔버스 플러그인입니다(cordis).
dsh-talk
perrylink/dsh-talk
DeepSeek Harness용 음성 I/O — 마이크와 오디오 출력을 통한 음성-텍스트 및 텍스트-음성 변환.
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
텍스트 전용 모델에 시각 기능을 부여합니다: 사용자 이미지를 OpenAI 호환 비전 모델로 전달하고, 그 설명을 Web UI 오른쪽 패널에 표시합니다.
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
DeepSeek Harness Web UI용 풀 듀플렉스 음성 모드: 토글(2초 일시정지 자동 전송) 또는 zipformer2 스트리밍 ASR로 편집 가능한 초안으로의 홀드 투 토크 받아쓰기, 선택 가능한 웨이크 워드 지원; 라이브 캡션이 포함된 문장별 Edge TTS 읽어주기, 말하는 동안 재생과 실행 중인 턴을 중단(진짜 barge-in). 온디바이스 ASR, API 키 불필요.