본문으로 건너뛰기

플러그인

DeepSeek-Harness 플러그인을 찾아보고, 필터링하고, 설치하세요.

플러그인 30개 찾음

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

작성기용 원클릭 프롬프트 강화(5가지 모드, 메모리 체인, 멀티 모델 폴백) 및 음성 인식(클라우드 Qwen3-ASR / 오프라인 SenseVoice, 무음 시 자동 정지), 원클릭 DSH 서비스 재시작 포함.

825일 전도구 및 기능
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

웹 UI용 음성 입력: Alt(또는 Alt+Space)를 눌러 받아쓰기 시작/중지, 브라우저 Web Speech(제로 구성) 또는 OpenAI 호환 클라우드 ASR, DSH 구성 LLM을 통한 선택적 다듬기, 설정 UI.

343일 전비전, 음성 및 멀티모달MIT
W

dsh-ears

wiziscool/dsh-ears

DeepSeek Harness(dsh)용 음성 입력 플러그인: 컴포저의 마이크 버튼으로 음성을 초안 텍스트로 변환하며, 다양한 음성 인식 백엔드 선택, dsh 자체 LLM 경로를 통한 선택적 다듬기, 네이티브 설정 페이지를 지원합니다.

2121시간 전비전, 음성 및 멀티모달MIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

DeepSeek Harness Web UI용 풀 듀플렉스 음성 모드: 토글(2초 일시정지 자동 전송) 또는 zipformer2 스트리밍 ASR로 편집 가능한 초안으로의 홀드 투 토크 받아쓰기, 선택 가능한 웨이크 워드 지원; 라이브 캡션이 포함된 문장별 Edge TTS 읽어주기, 말하는 동안 재생과 실행 중인 턴을 중단(진짜 barge-in). 온디바이스 ASR, API 키 불필요.

156시간 전비전, 음성 및 멀티모달MIT
D

dsh-video-lens

dundunhan/dsh-video-lens

텍스트 전용 DeepSeek Harness 에이전트에 비디오 이해 기능 부여: 장면 인식 프레임 샘플링 + VLM + 선택적 ASR 전사를 타임라인 증거로 융합. / 순수 텍스트 모델용 비디오 이해 플러그인(장면 인식 프레임 추출 + VLM + 선택적 음성 전사)

13지난달비전, 음성 및 멀티모달MIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

웹 UI용 음성 AI 여자친구: FunASR 마이크 입력, Qwen3-TTS 음성 응답, 동반 애니메이션 창, 그리고 NapCat을 통한 양방향 QQ 채팅(텍스트/음성/이미지 푸시).

1219일 전비전, 음성 및 멀티모달
C

dsh-bilibili

czx2244/dsh-bilibili

Bilibili 영상 분석 기능: 메타데이터, 자막(스크립트가 없으면 Bijian/sherpa-onnx/whisper.cpp로 ASR 대체), 댓글, 탄막, 선명한 키프레임을 제공하며 선택적으로 로컬 비전 설명도 지원합니다.

92개월 전도구 및 기능MIT
I

dsh-video-understand

ilps2/dsh-video-understand

저비용 영상 이해 도구. video_understand 도구가 Bilibili 링크 / BV / 로컬 영상을 AVIS 정보 계층(ASR + 장면 구조 + 객체 추적 + YOLO 라벨)으로 변환하고 요약 + Q&A를 반환한다. 질문 주도형 계층 간 동적 라우팅(L0 ASR / L1 객체 추적 / L2 키프레임 VLM), 반복 질문용 의미 계층 재사용, 질문별 예산 상한을 갖춘다. Python 엔진: 코어 계층에는 faster-whisper / opencv / yt-dlp가 필요하며(~200-300MB), 선택적 의미 계층을 추가하면 torch / transformers / ultralytics가 약 2GB 더 든다. 번들된 doctor --fix가 venv를 설정하고 둘 다 설치한다.

8지난달도구 및 기능
S

dsh-voice

stardustlc666/dsh-voice

음성 도구: 무료 edge-tts 뉴럴 음성 합성, OpenAI 호환 ASR 변환, 음성 목록, 음성 일괄 미리보기, 상태 자가 점검.

46시간 전비전, 음성 및 멀티모달MIT
H

dsh-voice

haoku123/dsh-voice

웹 UI용 전이중 음성 모드: 탭하여 토글 또는 누르고 있기(전송 키 또는 `Ctrl`)로 받아쓰기, 실시간 자막, sherpa-onnx를 통한 호스트 측 SenseVoice ASR, 문장별 음성 응답, 발화가 재생 및 실행 중인 턴을 중단(진정한 끼어들기). API 키 불필요.

4지난달비전, 음성 및 멀티모달MIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

컴포저를 위한 한 손, 키보드 없는 입력: 입력 상자에서 마우스를 길게 누르고 말한 뒤 놓으면 텍스트가 초안에 들어가고, 위로 밀면 반쯤 남은 문장 없이 취소됩니다. 겨냥할 마이크 버튼도, 외울 단축키도 없으며 손이 입력 영역을 떠날 필요가 없습니다. 다른 손이 바쁠 때 유용합니다. 인식은 완전히 오프라인으로 실행됩니다(SenseVoice + sherpa-onnx, API 키 불필요, 오디오는 기기를 떠나지 않음).

320시간 전비전, 음성 및 멀티모달MIT
N

voco-input-sh

nothree-code/voco-input-sh

웹 UI용 음성 입력: 로컬 VocoType 오프라인 음성 인식을 구동하고 인식된 텍스트를 작성창에 자동 삽입하는 마이크 버튼(자동 배포, 중복 제거, 연속 받아쓰기).

319일 전비전, 음성 및 멀티모달MIT
B

dsh-voice-call

biliye/dsh-voice-call

DSH 웹 GUI의 음성 통화 도우미: 드래그 가능한 플로팅 통화 볼, 발화마다 일시정지 후 전송하는 브라우저 측 VAD, FunASR HTTP 또는 스트리밍 음성 인식, MiniMax 또는 OpenAI 호환 TTS 응답, 자동 절전이 있는 선택적 웨이크 워드 모드, 그리고 진행·중지·음성 완료 보고가 있는 별도 서브에이전트 세션으로의 작업 파견.

24일 전비전, 음성 및 멀티모달MIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Muxiva가 오케스트레이션하는 DeepSeek Harness용 로컬 우선 양방향 음성

22개월 전비전, 음성 및 멀티모달Apache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

에이전트가 시작하는 음성 통화: `offer_call`이 사람에게 전화를 울리고(接听/拒接/稍后再说), 수락된 통화는 CrispASR + Qwen3-TTS(화자 9명, 중국어 방언 2개)로 로컬에서 합성·재생되며, 거절된 통화는 그 결정을 에이전트에 돌려줍니다.

23일 전비전, 음성 및 멀티모달MIT
1

dsh-wsl-media

173787247/dsh-wsl-media

Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).

13일 전개발 및 플러그인 도구MIT
1

dsh-wsl-im

173787247/dsh-wsl-im

Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.

13일 전개발 및 플러그인 도구MIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

119일 전비전, 음성 및 멀티모달MIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.

1지난달비전, 음성 및 멀티모달MIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

컴포저용 중국 대응 음성 입력입니다. 로컬 Python 브리지가 필요합니다 (pip install dashscope websockets, bridge/voice-bridge.py 실행) — 플러그인만으로는 작동하지 않습니다. 브라우저 마이크가 16kHz PCM을 브리지로 스트리밍하고, Alibaba Cloud DashScope ASR(paraformer-realtime-v2)를 실행합니다. 중간 결과가 커서 위치의 초안을 채우며, 무음 시 자동 정지, 선택적 자동 전송을 지원합니다.

115일 전비전, 음성 및 멀티모달MIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input

1지난달비전, 음성 및 멀티모달MIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

017일 전비전, 음성 및 멀티모달MIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

020일 전비전, 음성 및 멀티모달MIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

027일 전비전, 음성 및 멀티모달