Saltar al contenido principal

Plugins

Explora, filtra e instala plugins de DeepSeek-Harness.

30 plugins encontrados

F

dsh-prompt-enhancer

fishsb/dsh-prompt-enhancer

Mejora de prompts con un clic (5 modos, cadena de memoria, fallback multimodelo) más reconocimiento de voz (Qwen3-ASR en la nube / SenseVoice sin conexión, parada automática en silencio) para el compositor, con reinicio del servicio DSH con un clic.

82hace 5 díasHerramientas y funciones
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Entrada de voz para la interfaz web: pulsa Alt (o Alt+Space) para iniciar/detener el dictado, Web Speech del navegador (sin configuración) o ASR en la nube compatible con OpenAI, pulido opcional mediante el LLM configurado en DSH, interfaz de ajustes.

34hace 3 díasVisión, voz y multimodalMIT
W

dsh-ears

wiziscool/dsh-ears

Plugin de entrada de voz para DeepSeek Harness (dsh): un botón de micrófono en el compositor convierte el habla en un borrador transcrito, con opción de backends de reconocimiento de voz, pulido opcional mediante las rutas LLM propias de dsh y una página de configuración nativa.

21hace 23 horasVisión, voz y multimodalMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

Modo de voz dúplex completo para la interfaz web de DeepSeek Harness: conmutación (envío automático tras pausa de 2 s) o dictado pulsar-para-hablar en un borrador editable con ASR en streaming zipformer2, palabra de activación opcional; lectura en voz alta Edge TTS oración por oración con subtítulos en vivo, y la voz interrumpe la reproducción y el turno en curso (barge-in real). ASR en el dispositivo, sin clave de API.

15hace 8 horasVisión, voz y multimodalMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

Da a los agentes de DeepSeek Harness solo de texto comprensión de vídeo: muestreo de fotogramas consciente de la escena + VLM + transcripción ASR opcional fusionados en evidencia de línea de tiempo. / Complemento de comprensión de vídeo para modelos solo de texto (muestreo de fotogramas consciente de la escena + VLM + transcripción de voz opcional).

13el mes pasadoVisión, voz y multimodalMIT
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Novia de IA por voz para la interfaz web: entrada de micrófono con FunASR, respuestas habladas con Qwen3-TTS, ventana de animación de compañía y chat bidireccional de QQ (texto/voz/imagen push) mediante NapCat.

12hace 19 díasVisión, voz y multimodal
C

dsh-bilibili

czx2244/dsh-bilibili

Análisis de vídeos de Bilibili: metadatos, transcripción (con respaldo ASR vía Bijian/sherpa-onnx/whisper.cpp), comentarios, danmaku y fotogramas clave nítidos con descripciones de visión local opcionales.

9hace 2 mesesHerramientas y funcionesMIT
I

dsh-video-understand

ilps2/dsh-video-understand

Herramienta de comprensión de video de bajo coste: una herramienta video_understand convierte un enlace de Bilibili / BV / video local en una capa de información AVIS (ASR + estructura de escenas + seguimiento de objetos + etiquetas YOLO) y devuelve un resumen + Q&A. Incluye enrutamiento dinámico entre capas guiado por preguntas (L0 ASR / L1 seguimiento de objetos / L2 VLM de fotograma clave), reutilización de la capa semántica para preguntas repetidas y un tope de presupuesto por pregunta. Motor Python: la capa principal necesita faster-whisper / opencv / yt-dlp (~200-300MB); la capa semántica opcional añade ~2GB de torch / transformers / ultralytics. Un doctor --fix incluido configura el venv e instala ambos.

8el mes pasadoHerramientas y funciones
S

dsh-voice

stardustlc666/dsh-voice

Herramientas de voz: síntesis de voz neuronal gratuita con edge-tts, transcripción ASR compatible con OpenAI, lista de voces, vista previa de voces por lotes y autodiagnóstico de estado.

4hace 8 horasVisión, voz y multimodalMIT
H

dsh-voice

haoku123/dsh-voice

Modo de voz full-dúplex para la interfaz web: dictado con toque para alternar o mantener pulsado (tecla de envío o `Ctrl`) con subtítulos en vivo, ASR SenseVoice del lado del host mediante sherpa-onnx, respuestas habladas oración por oración, y hablar interrumpe la reproducción y el turno en curso (verdadera interrupción). Sin clave de API.

4el mes pasadoVisión, voz y multimodalMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

Entrada con una sola mano y sin teclado para el compositor: mantén pulsado el ratón sobre el cuadro de entrada, habla y suelta — el texto aparece en el borrador, y deslizar hacia arriba cancela sin dejar media frase. No hay botón de micrófono al que apuntar ni atajo que recordar; la mano nunca tiene que salir del área de entrada, que es justo lo importante cuando la otra mano está ocupada. El reconocimiento se ejecuta totalmente sin conexión (SenseVoice mediante sherpa-onnx, sin clave de API, el audio nunca sale del equipo).

3hace 21 horasVisión, voz y multimodalMIT
N

voco-input-sh

nothree-code/voco-input-sh

Entrada por voz para la interfaz web: un botón de micrófono que activa el reconocimiento de voz local sin conexión VocoType y auto inserta el texto reconocido en el compositor (despliegue automático, deduplicación, dictado continuo).

3hace 19 díasVisión, voz y multimodalMIT
B

dsh-voice-call

biliye/dsh-voice-call

Asistente de llamadas de voz para la GUI web de DSH: una bola de llamada flotante y arrastrable, VAD en el navegador que envía cada intervención tras una pausa, reconocimiento de voz FunASR HTTP o en streaming, respuestas TTS de MiniMax o compatibles con OpenAI, un modo opcional de palabra de activación con auto-suspensión y despacho de tareas a sesiones de subagente separadas con progreso, parada e informes hablados de finalización.

2hace 5 díasVisión, voz y multimodalMIT
P

muxiva-dsh-voice

piyotahu/muxiva-dsh-voice

Voz dúplex completa local-first para DeepSeek Harness, orquestada por Muxiva

2hace 2 mesesVisión, voz y multimodalApache-2.0
P

dsh-voice-call

pandapolo/dsh-voice-call

Llamadas de voz iniciadas por el agente: `offer_call` hace sonar al humano (接听/拒接/稍后再说); las llamadas aceptadas se sintetizan y reproducen localmente con CrispASR + Qwen3-TTS (9 voces, 2 dialectos chinos), y las rechazadas devuelven la decisión al agente.

2hace 3 díasVisión, voz y multimodalMIT
1

dsh-wsl-media

173787247/dsh-wsl-media

Local media/doc pipeline: ffprobe, extract, thumbnail, PDF, ASR, pandoc, OCR, exif (allowRoots include IM inbox).

1hace 3 díasDesarrollo y herramientas de pluginsMIT
1

dsh-wsl-im

173787247/dsh-wsl-im

Bridges Feishu, WeCom, DingTalk, QQ, Slack, Discord, Telegram and Mattermost into dsh agents (outbound WS/Stream/Gateway/long-poll/webhook), with im_status, optional local Whisper ASR, plain-text outbound for QQ/DingTalk/Telegram/Mattermost, and env CSV allowlists (DSH_IM_*_ALLOWED_USER_IDS). Empty allowedUserIds means EVERYONE can drive your agent — set a whitelist before exposing a bot.

1hace 3 díasDesarrollo y herramientas de pluginsMIT
M

dsh-minimax-asr

moluyao/dsh-minimax-asr

MiniMax 语音识别(asr-1.0)+ 语音合成(speech-2.8-hd)的 DeepSeek Harness 全局插件:转写工具、任务结束后用喇叭念一句的播报、实时免手对话、303 个音色可选

1hace 19 díasVisión, voz y multimodalMIT
F

dsh-funasr-voice

fenglin-ai/dsh-funasr-voice

Offline voice input for the DSH Web UI: mic to local FunASR (SenseVoiceSmall), one-click install, no cloud.

1el mes pasadoVisión, voz y multimodalMIT
S

dsh-voice-input-cn

schumchanvi/dsh-voice-input-cn

Entrada de voz lista para China para el compositor. Requiere un puente local en Python (pip install dashscope websockets, ejecutar bridge/voice-bridge.py); el plugin por sí solo no funciona. El micrófono del navegador transmite PCM de 16 kHz al puente, que ejecuta Alibaba Cloud DashScope ASR (paraformer-realtime-v2); el texto intermedio rellena el borrador en el cursor, parada automática por silencio y envío automático opcional.

1hace 15 díasVisión, voz y multimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input

1el mes pasadoVisión, voz y multimodalMIT
B

dsh-asr-voice

bittersmilezzz/dsh-asr-voice

开口即成文 · Speak-to-prompt for DeepSeek Harness:云端 ASR 语音识别 + 提示词优化 + 填入草稿/自动发送,跨平台 macOS / Windows。

0hace 17 díasVisión, voz y multimodalMIT
R

dsh-voice-input

rio-promax/dsh-voice-input

DSH voice input plugin: browser realtime + VAD dictation + local/cloud ASR + DeepSeek AI polish

0hace 20 díasVisión, voz y multimodalMIT
J

dsh-voice-input-qwen-asr

jsoncode/dsh-voice-input-qwen-asr

Voice input plugin (dual-face): mic button beside the composer send action, live recording bubble streaming PCM to a local Qwen3-ASR python service managed by the host, plus an ASR environment settings page (clone runtime/model repos, create venv, run ser

0hace 27 díasVisión, voz y multimodal