Saltar al contenido principal

Plugins

Explora, filtra e instala plugins de DeepSeek-Harness.

18 plugins encontrados

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Cerebro DeepSeek + transcripción automática de imágenes: adjunta imágenes en la GUI y cada una se transcribe mediante el modelo oficial deepseek-v4-flash-vision-exp por defecto (un cerebro V4-Pro puramente textual puede ver imágenes), con cualquier VLM compatible con OpenAI u Ollama local como alternativas.

16el mes pasadoVisión, voz y multimodalMIT
R

dsh-plugin-call-me

radres/dsh-plugin-call-me

Hace sonar tu teléfono mediante CallKit: herramientas `call_me` y `text_me`, más llamadas opcionales de fin de turno y de aprobación cuya respuesta hablada se transcribe de vuelta a la sesión.

7anteayerIntegraciones y acceso remotoMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

Asistente de voz para dsh web: di la frase de activación (p. ej. «小鲸») para activar el dictado manos libres — lo que dices se transcribe y se escribe automáticamente en el cuadro de chat. Admite comandos de edición hablados (enviar, borrar, nueva línea, detener la lectura) y lee en voz alta las respuestas del asistente en chino. El reconocimiento de voz se ejecuta localmente en el navegador mediante sherpa-onnx WASM, así que funciona sin conexión y sin clave de API.

3el mes pasadoVisión, voz y multimodalMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Entrada de voz con conversión voz a texto para la interfaz web: un botón de micrófono en el compositor transcribe el habla al borrador mediante la API Web Speech del navegador (sin configuración) o una API Whisper compatible con OpenAI (OpenAI / Groq), con un modelo e idioma seleccionables en Ajustes.

3el mes pasadoVisión, voz y multimodalMIT
J

dsh-voice

jesse-njx/dsh-voice

Notas de voz de entrada, respuestas habladas de salida: dicta audio que se convierte en mensajes de usuario (transcribir), haz que el agente lea las respuestas en voz alta (hablar), con prioridad local bajo ~/.dsh/voice.

3hace 2 mesesVisión, voz y multimodalMIT
B

dsh-vision-plugin

bug-huntter/dsh-vision-plugin

Reconocimiento de imágenes configurable para modelos DSH solo de texto: los mensajes de imagen se transcriben primero mediante un modelo de visión compatible con OpenAI (URL base, ID de modelo y clave API configurados en una sección de Ajustes) y luego se pasan al modelo principal como texto, mientras se anuncia la compatibilidad con entrada de imágenes. El esquema de autenticación de la clave API es seleccionable (cabeceras de petición estilo OpenAI, Anthropic, Gemini o Azure) y se notifica la falta de una clave antes de enviar cualquier petición.

2hace 7 díasVisión, voz y multimodalMIT
K

dsh-vision-recognizer

kaixinbaba/dsh-vision-recognizer

Ruta de proveedor de visión que transcribe imágenes adjuntas a texto mediante un modelo configurable (más de 15 proveedores compatibles con OpenAI y Anthropic) mientras DeepSeek sigue respondiendo.

2hace 2 mesesVisión, voz y multimodalMIT
3

dsh-vision (vision-route)

314857493/dsh-vision

Registra una ruta de proveedor `deepseek-vision`: la interfaz web acepta imágenes pegadas y las transcribe a texto mediante la API de visión gratuita Zhipu GLM antes de delegar al adaptador DeepSeek.

2el mes pasadoVisión, voz y multimodalMIT
X

dsh-vision-bridge

ximengxiaolan/dsh-vision-bridge

Las imágenes adjuntas en el editor se transcriben a texto mediante un modelo de visión compatible con OpenAI antes de llegar a los modelos de DeepSeek de solo texto.

2hace 2 mesesVisión, voz y multimodalMIT
J

dsh-mmroute

jmxsxwyzjdwl/dsh-mmroute

Enrutamiento multimodal transparente para modelos solo de texto: cada imagen en cada llamada al modelo es transcrita por completo (OCR literal, datos, zonas de incertidumbre, reforzado contra inyecciones) por tu propio intérprete multimodal, con una nueva revisión enfocada mediante vision_relook y reintento automático en fallos relacionados con imágenes. Sin endpoints incluidos, sin credenciales prestadas.

1hace 28 díasVisión, voz y multimodalMIT
A

dsh-audio-copilot

ai-yucheng/dsh-audio-copilot

Audio Copilot para DeepSeek Harness: transcribe audio (ASR) y sintetiza voz (TTS) — da oídos y voz a los agentes solo-texto. TTS SAPI local de Windows listo para usar; endpoints ASR/TTS compatibles con OpenAI configurables. Incluye entrada de voz en el compositor

1hace 2 mesesVisión, voz y multimodalMIT
3

dsh-vision

314857493/dsh-vision

Plugin de DeepSeek Harness: una ruta `deepseek-vision` que declara entrada de imágenes y transcribe las imágenes pegadas mediante los modelos de visión gratuitos Zhipu GLM antes de delegar en el adaptador de DeepSeek.

1hace 2 mesesVisión, voz y multimodalMIT
C

dsh-voice-mimo

ch1bug/dsh-voice-mimo

Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).

0hace 21 díasVisión, voz y multimodalMIT
M

dsh-voice-input-en

mohith-das/dsh-voice-input-en

Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow

0el mes pasadoVisión, voz y multimodalMIT
S

dsh-vision-pro-bridge

shainedemo/dsh-vision-pro-bridge

Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.

0el mes pasadoVisión, voz y multimodalMIT
J

dsh-autovision

junkrat9527/dsh-autovision

Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.

0hace 2 mesesVisión, voz y multimodalMIT
N

dsh-voice-input

newdanew/dsh-voice-input

Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.

0hace 2 mesesVisión, voz y multimodalMIT
E

dsh-plugin-image-input

elohia/dsh-plugin-image-input

Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).

0hace 2 mesesVisión, voz y multimodalMIT