Plugins
Explora, filtra e instala plugins de DeepSeek-Harness.
18 plugins encontrados
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
Cerebro DeepSeek + transcripción automática de imágenes: adjunta imágenes en la GUI y cada una se transcribe mediante el modelo oficial deepseek-v4-flash-vision-exp por defecto (un cerebro V4-Pro puramente textual puede ver imágenes), con cualquier VLM compatible con OpenAI u Ollama local como alternativas.
dsh-plugin-call-me
radres/dsh-plugin-call-me
Hace sonar tu teléfono mediante CallKit: herramientas `call_me` y `text_me`, más llamadas opcionales de fin de turno y de aprobación cuya respuesta hablada se transcribe de vuelta a la sesión.
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
Asistente de voz para dsh web: di la frase de activación (p. ej. «小鲸») para activar el dictado manos libres — lo que dices se transcribe y se escribe automáticamente en el cuadro de chat. Admite comandos de edición hablados (enviar, borrar, nueva línea, detener la lectura) y lee en voz alta las respuestas del asistente en chino. El reconocimiento de voz se ejecuta localmente en el navegador mediante sherpa-onnx WASM, así que funciona sin conexión y sin clave de API.
dsh-stt-input
baisama-cloud/dsh-stt-input
Entrada de voz con conversión voz a texto para la interfaz web: un botón de micrófono en el compositor transcribe el habla al borrador mediante la API Web Speech del navegador (sin configuración) o una API Whisper compatible con OpenAI (OpenAI / Groq), con un modelo e idioma seleccionables en Ajustes.
dsh-voice
jesse-njx/dsh-voice
Notas de voz de entrada, respuestas habladas de salida: dicta audio que se convierte en mensajes de usuario (transcribir), haz que el agente lea las respuestas en voz alta (hablar), con prioridad local bajo ~/.dsh/voice.
dsh-vision-plugin
bug-huntter/dsh-vision-plugin
Reconocimiento de imágenes configurable para modelos DSH solo de texto: los mensajes de imagen se transcriben primero mediante un modelo de visión compatible con OpenAI (URL base, ID de modelo y clave API configurados en una sección de Ajustes) y luego se pasan al modelo principal como texto, mientras se anuncia la compatibilidad con entrada de imágenes. El esquema de autenticación de la clave API es seleccionable (cabeceras de petición estilo OpenAI, Anthropic, Gemini o Azure) y se notifica la falta de una clave antes de enviar cualquier petición.
dsh-vision-recognizer
kaixinbaba/dsh-vision-recognizer
Ruta de proveedor de visión que transcribe imágenes adjuntas a texto mediante un modelo configurable (más de 15 proveedores compatibles con OpenAI y Anthropic) mientras DeepSeek sigue respondiendo.
dsh-vision (vision-route)
314857493/dsh-vision
Registra una ruta de proveedor `deepseek-vision`: la interfaz web acepta imágenes pegadas y las transcribe a texto mediante la API de visión gratuita Zhipu GLM antes de delegar al adaptador DeepSeek.
dsh-vision-bridge
ximengxiaolan/dsh-vision-bridge
Las imágenes adjuntas en el editor se transcriben a texto mediante un modelo de visión compatible con OpenAI antes de llegar a los modelos de DeepSeek de solo texto.
dsh-mmroute
jmxsxwyzjdwl/dsh-mmroute
Enrutamiento multimodal transparente para modelos solo de texto: cada imagen en cada llamada al modelo es transcrita por completo (OCR literal, datos, zonas de incertidumbre, reforzado contra inyecciones) por tu propio intérprete multimodal, con una nueva revisión enfocada mediante vision_relook y reintento automático en fallos relacionados con imágenes. Sin endpoints incluidos, sin credenciales prestadas.
dsh-audio-copilot
ai-yucheng/dsh-audio-copilot
Audio Copilot para DeepSeek Harness: transcribe audio (ASR) y sintetiza voz (TTS) — da oídos y voz a los agentes solo-texto. TTS SAPI local de Windows listo para usar; endpoints ASR/TTS compatibles con OpenAI configurables. Incluye entrada de voz en el compositor
dsh-vision
314857493/dsh-vision
Plugin de DeepSeek Harness: una ruta `deepseek-vision` que declara entrada de imágenes y transcribe las imágenes pegadas mediante los modelos de visión gratuitos Zhipu GLM antes de delegar en el adaptador de DeepSeek.
dsh-voice-mimo
ch1bug/dsh-voice-mimo
Xiaomi MiMo-powered voice for DeepSeek Harness: browser 🎤/🧠/🔊 UI, voice_transcribe/voice_understand/voice_speak tools, configurable voice map (preset/voicedesign/voiceclone). Fork of zhuiyueya/dsh-voice (MIT), Settings pattern from Anionex/dsh-vision-toolkit (MIT).
dsh-voice-input-en
mohith-das/dsh-voice-input-en
Minimal English-only voice input for the DeepSeek Harness Web UI: a mic button in the composer that transcribes speech into the draft via the browser's native SpeechRecognition API. No dependencies, no subprocess, no network calls beyond whatever the brow
dsh-vision-pro-bridge
shainedemo/dsh-vision-pro-bridge
Vision bridge for text-only DeepSeek models: transcribes attached images with deepseek-v4-flash-vision-exp before they reach deepseek-v4-pro, with no third-party dependencies.
dsh-autovision
junkrat9527/dsh-autovision
Vision for text-only dsh models: paste an image and a configured multimodal model transcribes it to text automatically — transparent twin routing, an agent-callable read-image tool, no built-in keys or relay.
dsh-voice-input
newdanew/dsh-voice-input
Voice input for the web UI: a mic button in the composer that transcribes speech into the draft via the Web Speech API, with an optional auto-send toggle.
dsh-plugin-image-input
elohia/dsh-plugin-image-input
Image-to-text input for the Web UI: paste or drag an image and it is transcribed into structured text and sent, giving text-only LLMs image-input takeover (OpenAI-compatible vision API).