Перейти к основному содержимому

Зрение, голос и мультимодальность

Плагины «Зрение, голос и мультимодальность» дают текстовым моделям DeepSeek в DeepSeek-Harness (dsh) глаза, уши и голос. Здесь есть инструменты зрения и провайдерские маршруты, которые распознают и описывают вставленные скриншоты через Zhipu GLM, Gemini, Doubao или локальный Ollama, голосовой ввод с микрофона через браузерный Web Speech API или Whisper-совместимые API, озвучивание ответов с помощью Edge TTS или собственных голосов, полнодуплексные голосовые режимы, а также генераторы изображений, видео и музыки.

Найдено плагинов: 86

L

modlens

liustack/modlens

Мост зрения для текстовых моделей: вставьте изображение — получите структурированные JSON-данные (OCR, разметка, семантика).

3.1k3 часа назадЗрение, голос и мультимодальностьMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

Бесплатное зрение для текстовых агентов: встроенная цепочка распознавания без ключей API плюс пиксельные инструменты (вопрос-ответ, grounding, обрезка, попиксельное сравнение, цвета, OCR, трассировка в SVG, вырезание, скриншоты); просто вставьте изображение.

7403 часа назадЗрение, голос и мультимодальностьMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

Задачи компьютерного зрения для текстовых моделей: вопрос-ответ по изображению с учётом намерения, OCR для длинных скриншотов, воспроизведение UI, grounding и попиксельное сравнение.

6946 часов назадЗрение, голос и мультимодальностьMIT
J

picturereader

jing-hy/picturereader

Image "reading" for text-only models: downscale + reduce color depth + structure/color fingerprints into text grids fed back to the conversation, letting the model zoom, sample and OCR autonomously like a multimodal model; fully local with zero external model dependency, ships an image-reading methodology skill and optional PaddleOCR.

208 часов назадЗрение, голос и мультимодальностьMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

Внешний плагин зрения для DeepSeek Harness: панель настроек с кнопкой-китом, распознавание изображений с авто-ответом и инструменты агента для скриншотов/распознавания.

123 дня назадЗрение, голос и мультимодальностьMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

Free vision bridge and image generation for text-only models: paste-image reading, GLM-4V-Flash and Gemini engine failover, ModLens-style structured evidence, and a seeded free vision model route.

11вчераЗрение, голос и мультимодальностьMIT
F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

Ядро DeepSeek + автоматическая транскрипция изображений: прикреплённые в GUI изображения расшифровываются в текст через любую VLM, совместимую с OpenAI, прежде чем попасть к текстовой DeepSeek — быстрый путь по ключу (по умолчанию qwen3.7-flash; DashScope/Zhipu/OpenRouter или любой совместимый с OpenAI эндпоинт) с вашим собственным ключом, либо локальный Ollama с автоопределением без какой-либо настройки.

11позавчераЗрение, голос и мультимодальностьMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

Adds a configurable vision model to text-only main models: a vision_read_image tool, a composer-bar vision-model selector, and automatic image-to-text conversion for text-only routes.

1012 часов назадЗрение, голос и мультимодальностьMIT
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

Dsh-visual-plugin. Дайте вашей текстовой модели глаза: пересылайте изображения пользователя в любую совместимую с OpenAI модель зрения и смотрите результаты в правой панели веб-интерфейса.

913 часов назадЗрение, голос и мультимодальностьMIT
C

Gemini-Eyes

consolesun/gemini-eyes

MCP bridge to gemini.google.com: vision analysis of images and videos, Imagen image and Veo video generation, and conversation management using the logged-in browser session with no API key.

84 дня назадЗрение, голос и мультимодальность
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

Reads assistant replies aloud via free Edge TTS or your own RVC voice models: read-aloud buttons + auto-read, adaptive chunked progressive playback (gapless long reads), one-click voice-pack installs from a registry, and a portable RVC runtime.

78 часов назадЗрение, голос и мультимодальностьMIT
D

dsh-imagegen

dickpy/dsh-imagegen

AI image generation for the DSH Web GUI: text-to-image and image-to-image through a configurable OpenAI-compatible endpoint (gpt-image-2 / gpt-image-1 / dall-e-3), with an api_url/api_key settings card and a sidebar split-pane generation studio.

75 часов назадЗрение, голос и мультимодальностьApache-2.0
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

Automatically generates and displays images in the DSH chat via API channels or local CLIs (supports mmx / codex / agy).

7вчераЗрение, голос и мультимодальностьMIT
5

dsh-vision

54xkeee/dsh-vision

Vision for text-only DeepSeek via Doubao Web by default (zero-cost, no API key — drives your logged-in Chrome through a Windows CDP bridge), with Antigravity IDE quota (flash/pro) or Gemini fallback; auto detail escalation, vision evidence memory with compaction rehydration, content-hash cache, and a bilingual client panel.

7позавчераЗрение, голос и мультимодальностьMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Composer mic for the Web UI: tap-to-monitor live transcription and hold-to-talk, with host Edge TTS reply reading that streams while the model generates, echo-pause during reading, and tap-to-stop.

6вчераЗрение, голос и мультимодальностьMIT
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

A vision-language gateway provider route: pasted images are described by a configurable VL model (Qwen-VL by default) before the DeepSeek wire.

6вчераЗрение, голос и мультимодальностьMIT
M

dsh-windows-ocr

maxwell-feng/dsh-windows-ocr

Local OCR for attached images via the built-in Windows engine (Windows.Media.Ocr): only the recognized text is sent to the model, never the image bytes; vision passthrough is opt-in.

6вчераЗрение, голос и мультимодальностьMIT
3

dsh-voice

3274375092/dsh-voice

Voice input for DeepSeek Harness: speak into the microphone and the recognized text is submitted as a normal chat message, via local or browser speech recognition.

43 дня назадЗрение, голос и мультимодальностьMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

Vision MCP and DSH bundle for text-only DeepSeek: analyze_image, analyze_clipboard, compare_images and vision_status tools, a visual settings page, free GLM-4.6V-Flash by default, result caching and rate-limit tolerance; keys stay out of logs.

4позавчераЗрение, голос и мультимодальностьMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

MiniMax-powered multimodal plugin: real-time voice call mode (streaming conversation, floating dock UI), voice mode and mic voice input, plus image/video/music/speech generation and vision inspection tools.

4вчераЗрение, голос и мультимодальностьMIT
H

dsh-her-eyes

huashenglian/dsh-her-eyes

Плагин dsh, позволяющий AI автоматически вызывать VLM (мультимодальные модели) для визуального анализа.

45 дней назадЗрение, голос и мультимодальностьMIT
A

dsh-speak

alan2z/dsh-speak

Voice-announce the final reply on Windows (SAPI5 natural voices) and macOS (system voice); skips reasoning and tool calls, one-line npm install.

3позавчераЗрение, голос и мультимодальностьMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

Advertise image paste on text-only DeepSeek routes, describe attachments with a vision sidecar, and leave native vision models untouched.

3позавчераЗрение, голос и мультимодальностьMIT
N

free-vision-skill

niyongsheng/free-vision-skill

Fully-local image understanding & OCR via macOS Vision Framework: `ocr_image` (text, table layout + coordinates) and `view_image` (scene, faces, QR) — paste multiple images into the web input box or pass path/URL/base64; images never leave your Mac.

33 дня назадЗрение, голос и мультимодальностьMIT