ビジョン、音声とマルチモーダル
ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。
312 件のプラグインが見つかりました
dsh-vision-sidecar
121103qwq/dsh-vision-sidecar
DeepSeek Harness 向けのホスト型無料ビジョンサイドカー。永続的なセッションエビデンス付き。
dsh-image-subagent
yuqingsh/dsh-image-subagent
dsh-vision-bridge
gxx182/dsh-vision-bridge
セッション画像を設定可能なビジョンプロバイダーに接続し、テキストのみの分析結果を適格なDeepSeek Harnessモデルルートに返します。
dsh-omni-workstation
huashenglian/dsh-omni-workstation
DSH 向けのオムニモーダル・ワークステーション:順序付けられたマルチカード VLM フェイルオーバーチェーン上の analyze_image、同じ画像リゾルバーを共有する 6 ツールのビジョンツールキット(ズーム、色サンプリング、ピクセル差分、OCR、要素検出、インライン表示)、OpenAI/DashScope/ComfyUI プロトコル上の generate_image、/build-video-tool ビルダーを備えたマルチカード非同期 generate_video、7 つのプロバイダー上の speak/clone_voice TTS。すべてが 1 つの自動保存設定ページから操作されます。
dsh-hold-to-talk
wangzhanchao883/dsh-hold-to-talk
コンポーザー向けの片手・キーボード不要の入力:入力ボックス上でマウスを押し続けて話し、離すとテキストが下書きに入り、上へスライドすると中途半端な文を残さずキャンセルできます。狙って押すマイクボタンも覚えるショートカットも不要で、もう一方の手がふさがっているときに手が入力エリアから離れずに済むのが要点です。認識は完全にオフラインで動作します(sherpa-onnx 経由の SenseVoice、API キー不要、音声はマシン外に出ません)。
dsh-plugin-speech
nakamuraia/dsh-plugin-speech
DeepSeek Harnessでアシスタントの応答を音声で読み上げ:ストリーミング再生対応のテキスト読み上げプロバイダー。
dsh-voice-assistant
supersyh-sss/dsh-voice-assistant
dsh web 向けの音声アシスタント:ウェイクフレーズ(例:「小鲸」)を言うとハンズフリーの音声入力が有効になり、話した内容が文字起こしされて自動的にチャットボックスへ入力されます。音声による編集コマンド(送信、クリア、改行、読み上げ停止)に対応し、アシスタントの返答を中国語で読み上げます。音声認識は sherpa-onnx WASM によりブラウザ内でローカルに実行されるため、API キーなしでオフラインでも動作します。
dsh-audiogen
shimingming520/dsh-audiogen
DeepSeek Harness Web GUI用AI音声生成—マルチベンダーTTS、音楽、効果音、ボイスデザイン、サイドバーパネル、モデル比較、リソースライブラリ、Agentツール搭載。
dsh-voco
lgquan/dsh-voco
DSHのためのハンズフリー Listening、プッシュ・トゥ・トーク、音声認識、TTS 応答、バックグラウンド Agent 委任を備えた継続的な音声会話。
dsh-gsv
taoruiliu19/dsh-gsv
DeepSeek Harness向けリアルタイムローカルTTS:音声プリセット、自動読み上げ、エンジン設定アシスタント、読み上げボタン、GSV-TTS-Liteエンジン用設定パネル。
dsh-ximalaya
jerryqx/dsh-ximalaya
DSH Web UI 内で Ximalaya のポッドキャストとオーディオブックを聴けます:アルバム検索、ページ送りでのトラック閲覧、再生中バー(前へ/再生/次へ、シーク、音量、速度)での再生。QR ログイン後は「Mine」ページに、いいねしたトラック(クリックで再生)、最新エピソードのヒント付きの購読アルバム、フォロー中のアンカーとその公開アルバムが一覧表示されます。ホストは Range 対応で音声ストリームをリレーし、エージェントが要求に応じて検索・再生できるよう `ximalaya_play` ツールを登録します。
phone-eye
boheastill/phone-eye
AI エージェントが実機の Android 端末を見て操作できるようにします:phone_look(ビジョン + UI ツリーの融合)、タップ/スワイプ/入力、スクリーンショットを adb 経由で提供し、あらゆる MCP クライアントで利用できます。
dsh-image-vision
xiaoyuink/dsh-image-vision
あらゆる DSH モデル向けの画像理解:vision、OCR、grounding、クロップツールと、病理組織学、細胞生物学、解剖学、臨床画像、科学図表向けのドメインプリセット。
Deepseek-Continuity
linxuhao/deepseek-continuity
ローカルでの画像、音声、音楽、音響効果の生成と文字起こし。固定ID機能を搭載:キャラクター、動物、物体、俳優の音声を一度定義すれば以降のすべての呼び出しで再利用できます。退化した出力(平坦に近い画像、無音オーディオ)は成功として返さず拒否。生成された行はテキストとして読み戻せるため、末尾を飲み込んだクローンも可視化されます。エンジンはアイドル時にアンロードされ、画像生成と文字起こしはローカルのVulkanバックエンドの代わりにOpenAI互換APIを指し示すこともできます。
dsh-ui-spec
yumimanji/dsh-ui-spec
OCR、決定論的ジオメトリ、シーングラフ、アセット、レンダリング比較を用いて、UIスクリーンショットを実装グレードのWeb仕様書に変換するDeepSeek Harnessプラグインです。
deepseekeyes
dttxorg/deepseekeyes
DeepSeek Harness向けの監査可能なビジョンおよびクロスプラットフォームのComputer Useランタイム。情報源を保持する証拠を備えます。
voco-input-sh
nothree-code/voco-input-sh
Web UI 用の音声入力: ローカルの VocoType オフライン音声認識を駆動するマイクボタンで、認識したテキストを自動的に composer に挿入する(自動デプロイ、重複排除、連続ディクテーション)。
dsh-stt-input
baisama-cloud/dsh-stt-input
Web UI 用音声入力:コンポーザーのマイクボタンがブラウザ Web Speech API(ゼロコンフィグ)または OpenAI 互換 Whisper API(OpenAI / Groq)で音声をドラフトに転写。Settings でモデルと言語を選択可能。
visual-review
wang-bool/visual-review
貼り付け/アップロードした画像を DSH Web チャット内でインライン表示し、テキストのみのモデルに視覚を与えます。モデルから呼べる visual_review ツールは、まず OpenAI 互換のマルチモーダル API を呼び出し、失敗した場合はローカルの Qwen3-VL ワーカーにフォールバックします。
dsh-plugins (dsh-vision)
tzhr-invest/dsh-plugins
設定した任意の OpenAI 互換 vision エンドポイント経由でローカル画像を説明する、エージェント呼び出し可能な vision ツール。任意のマルチモデル相互チェックと組み込みキーなし。
dsh-plugin-multimodal
shinjiyu/dsh-plugin-multimodal
テキストのみのDeepSeekルートで画像貼り付けを公開し、視覚サイドカーで添付ファイルを説明し、ネイティブ視覚モデルは変更しません。
dsh-vision-tools
moon09300731/dsh-vision-tools
DeepSeek Harness向けの完全な視覚機能バンドルです。vision_understandツール(OpenAI互換の視覚API、デフォルトで無料のZhipu GLM-4V-Flash)に加え、画像認識用の貼り付け/ドラッグ&ドロップ/ボタンのエントリーポイントを提供します。
dsh-plugin-grok2api-media-tool
lsjspl/dsh-plugin-grok2api-media-tool
grok2api API を通じて dsh に画像と動画を生成する機能を与える。
dsh-image-gen
leemancheung/dsh-image-gen
Codex サブスクリプション OAuth を既定とし、または明示的な API キーモードを使う GPT Image 2 の `image_gen`。編集中カード、最大 3 つのライブ API partial、永続的な添付リプレイ / ライトボックス / ダウンロード、テキストのみのモデル出力、そして範囲を絞った認証情報安全リクエストを備える。