メインコンテンツへスキップ

ビジョン、音声とマルチモーダル

ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。

312 件のプラグインが見つかりました

1

dsh-vision-sidecar

121103qwq/dsh-vision-sidecar

DeepSeek Harness 向けのホスト型無料ビジョンサイドカー。永続的なセッションエビデンス付き。

42 か月前ビジョン、音声とマルチモーダルMIT
Y

dsh-image-subagent

yuqingsh/dsh-image-subagent

42 か月前ビジョン、音声とマルチモーダルMIT
G

dsh-vision-bridge

gxx182/dsh-vision-bridge

セッション画像を設定可能なビジョンプロバイダーに接続し、テキストのみの分析結果を適格なDeepSeek Harnessモデルルートに返します。

42 か月前ビジョン、音声とマルチモーダルMIT
H

dsh-omni-workstation

huashenglian/dsh-omni-workstation

DSH 向けのオムニモーダル・ワークステーション:順序付けられたマルチカード VLM フェイルオーバーチェーン上の analyze_image、同じ画像リゾルバーを共有する 6 ツールのビジョンツールキット(ズーム、色サンプリング、ピクセル差分、OCR、要素検出、インライン表示)、OpenAI/DashScope/ComfyUI プロトコル上の generate_image、/build-video-tool ビルダーを備えたマルチカード非同期 generate_video、7 つのプロバイダー上の speak/clone_voice TTS。すべてが 1 つの自動保存設定ページから操作されます。

314 日前ビジョン、音声とマルチモーダルMIT
W

dsh-hold-to-talk

wangzhanchao883/dsh-hold-to-talk

コンポーザー向けの片手・キーボード不要の入力:入力ボックス上でマウスを押し続けて話し、離すとテキストが下書きに入り、上へスライドすると中途半端な文を残さずキャンセルできます。狙って押すマイクボタンも覚えるショートカットも不要で、もう一方の手がふさがっているときに手が入力エリアから離れずに済むのが要点です。認識は完全にオフラインで動作します(sherpa-onnx 経由の SenseVoice、API キー不要、音声はマシン外に出ません)。

3昨日ビジョン、音声とマルチモーダルMIT
N

dsh-plugin-speech

nakamuraia/dsh-plugin-speech

DeepSeek Harnessでアシスタントの応答を音声で読み上げ:ストリーミング再生対応のテキスト読み上げプロバイダー。

318 日前ビジョン、音声とマルチモーダルMIT
S

dsh-voice-assistant

supersyh-sss/dsh-voice-assistant

dsh web 向けの音声アシスタント:ウェイクフレーズ(例:「小鲸」)を言うとハンズフリーの音声入力が有効になり、話した内容が文字起こしされて自動的にチャットボックスへ入力されます。音声による編集コマンド(送信、クリア、改行、読み上げ停止)に対応し、アシスタントの返答を中国語で読み上げます。音声認識は sherpa-onnx WASM によりブラウザ内でローカルに実行されるため、API キーなしでオフラインでも動作します。

3先月ビジョン、音声とマルチモーダルMIT
S

dsh-audiogen

shimingming520/dsh-audiogen

DeepSeek Harness Web GUI用AI音声生成—マルチベンダーTTS、音楽、効果音、ボイスデザイン、サイドバーパネル、モデル比較、リソースライブラリ、Agentツール搭載。

324 日前ビジョン、音声とマルチモーダルApache-2.0
L

dsh-voco

lgquan/dsh-voco

DSHのためのハンズフリー Listening、プッシュ・トゥ・トーク、音声認識、TTS 応答、バックグラウンド Agent 委任を備えた継続的な音声会話。

3先月ビジョン、音声とマルチモーダルMIT
T

dsh-gsv

taoruiliu19/dsh-gsv

DeepSeek Harness向けリアルタイムローカルTTS:音声プリセット、自動読み上げ、エンジン設定アシスタント、読み上げボタン、GSV-TTS-Liteエンジン用設定パネル。

3先月ビジョン、音声とマルチモーダルMIT
J

dsh-ximalaya

jerryqx/dsh-ximalaya

DSH Web UI 内で Ximalaya のポッドキャストとオーディオブックを聴けます:アルバム検索、ページ送りでのトラック閲覧、再生中バー(前へ/再生/次へ、シーク、音量、速度)での再生。QR ログイン後は「Mine」ページに、いいねしたトラック(クリックで再生)、最新エピソードのヒント付きの購読アルバム、フォロー中のアンカーとその公開アルバムが一覧表示されます。ホストは Range 対応で音声ストリームをリレーし、エージェントが要求に応じて検索・再生できるよう `ximalaya_play` ツールを登録します。

3先月ビジョン、音声とマルチモーダルMIT
B

phone-eye

boheastill/phone-eye

AI エージェントが実機の Android 端末を見て操作できるようにします:phone_look(ビジョン + UI ツリーの融合)、タップ/スワイプ/入力、スクリーンショットを adb 経由で提供し、あらゆる MCP クライアントで利用できます。

3先月ビジョン、音声とマルチモーダルMIT
X

dsh-image-vision

xiaoyuink/dsh-image-vision

あらゆる DSH モデル向けの画像理解:vision、OCR、grounding、クロップツールと、病理組織学、細胞生物学、解剖学、臨床画像、科学図表向けのドメインプリセット。

329 日前ビジョン、音声とマルチモーダル
L

Deepseek-Continuity

linxuhao/deepseek-continuity

ローカルでの画像、音声、音楽、音響効果の生成と文字起こし。固定ID機能を搭載:キャラクター、動物、物体、俳優の音声を一度定義すれば以降のすべての呼び出しで再利用できます。退化した出力(平坦に近い画像、無音オーディオ)は成功として返さず拒否。生成された行はテキストとして読み戻せるため、末尾を飲み込んだクローンも可視化されます。エンジンはアイドル時にアンロードされ、画像生成と文字起こしはローカルのVulkanバックエンドの代わりにOpenAI互換APIを指し示すこともできます。

312 日前ビジョン、音声とマルチモーダルMIT
Y

dsh-ui-spec

yumimanji/dsh-ui-spec

OCR、決定論的ジオメトリ、シーングラフ、アセット、レンダリング比較を用いて、UIスクリーンショットを実装グレードのWeb仕様書に変換するDeepSeek Harnessプラグインです。

32 か月前ビジョン、音声とマルチモーダルMIT
D

deepseekeyes

dttxorg/deepseekeyes

DeepSeek Harness向けの監査可能なビジョンおよびクロスプラットフォームのComputer Useランタイム。情報源を保持する証拠を備えます。

32 か月前ビジョン、音声とマルチモーダルMIT
N

voco-input-sh

nothree-code/voco-input-sh

Web UI 用の音声入力: ローカルの VocoType オフライン音声認識を駆動するマイクボタンで、認識したテキストを自動的に composer に挿入する(自動デプロイ、重複排除、連続ディクテーション)。

320 日前ビジョン、音声とマルチモーダルMIT
B

dsh-stt-input

baisama-cloud/dsh-stt-input

Web UI 用音声入力:コンポーザーのマイクボタンがブラウザ Web Speech API(ゼロコンフィグ)または OpenAI 互換 Whisper API(OpenAI / Groq)で音声をドラフトに転写。Settings でモデルと言語を選択可能。

3先月ビジョン、音声とマルチモーダルMIT
W

visual-review

wang-bool/visual-review

貼り付け/アップロードした画像を DSH Web チャット内でインライン表示し、テキストのみのモデルに視覚を与えます。モデルから呼べる visual_review ツールは、まず OpenAI 互換のマルチモーダル API を呼び出し、失敗した場合はローカルの Qwen3-VL ワーカーにフォールバックします。

32 か月前ビジョン、音声とマルチモーダルMIT
T

dsh-plugins (dsh-vision)

tzhr-invest/dsh-plugins

設定した任意の OpenAI 互換 vision エンドポイント経由でローカル画像を説明する、エージェント呼び出し可能な vision ツール。任意のマルチモデル相互チェックと組み込みキーなし。

35 日前ビジョン、音声とマルチモーダルMIT
S

dsh-plugin-multimodal

shinjiyu/dsh-plugin-multimodal

テキストのみのDeepSeekルートで画像貼り付けを公開し、視覚サイドカーで添付ファイルを説明し、ネイティブ視覚モデルは変更しません。

32 か月前ビジョン、音声とマルチモーダルMIT
M

dsh-vision-tools

moon09300731/dsh-vision-tools

DeepSeek Harness向けの完全な視覚機能バンドルです。vision_understandツール(OpenAI互換の視覚API、デフォルトで無料のZhipu GLM-4V-Flash)に加え、画像認識用の貼り付け/ドラッグ&ドロップ/ボタンのエントリーポイントを提供します。

32 か月前ビジョン、音声とマルチモーダルMIT
L

dsh-plugin-grok2api-media-tool

lsjspl/dsh-plugin-grok2api-media-tool

grok2api API を通じて dsh に画像と動画を生成する機能を与える。

3先月ビジョン、音声とマルチモーダル
L

dsh-image-gen

leemancheung/dsh-image-gen

Codex サブスクリプション OAuth を既定とし、または明示的な API キーモードを使う GPT Image 2 の `image_gen`。編集中カード、最大 3 つのライブ API partial、永続的な添付リプレイ / ライトボックス / ダウンロード、テキストのみのモデル出力、そして範囲を絞った認証情報安全リクエストを備える。

36 日前ビジョン、音声とマルチモーダルMIT