ビジョン、音声とマルチモーダル
ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。
312 件のプラグインが見つかりました
dsh-web-ui (dsh-tool-describe-image)
zhu1090093659/dsh-web-ui
テキスト専用モデル向けの `describe_image` ビジョンツール: 画像(ローカルパス、URL、添付)は設定可能な OpenAI 互換のビジョンエンドポイントに送られ、返ってきたテキストだけがセッションに入る。
ipollowork
devin-axis/ipollowork
iPolloWork HyperFrames Video Studio と 27 個の編集可能なビデオテンプレートを、DeepSeek Harness のネイティブな会話ビューとして提供します。
modlens
liustack/modlens
テキスト専用モデル向けのビジョンブリッジ: 画像を貼り付けると、構造化された JSON エビデンス(OCR、レイアウト、セマンティクス)を取得。
dsh-vision-router
ysr666/dsh-vision-router
テキスト専用エージェント向けの無料ビジョン機能: キー不要の内蔵ビジョンチェーンとピクセルツール群(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。画像を貼り付けるだけで使用可能。
dsh-vision-toolkit
anionex/dsh-vision-toolkit
テキスト専用モデルに視覚機能を追加:画像を貼り付けると、モデルがVision Toolkitバリアントに切り替わり、画像Q&A、複数画像比較、ロングスクリーンショットOCR、スクリーンショットからのUI再現、要素グラウンディング、ピクセル差分に対応します。デフォルトではAPIキー不要で、作者がホストする無料サービスにより1マシンあたり1日100枚まで処理可能。独自の_provider_への切り替えも設定できます。
tongflow
tong-io/tongflow
DeepSeek Harness(dsh)用 TongFlow スタジオプラグイン:撮影クルー形式のプロジェクトモデル、エージェント作成の TongFlow ワークフロー、決定論的メディア生成、埋め込みキャンバス。
dsh-image-gen
shanliuling/dsh-image-gen
DeepSeek Harness向けネイティブ対話型画像生成:エージェントに画像作成を依頼すると、生成から結果の会話内保持までを自動的に処理します。
watch-skill
oxbshw/watch-skill
DeepWatch の機能を、既存の DeepSeek Harness プロファイルにインストールできるようにします。
dsh-imagegen
dickpy/dsh-imagegen
DSH Web GUI向けのAI画像生成:設定可能なOpenAI互換エンドポイント(gpt-image-2 / gpt-image-1 / dall-e-3)を介したテキストから画像、画像から画像への変換に対応、api_url/api_keyの設定カードとサイドバーの分割ペイン生成スタジオを備える。
dsh-comfyui
fandc520/dsh-comfyui
DeepSeek Harness からローカルまたはリモートの ComfyUI サーバーを操作:comfyui_run / comfyui_object_info / comfyui_workflow ツールで画像や動画を生成・編集。ワークフローライブラリ(グラフ抽出:コンポーネントごと/メインフロー/すべて)、解像度自動マッチング付きロードエリア、ライブキュー、SDXL と Wan 2.1 テンプレート、コンパニオンスキル、同一オリジンのメディアプロキシを備えます。
dsh-omi-voice
polinnizhong/dsh-omi-voice
DeepSeek Harness 用のチャット内読み上げ機能:自然な Doubao TTS ボイス(BYOK)で AI 返信をタップして読み上げ・一時停止・再開。コード・表・図は除外し、最終回答のみを読み上げます。ローカルエンジンで、プラグインは API キーを保持しません。
deepseek-harness-video-director
chiphoton/deepseek-harness-video-director
🎬AI 監督:DeepSeek-Harness が演出する MiniMax-H3 動画生成プラグイン。🤖プロンプト以上。🪄キャンバス UI。
dsh-design-qa
sunxin-ai/dsh-design-qa
テキストのみのモデル向けデザイン忠実度 QA。`deepseek_vision` ツールが OpenAI 互換の任意の vision 経路から目を借りることで、モデルは実装がモックと一致するかを判断できます。これとともに、その判断の裏にあるベンチマーク(4 つの fixture、23 個の注入不具合、raw transcript)と、それが依拠する質問の規律も提供されます。
picturereader
jing-hy/picturereader
テキストのみのモデルのための画像「読み取り」:ダウンスケール+色深度削減+構造/色のフィンガープリントをテキストグリッドに変換して会話に戻すことで、モデルはマルチモーダルモデルのように自律的にズーム、サンプリング、OCR を行えます。完全にローカルで動作し、外部モデルへの依存はゼロ。画像読み取りの方法論スキルとオプションの PaddleOCR を同梱しています。
dsh-voice-scribe
pensivefei/dsh-voice-scribe
Web UI向け音声入力:Alt(またはAlt+Space)を押してディクテーションを開始/停止、ブラウザWeb Speech(ゼロ設定)またはOpenAI互換クラウドASR、DSH設定LLMによるオプションのポリッシュ、設定UI。
dsh-vision
oil-oil/dsh-vision
DeepSeek Harness にネイティブに近い画像理解機能を追加。
dsh-web-ui (dsh-tool-describe-image)
damonkoy/dsh-web-ui
視覚言語モデルを介してテキスト専用モデルに画像理解を提供、`describe_image` ツールとして公開。
dsh-ears
wiziscool/dsh-ears
DeepSeek Harness(dsh)向け音声入力プラグイン:コンポーザーのマイクボタンで音声を下書き転写に変換し、複数の音声認識バックエンドから選択可能で、dsh 独自の LLM ルートによる任意の推敲とネイティブ設定ページを備えています。
dsh-plugin-tts
1624318455/dsh-plugin-tts
無料のEdge TTSまたは独自のRVC音声モデルでアシスタントの返信を読み上げ:読み上げボタン+自動読み上げ、適応型チャンク分割によるプログレッシブ再生(長文もギャップレス)、レジストリからのボイスパックをワンクリックでインストール、ポータブルなRVCランタイムを提供。
dsh-media-skills
mjorgin/dsh-media-skills
テキスト専用モデル向けの無料ビジョンブリッジと画像生成:貼り付けた画像の読み取り、GLM-4V-FlashとGeminiエンジンのフェイルオーバー、ModLens方式の構造化エビデンス、およびシード付きの無料ビジョンモデルルート。
dsh-aigc-canvas
dsh-external/dsh-aigc-canvas
AIGC キャンバスプラグインです(cordis)。
dsh-talk
perrylink/dsh-talk
DeepSeek Harness の音声 I/O — マイク入力と音声出力による speech-to-text / text-to-speech。
dsh-visual-plugin
jyh20030112/dsh-visual-plugin
テキスト専用モデルに視覚機能を付与: ユーザーの画像を OpenAI 互換のビジョンモデルに転送し、その説明を Web UI の右パネルに表示します。
dsh-voice-mode (dsh-voice-mode)
qishuilalala/dsh-voice-mode
DeepSeek Harness Web UI 用のフルデュプレックス音声モード:トグル(2 秒ポーズで自動送信)またはプッシュトゥトークによるディクテーションを、編集可能なドラフトに zipformer2 ストリーミング ASR で入力、オプションでウェイクワード対応。Edge TTS によるセンテンス単位の読み上げとライブキャプション、話すと再生と実行中ターンを割り込みます(真のバージイン)。オンデバイス ASR で API キー不要。