メインコンテンツへスキップ

ビジョン、音声とマルチモーダル

ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。

312 件のプラグインが見つかりました

Z

dsh-web-ui (dsh-tool-describe-image)

zhu1090093659/dsh-web-ui

テキスト専用モデル向けの `describe_image` ビジョンツール: 画像(ローカルパス、URL、添付)は設定可能な OpenAI 互換のビジョンエンドポイントに送られ、返ってきたテキストだけがセッションに入る。

8k6 日前ビジョン、音声とマルチモーダルApache-2.0
D

ipollowork

devin-axis/ipollowork

iPolloWork HyperFrames Video Studio と 27 個の編集可能なビデオテンプレートを、DeepSeek Harness のネイティブな会話ビューとして提供します。

4.2k2 か月前ビジョン、音声とマルチモーダル
L

modlens

liustack/modlens

テキスト専用モデル向けのビジョンブリッジ: 画像を貼り付けると、構造化された JSON エビデンス(OCR、レイアウト、セマンティクス)を取得。

4.1k5 日前ビジョン、音声とマルチモーダルMIT
Y

dsh-vision-router

ysr666/dsh-vision-router

テキスト専用エージェント向けの無料ビジョン機能: キー不要の内蔵ビジョンチェーンとピクセルツール群(Q&A、グラウンディング、クロップ、ピクセル差分、カラー、OCR、SVG トレース、切り抜き、スクリーンショット)。画像を貼り付けるだけで使用可能。

1.1k昨日ビジョン、音声とマルチモーダルMIT
A

dsh-vision-toolkit

anionex/dsh-vision-toolkit

テキスト専用モデルに視覚機能を追加:画像を貼り付けると、モデルがVision Toolkitバリアントに切り替わり、画像Q&A、複数画像比較、ロングスクリーンショットOCR、スクリーンショットからのUI再現、要素グラウンディング、ピクセル差分に対応します。デフォルトではAPIキー不要で、作者がホストする無料サービスにより1マシンあたり1日100枚まで処理可能。独自の_provider_への切り替えも設定できます。

887一昨日ビジョン、音声とマルチモーダルMIT
T

tongflow

tong-io/tongflow

DeepSeek Harness(dsh)用 TongFlow スタジオプラグイン:撮影クルー形式のプロジェクトモデル、エージェント作成の TongFlow ワークフロー、決定論的メディア生成、埋め込みキャンバス。

870先月ビジョン、音声とマルチモーダルAGPL-3.0
S

dsh-image-gen

shanliuling/dsh-image-gen

DeepSeek Harness向けネイティブ対話型画像生成:エージェントに画像作成を依頼すると、生成から結果の会話内保持までを自動的に処理します。

5643 日前ビジョン、音声とマルチモーダルApache-2.0
O

watch-skill

oxbshw/watch-skill

DeepWatch の機能を、既存の DeepSeek Harness プロファイルにインストールできるようにします。

37818 日前ビジョン、音声とマルチモーダルMIT
D

dsh-imagegen

dickpy/dsh-imagegen

DSH Web GUI向けのAI画像生成:設定可能なOpenAI互換エンドポイント(gpt-image-2 / gpt-image-1 / dall-e-3)を介したテキストから画像、画像から画像への変換に対応、api_url/api_keyの設定カードとサイドバーの分割ペイン生成スタジオを備える。

99一昨日ビジョン、音声とマルチモーダルApache-2.0
F

dsh-comfyui

fandc520/dsh-comfyui

DeepSeek Harness からローカルまたはリモートの ComfyUI サーバーを操作:comfyui_run / comfyui_object_info / comfyui_workflow ツールで画像や動画を生成・編集。ワークフローライブラリ(グラフ抽出:コンポーネントごと/メインフロー/すべて)、解像度自動マッチング付きロードエリア、ライブキュー、SDXL と Wan 2.1 テンプレート、コンパニオンスキル、同一オリジンのメディアプロキシを備えます。

936 日前ビジョン、音声とマルチモーダルMIT
P

dsh-omi-voice

polinnizhong/dsh-omi-voice

DeepSeek Harness 用のチャット内読み上げ機能:自然な Doubao TTS ボイス(BYOK)で AI 返信をタップして読み上げ・一時停止・再開。コード・表・図は除外し、最終回答のみを読み上げます。ローカルエンジンで、プラグインは API キーを保持しません。

74先月ビジョン、音声とマルチモーダルMIT
C

deepseek-harness-video-director

chiphoton/deepseek-harness-video-director

🎬AI 監督:DeepSeek-Harness が演出する MiniMax-H3 動画生成プラグイン。🤖プロンプト以上。🪄キャンバス UI。

694 日前ビジョン、音声とマルチモーダルMIT
S

dsh-design-qa

sunxin-ai/dsh-design-qa

テキストのみのモデル向けデザイン忠実度 QA。`deepseek_vision` ツールが OpenAI 互換の任意の vision 経路から目を借りることで、モデルは実装がモックと一致するかを判断できます。これとともに、その判断の裏にあるベンチマーク(4 つの fixture、23 個の注入不具合、raw transcript)と、それが依拠する質問の規律も提供されます。

4426 日前ビジョン、音声とマルチモーダルMIT
J

picturereader

jing-hy/picturereader

テキストのみのモデルのための画像「読み取り」:ダウンスケール+色深度削減+構造/色のフィンガープリントをテキストグリッドに変換して会話に戻すことで、モデルはマルチモーダルモデルのように自律的にズーム、サンプリング、OCR を行えます。完全にローカルで動作し、外部モデルへの依存はゼロ。画像読み取りの方法論スキルとオプションの PaddleOCR を同梱しています。

373 日前ビジョン、音声とマルチモーダルMIT
P

dsh-voice-scribe

pensivefei/dsh-voice-scribe

Web UI向け音声入力:Alt(またはAlt+Space)を押してディクテーションを開始/停止、ブラウザWeb Speech(ゼロ設定)またはOpenAI互換クラウドASR、DSH設定LLMによるオプションのポリッシュ、設定UI。

343 日前ビジョン、音声とマルチモーダルMIT
O

dsh-vision

oil-oil/dsh-vision

DeepSeek Harness にネイティブに近い画像理解機能を追加。

242 か月前ビジョン、音声とマルチモーダルMIT
D

dsh-web-ui (dsh-tool-describe-image)

damonkoy/dsh-web-ui

視覚言語モデルを介してテキスト専用モデルに画像理解を提供、`describe_image` ツールとして公開。

222 か月前ビジョン、音声とマルチモーダルApache-2.0
W

dsh-ears

wiziscool/dsh-ears

DeepSeek Harness(dsh)向け音声入力プラグイン:コンポーザーのマイクボタンで音声を下書き転写に変換し、複数の音声認識バックエンドから選択可能で、dsh 独自の LLM ルートによる任意の推敲とネイティブ設定ページを備えています。

21昨日ビジョン、音声とマルチモーダルMIT
1

dsh-plugin-tts

1624318455/dsh-plugin-tts

無料のEdge TTSまたは独自のRVC音声モデルでアシスタントの返信を読み上げ:読み上げボタン+自動読み上げ、適応型チャンク分割によるプログレッシブ再生(長文もギャップレス)、レジストリからのボイスパックをワンクリックでインストール、ポータブルなRVCランタイムを提供。

216 日前ビジョン、音声とマルチモーダルMIT
M

dsh-media-skills

mjorgin/dsh-media-skills

テキスト専用モデル向けの無料ビジョンブリッジと画像生成:貼り付けた画像の読み取り、GLM-4V-FlashとGeminiエンジンのフェイルオーバー、ModLens方式の構造化エビデンス、およびシード付きの無料ビジョンモデルルート。

1912 日前ビジョン、音声とマルチモーダルMIT
D

dsh-aigc-canvas

dsh-external/dsh-aigc-canvas

AIGC キャンバスプラグインです(cordis)。

1722 日前ビジョン、音声とマルチモーダル
P

dsh-talk

perrylink/dsh-talk

DeepSeek Harness の音声 I/O — マイク入力と音声出力による speech-to-text / text-to-speech。

168 日前ビジョン、音声とマルチモーダルApache-2.0
J

dsh-visual-plugin

jyh20030112/dsh-visual-plugin

テキスト専用モデルに視覚機能を付与: ユーザーの画像を OpenAI 互換のビジョンモデルに転送し、その説明を Web UI の右パネルに表示します。

163 日前ビジョン、音声とマルチモーダルMIT
Q

dsh-voice-mode (dsh-voice-mode)

qishuilalala/dsh-voice-mode

DeepSeek Harness Web UI 用のフルデュプレックス音声モード:トグル(2 秒ポーズで自動送信)またはプッシュトゥトークによるディクテーションを、編集可能なドラフトに zipformer2 ストリーミング ASR で入力、オプションでウェイクワード対応。Edge TTS によるセンテンス単位の読み上げとライブキャプション、話すと再生と実行中ターンを割り込みます(真のバージイン)。オンデバイス ASR で API キー不要。

1510 時間前ビジョン、音声とマルチモーダルMIT