メインコンテンツへスキップ

ビジョン、音声とマルチモーダル

ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。

312 件のプラグインが見つかりました

F

dsh-vision-proxy

flyvhidbwo/dsh-vision-proxy

DeepSeek ブレイン + 自動画像文字起こし:GUI で画像を添付すると、デフォルトで公式の deepseek-v4-flash-vision-exp により文字起こしされます(純粋テキストの V4-Pro ブレインも画像を見ることができます)。代替として、任意の OpenAI 互換 VLM またはローカル Ollama も使用可能。

15先月ビジョン、音声とマルチモーダルMIT
D

dsh-video-lens

dundunhan/dsh-video-lens

テキストのみの DeepSeek Harness エージェントに動画理解能力を付与:シーン認識フレームサンプリング + VLM + オプションの ASR 文字起こしをタイムラインエビデンスに融合。/ 純テキストモデル用の動画理解プラグイン(シーン感知抽フレーム + VLM + オプション音声転写)

13先月ビジョン、音声とマルチモーダルMIT
P

dsh-vision-opencode

poiuyjie/dsh-vision-opencode

テキスト専用のメインモデルに設定可能なビジョンモデルを追加: vision_read_image ツール、コンポーザーバーのビジョンモデル選択、テキスト専用ルート向けの画像からテキストへの自動変換。

1323 日前ビジョン、音声とマルチモーダルMIT
Z

dsh-agnes-studio

zmm863-commits/dsh-agnes-studio

フローティングの DSH パネルとしての AI 画像・動画スタジオ。会話を置き換えるのではなく並行して制作できます:テキストから画像、画像から画像、複数画像の合成を 1K〜4K、8 種類のアスペクト比で。テキストから動画、画像から動画は 4〜12 秒で先頭フレームを制御。ショートドラマモードは台本(.txt/.md/.json)を読み込み、絵コンテショットに分割してプレビューと一括生成を行います。プロンプトエキスパート用ワークスペースも搭載。ランタイム依存はゼロです。

123 日前ビジョン、音声とマルチモーダル
B

dsh-voice-ai-girlfriend-plugin

beiyege-01/dsh-voice-ai-girlfriend-plugin

Web UI 向けの音声 AI ガールフレンド:FunASR のマイク入力、Qwen3-TTS の音声応答、コンパニオンアニメーションウィンドウ、NapCat 経由の双方向 QQ チャット(テキスト/音声/画像送信)。

1219 日前ビジョン、音声とマルチモーダル
P

dsh-plugin-xiaomi-mimo-tts

ppy-web/dsh-plugin-xiaomi-mimo-tts

DSH Web に Xiaomi MiMo のテキスト読み上げを追加します。アシスタントメッセージの読み上げ、PCM ストリーミング、プリセットおよびカスタムの音声デザイン、ブラウザ音声へのフォールバック、再生コントロール、任意の UI サウンドを備えます。

113 日前ビジョン、音声とマルチモーダルMIT
A

dsh-speak

alan2z/dsh-speak

依存関係ゼロ、イベント駆動の音声通知プラグイン: 追加モデル不要、トークンコスト不要。システム内蔵のナチュラル音声で読み上げ、WindowsとmacOSの両方に対応。最終応答の通知、承認・質問アラート、オプションのイベント通知(ターン終了、コマンド完了、目標変更、ツールエラー、Todo更新)、最終応答のリプレイ機能、ビジュアル設定ページはバイリンガル対応。

117 日前ビジョン、音声とマルチモーダルMIT
C

Gemini-Eyes

consolesun/gemini-eyes

gemini.google.comへのMCPブリッジ:画像・動画のビジョン解析、Imagen画像生成とVeo動画生成、そしてAPIキー不要でログイン済みブラウザセッションを利用した会話管理。

11先月ビジョン、音声とマルチモーダル
P

dsh-draw

perrylink/dsh-draw

複数エンジンの text-to-image generation(OpenAI Images と Zhipu CogView の presets)。session ごとの quota tracking、engine failover、credential-safe config、再生成付きの結果カードを備える。

98 日前ビジョン、音声とマルチモーダルApache-2.0
S

dsh-deepseek-vision

siegfly/dsh-deepseek-vision

ビジョン言語ゲートウェイのプロバイダールート:貼り付けられた画像はDeepSeekに送られる前に、設定可能なVLモデル(デフォルトはQwen-VL)によって説明文が生成されます。

922 日前ビジョン、音声とマルチモーダルMIT
L

dsh-vision

linenxi-ctrl/dsh-vision

DeepSeek Harness 向け外部ビジョンプラグイン: クジラボタンの設定パネル、自動返信付き画像認識、エージェント用スクリーンショット/認識ツール。

92 か月前ビジョン、音声とマルチモーダルMIT
A

dsh-highres-vision

azwosile/dsh-highres-vision

DeepSeek Harness ネイティブのビジョンモデル deepseek-v4-flash-vision-exp 向けに、画像の受付上限を 32 MiB / 8192 px / 600 枚に引き上げ、大きな画像をタイル分割し、ホストの read_image ツールを通じて画像全体と 800x800 のタイルを返す highres_read ツールを追加します。

822 日前ビジョン、音声とマルチモーダルMIT
G

dsh-voice

goodandready/dsh-voice

Web UI向け音声入力:無音区間で分割するディクテーションと音声メッセージを提供し、それぞれに独自のプロバイダーフォールバックチェーン(Deepgram、Groq、HuggingFace、ローカルwhisper.cpp、またはOpenAI互換エンドポイント)があります。

8昨日ビジョン、音声とマルチモーダルMIT
3

dsh-voice

3274375092/dsh-voice

DeepSeek Harness用音声入力:マイクに向かって話すと、認識されたテキストが通常のチャットメッセージとして送信されます。ローカルまたはブラウザ音声認識を利用。

8一昨日ビジョン、音声とマルチモーダルMIT
F

dsh-free-vision

fuzzysoul/dsh-free-vision

テキスト専用モデル用フリービジョンブリッジ:無料ティアプロバイダー(Qwen3-VL-Flash、Doubao、DeepSeek-OCR)による画像理解、OCR、UIおよびデバッグ分析、設定GUI付き。

8先月ビジョン、音声とマルチモーダルMIT
C

dsh-chat-imagine

corrinehu/dsh-chat-imagine

APIチャネルまたはローカルCLI(mmx / codex / agy)を通じてDSHチャット内で画像を自動生成・表示し、対応CLIを使用して画像認識も行えます。

8先月ビジョン、音声とマルチモーダルMIT
S

dsh-tool-vision

scorp1o117/dsh-tool-vision

ローカル画像または HTTP(S) 画像 URL を、設定済みの OpenAI compatible vision endpoint に inspect_image tool で送信し、そのテキスト応答を会話に返す。

83 日前ビジョン、音声とマルチモーダル
W

dsh-appshots

wongyuye/dsh-appshots

macOSおよびWindows上のDSH Desktop向けCodexスタイルのウィンドウキャプチャ:両方のCommandキー(macOS)または両方のCtrlキー(Windows)を押す、もしくはカメラボタンで、最前面のウィンドウを撮影し、現在のチャットに添付して、VoiceOverスタイルのアクセシビリティツリーを隠しコンテキストとして注入します。

715 日前ビジョン、音声とマルチモーダルMIT
5

dsh-vision

54xkeee/dsh-vision

テキストのみのDeepSeekにビジョン機能を追加、デフォルトはDoubao Web経由(無料・APIキー不要——WindowsのCDPブリッジ経由でログイン済みのChromeを操作)、Antigravity IDEのクォータ(flash/pro)またはGeminiへのフォールバックにも対応。詳細レベルの自動エスカレーション、圧縮後の再水和に対応したビジョン証跡メモリ、コンテンツハッシュキャッシュ、バイリンガルのクライアントパネルを備える。

72 か月前ビジョン、音声とマルチモーダルMIT
Y

dsh-duet

yums/dsh-duet

DSH Web向けのフルデュプレックス中国語音声インタラクション:タスクの口述と編集、リクエストの送信、セッション管理、DSHの質問への回答、そして簡潔なタスク完了アナウンスを聞くことができます。

63 日前ビジョン、音声とマルチモーダルApache-2.0
Y

deepseek-harness-plugins (vision-bridge)

yinxe/deepseek-harness-plugins

テキスト専用モデルに画像を見せられるようにします:[image omitted because this model accepts text only] のようなプレースホルダー付きで画像が届くと、モデルは vision_describe ツールを呼び、プラグインが画像参照と質問をマルチモーダルモデルへ転送し、失敗時はフォールバックモデルで再試行します。設定ページで構成し、公式の設定 API で永続化されます。

6一昨日ビジョン、音声とマルチモーダルMIT
Z

dsh-voice-input-plugin

zhangbo-cn/dsh-voice-input-plugin

Web UI向けコンポーザーマイク:タップでライブ文字起こしをモニターし、押している間話せるホールドトーク機能を提供します。モデルが生成している間にストリーミングされるホストのEdge TTSによる返信読み上げ、読み上げ中のエコー一時停止、タップで停止も備えています。

6先月ビジョン、音声とマルチモーダルMIT
G

dsh-ocr-local

grelvan/dsh-ocr-local

テキスト専用ルート用のローカルOCRフォールバック:セッションモデルが画像を受け付けないと宣言した場合、添付画像をローカルにキャッシュし、そのパスを注入してモデルがocr_imageを呼び出せるようにする—PP-OCRv5 + ONNX RuntimeをCPUで使用、APIキー不要、画像はマシンを離れない。モデルが画像を見える場合には無音。

55 日前ビジョン、音声とマルチモーダル
N

vision-exp-tile

nicholas023/vision-exp-tile

vision-expモデル用大画像認識:ロスレス800×800タイル認識(smart/pipeline/full)、前処理と手書きルーティング付きローカルOCR、DirectML/CUDA/OpenVINO対応のオプション複数ベンダーGPU(CPU自動フォールバック)。

5先月ビジョン、音声とマルチモーダルMIT