ビジョン、音声とマルチモーダル
ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。
312 件のプラグインが見つかりました
dsh-vision-proxy
flyvhidbwo/dsh-vision-proxy
DeepSeek ブレイン + 自動画像文字起こし:GUI で画像を添付すると、デフォルトで公式の deepseek-v4-flash-vision-exp により文字起こしされます(純粋テキストの V4-Pro ブレインも画像を見ることができます)。代替として、任意の OpenAI 互換 VLM またはローカル Ollama も使用可能。
dsh-video-lens
dundunhan/dsh-video-lens
テキストのみの DeepSeek Harness エージェントに動画理解能力を付与:シーン認識フレームサンプリング + VLM + オプションの ASR 文字起こしをタイムラインエビデンスに融合。/ 純テキストモデル用の動画理解プラグイン(シーン感知抽フレーム + VLM + オプション音声転写)
dsh-vision-opencode
poiuyjie/dsh-vision-opencode
テキスト専用のメインモデルに設定可能なビジョンモデルを追加: vision_read_image ツール、コンポーザーバーのビジョンモデル選択、テキスト専用ルート向けの画像からテキストへの自動変換。
dsh-agnes-studio
zmm863-commits/dsh-agnes-studio
フローティングの DSH パネルとしての AI 画像・動画スタジオ。会話を置き換えるのではなく並行して制作できます:テキストから画像、画像から画像、複数画像の合成を 1K〜4K、8 種類のアスペクト比で。テキストから動画、画像から動画は 4〜12 秒で先頭フレームを制御。ショートドラマモードは台本(.txt/.md/.json)を読み込み、絵コンテショットに分割してプレビューと一括生成を行います。プロンプトエキスパート用ワークスペースも搭載。ランタイム依存はゼロです。
dsh-voice-ai-girlfriend-plugin
beiyege-01/dsh-voice-ai-girlfriend-plugin
Web UI 向けの音声 AI ガールフレンド:FunASR のマイク入力、Qwen3-TTS の音声応答、コンパニオンアニメーションウィンドウ、NapCat 経由の双方向 QQ チャット(テキスト/音声/画像送信)。
dsh-plugin-xiaomi-mimo-tts
ppy-web/dsh-plugin-xiaomi-mimo-tts
DSH Web に Xiaomi MiMo のテキスト読み上げを追加します。アシスタントメッセージの読み上げ、PCM ストリーミング、プリセットおよびカスタムの音声デザイン、ブラウザ音声へのフォールバック、再生コントロール、任意の UI サウンドを備えます。
dsh-speak
alan2z/dsh-speak
依存関係ゼロ、イベント駆動の音声通知プラグイン: 追加モデル不要、トークンコスト不要。システム内蔵のナチュラル音声で読み上げ、WindowsとmacOSの両方に対応。最終応答の通知、承認・質問アラート、オプションのイベント通知(ターン終了、コマンド完了、目標変更、ツールエラー、Todo更新)、最終応答のリプレイ機能、ビジュアル設定ページはバイリンガル対応。
Gemini-Eyes
consolesun/gemini-eyes
gemini.google.comへのMCPブリッジ:画像・動画のビジョン解析、Imagen画像生成とVeo動画生成、そしてAPIキー不要でログイン済みブラウザセッションを利用した会話管理。
dsh-draw
perrylink/dsh-draw
複数エンジンの text-to-image generation(OpenAI Images と Zhipu CogView の presets)。session ごとの quota tracking、engine failover、credential-safe config、再生成付きの結果カードを備える。
dsh-deepseek-vision
siegfly/dsh-deepseek-vision
ビジョン言語ゲートウェイのプロバイダールート:貼り付けられた画像はDeepSeekに送られる前に、設定可能なVLモデル(デフォルトはQwen-VL)によって説明文が生成されます。
dsh-vision
linenxi-ctrl/dsh-vision
DeepSeek Harness 向け外部ビジョンプラグイン: クジラボタンの設定パネル、自動返信付き画像認識、エージェント用スクリーンショット/認識ツール。
dsh-highres-vision
azwosile/dsh-highres-vision
DeepSeek Harness ネイティブのビジョンモデル deepseek-v4-flash-vision-exp 向けに、画像の受付上限を 32 MiB / 8192 px / 600 枚に引き上げ、大きな画像をタイル分割し、ホストの read_image ツールを通じて画像全体と 800x800 のタイルを返す highres_read ツールを追加します。
dsh-voice
goodandready/dsh-voice
Web UI向け音声入力:無音区間で分割するディクテーションと音声メッセージを提供し、それぞれに独自のプロバイダーフォールバックチェーン(Deepgram、Groq、HuggingFace、ローカルwhisper.cpp、またはOpenAI互換エンドポイント)があります。
dsh-voice
3274375092/dsh-voice
DeepSeek Harness用音声入力:マイクに向かって話すと、認識されたテキストが通常のチャットメッセージとして送信されます。ローカルまたはブラウザ音声認識を利用。
dsh-free-vision
fuzzysoul/dsh-free-vision
テキスト専用モデル用フリービジョンブリッジ:無料ティアプロバイダー(Qwen3-VL-Flash、Doubao、DeepSeek-OCR)による画像理解、OCR、UIおよびデバッグ分析、設定GUI付き。
dsh-chat-imagine
corrinehu/dsh-chat-imagine
APIチャネルまたはローカルCLI(mmx / codex / agy)を通じてDSHチャット内で画像を自動生成・表示し、対応CLIを使用して画像認識も行えます。
dsh-tool-vision
scorp1o117/dsh-tool-vision
ローカル画像または HTTP(S) 画像 URL を、設定済みの OpenAI compatible vision endpoint に inspect_image tool で送信し、そのテキスト応答を会話に返す。
dsh-appshots
wongyuye/dsh-appshots
macOSおよびWindows上のDSH Desktop向けCodexスタイルのウィンドウキャプチャ:両方のCommandキー(macOS)または両方のCtrlキー(Windows)を押す、もしくはカメラボタンで、最前面のウィンドウを撮影し、現在のチャットに添付して、VoiceOverスタイルのアクセシビリティツリーを隠しコンテキストとして注入します。
dsh-vision
54xkeee/dsh-vision
テキストのみのDeepSeekにビジョン機能を追加、デフォルトはDoubao Web経由(無料・APIキー不要——WindowsのCDPブリッジ経由でログイン済みのChromeを操作)、Antigravity IDEのクォータ(flash/pro)またはGeminiへのフォールバックにも対応。詳細レベルの自動エスカレーション、圧縮後の再水和に対応したビジョン証跡メモリ、コンテンツハッシュキャッシュ、バイリンガルのクライアントパネルを備える。
dsh-duet
yums/dsh-duet
DSH Web向けのフルデュプレックス中国語音声インタラクション:タスクの口述と編集、リクエストの送信、セッション管理、DSHの質問への回答、そして簡潔なタスク完了アナウンスを聞くことができます。
deepseek-harness-plugins (vision-bridge)
yinxe/deepseek-harness-plugins
テキスト専用モデルに画像を見せられるようにします:[image omitted because this model accepts text only] のようなプレースホルダー付きで画像が届くと、モデルは vision_describe ツールを呼び、プラグインが画像参照と質問をマルチモーダルモデルへ転送し、失敗時はフォールバックモデルで再試行します。設定ページで構成し、公式の設定 API で永続化されます。
dsh-voice-input-plugin
zhangbo-cn/dsh-voice-input-plugin
Web UI向けコンポーザーマイク:タップでライブ文字起こしをモニターし、押している間話せるホールドトーク機能を提供します。モデルが生成している間にストリーミングされるホストのEdge TTSによる返信読み上げ、読み上げ中のエコー一時停止、タップで停止も備えています。
dsh-ocr-local
grelvan/dsh-ocr-local
テキスト専用ルート用のローカルOCRフォールバック:セッションモデルが画像を受け付けないと宣言した場合、添付画像をローカルにキャッシュし、そのパスを注入してモデルがocr_imageを呼び出せるようにする—PP-OCRv5 + ONNX RuntimeをCPUで使用、APIキー不要、画像はマシンを離れない。モデルが画像を見える場合には無音。
vision-exp-tile
nicholas023/vision-exp-tile
vision-expモデル用大画像認識:ロスレス800×800タイル認識(smart/pipeline/full)、前処理と手書きルーティング付きローカルOCR、DirectML/CUDA/OpenVINO対応のオプション複数ベンダーGPU(CPU自動フォールバック)。