メインコンテンツへスキップ

ビジョン、音声とマルチモーダル

ビジョン、音声とマルチモーダルプラグインは、DeepSeek-Harness(dsh)のテキスト専用 DeepSeek モデルに目、耳、そして声を与えます。貼り付けたスクリーンショットを智譜 GLM、Gemini、Doubao、あるいはローカルの Ollama で OCR・説明するビジョンツールとプロバイダールート、ブラウザの Web Speech API や Whisper 互換 API によるマイク音声入力、Edge TTS やカスタム音声による読み上げ、全二重の音声モード、画像・動画・音楽の生成ツールを探せます。

312 件のプラグインが見つかりました

B

dsh-ocr-local

balcoz/dsh-ocr-local

DeepSeek Harness用ローカルOCR:画像を貼り付け・添付し、PP-OCRv5 + ONNX Runtimeでテキストを取得、完全オフライン。TUI (cc-tui) およびWeb対応。

52 か月前ビジョン、音声とマルチモーダル
S

dsh-vision-bridge

sfyyy/dsh-vision-bridge

テキスト専用のDSHセッション向けオンデマンドビジョン:画像はマーカーに変換され、vision_describeツールが画像と質問のみをOpenAI互換のビジョンモデルに送信します

52 か月前ビジョン、音声とマルチモーダルMIT
0

dsh-voice-input

0nt-one/dsh-voice-input

コンポーザーツール列のマイクボタン: Web Speech API による音声テキスト変換(Chrome/Edge)、言語切替、オプションの自動送信、依存ゼロ。

52 か月前ビジョン、音声とマルチモーダルMIT
T

dsh-plugin-appshot

tauruswood/dsh-plugin-appshot

DSH 向け Codex Appshots: グローバルショートカットで最前面アクティブウィンドウをキャプチャし、コンポーザーにシームレスにマウントしてエージェントクエリに使用。

55 日前ビジョン、音声とマルチモーダルMIT
P

dsh-screenshot

paicat1/dsh-screenshot

DSH 向けゼロ依存画面キャプチャ:Lightweight — 依存ゼロ、バイナリゼロ;Stage & shoot — ワンクリックで全画面、ウィンドウレイアウト、隠れたウィンドウの hover-snap キャプチャ;Agent self-service — パスのみ配信;パスは普遍的で、modlens (任意) と組み合わせれば 1 コールで構造化証跡を取得可能。

525 日前ビジョン、音声とマルチモーダルMIT
A

dsh-guide-dog

atropinoltt/dsh-guide-dog

MiniMax駆動のマルチモーダルプラグイン:リアルタイム音声通話モード(ストリーミング会話、フローティングドックUI)、音声モードとマイク音声入力、さらに画像/動画/音楽/音声生成および視覚検査ツール。

52 か月前ビジョン、音声とマルチモーダルMIT
E

canvas-workbench

elangan1997-cmyk/canvas-workbench

ローカル画像生成ワークベンチ、購読料ゼロ:自分の API で画像生成(任意の OpenAI 互換インターフェース、購読料ゼロ)、キャンバスレイアウト+画像修正/消去/背景除去/OCR/ベクター変換、編集可能な PSD/AI 納品、Photoshop/Illustrator の画像レイヤー間で双方向ブリッジ

43 日前ビジョン、音声とマルチモーダルMIT
Y

dsh-tts-bridge

yuuyuko-uu/dsh-tts-bridge

小さなブラウザー拡張機能で操作される、DeepSeek Webページの組み込み読み上げ機能を使用してDSHの会話を読み上げます。

43 日前ビジョン、音声とマルチモーダル
C

dsh-cycle-image-gen

chengzzzi44/dsh-cycle-image-gen

OpenAI 互換の任意の images エンドポイントを利用する、DeepSeek Harness 向けの画像生成ツールです。Web UI にインラインのギャラリーを備えています。

422 日前ビジョン、音声とマルチモーダルMIT
V

tripo3d-plugin-dsh

vast-ai-research/tripo3d-plugin-dsh

DeepSeek Harness 向けの Tripo 3D スキルです。テキストプロンプトまたは参照画像から、tripo-cli 経由でエンジンにそのまま投入できる 3D アセットを生成します。テクスチャリング、リギング、リトポロジー、フォーマット変換を一度に実行できます。

424 日前ビジョン、音声とマルチモーダル
L

deepseek-vl-support

limccn/deepseek-vl-support

Claude Code、Codex、Agent Plugins クライアントで DeepSeek(テキスト専用)モデルに画像認識機能を付与:任意の OpenAI 互換 vision endpoint 経由で画像を説明します。

4先月ビジョン、音声とマルチモーダルMIT
L

screenshot-feedback-hook-mcp (dsh-plugin)

lkh081231/screenshot-feedback-hook-mcp

スクリーンショット取得ツールと2つの任意の自動キャプチャポイントを追加し、画面を画像ブロックとして会話に挿入します。画像対応モデルが必要です。

4先月ビジョン、音声とマルチモーダルMIT
A

dsh-pdf-reader

angeloszou/dsh-pdf-reader

ビジョンモデル向けコンテンツ認識PDF読み取りプラグイン:各ページを図(ベクターとラスター)、表、数式リスク、2段組みレイアウトについてプロファイルし、コンテンツ認識ハイブリッド抽出を適用、図・表・数式ページを高DPI領域クロップとしてレンダリング。ページレイアウト把握用の低解像度プレビューを提供し、指定領域を高解像度でレンダリング。エージェント向けに複数ツールとしてパッケージ化。

4先月ビジョン、音声とマルチモーダルMIT
N

dsh-hos-scrcpy

ns-zzj/dsh-hos-scrcpy

AI で HarmonyOS 搭載スマホを DSH Web UI から操作する: リアルタイム H.264 画面ミラーリング、マウスによるタッチとシステムキー、hilog ストリーミング、そしてモデルが画面を読み取り、UI コントロールの位置を特定してから、タップ、長押し、キー押下、文字入力を行える agentic tools を提供する。

4一昨日ビジョン、音声とマルチモーダルMIT
X

dsh-vision-hub (tool-vision)

xing666173/dsh-vision-hub

強化されたビジョンツールボックス:単一のOpenAI互換エンドポイントで駆動される14のピクセルレベルビジョンツール(describe、ground、detect、crop、pixel-diff、OCR、long-screenshot OCR、vectorize、colors、cutout、screenshot、present、materialize、html-screenshot)、クリーンな[图片: path]ブリッジマーカー、コンテンツ安全性分類、レート制限自動リトライを備える。

4先月ビジョン、音声とマルチモーダル
D

dsh-image-pathify

dami9527/dsh-image-pathify

テキスト専用モデルがチャットに貼り付けられた画像を扱えるようにします。ネイティブなヴィジョン体験、画像の一括表示、OpenAI互換の内蔵analyze_imageツールを提供。ヴィジョン対応モデルには影響しません。

48 日前ビジョン、音声とマルチモーダルMIT
S

dsh-voice

stardustlc666/dsh-voice

音声ツール:無料のedge-ttsニューラル音声合成、OpenAI互換のASR文字起こし、音声リスト、音声の一括プレビュー、ヘルス自己チェック。

412 時間前ビジョン、音声とマルチモーダルMIT
H

dsh-voice

haoku123/dsh-voice

Web UI向けのフルデュプレックス音声モード:タップで切り替えまたは押し続けでディクテーション(送信キーまたは`Ctrl`)、ライブキャプション付き、sherpa-onnx経由のホスト側SenseVoice ASR、文ごとの音声応答、話すことで再生と実行中のターンを中断(真の割り込み)。APIキー不要。

4先月ビジョン、音声とマルチモーダルMIT
F

dsh-chatvoice

fuzzysoul/dsh-chatvoice

Web UI向けの無料音声クローズドループ:ブラウザのSpeechRecognitionによるマイク入力で暫定結果をライブ表示し、さらに読み上げ用スピーカーボタンとアシスタント応答の自動読み上げを提供。設定不要でAPIキーも不要です。

42 か月前ビジョン、音声とマルチモーダルMIT
X

dsh-draw-router

xiaozhe7772222/dsh-draw-router

DeepSeek Harness (DSH) 向けの統合画像生成ルーター: 任意の OpenAI 互換エンドポイントから画像モデルを自動検出し、draw_image と draw_list_sources ツールを提供し、SenseNova、StepFun、Agnes、Qwen、Flux、SD、Imagen などをサポートする。

4先月ビジョン、音声とマルチモーダルMIT
N

free-vision-skill

niyongsheng/free-vision-skill

macOS Vision Frameworkによる完全ローカルでの画像理解とOCR: `ocr_image`(テキスト、表のレイアウト+座標)および`view_image`(シーン、顔、QR) — 複数の画像をWeb入力ボックスに貼り付けるか、path/URL/base64で渡せます。画像がMacから外部に送信されることはありません。

4先月ビジョン、音声とマルチモーダルMIT
G

deepseek-vision (dsh-plugin-deepseek-vision)

gou-gee/deepseek-vision

テキスト専用 DeepSeek 向け Vision MCP および DSH バンドル: analyze_image、analyze_clipboard、compare_images、vision_status ツール、ビジュアル設定ページ、デフォルトで無料 GLM-4.6V-Flash、結果キャッシュとレート制限トレランス。キーはログに残しません。

426 日前ビジョン、音声とマルチモーダルMIT
F

dsh-plugin-deepeye

favio8/dsh-plugin-deepeye

DeepSeek Harness(DSH)向け DeepEye ビジョンプラグイン: 画像説明、OCR、VQA、UI レイアウト、クリップボード分析。

42 か月前ビジョン、音声とマルチモーダル
H

dsh-her-eyes

huashenglian/dsh-her-eyes

AI が VLM(マルチモーダルモデル)を自動呼び出しして視覚分析を行えるようにする dsh プラグイン。

42 か月前ビジョン、音声とマルチモーダルMIT