
News Observation Lab for Future
DeepSeek‑V4‑Flash‑Vision‑Exp の概要と利用手順

はじめに
DeepSeek‑V4‑Flash‑Vision‑Exp は、DeepSeek‑V4 系列で初めて実験的にマルチモーダル機能を組み込んだモデルです。DeepSeek‑V4‑Flash アーキテクチャに視覚モジュールを追加し、継続的な学習によって画像理解能力を獲得しています。
従来モデルとの比較
同じテキストエージェントタスクでは DeepSeek‑V4‑Flash‑0731 とほぼ同等の性能を保ちつつ、マルチモーダルエージェント能力が大幅に向上しました。
評価条件
テキストエージェントベンチマークは、DeepSeek Harness の最小構成で、最大推論努力レベル(temperature=1.0、top_p=0.95)で評価されています。ApexBench および Agents’ Last Exam では、DeepSeek‑V4‑Flash‑0731 が入力中のマルチモーダル要素を無視します。
リポジトリ構成
本リポジトリはトークナイザー、プロンプトエンコーディング参照、および DeepSeek‑V4 Flash Vision 用の最小 PyTorch 推論実装を含みます。
encoding/: OpenAI 形式のメッセージをモデルプロンプトへ変換するディレクトリinference/: 重み変換と最小推論実装、サンプルプロンプト例を格納- その他:
config.json,generation_config.json,model.safetensors.index.json,tokenizer.json,tokenizer_config.json
エンコーディングと推論は意図的に分離されており、プロンプトフォーマットは PyTorch に依存せず、推論側が明示的にエンコーディングモジュールをインポートします。シンボリックリンクは不要です。
プロンプトエンコーディング
OpenAI スタイルの JSON コンテンツブロックと、コンパクトな <image>path</image> テキスト表記の両方がサポートされています。inference/examples/ 配下の例は、どちらも同一のプロンプトとトークン ID を生成します。
最小推論
依存関係のインストール、チェックポイント変換、TXT/JSON 推論コマンドについては inference/README.md を参照してください。
vLLM での実行例
単一ノード(4×GB300)でモデルを提供するコマンド例です。
docker run --gpus all \
vllm/vllm-openai:deepseekv4-flash-vision deepseek-ai/DeePSeek-V4-Flash-Vision-Exp \
--kv-cache-dtype fp8 \
--block-size 256 \
--tensor-parallel-size 4 \
--tool-call-parser deepseek_v4 \
--enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--reasoning-config '{"reasoning_parser":"deepseek_v4","reasoning_start_str":"","reasoning_end_str":""}' \
--speculative-config '{"method":"dsspark","model":"deepseek-ai/DeePSeek-V4-Flash-Vision-Exp","num_speculative_tokens":3,"draft_sample_method":"probabilistic","enable_adaptive_verification":true}'
SGLang での実行例
DSPARK を有効化し、同一チェックポイントからターゲットとドラフトの重みを取得します。
sglng serve \
--model-path deepseek-ai/DeePSeek-V4-Flash-Vision-Exp \
--tp 4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.85 \
--host 0.0.0.0 \
--port 30000
ライセンス
本リポジトリはライセンス情報を含んでいます。
元記事: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp