現在
deepseek-chat/deepseek-reasonerというモデル名でAPIを呼び出している場合、この時刻以降は動作しなくなります(廃止後は互換的にdeepseek-v4-flashの非思考/思考モードに自動的に対応づけられますが、明示的に新モデル名へ切り替えることを強く推奨します)。本番環境で使用中の場合は今すぐコードを確認してください。出典:DeepSeek公式APIドキュメント(api-docs.deepseek.com、2026年7月23日確認)
2026年7月31日、DeepSeekは「DeepSeek-V4-Flash-0731」を公開ベータとして提供開始した。公式発表のエージェント系ベンチマークでは、Terminal Bench 2.1で82.7・NL2Repoで54.2・DeepSWEで54.4・Toolathlon Verifiedで70.3を記録し、V4 Pro Previewを上回るエージェント性能を公式に主張している(ただし公開コード系ベンチマークには非公開のDeepSeek Harnessや独自の推論設定が含まれるため、第三者評価と単純比較しないよう注意)。
一方でV4 Proは本記事執筆時点(2026年8月上旬)でもPreviewのままで、正式版(GA)は未リリース。以下の性能・料金比較は主にV4 Pro Previewおよび従来のV4-Flashの数値であり、V4-Flash-0731固有の詳細な仕様は今後追記予定。
2026年4月24日、DeepSeekが公開した「DeepSeek V4 Pro」は、コーディング系ベンチマーク3部門でGPT-5.4・Claude Opus 4.6・Gemini 3.1-Proを上回る、現時点で最強クラスのオープンウェイトAIモデルだ。総パラメータ1.6兆(アクティブ49B)のMoE構造で1Mトークンコンテキストを実用速度で処理し、MITライセンスで完全公開されている。本記事では技術アーキテクチャ・ベンチマーク実測値・料金比較・実装手順・日本企業導入時の論点まで徹底解説する。
📌 この記事でわかること
・DeepSeek V4 Proが「コーディング世界一」と言われる根拠(実測ベンチマーク値)
・4つのアーキテクチャ革新(Hybrid Attention / mHC / Engram Memory / Muon)の技術的中身
・V4-Pro と V4-Flash の正しい使い分け方
・公式API・各プロバイダー別の料金実態と最安構成
・米NIST傘下CAISIの評価レポートが示す「フロンティアとの実力差」の客観的読み方
・日本企業がDeepSeek V4を導入する際のデータガバナンス論点
・Cursor / Claude Code / Python SDKでの具体的な接続手順
1. DeepSeek V4 Proとは何か:まず3点で把握する
DeepSeek V4 ProはMoE(Mixture of Experts)型の大規模言語モデルで、2026年4月24日にプレビュー版としてリリースされた。最初に押さえるべき要点は次の3つだ。
- 規模:総パラメータ1.6兆/アクティブ49B/事前学習データ32Tトークン超/コンテキスト1Mトークン/最大出力384K
- 性能:LiveCodeBench 93.5・Codeforces 3206・IMOAnswerBench 89.8など、主要クローズドモデルを上回るベンチマーク値を複数部門で記録
- 公開性:MITライセンスの完全オープンウェイト(Hugging Faceで重み公開)。公式API料金は入力$0.435(キャッシュ未ヒット)・出力$0.87/100万トークン
同時公開されたV4-Flash(284B総パラ/13Bアクティブ)と組み合わせた二段構成が、コスト最適化の鍵になる。なお2026年7月31日には後継の「V4-Flash-0731」が公開ベータとして先行しており、最新状況は本記事冒頭の追記を参照してほしい。
V4-Pro と V4-Flash のスペック対比
| 項目 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ | 1.6T | 284B |
| アクティブパラメータ | 49B | 13B |
| コンテキスト長 | 1M tokens | 1M tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 推論モード | Thinking / Non-Thinking | Thinking / Non-Thinking |
| 並行実行数の上限 | 500 | 2500 |
| 得意用途 | 高難度コード・数学・複雑エージェント | 高頻度・低レイテンシ・コスト重視 |
| ライセンス | MIT | MIT |
| HuggingFace容量 | 865GB | 160GB |
deepseek-chat/deepseek-reasonerは2026年7月24日15:59 UTC(日本時間25日0:59)に廃止される。既存スクリプトはdeepseek-v4-proまたはdeepseek-v4-flash(non-thinking/thinking)への明示的な移行を推奨する(廃止後は自動的にdeepseek-v4-flashの各モードに対応づけられるが、意図しない挙動を避けるため早めの移行が安全)。
2. 4つのアーキテクチャ革新:V4がV3と根本的に異なる理由
V4 Proは単なるスケールアップではなく、インフラ自体を書き直している。4つの革新が相互に補完し合うことで、1.6Tという巨大なモデルを実用速度・実用コストで動かすことを可能にしている。
革新① Hybrid Attention(CSA + HCA)
従来のTransformerアテンションはO(n²)の計算量で、コンテキスト長が伸びると推論コストが爆発的に増加する。V4はこの問題を2種類のアテンションを組み合わせることで解決した。
- CSA(Compressed Sparse Attention):粗いフィルタリングで関連トークンを事前に絞り込む
- HCA(Heavily Compressed Attention):絞り込んだ領域に対して高密度な注意計算を集中させる
結果として、1Mトークン入力時のFLOPsをV3.2比で27%に、KVキャッシュを10%に圧縮。「理論上は読めるが遅すぎて使えない」だった長コンテキスト処理が、本番運用に耐える速度とコストで実現された。
革新② Manifold-Constrained Hyper-Connections(mHC)
深層MoEモデルでは、層を重ねるほど残差接続の信号が歪み、勾配消失・爆発が起きやすくなる。mHCはSinkhorn-Knoppアルゴリズムを用いて接続行列を数学的多様体(manifold)に射影し、信号増幅を1.6倍以内に制御する。
これにより、従来は不安定化しがちな1兆パラメータ超スケールでも安定した学習が可能になった。残差ストリームの幅を4倍に拡大しても学習時間のオーバーヘッドはわずか6.7%という効率性も特徴だ。
革新③ Engram Conditional Memory
人間の脳の「記憶痕跡(エングラム)」に着想を得た技術で、モデルが持つ「静的事実知識」と「推論・思考能力」を別々の経路で処理する。
実務上の意義は2点ある。第一に、長い文脈の中から関連情報を効率的に引き出せるためロングコンテキストの精度が向上する点。第二に、事実知識のアップデートにモデル全体の再学習が不要になるため、将来のバージョンアップコストが大幅に下がる点だ。
革新④ Muon Optimizer
DeepSeek自社開発の最適化アルゴリズムで、従来のAdamWより収束が速く学習が安定している。兆単位のパラメータを扱うスケールで同じ計算リソースからより深い学習を引き出すことが可能で、32Tトークンの事前学習を実現した背景技術の一つだ。
3. ベンチマーク完全比較:得意・不得意を両方見る
V4-Proのベンチマーク数値は印象的だが、全領域でトップではない。得意・不得意を把握した上でモデルを選定することが重要だ。なお以下の数値は基本的にThinking Maxモード(最大推論強度)での測定値で、いずれも2026年4月のプレビュー版公開時点のもの。
コーディング系:V4-Proが3部門を制覇
| ベンチマーク | V4-Pro | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1-Pro | 1位 |
|---|---|---|---|---|---|
| LiveCodeBench | 93.5 | — | 88.8 | 91.7 | V4-Pro 🏆 |
| Codeforces Rating | 3206 | 3168 | — | 3052 | V4-Pro 🏆 |
| Apex Shortlist Pass@1 | 90.2 | 78.1 | 85.9 | 89.1 | V4-Pro 🏆 |
| SWE-bench Verified | 80.6–82.1 | — | 80.8 | 80.6 | 同率1位 |
| Terminal-Bench 2.0 | 67.9 | 75.1 | 65.4 | 68.5 | GPT-5.4 |
LiveCodeBench(毎月問題更新でデータ汚染を防ぐ)で93.5、競技プログラミングのCodeforcesでIGM(国際特級マスター)レベルに相当する3206を記録。コーディング用途では現状最強の選択肢の一つと言える。ただし多段階ツールチェーンを評価するTerminal-Benchではまだ遅れがある。
数学・推論系:首位争いに参加、ただし全勝ではない
| ベンチマーク | V4-Pro | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1-Pro | 1位 |
|---|---|---|---|---|---|
| IMOAnswerBench | 89.8 | 91.4 | 75.3 | 81.0 | GPT-5.4(V4-Proは2位) |
| HMMT 2026 | 95.2 | 97.7 | 96.2 | — | GPT-5.4 |
| MMLU-Pro(一般知識) | 87.5 | 87.5 | 89.1 | 91.0 | Gemini 3.1-Pro |
| MATH | 92% | — | — | — | — |
| HumanEval | 90% | — | — | — | — |
数学オリンピックレベルのIMOAnswerBenchでClaudeを14ポイント以上引き離している点は特筆に値する。一方、MMLU-Proのような一般知識の問答ではGeminiに及ばず、最難関の数学整合性ではGPT-5.4がリードしている。
ユースケース別「どのモデルを選ぶか」フロー
| 用途 | 推奨モデル | 理由 |
|---|---|---|
| コード生成・レビュー・リファクタリング | V4-Pro | LiveCodeBench/Codeforces 1位 |
| 競技プログラミング・アルゴリズム | V4-Pro | Codeforces 3206(IGMレベル) |
| 数学・STEM推論 | V4-Pro(またはGPT-5.4) | IMO 2位だがClaudeを大幅リード |
| 大規模コードベース全体の読解 | V4-Pro | 1Mコンテキスト実用速度で動作 |
| 多段階エージェントチェーン | GPT-5.4 | Terminal-Bench リード |
| 一般知識Q&A・雑学 | Gemini 3.1-Pro | MMLU-Pro 91.0でトップ |
| 日本語文書作成・敬語処理 | Claude/GPT-5.4 | 自然な日本語はまだリード |
| 高頻度・低コストAPI処理 | V4-Flash | Proの約1/3のコスト・並行実行数5倍 |
4. 1Mトークンコンテキストが変える実務
コンテキスト長の拡張は単なるスペック向上にとどまらず、業務フロー自体を変える。
| タスク | V3.2時代(128K前後) | V4-Pro時代(1M) |
|---|---|---|
| 大規模コードリポジトリの監査 | ファイルを分割して個別に処理、関係性の見落としリスク | 全ファイルを一括投入してファイル横断の整合性チェックが可能 |
| 200ページの技術仕様書への問答 | RAGの構築が必要 | ドキュメントをそのまま貼り付けて即質問 |
| M&Aデューデリジェンス資料の分析 | 数日かかる手作業が必要 | 複数の契約書・財務資料を一括分析 |
| 長編小説・コンテンツの整合性確認 | 記憶管理が必要 | 384K出力と組み合わせて全体を把握しながら執筆 |
5. 推論モードの3段階:Thinkingをどう使うか
V4-ProとV4-Flashの両方で、推論強度を3段階から選択できる。ベンチマーク上の高得点はすべてThinking Maxモードでの値だ。
| モード | 用途 | 応答速度 | コスト感 |
|---|---|---|---|
| Non-Thinking | FAQ・分類・抽出・チャットボット | 最速 | 最安 |
| Thinking(標準) | 一般的なコード生成・要約・分析 | 中速 | 中程度 |
| Thinking Max(V4-Pro-Max) | 競技プログラミング・数学証明・複雑エージェント | 低速 | 高め |
6. 料金完全比較:公式APIから各プロバイダーまで
公式DeepSeek API(2026年7月23日確認・最新)
| モデル | 入力(キャッシュヒット/1Mトークン) | 入力(キャッシュ未ヒット/1Mトークン) | 出力(/1Mトークン) |
|---|---|---|---|
| V4-Pro | $0.003625 | $0.435 | $0.87 |
| V4-Flash | $0.0028 | $0.14 | $0.28 |
出典:DeepSeek公式APIドキュメント「Models & Pricing」(api-docs.deepseek.com、2026年7月23日確認)。旧「$1.74/$3.48」という価格表記は現在確認できず、上記が現行価格。
APIプロバイダー別比較(Thinking Maxモード)
| プロバイダー | ブレンド価格(/1M) | 出力速度 | TTFT | 特徴 |
|---|---|---|---|---|
| Fireworks | $2.17 | 174 t/s | ~1秒 | 速度・レイテンシ最速 |
| DeepInfra(FP4) | $2.17 | 34.2 t/s | ~1.2秒 | 本番安定性・推奨構成 |
| Novita | $2.17 | 33.5 t/s | — | コスト並び |
| Together.ai | $2.67 | 52.1 t/s | ~1秒 | サブ秒レイテンシ唯一 |
| 公式DeepSeek | $2.17 | 33.9 t/s | 128秒 | 初回レスポンスが遅い |
| OpenRouter | $0.435〜 | — | — | ルーティング後の実効値に注意 |
上記プロバイダー別比較は2026年5月時点の第三者計測値。プロバイダーの料金・速度は変動するため、最新値は各社公式サイトで確認のこと。
コスト重視の本番構成はDeepInfra(FP4)が定番。速度重視ならFireworks。GPT-5.4比で大幅に低いコストで同等以上のコーディング性能が得られるのが最大の訴求点だ。
7. 米NIST・CAISI評価レポートが示すもの
2026年5月、米国標準技術研究所(NIST)傘下のAI標準・革新センター(CAISI)がDeepSeek V4 Proを評価したレポートを公開した。
- 評価結果:「これまで評価した中で最も高性能な中国発モデル」と認定
- フロンティアとの差:米国最先端モデルと比較して約8ヶ月分の差があるとCAISIは分析
- 評価5分野:サイバー/ソフトウェアエンジニアリング/自然科学/抽象推論/数学
- 使用ベンチマーク:ARC-AGI-2・PortBench(内部構築)を含む9種類、35モデルで比較
8. 日本語性能と日本企業導入時の論点
日本語性能の実態
- 多言語対応で日本語の基本的な読解・生成は可能
- ビジネス文書の要約・翻訳・コード生成での利用実績あり
- 敬語の自然さや文脈的なニュアンスでは、Claude・GPT-5.4が依然リード
- 技術文書・コードコメントの日本語については十分な水準
データガバナンスと企業導入のリスク管理
| 業種・状況 | 推奨アプローチ |
|---|---|
| 機密性の低いコード生成・外部公開情報の分析 | 公式API・OpenRouterで即利用可 |
| 社内文書・個人情報を含む処理 | Hugging Faceからセルフホスト、またはTogether.ai等の国内/中立プロバイダー経由 |
| 金融・医療・法務など高機密業種 | オンプレミス構築を推奨(≥8×H200相当が必要) |
| 中小企業でコスト重視 | V4-Flash×クラウドAPI、まず非機密タスクで試験導入 |
9. 実装ガイド:API接続からIDEまで
Python SDK(OpenAI互換)での基本接続
client = OpenAI(
api_key=”your-deepseek-api-key”,
base_url=”https://api.deepseek.com/v1″,
)
# Non-Thinkingモード(高速・低コスト)
response = client.chat.completions.create(
model=”deepseek-v4-pro”,
messages=[
{“role”: “system”, “content”: “あなたはシニアエンジニアです。”},
{“role”: “user”, “content”: “Pythonで非同期のレートリミッターを実装してください。”},
],
max_tokens=4096,
)
print(response.choices[0].message.content)
Thinkingモードの有効化(高難度タスク向け)
response = client.chat.completions.create(
model=”deepseek-v4-pro”,
messages=[
{“role”: “user”, “content”: “以下のコードのバグを全て検出し、修正版を提示してください。\n\n{コード}”},
],
extra_body={
“reasoning”: {“enabled”: True, “effort”: “high”},
},
max_tokens=16384,
)
# 思考プロセスと最終回答を別々に取得
print(“— 推論過程 —“)
print(response.choices[0].message.reasoning_content)
print(“\n— 最終回答 —“)
print(response.choices[0].message.content)
CursorへのV4-Pro導入
Settings → Models → Custom OpenAI-Compatible から以下を設定する。
- Base URL:
https://api.deepseek.com/v1 - API Key:DeepSeek APIキー
- Model Name:
deepseek-v4-pro
Claude Code(Anthropic SDK互換)での利用
DeepSeek V4はAnthropicプロトコルにも対応している。環境変数を以下のように設定することで、Claude CodeのバックエンドをV4-Proに切り替えられる。
ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropicANTHROPIC_API_KEY=your-deepseek-key- モデル指定:
deepseek-v4-pro
10. ローカル実行の要件
| 構成 | 必要環境 | 用途 |
|---|---|---|
| V4-Pro フル精度 | ≥8×H200(またはH100)クラスタ | エンタープライズ本番環境 |
| V4-Flash フル精度 | 160GB/複数GPU | 中規模サービス |
| V4-Flash 量子化版 | 128GB M5 MacBook Pro(将来的に実行可能性) | 個人開発・検証 |
月間処理量が数百億トークンに達しない限り、自前でデプロイするよりクラウドAPIを使う方が経済的だ。セルフホストが本当に得になるのは、データガバナンス上の理由でクラウドAPIを使えないケースが主だ。
11. よくある質問
Q0. 旧モデルID(deepseek-chat/deepseek-reasoner)はいつ廃止されますか?
A. DeepSeek公式APIドキュメントによれば、2026年7月24日15:59 UTC(日本時間25日0:59)に廃止される。廃止後はdeepseek-v4-flashの非思考/思考モードに互換的に対応づけられるが、意図しない挙動を避けるため、本番環境では今すぐ新モデル名(deepseek-v4-proまたはdeepseek-v4-flash)への明示的な切り替えを推奨する。
Q0-2. DeepSeek V4は正式版(GA)になりましたか?
A. 2026年8月上旬時点では、V4-Pro・V4-Flashともに公式な正式版(GA)はアナウンスされていない。ただし2026年7月31日、V4-Flashの後継として「DeepSeek-V4-Flash-0731」が公開ベータとして提供開始されており、Preview版より一歩先に進んでいる状態だ。V4 Proは引き続きPreviewのままで、GA移行時期は未定。両者の版が混在しているため、比較記事や社内資料を作る際は「どの版のベンチマーク値か」を必ず確認してほしい。
Q1. DeepSeek V4 Proは日本語で使えますか?
A. 日本語のテキスト生成・翻訳・要約には対応している。技術文書やコードのコメント生成では十分実用的だが、日本語の自然さや敬語の精密さではClaudeやGPT-5.4が依然として優位だ。日本語が主なユースケースの場合は、実際のタスクで比較検証をおすすめする。
Q2. 無料で使えますか?
A. chat.deepseek.comのWebインターフェースは無料で利用できる。API利用は従量課金制で、2026年7月23日時点でV4-Proは入力$0.435・出力$0.87/100万トークン(キャッシュ未ヒット時)。オープンウェイトモデルとして重みも公開されているが、ローカル実行には大規模なGPU環境が必要だ。
Q3. データは中国に送られますか?セキュリティリスクは?
A. 公式DeepSeek APIを利用すると、データは中国サーバーを経由する。機密情報・個人情報を扱う場合は、①Hugging FaceからセルフホストするかTogether.aiなどの中継プロバイダーを使う、②社内AIポリシーで使用可能なデータの分類を決める、の2点が重要だ。
Q4. GPT-5.4やClaudeより優れていますか?
A. 一概には言えない。コーディング(LiveCodeBench/Codeforces/Apex)では現状最上位クラスで、GPT-5.4やClaudeを上回る数値が出ている。一方、多段階エージェントチェーン(Terminal-Bench)や一般知識(MMLU-Pro)はそれぞれGPT-5.4・Geminiが優位だ。米NIST傘下のCAISI評価では5分野の総合スコアでフロンティアと約8ヶ月の差があるとされている。
Q5. V4-ProとV4-Flashはどう使い分けるべきですか?
A. コーディング・数学証明・長文分析など高難度タスクにはV4-Pro(特にThinking Max)、チャットボット・分類・抽出など高頻度で速度が重要なタスクにはV4-Flashが適している。同じAPIキーでモデル名を切り替えるだけで移行できるため、タスクごとにルーティングするハイブリッド構成が最もコスパの良い使い方だ。
Q6. Thinkingモードはいつ使うべきですか?
A. 競技プログラミング・数学の証明・複雑なバグ修正・マルチステップの論理推論など、「深く考える必要がある」タスクで有効。通常の会話・要約・翻訳ではNon-Thinkingモードの方が速く安い上、品質の差はほぼない。ベンチマーク値はすべてThinking Maxモードの数値である点に注意してほしい。
Q7. ローカルで動かすにはどんなPC・サーバーが必要ですか?
A. V4-Proのフルモデルは865GBあり、実行には8枚以上のH200/H100クラスタが必要。V4-Flash(160GB)であれば比較的小規模なGPU環境でも動作する。量子化した軽量版は将来的に128GB M5 MacBook Proでの実行も期待されているが、現時点では個人PCでの実用は難しい。
Q8. 企業での導入はどう進めるべきですか?
A. 段階的なアプローチが有効。まずAPIで非機密のタスク(外部公開コードの生成・公開情報の分析)から試験導入し、性能・コストを既存モデルと比較する。効果が確認できたら対象タスクを拡大し、機密データを扱う用途が出てきた段階でセルフホストやプライベートAPIの構築を検討するという流れが現実的だ。
12. まとめ
DeepSeek V4 Proは「オープンウェイト最強のコーディングAI」として登場した。1.6Tというオープンモデル史上最大規模のパラメータを持ちながら、Hybrid Attention/mHC/Engram Memory/Muon Optimizerという4つのアーキテクチャ革新によって実用速度・実用コストで動作する。2026年7月31日にはV4-Flashの後継ベータが先行公開されており、Proの正式版(GA)も今後控えている。
ただし「コーディングで最強だからすべてに使う」という発想は非効率だ。多段階エージェント・一般知識・日本語の自然さという領域では他モデルがまだ優位に立っている。V4-Proをコーディング・数学・大規模コンテキスト処理に集中させ、V4-FlashやClaudeを用途に応じて組み合わせるマルチモデル体制が、2026年現在のAI活用の最適解だ。GLM-5.2・Kimi K2.5等の他の主要モデルとの比較はAIモデル使い分け完全ガイドで整理している。
- 本番環境でdeepseek-chat/deepseek-reasonerを使っている場合、廃止(7月24日15:59 UTC)前に新モデル名へ切り替える
- chat.deepseek.com のExpert Mode(V4-Pro相当)で無料試用してみる
- 現在使っているAI APIのコスト試算と、V4-Flash移行での削減効果をシミュレーションする
本記事の情報は2026年5月時点の内容に、2026年7月23日時点でDeepSeek公式APIドキュメントを確認して料金・モデルID廃止日を訂正・更新し、さらに2026年8月4日時点でV4-Flash-0731公開ベータの情報を追記したものです。DeepSeek V4は本記事執筆時点でV4 Proがプレビュー版の位置づけであり、正式版(GA)移行に伴い仕様・料金・ベンチマーク比較対象が変更される可能性があります。最新情報は必ずDeepSeek公式サイト(api-docs.deepseek.com)および各APIプロバイダーの公式ドキュメントでご確認ください。
