CursorでDeepSeek V4と連携して費用を節約する
DeepSeekが2026年4月24日にプレビュー公開したDeepSeek-V4は、2026年7月20日に正式版(GA)へ移行しました。さらに2026年9月10日には新アーキテクチャのDeepSeek-V4.1-Flashが登場し、旧V4-Flash系を置き換えています。オープンソース最高水準のコーディング性能を誇りながら、GPT-5.6やClaude Fable 5の数十分の一〜百分の一のコストで利用できます。BYOKを使ってCursorに組み込み、費用を大幅に削減しましょう。
📌 この記事は2026年9月11日時点の情報に更新済みです。 2026年9月10日のDeepSeek-V4.1-Flash登場に伴うモデル名・料金体系の変更、およびV4-Pro段階的廃止(2026年9月14日〜)を反映しています。

DeepSeek V4 とは
DeepSeek V4はMixture-of-Experts(MoE)アーキテクチャを採用した大規模言語モデルです。2026年4月24日にプレビュー版として公開され、同時にAPIも提供開始されました。2026年7月20日に「正式版(GA / General Availability)」へ正式移行し、Agent能力・数学推理・コード生成の専用強化と、正式な商用課金体系(後述のピーク料金制)が導入されています。
さらに2026年9月10日、DeepSeekは新アーキテクチャファミリーの第一弾となるDeepSeek-V4.1-Flashを正式リリースしました。旧世代のV4-Flash / V4-Flash-Vision-Expを置き換えるモデルで、ネイティブなマルチモーダル(画像理解)対応、複数のベンチマークでV4-Proを上回る性能、そして大幅なコスト削減を同時に実現しています。
モデルラインナップ(2026年9月10日更新)
| モデル | 総パラメータ数 | 実行時アクティブ数 | コンテキスト長 | 用途 |
|---|---|---|---|---|
| deepseek-flash(DeepSeek-V4.1-Flash) | 5520億(MoEバックボーン) | Prefill 80億 / Decode 160億 | 1M tokens | 汎用・コーディング・エージェント・画像理解を含む高速処理全般 |
| deepseek-v4-pro(廃止予定) | 1.6兆 | 490億 | 1M tokens | 2026年9月14日以降、順次deepseek-flashへルーティング(後述) |
DeepSeek-V4.1-Flashは「Causal Encoder-Decoder(CED)」という新アーキテクチャを採用しており、40層のTransformerを20層のエンコーダー+20層のデコーダーに分割。デコーダーのKVキャッシュはエンコーダーの出力から生成されるため、トークンあたりのアクティブパラメータ数がPrefill時8B・Decode時16Bまで抑えられています。KVキャッシュのフットプリントも旧世代(V4-Flash)比でHBM使用量が1/4、SSD使用量が1/8に削減されました。
両モデルとも Thinking(推論)モード と Non-Thinkingモード を切り替えて利用できます。最大出力は384Kトークンです。
旧モデル名は廃止済み
| 旧モデル名 | 旧ルーティング先 | 廃止日 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(Non-Thinking) | 2026年7月24日 23:59(北京時間)廃止済み |
deepseek-reasoner |
deepseek-v4-flash(Thinking) | 2026年7月24日 23:59(北京時間)廃止済み |
deepseek-v4-flash |
現在は deepseek-flash(V4.1-Flash) へ自動ルーティング(エイリアスとして動作) | 2026年9月10日 廃止・エイリアス化 |
deepseek-v4-flash-vision-exp |
現在は deepseek-flash(V4.1-Flash) へ自動ルーティング(エイリアスとして動作) | 2026年9月10日 廃止・エイリアス化 |
⚠️ deepseek-v4-flash / deepseek-v4-flash-vision-exp は当面エイリアスとして動作しますが、DeepSeek公式は今後 deepseek-flash を正式名称として使うことを推奨しています。新規の連携では deepseek-flash を指定してください。
DeepSeek-V4-Proは段階的に廃止(2026年9月14日〜)
DeepSeek公式は、複数の第三者テストでV4.1-Flashが性能・コスト・速度・総処理時間の全てでV4-Proを上回ったとして、V4-Proの段階的廃止を発表しました。
-
2026年9月14日 12:00(北京時間・UTC 04:00)以降:
deepseek-v4-pro宛のリクエストは全て deepseek-flash(V4.1-Flash) へ、V4.1-Flashの料金体系でルーティングされます - この措置は、将来リリース予定の DeepSeek-V4.1-Pro が登場するまで継続される見込みです
- 現時点で
deepseek-v4-proを明示的に指定している連携がある場合、9月14日以降は実質的にV4.1-Flashが呼ばれることになるため、事前に動作確認をしておくと安心です
料金:V4.1-Flash登場でさらに値下げ(2026年9月10日改定)
DeepSeekは2026年6月29日にピーク料金制を導入し、2026年8月16日にはV4正式版向けの料金改定を実施しましたが、2026年9月10日のV4.1-Flash登場に合わせてFlash系の料金がさらに引き下げられました。ピーク/オフピークの時間帯区分自体は変更ありません。
- ピーク時間帯:平日 9:00〜12:00、14:00〜18:00(北京時間)= オフピーク価格の2倍
- オフピーク時間帯:上記以外の時間帯(土日・祝日を含む)
最新料金表(100万トークンあたり/円・ドル換算、2026年9月10日改定後)
DeepSeek公式の建値は米ドルです。参考として、2026年9月時点の実勢レート(1ドル≈153円)で円換算しています。
| モデル | 項目 | オフピーク($) | オフピーク(円) | ピーク時($) | ピーク時(円) |
|---|---|---|---|---|---|
| deepseek-flash(V4.1-Flash) | 入力(キャッシュヒット) | $0.003 | 約0.5円 | $0.006 | 約0.9円 |
| 入力(キャッシュミス) | $0.15 | 約23円 | $0.30 | 約46円 | |
| 出力 | $0.60 | 約92円 | $1.20 | 約184円 |
⚠️ V4.1-Flash登場前(2026年8月16日〜9月9日)は、旧V4-Flashが $0.22(オフピーク入力・キャッシュミス)/ $0.66(オフピーク出力)、V4-Proが $0.66 / $1.98 という水準でした。今回の改定で、旧V4-Proのオフピーク料金と比べて出力コストは約70%、入力(キャッシュミス)コストは約77%、キャッシュヒット入力は約86%の値下げとなっています。
deepseek-v4-proは2026年9月14日以降このV4.1-Flash料金へ統合されるため、事実上V4-Pro単体の料金表は近く廃止されます。正確な最新料金・現在のレートでの換算は必ず api-docs.deepseek.com/quick_start/pricing で確認してください。
主要モデルとの出力コスト比較(オフピーク時)
| モデル | 出力 1M tokens あたり(目安) |
|---|---|
| Claude Fable 5 | $50.00 |
| GPT-5.6 Sol | $30.00 |
| DeepSeek V4.1-Flash(deepseek-flash・オフピーク) | $0.60 |
以前の記事ではV4-ProとV4-Flashを分けて比較していましたが、V4-Proが2026年9月14日以降V4.1-Flashへ統合されるため、現在は実質的に単一モデル(deepseek-flash)での比較が意味を持ちます。それでも主要フラッグシップモデルの数十分の一〜百分の一のコストで運用できる点は変わりません。オフピーク時間帯を狙って大量ジョブを流せば、さらにコストを抑えられます。コーディングエージェントのように出力トークンが多いワークロードほど、時間帯選びの効果が大きく効いてきます。

参考:GPTの価格https://developers.openai.com/api/docs/pricing
DeepSeek V4 / V4.1-Flash のコーディング性能
正式版(V4-Pro GA、2026年8月13日)ではAgent能力・数学推理・コード生成に特化した追加チューニングが行われています。
- SWE-bench Verified:約85%前後
- LiveCodeBench:93%台(オープンソース最高水準)
- HumanEval Pass@1:約90%
さらに2026年9月10日公開のDeepSeek-V4.1-Flashについて、DeepSeek公式は複数の第三者・自社テストにおいてV4-Proを性能・コスト・速度・総処理時間の全てで上回る結果が出ていると発表しています。新しいCausal Encoder-Decoderアーキテクチャと大規模なRLポストトレーニングにより、V4-Pro以上のベンチマーク結果をより少ないアクティブパラメータ(Prefill 8B/Decode 16B)で達成しているとのことです。1Mトークンのコンテキストウィンドウにより、大規模なコードベース全体を一度に読み込んだアーキテクチャレビューや依存関係の解析も引き続き可能です。
既存フラッグシップ(Claude Fable 5やGPT-5.6 Sol)を全面的に上回るわけではありませんが、1/50〜1/100程度のコストでオープンソース最強クラスの性能を提供する、という位置付けはむしろ強まっています。
⚠️ 注意:CursorのThinkingモードは依然として非対応(2026年9月現在)
DeepSeek V4系のThinkingモードは、マルチターンのツール呼び出し後に reasoning_content を返す仕様を持ちます。Cursorはこの仕様にネイティブ対応しておらず、Thinkingモード(特にV4-Pro)をそのままCursorで使うとツール呼び出し時に400エラーになることがあります。
- Non-Thinkingモード(通常の補完、deepseek-flashなど)は問題なく動作します
- V4.1-Flashは新アーキテクチャのため、Thinkingモード利用時のCursor互換性について記事執筆時点でコミュニティ側の検証情報がまだ少ない状況です。V4-Pro向けに使われていたコミュニティ製の互換プロキシ(例:GitHub上の
yxlao/deepseek-cursor-proxy)がそのまま使えるかは未確認のため、最新のIssueやCursorフォーラムを確認してください。 - 手軽に済ませたい場合は、thinkingモードをオフにして
deepseek-flashを使うのが最も簡単です。 - 高度な推論を活用したい場合は、DeepSeek公式チャット のExpert Modeを別途利用するのも引き続き有効です。
APIキーの発行
- https://platform.deepseek.com/api_keys にアクセス
- ログイン後、「Create new API key」からキーを発行
- https://platform.deepseek.com/top_up でトークンをチャージ
使った分だけ購入するプリペイド方式です。
CursorへのDeepSeek V4系の登録手順
1. Cursorを起動して設定を開く
File → Preferences → Cursor Settings → Models
2. カスタムモデルを追加する
「+ Add model」をクリックし、以下のモデル名を追加します(deepseek-chat / deepseek-reasoner はすでに廃止されているため使用不可)。
deepseek-flash
deepseek-v4-pro / deepseek-v4-flash を既に登録している場合、当面はエイリアスとして動作しますが、2026年9月14日以降 deepseek-v4-pro は事実上V4.1-Flashを指すことになります。新規登録・移行の際は上記の deepseek-flash を使うのがおすすめです。
3. OpenAI互換エンドポイントを設定する
「Override OpenAI Base URL」に以下を入力します。
https://api.deepseek.com


DeepSeekはOpenAI互換のAPIエンドポイントを提供しているため、Base URLを差し替えるだけで動作します。Thinkingモードを使いたい場合は、上記のコミュニティプロキシを利用する場合に限り、Base URLをプロキシのローカルアドレスに向けます。
4. APIキーを入力してVerify
DeepSeekで発行したAPIキーを入力し、「Verify」ボタンで接続確認します。
エラーコードの参考
| コード | 原因 |
|---|---|
| 402 | 残高不足 |
| 400 | 存在しないモデル名、またはThinkingモードの reasoning_content 未対応によるエラー |
| 401 | APIキーが無効 |
エラーが出る場合は、他のモデル(gpt系など)のチェックを外してDeepSeekのみにすると解決することがあります。400エラーが出続ける場合は、まずThinkingモードをオフにして切り分けてください。
モデルの使い分け
V4-Proの段階的廃止(2026年9月14日〜)に伴い、現在はほぼ全てのユースケースで deepseek-flash(V4.1-Flash)を選べば問題ない状況になっています。
| ユースケース | 推奨モデル | 理由 |
|---|---|---|
| 複雑なリファクタリング・設計レビュー |
deepseek-flash(可能ならオフピーク時間帯に実行) |
公式発表ではV4-Pro以上の性能を、より低コストで達成。ピーク時は料金2倍なので時間帯を意識 |
| インライン補完・シンプルな質問 | deepseek-flash |
超低レイテンシ・超低コスト。ネイティブ画像理解にも対応 |
| 大量の自動化タスク・バッチ処理 |
deepseek-flash(オフピーク時間帯にスケジュール) |
キャッシュヒット時は$0.003/1Mと破格。夜間・早朝に回すとさらに割安 |
ローカルモデル
お使いのPCに強めのGPUが積んでいる場合はローカルモデルを利用するのも良い
To run DeepSeek-V4-Flash-0731 in full precision lossless, run Q8 (UD-Q8_K_XL), which is 162GB and only 7GB bigger than Q4 (UD-Q4_K_XL).
See our DeepSeek-V4 guide for quantization analysis and instructions.
You can now run DeepSeek-V4-Flash-0731 in Unsloth Studio with toggles for High and Max thinking.
⚠️ 上記は旧世代DeepSeek-V4-Flash-0731向けの情報です。新アーキテクチャのDeepSeek-V4.1-Flashの重みはHugging Faceで公開されたばかりで、Unsloth/llama.cpp/Ollama等のローカル推論ツール側の対応状況は記事執筆時点でまだ流動的です。ローカル実行を検討する場合は、各ツールの最新の対応状況を確認してください。
Huggin FaceのUnsloth(旧V4-Flash-0731向け)
DeepSeek-V4.1-Flash(公式・新アーキテクチャ)
Ollama(旧V4-Flash向け、V4.1-Flash対応は要確認)
ollama launch claude --model deepseek-v4-flash:cloud
まとめ
DeepSeek V4は2026年7月にGA(正式版)へ移行し、さらに2026年9月10日には新アーキテクチャのDeepSeek-V4.1-Flashが登場、オープンソースモデルとして最高水準のコーディング性能を持ちながら、主要フラッグシップモデルの数十分の一〜百分の一のコストで利用できるようになりました。
- 2026年9月10日、
deepseek-flash(DeepSeek-V4.1-Flash)が正式リリース。旧deepseek-v4-flash/deepseek-v4-flash-vision-expは廃止され、当面エイリアスとしてV4.1-Flashへルーティング - 2026年9月14日12:00(北京時間)以降、
deepseek-v4-proもV4.1-Flashへ順次ルーティング(V4.1-Proリリースまでの暫定措置) - 料金はさらに引き下げ:オフピークで入力(キャッシュミス)$0.15、出力$0.60/1Mトークン(旧V4-Pro比で最大約86%減)
- 公式発表では、V4.1-FlashはV4-Proを性能・コスト・速度・総処理時間で上回る
- Thinkingモードは依然としてCursor非対応。
deepseek-flashのthinkingオフ運用が現実的 - 旧モデル名(
deepseek-chat/deepseek-reasoner)は2026年7月24日付ですでに廃止済み
コーディングコストを下げたいエンジニアにとって、DeepSeek V4.1-Flash × CursorのBYOK連携は、モデル統合と値下げが進んだことで、これまで以上に有力な選択肢になっています。
参考リンク
- DeepSeek API Docs
- DeepSeek Platform(APIキー・チャージ)
- DeepSeek-V4.1-Flash 公式発表
- DeepSeek-V4.1-Flash Hugging Face
- DeepSeek-V4.1-Flash Technical Report
- DeepSeek API Change Log
- DeepSeek V4 Hugging Face(旧世代)
- Cursor
- Cursor フォーラム:Thinking Mode対応リクエスト
- yxlao/deepseek-cursor-proxy(コミュニティ製Thinkingモード対応プロキシ、V4.1-Flash対応は要確認)
Discussion
Deepseek-R1などがCursorに利用できないのかなと、ネットに彷徨っていたら、ドンピシャのこの記事に出会いました。ありがとうございます。大変参考になります。