SWE-2とは?CognitionのDevin新モデルの性能・料金・無料期間・使い方【2026年10月】

Devin(旧Windsurf)を開発するCognitionが、2026年9月10日に新しいコーディングモデルSWE-2を発表した。中国Moonshot AIのKimi K3をベースに追加学習したモデルで、発表では「Fable 5.1と1ポイント以内の性能で64%安い」とうたう。本記事では、Cognitionの発表ブログ・Devinの料金ページ・公式ドキュメントをもとに、SWE-2の性能・料金と無料期間・使い方を整理する。得意な分野だけでなく、大きく負けているベンチマークもそのまま載せる。

2026年10月11日時点の情報:Cognition公式ブログ「SWE-2」(2026年9月10日、The Cognition Team)、devin.ai/pricing、Devin公式ドキュメント(モデル一覧・CLI・Fusion・リリースノート)で確認した。ベンチマークの数値はすべてCognitionによる自社測定で、第三者の検証ではない。Devin全体の使い方はDevinの使い方・料金、エディタはWindsurf(現Devin Desktop)とは?で解説している。

この記事でわかること

  • SWE-2の正体(ベースモデル・推論レベル)
  • 公式ベンチマークの全数値と、苦手な分野
  • 無料期間(公式ページで日付が違う点に注意)と、その後の料金
  • Devin Desktop・CLI・Web・Slackでの使い方とFusionでの組み合わせ
目次

1. SWE-2とは——Kimi K3ベースのDevin専用モデル

項目 内容(公式情報)
発表 2026年9月10日(Cognition公式ブログ、著者表記はThe Cognition Team)
位置づけ 「our most advanced coding model yet」(同社で最も高性能なコーディングモデル)。前のフラッグシップはSWE-1.7(2026年7月8日発表)
ベースモデル Kimi K3(2.8兆パラメータ)からの追加学習。学習基盤とレシピはSWE-1.7のものを引き継いだ
推論レベル Medium・High・Maxの3段階。全レベルを1回の強化学習でまとめて鍛えたのが新しい点としている
使える場所 Devin Desktop・Devin CLI(発表当日から)、Devin Web・Fusion(展開中と発表)
API・重み 単体のAPI提供や重みの公開は、公式には記載なし

Cognitionによると、強化学習によって多くのベンチマークでKimi K3から約5〜6ポイント上がったという。中国製モデルをベースにしている点については、発表ブログはプロパガンダ・検閲に関する評価で全体の98.0%の試行に合格したと説明している。中国製AIを業務で使うときの一般的な論点は中国製AIの危険性で整理している。

2. ベンチマーク——得意と苦手がはっきり分かれる

Cognitionが発表ブログに載せた表をそのまま転記する(各モデルとも推論レベルの中で最も良いスコア)。

ベンチマーク SWE-2 Kimi K3 Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra SWE-1.7
FrontierCode 1.1 Main 50.0% 44.2% 48.0% 50.9% 47.5% 53.3% 42.0%
DeepSWE 1.1 73.0% 68.5% 67.5% 67.4% 72.7% 74.1% 37.7%
Terminal-Bench 2.1 92.8% 88.3% 88.4% 91.4% 88.8% 89.9% 81.5%
Terminal-Bench 4 27.3% 21.5% 20.3% 55.8% 37.3% 57.9% 7.6%

出典:Cognition公式ブログ「SWE-2」(2026年9月10日)。公開スコアがあるものはそれを使い、ないものはCognitionの社内環境で各社の標準ツール(AnthropicはClaude Code、OpenAIはCodex、xAIはGrok Build、オープンウェイトのモデルはDevin CLI)を使って測定したと説明している。

読み取れること

  • 得意:Terminal-Bench 2.1では表の中で最も高く、DeepSWE 1.1でもGPT-6 Astra(74.1%)に次ぐ。FrontierCode 1.1 MainはFable 5.1と0.9ポイント差
  • 苦手:より難しいTerminal-Bench 4では27.3%で、Fable 5.1(55.8%)やGPT-6 Astra(57.9%)の半分以下
  • ベースのKimi K3からは全項目で上がっており、前モデルSWE-1.7からの伸びは大きい

コストと速さの主張

比較 Cognitionの主張
対Fable 5.1(FrontierCode 1.1 Main) 差は1ポイント以内で、64%安い
対GPT-6 Astra 差は数ポイントで、コストは4分の1
対SWE-1.7(FrontierCode 1.1 Main) SWE-2 Mediumはスコアが上回り、ターン数は58%少なく、平均コストは81%低い
1回の作業の平均ステップ数 SWE-1.7は127、SWE-2はMedium 53/High 80/Max 98
最初の実質的な編集までのステップ数(中央値) SWE-2 Mediumは18、SWE-1.7は48

Mediumは手を動かし始めるのが速く、HighとMaxは複雑な作業で優位に立つ、というのがCognitionの説明だ。

3. 料金と無料期間——終了日は公式ページ同士で違う

⚠️ 無料期間の終了日が、公式ページによって違う。料金ページ(devin.ai/pricing)は「Devin DesktopとCLIで2026年10月16日まで無料」、公式ドキュメントのモデル一覧は「セルフサーブのプランで2026年10月15日まで無料」と書いている(いずれも2026年10月11日確認)。確実に無料で試すなら10月15日までに使っておきたい。

区分 料金(公式ドキュメントより)
個人・チーム向け(セルフサーブ) 無料期間中は0ドル。終了後はリスト価格で計上:100万トークンあたり入力3.00ドル・出力15.00ドル・キャッシュ入力0.30ドル
Enterprise 2026年12月31日までリスト価格の75%引き(100万トークンあたり入力0.75ドル・出力3.75ドル・キャッシュ読み取り0.075ドル)
音声モード 通話中のモデル利用には、SWE-2の無料・割引は適用されない

Devinのプランは、Free(0ドル)・Pro(月20ドル)・Max(月200ドル)・Teams(月80ドル+フル開発シート1人あたり月40ドル)・Enterprise(要相談)。料金ページでは、Proの特典として「Free use of SWE-2」が書かれている(2026年10月11日確認)。

4. 使い方——Desktop・CLI・Web・Slack

使う場所 選び方
Devin Desktop モデル選択でSWE-2と推論レベルを選ぶ
Devin CLI --modelフラグ、/model(引数なしで選択画面)、または ~/.config/devin/config.json で指定。推論レベルはAlt+T(macOSはOpt+T)で切り替え
Devin Web(クラウド) 2026年9月21日から、エージェント選択の「Research preview」欄に研究プレビューとして登場。セッション開始時にSWE-2と推論レベルを選ぶか、入力欄横の切り替えで途中から変更できる
Slack !swe2 で指定
Enterprise Enterprise管理者がSettingsで「SWE-2 (Preview)」を有効にし、その後に組織の管理者がAgent capabilitiesで組織ごとにオン・オフする

Web版は研究プレビューのため、挙動や提供状況は変わりうるとリリースノートに明記されている。

Fusionでの組み合わせ(推奨が2通りある)

Fusionは、主導するモデル(lead)と補助するモデル(sidekick)を組み合わせて動かすDevinの機能で、有料プランで使える(CLIは3000.10.20以上、Desktopは3.10.0以上)。CLIでは /fusion で主導モデル・推論レベル・補助モデルを選ぶ。SWE-2との組み合わせは、公式の中で2通りの書き方がある。

出典 推奨の組み合わせ
Fusionのドキュメント(CLI版・Desktop版) Fable 5.1 + SWE-2。「最良の結果のための推奨の組み合わせ」と記載
Desktopの更新履歴 v3.10.48(2026年9月29日) ChatGPTプランとの連携の文脈で、コストパフォーマンス重視なら GPT-6 Astra を主導、SWE-2 を補助にする組み合わせ

性能を優先するならFable 5.1主導、ChatGPTのプランを使っていて費用を抑えたいならGPT-6 Astra主導、という使い分けになる。

5. どんな人に向いているか

  • 向いている:Devin DesktopやCLIで日常的にコードを書く人。無料期間中は試す価値が高い。ふだんの実装・修正作業を安く回したいチームにも合う
  • 向いていない:ターミナル操作が多い難しい長時間タスク(Terminal-Bench 4の結果が弱い)。この種の作業はFable 5.1やGPT-6 Astraを主導にしたFusionのほうが向いている可能性が高い(発表値からの見立て)
  • 使えない:自社のアプリからAPIで直接呼びたい場合。単体APIは公式に記載がない

AIの利用料を全体で下げる考え方はAIコスト削減・最適化ガイドも参考になる。

まとめ

  • SWE-2はCognitionが2026年9月10日に発表したコーディングモデル。Kimi K3からの追加学習で、推論レベルは3段階
  • 発表値ではFrontierCode 1.1 MainでFable 5.1と1ポイント以内・64%安い。一方、Terminal-Bench 4は27.3%と大きく劣る
  • 無料期間は料金ページで10月16日まで、ドキュメントで10月15日まで。その後は100万トークンあたり入力3ドル・出力15ドル
  • Devin Desktop・CLIで使え、Web版は研究プレビュー、Slackは「!swe2」。単体APIは公式に記載なし

よくある質問

Q. SWE-2とは何ですか?

A. Devinを開発するCognitionが2026年9月10日に発表したコーディング用のAIモデル。中国Moonshot AIのKimi K3(2.8兆パラメータ)をもとに追加学習しており、推論レベルをMedium・High・Maxの3段階から選べる。

Q. SWE-2は無料で使えますか?

A. 2026年10月11日時点では、個人向けの有料プランで無料期間中。ただし終了日が公式ページで違い、料金ページは「Devin DesktopとCLIで2026年10月16日まで」、ドキュメントは「セルフサーブのプランで10月15日まで」としている。その後はリスト価格(100万トークンあたり入力3ドル・出力15ドル)で利用量に計上される。

Q. どこで使えますか?

A. Devin Desktop(旧Windsurf)とDevin CLIで発表当日から使える。Devinのクラウド版(Web)では9月21日から研究プレビューとして選べ、Slackでは「!swe2」で指定する。Enterpriseでは管理者が有効にする必要がある。

Q. APIで呼び出したり、モデルをダウンロードしたりできますか?

A. 2026年10月11日時点で、SWE-2単体のAPI提供や重み(ウェイト)公開は公式には記載がない。Devinの製品の中で使うモデルという位置づけになっている。

Q. Fable 5.1やGPT-6 Astraより優れていますか?

A. Cognitionの発表値では、FrontierCode 1.1 MainでFable 5.1との差は1ポイント以内で、コストは64%安い。一方、Terminal-Bench 4では27.3%にとどまり、Fable 5.1(55.8%)やGPT-6 Astra(57.9%)に大きく負けている。数値はいずれもCognitionの自社測定。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
目次