Devin(旧Windsurf)を開発するCognitionが、2026年9月10日に新しいコーディングモデルSWE-2を発表した。中国Moonshot AIのKimi K3をベースに追加学習したモデルで、発表では「Fable 5.1と1ポイント以内の性能で64%安い」とうたう。本記事では、Cognitionの発表ブログ・Devinの料金ページ・公式ドキュメントをもとに、SWE-2の性能・料金と無料期間・使い方を整理する。得意な分野だけでなく、大きく負けているベンチマークもそのまま載せる。
2026年10月11日時点の情報:Cognition公式ブログ「SWE-2」(2026年9月10日、The Cognition Team)、devin.ai/pricing、Devin公式ドキュメント(モデル一覧・CLI・Fusion・リリースノート)で確認した。ベンチマークの数値はすべてCognitionによる自社測定で、第三者の検証ではない。Devin全体の使い方はDevinの使い方・料金、エディタはWindsurf(現Devin Desktop)とは?で解説している。
この記事でわかること
- SWE-2の正体(ベースモデル・推論レベル)
- 公式ベンチマークの全数値と、苦手な分野
- 無料期間(公式ページで日付が違う点に注意)と、その後の料金
- Devin Desktop・CLI・Web・Slackでの使い方とFusionでの組み合わせ
1. SWE-2とは——Kimi K3ベースのDevin専用モデル
| 項目 | 内容(公式情報) |
|---|---|
| 発表 | 2026年9月10日(Cognition公式ブログ、著者表記はThe Cognition Team) |
| 位置づけ | 「our most advanced coding model yet」(同社で最も高性能なコーディングモデル)。前のフラッグシップはSWE-1.7(2026年7月8日発表) |
| ベースモデル | Kimi K3(2.8兆パラメータ)からの追加学習。学習基盤とレシピはSWE-1.7のものを引き継いだ |
| 推論レベル | Medium・High・Maxの3段階。全レベルを1回の強化学習でまとめて鍛えたのが新しい点としている |
| 使える場所 | Devin Desktop・Devin CLI(発表当日から)、Devin Web・Fusion(展開中と発表) |
| API・重み | 単体のAPI提供や重みの公開は、公式には記載なし |
Cognitionによると、強化学習によって多くのベンチマークでKimi K3から約5〜6ポイント上がったという。中国製モデルをベースにしている点については、発表ブログはプロパガンダ・検閲に関する評価で全体の98.0%の試行に合格したと説明している。中国製AIを業務で使うときの一般的な論点は中国製AIの危険性で整理している。
2. ベンチマーク——得意と苦手がはっきり分かれる
Cognitionが発表ブログに載せた表をそのまま転記する(各モデルとも推論レベルの中で最も良いスコア)。
| ベンチマーク | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
出典:Cognition公式ブログ「SWE-2」(2026年9月10日)。公開スコアがあるものはそれを使い、ないものはCognitionの社内環境で各社の標準ツール(AnthropicはClaude Code、OpenAIはCodex、xAIはGrok Build、オープンウェイトのモデルはDevin CLI)を使って測定したと説明している。
読み取れること
- 得意:Terminal-Bench 2.1では表の中で最も高く、DeepSWE 1.1でもGPT-6 Astra(74.1%)に次ぐ。FrontierCode 1.1 MainはFable 5.1と0.9ポイント差
- 苦手:より難しいTerminal-Bench 4では27.3%で、Fable 5.1(55.8%)やGPT-6 Astra(57.9%)の半分以下
- ベースのKimi K3からは全項目で上がっており、前モデルSWE-1.7からの伸びは大きい
コストと速さの主張
| 比較 | Cognitionの主張 |
|---|---|
| 対Fable 5.1(FrontierCode 1.1 Main) | 差は1ポイント以内で、64%安い |
| 対GPT-6 Astra | 差は数ポイントで、コストは4分の1 |
| 対SWE-1.7(FrontierCode 1.1 Main) | SWE-2 Mediumはスコアが上回り、ターン数は58%少なく、平均コストは81%低い |
| 1回の作業の平均ステップ数 | SWE-1.7は127、SWE-2はMedium 53/High 80/Max 98 |
| 最初の実質的な編集までのステップ数(中央値) | SWE-2 Mediumは18、SWE-1.7は48 |
Mediumは手を動かし始めるのが速く、HighとMaxは複雑な作業で優位に立つ、というのがCognitionの説明だ。
3. 料金と無料期間——終了日は公式ページ同士で違う
⚠️ 無料期間の終了日が、公式ページによって違う。料金ページ(devin.ai/pricing)は「Devin DesktopとCLIで2026年10月16日まで無料」、公式ドキュメントのモデル一覧は「セルフサーブのプランで2026年10月15日まで無料」と書いている(いずれも2026年10月11日確認)。確実に無料で試すなら10月15日までに使っておきたい。
| 区分 | 料金(公式ドキュメントより) |
|---|---|
| 個人・チーム向け(セルフサーブ) | 無料期間中は0ドル。終了後はリスト価格で計上:100万トークンあたり入力3.00ドル・出力15.00ドル・キャッシュ入力0.30ドル |
| Enterprise | 2026年12月31日までリスト価格の75%引き(100万トークンあたり入力0.75ドル・出力3.75ドル・キャッシュ読み取り0.075ドル) |
| 音声モード | 通話中のモデル利用には、SWE-2の無料・割引は適用されない |
Devinのプランは、Free(0ドル)・Pro(月20ドル)・Max(月200ドル)・Teams(月80ドル+フル開発シート1人あたり月40ドル)・Enterprise(要相談)。料金ページでは、Proの特典として「Free use of SWE-2」が書かれている(2026年10月11日確認)。
4. 使い方——Desktop・CLI・Web・Slack
| 使う場所 | 選び方 |
|---|---|
| Devin Desktop | モデル選択でSWE-2と推論レベルを選ぶ |
| Devin CLI | --modelフラグ、/model(引数なしで選択画面)、または ~/.config/devin/config.json で指定。推論レベルはAlt+T(macOSはOpt+T)で切り替え |
| Devin Web(クラウド) | 2026年9月21日から、エージェント選択の「Research preview」欄に研究プレビューとして登場。セッション開始時にSWE-2と推論レベルを選ぶか、入力欄横の切り替えで途中から変更できる |
| Slack | !swe2 で指定 |
| Enterprise | Enterprise管理者がSettingsで「SWE-2 (Preview)」を有効にし、その後に組織の管理者がAgent capabilitiesで組織ごとにオン・オフする |
Web版は研究プレビューのため、挙動や提供状況は変わりうるとリリースノートに明記されている。
Fusionでの組み合わせ(推奨が2通りある)
Fusionは、主導するモデル(lead)と補助するモデル(sidekick)を組み合わせて動かすDevinの機能で、有料プランで使える(CLIは3000.10.20以上、Desktopは3.10.0以上)。CLIでは /fusion で主導モデル・推論レベル・補助モデルを選ぶ。SWE-2との組み合わせは、公式の中で2通りの書き方がある。
| 出典 | 推奨の組み合わせ |
|---|---|
| Fusionのドキュメント(CLI版・Desktop版) | Fable 5.1 + SWE-2。「最良の結果のための推奨の組み合わせ」と記載 |
| Desktopの更新履歴 v3.10.48(2026年9月29日) | ChatGPTプランとの連携の文脈で、コストパフォーマンス重視なら GPT-6 Astra を主導、SWE-2 を補助にする組み合わせ |
性能を優先するならFable 5.1主導、ChatGPTのプランを使っていて費用を抑えたいならGPT-6 Astra主導、という使い分けになる。
5. どんな人に向いているか
- 向いている:Devin DesktopやCLIで日常的にコードを書く人。無料期間中は試す価値が高い。ふだんの実装・修正作業を安く回したいチームにも合う
- 向いていない:ターミナル操作が多い難しい長時間タスク(Terminal-Bench 4の結果が弱い)。この種の作業はFable 5.1やGPT-6 Astraを主導にしたFusionのほうが向いている可能性が高い(発表値からの見立て)
- 使えない:自社のアプリからAPIで直接呼びたい場合。単体APIは公式に記載がない
AIの利用料を全体で下げる考え方はAIコスト削減・最適化ガイドも参考になる。
まとめ
- SWE-2はCognitionが2026年9月10日に発表したコーディングモデル。Kimi K3からの追加学習で、推論レベルは3段階
- 発表値ではFrontierCode 1.1 MainでFable 5.1と1ポイント以内・64%安い。一方、Terminal-Bench 4は27.3%と大きく劣る
- 無料期間は料金ページで10月16日まで、ドキュメントで10月15日まで。その後は100万トークンあたり入力3ドル・出力15ドル
- Devin Desktop・CLIで使え、Web版は研究プレビュー、Slackは「!swe2」。単体APIは公式に記載なし
よくある質問
Q. SWE-2とは何ですか?
A. Devinを開発するCognitionが2026年9月10日に発表したコーディング用のAIモデル。中国Moonshot AIのKimi K3(2.8兆パラメータ)をもとに追加学習しており、推論レベルをMedium・High・Maxの3段階から選べる。
Q. SWE-2は無料で使えますか?
A. 2026年10月11日時点では、個人向けの有料プランで無料期間中。ただし終了日が公式ページで違い、料金ページは「Devin DesktopとCLIで2026年10月16日まで」、ドキュメントは「セルフサーブのプランで10月15日まで」としている。その後はリスト価格(100万トークンあたり入力3ドル・出力15ドル)で利用量に計上される。
Q. どこで使えますか?
A. Devin Desktop(旧Windsurf)とDevin CLIで発表当日から使える。Devinのクラウド版(Web)では9月21日から研究プレビューとして選べ、Slackでは「!swe2」で指定する。Enterpriseでは管理者が有効にする必要がある。
Q. APIで呼び出したり、モデルをダウンロードしたりできますか?
A. 2026年10月11日時点で、SWE-2単体のAPI提供や重み(ウェイト)公開は公式には記載がない。Devinの製品の中で使うモデルという位置づけになっている。
Q. Fable 5.1やGPT-6 Astraより優れていますか?
A. Cognitionの発表値では、FrontierCode 1.1 MainでFable 5.1との差は1ポイント以内で、コストは64%安い。一方、Terminal-Bench 4では27.3%にとどまり、Fable 5.1(55.8%)やGPT-6 Astra(57.9%)に大きく負けている。数値はいずれもCognitionの自社測定。
