Routine Labo / 検証レポート

Gemini 3.7 Flash を実機で検証する
― 3週間で本当に強くなったのか

2026年8月17日 / Routine Labo

Gemini 3.7 Flash 実機検証。3.6 Flash・3.7 Flash・GPT-5.6 が作った3つのSNSアプリを並べた図

Gemini の主力枠「Flash」に、また新しいモデルが来ました。Gemini 3.7 Flash、公開は 2026年8月13日。 前の 3.6 Flash が7月21日なので、間隔はわずか3週間です。 しかも値段は据え置き。安くなったのではなく、同じ値段のまま中身だけが入れ替わりました

Google は「ウェブ開発の対戦成績が +50 Elo 伸びた」「長時間の開発で 48.6% → 65.3%」と言っています。 数字だけ見れば大きな伸びですが、3週間でそこまで変わるものでしょうか。 この記事では、自作の検証アリーナで同じお題を 3.6 Flash / 3.7 Flash / GPT-5.6 Terra の3モデルに同時に投げて、 公式の主張が手元でも見えるのかを確かめます。

1. 3週間で何が起きたのか

7月21日の3.6 Flashから8月13日の3.7 Flashまで3週間で世代交代した図
図解:Routine Labo

Flash は Google のラインナップの中で「毎日の実務を回す働き者」の枠です。 賢さの最高峰ではなく、速さと安さと実用の賢さのバランスを取りにいくモデルで、 API を使った自動化・大量処理・アプリ組み込みの現場でいちばん使われます。 その枠が、3週間で入れ替わりました。

項目Gemini 3.6 FlashGemini 3.7 Flash
公開日2026年7月21日2026年8月13日
入力価格(100万トークン)$0.75$0.75
出力価格(100万トークン)$3.75$3.75
コンテキスト100万トークン100万トークン
1回の返答の上限64,000トークン64,000トークン
学習データの区切り2026年3月2026年3月

表のとおり、価格もコンテキストも上限も同じです。動いたのは中身だけ。 なお $0.75 / $3.75 は導入価格で、2026年12月31日まで。 2027年1月1日から $1.50 / $7.50 に戻ります(これは 3.6 Flash も同じ条件です)。

使える場所は、Google AI Studio、Gemini API、Antigravity、Gemini アプリ、Gemini Enterprise。 AI Studio 経由なら無料ティアがあるので、この記事を読んだあと、お金を払わずにそのまま試せます。

Gemini 3.7 Flash の公式発表ページ
出典:Google 公式発表「Gemini 3.7 Flash を発表」 blog.google(2026-08-17 取得)

2. 公式は「何が」伸びたと言っているのか

ここが今回の主役です。Google 自身が出した比較表を、まず実物で見ます。

Gemini 3.7 Flash の公式ベンチマーク比較表
出典:Google 公式発表の評価表(Gemini 3.7 Flash / 3.6 Flash / Claude Sonnet 5 / GPT-5.6 Terra / Muse Spark 1.2)(2026-08-17 取得)
blog.google
3.6 Flashから3.7 Flashへのベンチマークの伸びを示した図
図解:Routine Labo
ベンチマーク 3.6 Flash 3.7 Flash GPT-5.6 Terra
Code Arena(Elo・ウェブ開発)153815881523
FrontierCode 1.1(コード品質)34.4%43.6%41.3%
AutomationBench(業務自動化)17.0%30.4%23.6%
GDP.pdf(専門PDF理解)22.0%34.0%24.7%
GDM-MRCR v2(128k長文検索)91.8%97.0%93.5%
DeepSWE v1.1(長時間の開発)48.6%65.3%69.6%
Terminal-bench 2.1(ターミナル)78.0%85.8%87.4%
OSWorld-2.0(PC操作)33.8%47.9%50.2%
出力価格(100万トークン)$3.75$3.75$12.00

この表でいちばん目を引くのは Code Arena(ウェブ開発の対戦成績)です。 3.7 Flash の 1588 に対して、出力単価が 3.2 倍高い GPT-5.6 Terra は 1523。 つまり Google は「ウェブ開発に限れば、うちの安いモデルのほうが上だ」と主張していることになります。

一方で、全部で勝っているわけではありません。長時間かかるソフトウェア開発(DeepSWE)、 ターミナル操作、PC操作の3つは、上位モデルのほうが上です。 「新しいから全部強い」ではなく、勝った土俵がはっきり分かれているというのが正確な読み方です。

3. 第三者の計測ではどの位置か

Artificial Analysis の Intelligence Index では、3.7 Flash が 56点。 3.6 Flash が 52点だったので4点の上積みで、最上位クラス(GPT-5.6 Terra と Muse Spark 1.2 が 57点)と1点差まで来ました。

Artificial Analysis の知能と所要時間のグラフ
出典:Artificial Analysis「Gemini 3.7 Flash: On the Intelligence vs. Time per Task Pareto frontier」 artificialanalysis.ai(2026-08-17 取得)
この回のいちばんの論点
差がない、という話ではありません。ほぼ同じ点数を、3倍の速さと、3分の1以下の出力単価で出している―― だから「主力をここに降ろしていいのか」という問いになります。

4. 検証のしくみ ― 同じ土俵で測る

同じお題を3つのモデルに同時に投げて左右で比較する検証アリーナのしくみ
図解:Routine Labo

使うのは自作の検証アリーナです。新しいモデルが出るたびに固定のお題をワンショットで生成させ、 左右に並べて比べるためのローカルアプリで、モデルが変わってもお題のほうは変えません。 土俵を変えてしまうと、過去のモデルの結果と比べられなくなるからです。

今回の条件は次のとおりです。

実際に投げるプロンプト(全文)

同じものを試したい方のために、投げる文字列をそのまま置いておきます。

お題本文(そのまま貼って使えます)
【出力条件・厳守】
1. 出力は「単一のHTMLファイル」を1つだけ。file:// でダブルクリックして即動くこと。
2. コードは省略禁止。「// 以下同様」「...(省略)」は禁止。全文を書ききる。
3. 外部ライブラリ・CDN・外部アセット(画像/音声/フォント)は一切禁止。
   アイコン・アバター・画像プレースホルダはSVGやCSSでコード生成する。
4. 起動時のコンソールエラーは0件であること。
5. 最後に「仕様チェックリスト」を表で出し、各項目に ✅ / ❌ を自己申告する(嘘の✅は最も減点される)。

【お題】X(旧Twitter)のようなスマホのSNSアプリのUIクローンを作れ。
実在サービスの名称・ロゴ・商標・実在人物は使わない(架空のサービス名とロゴ、
架空のユーザーを自作する)。「本物のSNSをスクロールしている」感覚の再現を最優先する。

■ スマホ縦画面(最重要):
- 9:16の縦画面専用設計。ウィンドウが縦長なら全面、横長で開かれた場合は画面中央に
  9:16のスマホ枠(角丸・ステータスバー風の帯つき)を出しその中にアプリを描く。
- 上部ヘッダ+下部タブバー(ホーム/検索/通知/プロフィール)のスマホSNSの画面文法を再現。

■ アプリ仕様:
- タイムライン: 架空ユーザー10人以上・計30件以上の投稿(アバター・表示名・ID・本文・
  経過時間・返信/リポスト/いいね/表示数)。無限スクロール風に下へ足されていく
  (投稿データは配列から生成・使い切ったらランダム合成)。
- 投稿操作: いいね(ハートが赤くなり数が増減)・リポスト(緑)・ブックマーク。
  タップ時の小さなアニメーション付き。
- 投稿詳細: 投稿タップで詳細画面(返信ツリー3件以上)へ。戻るで一覧位置を保持。
- 新規投稿: 右下の投稿ボタン→作成画面。文字数カウンタ(140字)付きで投稿すると
  タイムライン先頭に載る。
- プロフィール: 自分のページ(ヘッダ画像・アバター・自己紹介・投稿一覧・
  フォロー/フォロワー数)。自分の投稿の削除ができる。
- 通知タブ: いいね・フォローなどの架空通知が時々増え、タブにバッジが付く。
- 状態保存: 自分の投稿・いいね・ブックマークを localStorage に保存し、リロード後も残る。
- 演出: 引っ張って更新(スピナー→新着数件)、ダークモード切替、タブ切替アニメ。

■ 採点API: window.__APP = { tab, posts, myPosts, likes, post(text),
  like(postId), reset() } をグローバル公開する。
共通の実行条件(お題の前に付ける)
【実行条件・厳守(比較ベンチマーク)】
これはAIモデル比較ベンチマークのワンショット生成です。以下を厳守してください。
1. 一発勝負。反復・自己修正・生成後の実行確認・テスト・ブラウザ起動・ネット取得・ファイル探索は一切しない。
2. ツールを持つ環境でも、成果物のファイル書き出し以外にツールを使わない。
3. 出力は課題が指定する成果物(単一の完全なHTML等)のみ。前置きの説明・計画・感想は書かない。
4. コードは省略せず全文を書ききる。

以下が課題本文。

無料で軽く試したい場合(AI Studio 用の短い版)

上のお題はかなり長いので、まず動くところを見たい方向けに短い版も置いておきます。 AI Studio でモデルに Gemini 3.7 Flash を選んで、そのまま貼ってください。

短縮版(無料ティアで試す用)
あなたはWeb実装者です。単一のHTMLファイル1つだけを出力してください。
外部ライブラリ・CDN・外部画像は一切使わず、file:// で開いて即動くものにしてください。

お題: スマホ縦画面(9:16)のSNSタイムライン。架空のユーザー6人・投稿12件を配列から生成し、
いいねを押すとハートが赤くなって数が増減します。上部ヘッダと下部タブバー
(ホーム/検索/通知/プロフィール)を付けてください。コードは省略せず全文を書いてください。

5. できたアプリの、どこを見るか

「なんとなく良さそう」で終わらせないために、判定の軸を先に決めておきます。 どれも指示に書いてあるのに、モデルによって落ちやすいところです。

  1. 縦9:16の枠が崩れていないか ― 横長のウィンドウで開いたときにスマホ枠が出るか
  2. いいねの反応 ― ハートの色が変わり、数字が正しく増減するか
  3. 詳細から戻ったときのスクロール位置 ― 一覧の位置が保持されるか
  4. リロード後に自分の投稿が残るか ― 保存まで実装しきれているか
  5. 自己申告のチェックリストが本当か ― ✅ と実物が食い違っていないか
5番目がいちばん効きます
お題では「嘘の ✅ は最も減点される」と明示しています。 それでも実物と食い違う申告が出ることがあり、そこがモデルの性格の差として出るので、必ず突き合わせます。

6. どの仕事を降ろしていいか

Flashに降ろせる仕事とまだ上位に任せる仕事を分けたホワイトボード図
図解:Routine Labo
用途判定根拠(公式の実数)
ウェブアプリ・UIの一発生成◎ 降ろせるCode Arena 1588(上位クラスは 1523)
長文・大量の書類の処理◎ 降ろせる128k長文検索 97.0%(上位 93.5%)/専門PDF 34.0%(上位 24.7%)
業務自動化・定型のエージェント◎ 降ろせるAutomationBench 30.4%(3.6 は 17.0%・上位 23.6%)
数を回すバッチ処理◎ 降ろせる毎秒約340トークン・出力単価 $3.75(上位 $12.00)
長時間かかるソフトウェア開発△ 上位へDeepSWE 65.3%(上位 69.6%)
ターミナル操作・PC操作△ 上位へTerminal-bench 85.8%(上位 87.4%)/OSWorld 47.9%(上位 50.2%)

運用としては、まず安いほうに投げて、詰まったときだけ上位へ渡すのが素直です。 以前は「Flash は下書き用、仕上げは上位」でしたが、ウェブ開発と長文処理に限れば下書きのまま完成に届く場面が増えています。

7. 乗り換える前に知っておく3つの穴

出力上限・考える量の設定・価格の期限という3つの落とし穴の図
図解:Routine Labo

① 1回の返答は 64,000 トークンまで

コンテキストは100万トークン入りますが、返せる量は1回あたり 64,000 トークンです。 長いコードを一発で書かせると途中で切れ、切れた HTML は動かないので丸ごと無駄になります。 長い成果物を作らせるときは、分割して書き出させる前提で設計してください。

② 考える量の設定で 3〜5点動く

このモデルは考える量を調整できます。第三者計測では高 = 56点、中 = 53点、低 = 51点。 「Flash は何点」ではなく「どの設定で何点」で見ないと、速さと安さに振ったつもりが賢さまで落ちます。

③ 今の値段は期間限定

$0.75 / $3.75 は導入価格で、2026年12月31日まで。2027年1月1日から $1.50 / $7.50 に戻ります。 月あたりのコストを試算するときは、この安値のまま置かないほうが安全です。

Gemini API の料金ページ
出典:Gemini Developer API 料金ページ ai.google.dev(2026-08-17 取得)

8. まとめ

公式の数字を読むところで止めず、自分の手元の同じお題で確かめるところまでが検証です。 同じお題を回したい方は、上のプロンプトをそのままお使いください。

出典

数値はすべて 2026-08-17 時点の取得値です。